Commit d5eb6e3d authored by Delvallez Delvallez's avatar Delvallez Delvallez

premiers resultats expé en annexe

parent f5e7b69c
......@@ -203,3 +203,58 @@ TODO
- MechIR [Parry+25]
- Perturbation
- Données produites, visualisation et interprétation des graphiques
---
# Remarques et éléments à prendre en compte
## 2026-07-17
- Gestion de la traduction des concepts : ???
- et ce papier de l'autre jour, qu'en faire
-
- Rester théorie et résultats
- Prévoir annexe pour les résultats
- Prévoir annexe pour difficultés techniques (librairie, prise en main CaSciModOT)
- Placer "on ne dispose pas de données gold"
- Prouteau : dans Explicabilité RAG
- [x] 2.2 Système de RAG de confiance -> Interprétabilité pour les systèmes de RAG
- Développer le Challenge dans dataset :
- Le challenge la tache
- Les données fournies
- ce qui nous manque
- --
- Le format de dataset visé
- tous les dérouler V0, V1 et format V2 (à chaque fois: format, ce qui manque, les modifications proposées)
- [à rédiger] 1.3 la progression du stage en bref et le glissement du sujet
- 1.4 placer problématique résultats du cheminement
- garder l'évolution du sujet dans le bilan [personnel] ou intro (pas dans le mémoire)
- 3, 4 et 5 => reformulation
- 3 : prérequis à l'éxpé
- datset
- reprise d'un modèle
- 4 : ce qui était le 5.2 (Construction des pert, Estimation pertinence des pert, interprétation de activation Patching) _contribution méthodologique_
- 5 : résultat expérimentaux (ancinement 5.3)
- liste des perturbations choisies
- Ajouter touts les graphiques avec un texte succin => tri plus tart
---
# Typos à pister
- mécanistique -> mécaniste
- toin, iton,....
- pertuabtion
This diff is collapsed.
......@@ -38,8 +38,36 @@ de petites fonctions et outils python (ChatGPT)
\section{Contexte et enjeux du sujet}
\section{Contexte et problématiques traitées dans ce mémoire}
\subsection{Contexte}
\begin{verbatim}
- Intro RAG :
- les modèles ont des souci pour gérer la connaissance (hallucination, péremption des modèles)
- on a couplé les modèles génératifs avec un base de connaissance entrenue et maitrisée par concepteur et/ou utilisateur
- Intro XAI
- modèles opaques
- besoin de confiance
- méthode d'explications pour rendre coportement accessible et anticipable
- methodes qui ouvrent la boite, observent et donnent des explications
- On souhaite cartographier ces modèles
- On choisi un outil
- On découvre les difficultés et problématiques à l'usage
- On propose une méthodologie pour exploiter cet outil dans l'optique de cartographier la langue de spécialité
\end{verbatim}
\md{à reprendre}
\begin{verbatim}
TODO
- Objectif naif : Identifier les composants du modèle impliqués dans l'identification et la gestion
de la langue de spécialité d'un dataset
- Objectif pratique : Identifier et proposer des préconisations d'usage de la librairie MechIR pour
la localisation des composant impliqués dans la langue de spécialité
- Définition de langue de spécialité, réduction de l'objectif à l'identification du vocabulaire
de spécialité
\end{verbatim}
\subsection{Problématiques qui ont guidé ce travail}
\begin{verbatim}
TODO
\end{verbatim}
\begin{thebibliography}{}
\bibitem[Parry et~al., 2025]{parry_mechir_2025}
Parry, A., Chen, C., Eickhoff, C., and MacAvaney, S. (2025).
\newblock {MechIR}: {A} {Mechanistic} {Interpretability} {Framework} for {Information} {Retrieval}.
\newblock In {\em Advances in {Information} {Retrieval} - 47th {European} {Conference} on {Information} {Retrieval}, {ECIR} 2025, {Lucca}, {Italy}, {April} 6-10, 2025, {Proceedings}, {Part} {V}}, volume 15576 of {\em Lecture {Notes} in {Computer} {Science}}, pages 89--95. Springer.
\end{thebibliography}
This is BibTeX, Version 0.99d (TeX Live 2023/Debian)
Capacity: max_strings=200000, hash_size=200000, hash_prime=170003
The top-level auxiliary file: main.aux
The style file: apalike.bst
Database file #1: biblio.bib
You've used 1 entry,
1935 wiz_defined-function locations,
480 strings with 4087 characters,
and the built_in function-call counts, 585 in all, are:
= -- 58
> -- 23
< -- 2
+ -- 8
- -- 8
* -- 49
:= -- 94
add.period$ -- 4
call.type$ -- 1
change.case$ -- 9
chr.to.int$ -- 1
cite$ -- 1
duplicate$ -- 26
empty$ -- 41
format.name$ -- 9
if$ -- 122
int.to.chr$ -- 1
int.to.str$ -- 0
missing$ -- 1
newline$ -- 8
num.names$ -- 3
pop$ -- 11
preamble$ -- 1
purify$ -- 9
quote$ -- 0
skip$ -- 19
stack$ -- 0
substring$ -- 36
swap$ -- 10
text.length$ -- 2
text.prefix$ -- 0
top$ -- 0
type$ -- 6
warning$ -- 0
while$ -- 5
width$ -- 0
write$ -- 17
......@@ -15,6 +15,9 @@
% ecrire des maths
\usepackage{amsmath, amsfonts, amssymb}
%images
\usepackage{graphicx}
......@@ -27,7 +30,7 @@
% Infos du document
\title{Interprétabilité pour l'Extraction d'Information dans les systèmes de RAG}
\title{Interprétabilité Mécaniste pour l'Extraction d'Information dans les systèmes de RAG}
\author{Marine DELVALLEZ}
\date{\today}
......@@ -45,17 +48,24 @@
\input{sota/sota.tex}
\chapter{Construction d'un dataset}
\input{dataset/dataset.tex}
\chapter{Travail préalable et préparation des expériences}
\input{pre-expe/pre-expe.tex}
\chapter{Adaptation du modèle RAG4HN}
\input{modele/modele.tex}
\chapter{Contribution méthodologique}
\input{methodo/methodo.tex}
\chapter{Cartographie d'un modèle d'extraction d'information}
\input{cartographie/cartographie.tex}
\chapter{Résultats expérimentaux}
\input{resultats/resultats.tex}
\chapter{Conclusions et Perspectives}
\input{conclusion/conclusion.tex}
\bibliography{biblio.bib}
\bibliographystyle{apalike}
\appendix
\chapter{Résultats bruts d'expériences}
\input{res-expe/res-expe.tex}
\end{document}
\ No newline at end of file
\section{Objectifs}
\begin{verbatim}
- Objectif naif : Identifier les composants du modèle impliqués dans l'identification et la gestion
de la langue de spécialité d'un dataset
- Objectif pratique : Identifier et proposer des préconisations d'usage de la librairie MechIR pour
la localisation des composant impliqués dans la langue de spécialité
- Définition de langue de spécialité, réduction de l'objectif à l'identification du vocabulaire
de spécialité
\end{verbatim}
\md{À REMETTRE EN FORME}
\section{Méthodologie}
\subsection{Construction des perturbations}
\begin{verbatim}
......@@ -51,28 +41,3 @@ un critère de sensibilité ...
-> croiser les différentes caractéristiques (mot remplacé, type, niveau)
-> critique des noeuds sensibles de la dernière couche
\end{verbatim}
\section{Résultats et Analyse}
\subsection{Application à la cartographie du vocabulaire de la défense français dans mE5}
\begin{verbatim}
- Grand nombre de noeuds de la dernière couche du modèle
- pas de noeuds clairement associé au vocabulaire
...
\end{verbatim}
\subsection{Préconisations d'utilisation}
\begin{verbatim}
- des perturbations qui couvrent tous ou très grande partie des documents étudiés
- utiliser la question comme document témoin
\end{verbatim}
\section{Perspectives d'évolution de la méthode proposée}
\begin{verbatim}
- échelle pour situer le niveau d'un mot candidat remplaçant en fonction du mot remplacé
- critère d'identification du vocabulaire de spécialité
- intégration d'autres informations au critère de sensibilité
\end{verbatim}
\ No newline at end of file
\section{Architecture RAG4HistoricalNewspapers}
\begin{verbatim}
Reprendre [Tran+25]
\end{verbatim}
\section{Adaptation du modèle pour le stage}
\begin{verbatim}
- Suppression de la partie WebSearch (hors sujet)
- Suppression de la première extraction sur la base des titres
(incompatible avec le format des données du challenge)
- Passage de E5 à mE5 (on manipule du Français) [/!\ à vérifier]
- Montée en version des librairies pour la compatibilité avec les outils
- Reprise du reranking (mettre au propre la photo du schema sur l'ardoise)
\end{verbatim}
\ No newline at end of file
\section{Données du Challenge RAG@EvalLLM}
\section{Challenge RAG@EvalLLM}
\begin{verbatim}
Présentation des données :
- pdf à traiter sans structure normée du contenu
- majoritairement en français sauf quelques uns en anglais
- peuvent contenir des images
Présentation de la tâche du challenge (sauf si fait dans introduction)
- Identification des documents pertinents pour une question (phrase
- Le sujet de l'extraction d'informatoin et lu RAG est d'actualité
- Présentation du Challenge RAG@EvalLLM
- La tâche
- Identification des documents pertinents pour une question (phrase
parfois complexe ou suite de mots clés)
- questions fournies au dernier moment
- questions fournies au dernier moment
- pas de gold
- Les données
- pdf à traiter sans structure normée du contenu
- majoritairement en français sauf quelques uns en anglais
- peuvent contenir des images
\end{verbatim}
\section{Structure de données visée}
\section{Construction d'un dataset adapté}
\begin{verbatim}
À REPRENDRE
Base de données:
- Paires
- liste des champs et justification
......@@ -25,4 +28,19 @@ différents pdf, taille des documents, répartition positif/négatif)
- limites (biais, diversité ~> généralisabilité)
=> Placer le nom des outils utilisés (PyMuPDF4LLM et langchain.text_splitter.MarkdownSplitter)
---
- Le format de dataset visé
- tous les dérouler V0, V1 et format V2 (à chaque fois: format, ce qui manque, les modifications proposées)
\end{verbatim}
\section{Adaptation du modèle RAG4HN}
\begin{verbatim}
- Choix de ce modèle : traite des données en FR
- Suppression de la partie WebSearch (hors sujet)
- Suppression de la première extraction sur la base des titres
(incompatible avec le format des données du challenge)
- Montée en version des librairies pour la compatibilité avec les outils
- Reprise du reranking (mettre au propre la photo du schema sur l'ardoise)
\end{verbatim}
\ No newline at end of file
\section{Question Comme Document}
\subsection{Représentation et similarité de la question paddées/pertubée}
\includegraphics[width=\textwidth]{images/ScoresSimilarité_QuestionCommeDocument.png}
\paragraph{Dataset manipulé}
Une paire (question, question) où la question est exploitée comme question mais aussi comme document
\paragraph{Perturbations appliquées}
\begin{verbatim}
drone -> engin autonome
limitation -> contrainte
système -> dispositif
technique -> spécialisé
drone -> vecteur
limitation -> bornage
système -> ensemble
technique -> difficile
drone->gazon
limitation->animation
système->panneau
technique->magique
drone->ver de verre
limitation->plastique anarchique
système->esperluette en vent
technique->feuille entubée
Full-replace Synonymes 1
drone -> engin autonome
limitation -> contrainte
système -> dispositif
technique -> spécialisé
Full-replace Polysémie 1
drone -> vecteur
limitation -> bornage
système -> ensemble
technique -> difficile
Full-replace Elephants 1
drone -> gazon
limitation -> animation
système -> panneau
technique -> magique
Full-replace Elephants Roses 1
drone -> ver de verre
limitation -> plastique anarchique
système -> esperluette en vent
technique -> feuille entubée
\end{verbatim}
\paragraph{Données représentées}
Le graphique de gauche représente les scores de pertinence de la question comme document pour chaque perturbation. Les questions non modifiées (représentées en bleu) sont juste paddées pour faire correspondre la taille du document non modifié avec celui perturbé (ici de la question perturbée, représentées en rouge). Les scores de pertinence pour chaque perturbation sont dans l'ordre des perturbations citées. Les lignes verticales séparent les perturbations par niveau (de 1 à 4 en allant de gauche à droite) puis regroupent les pertuabtion de type full\_replace (le plus à droite, de niveau 1 à 4 en allant de gauche à droite)
Le graphique de droite est un histogramme des scores (en bleu pour la question paddée et en rouge pour la question perturbée)
\paragraph{Commentaires}
On observe bien la différence de représentation entre les questions et les question perturbées. On constate aussi que le système de padding is en place par \cite{parry_mechir_2025} provoque une perturbation des documents. Certaines perturbations améliorent la similarité de la question avec elle même. Cela est surprenant
\subsection{Différence des scores de petinence pour question paddée et question perturbée}
\includegraphics[width=\textwidth]{images/DifferencesScoresSimilarité_QuestionCommeDocument.png}
\paragraph{Données et perturbation}
Question comme document\\
Perturbation présentées précédemment
\paragraph{Lecture des graphiques}
Le graphique de gauche associe à chaque perturbation (dans l'ordre cité) la différence entre les scores de similarité à la question de la question perturbée et la question paddée pour la perturbation. Les points en rouge correspondnet à aux différences négatives et les points en vert aux différences positives. On attend des scores positifs car perturber un objet (en l'occurrence une question) réduit sa similarité à lui même. Les pints sont séparés pour identifier les pertubations de type replace de diférent niveau (1 à 4 de gauche à droite). Le cinquième (dernier) groupe correspond aux pertuabtions de type full\_replace (niveau 1 à 4 de gauche à droite)\\
Le grphique de droite représente la distribution de ces différences.
\paragraph{Analyse des graphiques}
Pour le premier graphique, on constate une augmentation de da différence pour les niveau les plus élevés concernnat les pertubations de type replace. Les perturbation de type full\_replace ont un effet de perturbation moins important que le padding induit par le modèle.
\ No newline at end of file
\md{À REPRENDRE}
\section{Résultats et Analyse}
\subsection{Application à la cartographie du vocabulaire de la défense français dans mE5}
\begin{verbatim}
- Grand nombre de noeuds de la dernière couche du modèle
- pas de noeuds clairement associé au vocabulaire
...
\end{verbatim}
\subsection{Préconisations d'utilisation}
\begin{verbatim}
- des perturbations qui couvrent tous ou très grande partie des documents étudiés
- utiliser la question comme document témoin
\end{verbatim}
\section{Perspectives d'évolution de la méthode proposée}
\begin{verbatim}
- échelle pour situer le niveau d'un mot candidat remplaçant en fonction du mot remplacé
- critère d'identification du vocabulaire de spécialité
- intégration d'autres informations au critère de sensibilité
\end{verbatim}
\ No newline at end of file
......@@ -7,7 +7,7 @@
le temps [ref à récupérer de Lewis+20]
- Il y a quelques années, on a cherché à associer un base de connaissances à ces
modèles [Lewis+20] (= définition de RAG)
- Parmis ces approches, on retrouve le cas des modèles de langue : RALLM
- Ces approches peuvent être appliquées aux tâches et modèles du TALN : RALLM
\end{verbatim}
......@@ -30,7 +30,7 @@ Au delà de l'innovation de l'architecture, on retrouve des innovations sur plus
caractéristiques de ces modèles : [R24/04] [R16/02]
- Multimodal [Liu+25]
- Chain of Thought [Xu+24]
- Gestion BDD dynamique [ref à trouver dans R24/05]
- Gestion BDD dynamique [Zhu25](https://arxiv.org/abs/2508.05662)
- BDD sparse et interprétable [Prouteau]???
\end{verbatim}
......@@ -46,7 +46,7 @@ de [Fan+23]
\end{verbatim}
\section{Systèmes RAG de confiance}
\section{Interprétabilité pour les systèmes de RAG}
\subsection{Trustworthy AI}
......@@ -55,7 +55,7 @@ La définition d'IA de confiance (Trustworthy AI) tend à varier en fonction des
et des utilisations de cette expression. Danss le contexte du Machine Learning, on désigne
l'IA de confiance comme l'ensembles des systèmes d'IA dans lesquels il est légitime (dans
le sens humainement entendable) d'avoir confiance. Le NIST (National Institute of Standards
and Technology (US)) propose différents axes ou composantes de l'IA de confiance : ...
and Technology (US)) propose différents axes ou composantes de l'IA de confiance : ... [Ni+25] + [Ref citée par Ni+25 du NIST]
\end{verbatim}
......
Markdown is supported
0% or
You are about to add 0 people to the discussion. Proceed with caution.
Finish editing this message first!
Please register or to comment