abstract = {This paper introduces a simple yet effective query expansion approach, denoted as query2doc, to improve both sparse and dense retrieval systems. The proposed method first generates pseudo-documents by few-shot prompting large language models (LLMs), and then expands the query with generated pseudo documents. LLMs are trained on web-scale text corpora and are adept at knowledge memorization. The pseudo-documents from LLMs often contain highly relevant information that can aid in query disambiguation and guide the retrievers. Experimental results demonstrate that query2doc boosts the performance of BM25 by 3\% to 15\% on ad-hoc IR datasets, such as MS-MARCO and TREC DL, without any model fine-tuning. Furthermore, our method also benefits state-of-the-art dense retrievers in terms of both in-domain and out-of-domain results.},
urldate = {2026-08-20},
booktitle = {Proceedings of the 2023 {Conference} on {Empirical} {Methods} in {Natural} {Language} {Processing}},
publisher = {Association for Computational Linguistics},
author = {Wang, Liang and Yang, Nan and Wei, Furu},
editor = {Bouamor, Houda and Pino, Juan and Bali, Kalika},
title = {Query {Rewriting} for {Retrieval}-{Augmented} {Large} {Language} {Models}},
url = {http://arxiv.org/abs/2305.14283},
doi = {10.48550/arXiv.2305.14283},
abstract = {Large Language Models (LLMs) play powerful, black-box readers in the retrieve-then-read pipeline, making remarkable progress in knowledge-intensive tasks. This work introduces a new framework, Rewrite-Retrieve-Read instead of the previous retrieve-then-read for the retrieval-augmented LLMs from the perspective of the query rewriting. Unlike prior studies focusing on adapting either the retriever or the reader, our approach pays attention to the adaptation of the search query itself, for there is inevitably a gap between the input text and the needed knowledge in retrieval. We first prompt an LLM to generate the query, then use a web search engine to retrieve contexts. Furthermore, to better align the query to the frozen modules, we propose a trainable scheme for our pipeline. A small language model is adopted as a trainable rewriter to cater to the black-box LLM reader. The rewriter is trained using the feedback of the LLM reader by reinforcement learning. Evaluation is conducted on downstream tasks, open-domain QA and multiple-choice QA. Experiments results show consistent performance improvement, indicating that our framework is proven effective and scalable, and brings a new framework for retrieval-augmented LLM.},
urldate = {2026-08-19},
publisher = {arXiv},
author = {Ma, Xinbei and Gong, Yeyun and He, Pengcheng and Zhao, Hai and Duan, Nan},
month = oct,
year = {2023},
note = {arXiv:2305.14283 [cs.CL]},
keywords = {Computer Science - Computation and Language},
}
@article{huang_survey_2025,
title = {A {Survey} on {Hallucination} in {Large} {Language} {Models}: {Principles}, {Taxonomy}, {Challenges}, and {Open} {Questions}},
volume = {43},
issn = {1046-8188, 1558-2868},
shorttitle = {A {Survey} on {Hallucination} in {Large} {Language} {Models}},
url = {https://dl.acm.org/doi/10.1145/3703155},
doi = {10.1145/3703155},
abstract = {The emergence of large language models (LLMs) has marked a significant breakthrough in natural language processing (NLP), fueling a paradigm shift in information acquisition. Nevertheless, LLMs are prone to hallucination, generating plausible yet nonfactual content. This phenomenon raises significant concerns over the reliability of LLMs in real-world information retrieval (IR) systems and has attracted intensive research to detect and mitigate such hallucinations. Given the open-ended general-purpose attributes inherent to LLMs, LLM hallucinations present distinct challenges that diverge from prior task-specific models. This divergence highlights the urgency for a nuanced understanding and comprehensive overview of recent advances in LLM hallucinations. In this survey, we begin with an innovative taxonomy of hallucination in the era of LLM and then delve into the factors contributing to hallucinations. Subsequently, we present a thorough overview of hallucination detection methods and benchmarks. Our discussion then transfers to representative methodologies for mitigating LLM hallucinations. Additionally, we delve into the current limitations faced by retrieval-augmented LLMs in combating hallucinations, offering insights for developing more robust IR systems. Finally, we highlight the promising research directions on LLM hallucinations, including hallucination in large vision-language models and understanding of knowledge boundaries in LLM hallucinations.},
language = {en},
number = {2},
urldate = {2026-08-19},
journal = {ACM Transactions on Information Systems},
author = {Huang, Lei and Yu, Weijiang and Ma, Weitao and Zhong, Weihong and Feng, Zhangyin and Wang, Haotian and Chen, Qianglong and Peng, Weihua and Feng, Xiaocheng and Qin, Bing and Liu, Ting},
month = mar,
year = {2025},
pages = {1--55},
}
@misc{artifex_software_pymupdf4llm_2026,
title = {{PyMuPDF4LLM}: {PDF} {Markdown} {Extraction} for {LLM} workflows},
title = {Seeing {Beyond}: {Enhancing} {Visual} {Question} {Answering} with {Multi}-{Modal} {Retrieval}},
...
...
@@ -151,6 +223,21 @@
year = {2022},
}
@misc{lu_bm25s_2024,
title = {{BM25S}: {Orders} of magnitude faster lexical search via eager sparse scoring},
shorttitle = {{BM25S}},
url = {http://arxiv.org/abs/2407.03618},
doi = {10.48550/arXiv.2407.03618},
abstract = {We introduce BM25S, an efficient Python-based implementation of BM25 that only depends on Numpy and Scipy. BM25S achieves up to a 500x speedup compared to the most popular Python-based framework by eagerly computing BM25 scores during indexing and storing them into sparse matrices. It also achieves considerable speedups compared to highly optimized Java-based implementations, which are used by popular commercial products. Finally, BM25S reproduces the exact implementation of five BM25 variants based on Kamphuis et al. (2020) by extending eager scoring to non-sparse variants using a novel score shifting method. The code can be found at https://github.com/xhluca/bm25s},
urldate = {2026-03-31},
publisher = {arXiv},
author = {Lù, Xing Han},
month = jul,
year = {2024},
note = {arXiv:2407.03618},
keywords = {Computer Science - Computation and Language, Computer Science - Information Retrieval},
}
@inproceedings{parry_mechir_2025,
series = {Lecture {Notes} in {Computer} {Science}},
title = {{MechIR}: {A} {Mechanistic} {Interpretability} {Framework} for {Information} {Retrieval}},
\section{Systèmes de Génération et Grands Modèles de Langue Augmentés par Extraction (RAG et RALLM)}
\subsection{Besoin et Définition}
\begin{verbatim}
- Les modèles profonds apprennent sur les données [ref à récupérer]
- Le problème des modèles génératifs : hallucination et connaissance bornée dans
le temps [ref à récupérer]
- Il y a quelques années, on a cherché à associer un base de connaissances à ces
modèles [Lewis+20] (= définition de RAG)
- Ces approches peuvent être appliquées aux tâches et modèles du TALN : RALLM
\end{verbatim}
Les modèles d'apprentissage profond tels que les Réseaux de neurones profond, Réseaux Convolutionnels ou les Réseaux basés sur le mécanisme d'attention constituent leur connaissances à partir des données utilisées pour les entraîner. Cependant, leurs connaissances et leur capacité d'extrapolation sont limités. Cela rend ces modèles vulnérables à l'obsolescence des résultats et aux hallucinations \md{reference valable à trouver}. Pour traiter ces problématiques, \cite{lewis_retrieval-augmented_2020} propose d'associer une base de donnée et un modèle d'extraction des données de cette base à un modèle génératif. La base de donnée permet d'entretenir plus facilement les connaissances du modèle obtenu afin de limiter l'obsolescence des résultats et/ou grandir la base de connaissance selon le besoin ou la tâche visée.\\
% \begin{verbatim}
% - Les modèles profonds apprennent sur les données [ref à récupérer]
% - Le problème des modèles génératifs : hallucination et connaissance bornée dans
% le temps [ref à récupérer]
% - Il y a quelques années, on a cherché à associer un base de connaissances à ces
% modèles [Lewis+20] (= définition de RAG)
% - Ces approches peuvent être appliquées aux tâches et modèles du TALN : RALLM
% \end{verbatim}
Les modèles d'apprentissage profond tels que les réseaux de neurones profond, réseaux convolutionnels ou les réseaux basés sur le mécanisme d'attention constituent leur connaissances à partir des données utilisées pour les entraîner. Cependant, leurs connaissances et leur capacité d'extrapolation sont limités. Cela rend ces modèles vulnérables à l'obsolescence des résultats et aux hallucinations \cite{huang_survey_2025}. Pour traiter ces problématiques, \cite{lewis_retrieval-augmented_2020} propose d'associer une base de donnée et un modèle d'extraction des données de cette base à un modèle génératif. La base de donnée permet d'entretenir plus facilement les connaissances du modèle obtenu afin de limiter l'obsolescence des résultats et/ou agrandir la base de connaissance selon le besoin ou la tâche visée.\\
Les systèmes combinant un modèle d'extraction (\textit{retrieval} en anglais) et un modèle génératif sont appelées systèmes RAG (Retrieval Augmented by Generation). La question ou requête de l'utilisateur est fournie au modèle d'extraction qui récupère les documents ou extraits de documents pertinent au regard de la question. Ces documents ainsi que la question sont alors donnés au générateur qui produit le résultat final. Ce processus est schématisé dans le Figure~\ref{fig:ArchiRAG}
\begin{figure}\begin{center}
...
...
@@ -18,7 +18,7 @@ modèles [Lewis+20] (= définition de RAG)
\label{fig:ArchiRAG}
\end{center}\end{figure}
Les systèmes RAG peuvent être appliqués à de nombreuses tâches générant différents types de données. \md{liste et definition des pricipales tâches aperçues durant le stage} Lorsque le modèle génératif est un Grand Modèle de Langue (LLM), on parle de systèmes RA-LLM \cite{fan_survey_2024}.
Les systèmes RAG peuvent être appliqués à de nombreuses tâches générant différents types de données (génération d'image, génération et/ou complétion de signaux, génération de texte, traduction,...). Lorsque le modèle génératif est un Grand Modèle de Langue (LLM), on parle de systèmes RA-LLM \cite{fan_survey_2024}. Ces modèles sont utilisées pour grande diversité de tâches du traitement automatique des langues. On retrouve notamment les différentes variantes de réponse aux questions (questions à forte intensité de raisonnement, question sur domaine ouvert,...), les tâches d'analyse de texte (vérification de fait, liage d'entité, détection d'entité nommées), des tâches de génération ou de complétion (traduction, prédiction de citation, dialogue, résumé de texte, complétion de texte à trous,...) ou encore les tâches d'extraction (extraction d'information, extraction d'argument, ...)
...
...
@@ -26,14 +26,14 @@ modèles [Lewis+20] (= définition de RAG)
\md{Cette sous-section est un résumé de \cite{fan_survey_2024}}
\begin{verbatim}
Description de l'archi de façon plus avancée
- Ces modèles peuvent être utilisés pour différents types de tâches (voir tableau
csv sur RAGRights)
- Avec le temps, l'idée de [Lewis+20] a été adaptée et augmentée de composants
L'intuition de compléter un modèle génératif avec une base de donnée comme proposé par \cite{lewis_retrieval-augmented_2020} a été reprise à plusieurs reprises. Des stratégies et éléments complémentaires ont été ajoutés à ces systèmes pour faciliter la symbiose entre les deux composants principaux. \cite{fan_survey_2024} propose une nouvelle généralisation de cette famille de modèle illustré par la Figure~\ref{fig:ArchiRALLM}
...
...
@@ -44,10 +44,11 @@ supplémentaires
\label{fig:ArchiRALLM}
\end{figure}
\paragraph{Extracteur} On peut distinguer les extracteurs (aussi appelés retriever) en deux groupes. Les \textit{Sparse retrievers} tels que TF-IDF ou BM25 \md{refs!} exploitent des statistiques sur les documents pour identifier les plus pertinents au regard de la question. Les \textit{Dense retrievers} projettent les documents et les questions dans un espace latent au sein duquel les documents pertinents sont identifiés. On retrouve deux principaux fonctionnements pour ces extracteurs. Les \textit{bi-encodeurs} projettent les documents et les questions séparément alors que les \textit{cross-encodeurs} les projettent sous forme de paires (question, document).
\paragraph{Extracteur} On peut distinguer les extracteurs (aussi appelés retriever) en deux groupes. Les \textit{Sparse retrievers} tels que TF-IDF ou BM25 \cite{sparck_jones_statistical_1972,lu_bm25s_2024} exploitent des statistiques sur les documents pour identifier les plus pertinents au regard de la question. Les \textit{Dense retrievers} projettent les documents et les questions dans un espace latent au sein duquel les documents pertinents sont identifiés. On retrouve deux principaux fonctionnements pour ces extracteurs. Les \textit{bi-encodeurs} projettent les documents et les questions séparément alors que les \textit{cross-encodeurs} les projettent sous forme de paires (question, document) et fournissent directement le score de pertinence.\\
Un hyper-paramètre important pour les extracteurs est la granularité d'extraction. Il correspond à la taille des extraits répertoriés dans la base de donnée. Les échelles les plus courantes sont celles du document, du passage et du token. On parle de \textit{chunk retrieval} pour les deux premières et de \textit{token retrieval} pour la troisième. On parle d'\textit{entity retrieval} lorsque la base est construite sous l'angle de la connaissance et non celui du langage.
\paragraph{Augmentation pré-extraction} Pour permettre une meilleure exploitation des informations disponibles dans la question, certains travaux proposent différentes stratégies de complétion et/ou reformulation de la question sous forme d'une requête. Le framework Rewrite-Retrieve-Read \cite{ma_query_2023} propose de reformuler la question à l'aide d'un autre LLM pour la désambiguïser. L'approche de Query2Doc \cite{wang_query2doc_2023} consiste en générer des pseudo-documents qui pourraient correspondre aux documents pertinents à extraire et de les ajouter à la question avant de donner le tout à l'extracteur. L'objectif est de fournir des indices supplémentaires pour assurer une meilleure pertinence des documents extraits.
\paragraph{Augmentation pré-extraction} Pour permettre une meilleure exploitation des informations disponibles dans la question, certains travaux proposent différentes stratégies de complétion et/ou reformulation de la question sous forme d'une requête. Le framework Rewrite-Retrieve-Read \md{[98 ds Fan+24]} propose de reformuler la question à l'aide d'un autre LLM pour la désambiguïser. L'approche de Query2Doc \md{[156 dans Fan+24]} consiste en générer des pseudo-documents qui pourraient correspondre aux documents pertinents à extraire et de les ajouter à la question avant de donner le tout à l'extracteur. L'objectif est de fournir des indices supplémentaires pour assurer une meilleure pertinence des documents extraits.\\
\md{Ajouter une remaque sur l'echelle des documents (chunk, token, entity)}
\paragraph{Augmentation post-extraction} Pour que les documents extraits soient exploités le mieux possible, plusieurs travaux s'intéressent à des techniques d'augmentation de cet ensemble d'extraits. Cela peut passer par le classement des documents du plus pertinent eu moins pertinent, le ré-ajustement du classement lorsqu'il existe, la combinaison des résultats de plusieurs extracteurs, la reformulation et/ou la synthèse des documents extraits.
...
...
@@ -61,14 +62,14 @@ supplémentaires
\subsection{Architectures aperçues au cours du stage}
\begin{verbatim}
Au delà de l'innovation de l'architecture, on retrouve des innovations sur plusieurs
caractéristiques de ces modèles : [R24/04] [R16/02]
Au delà des tentatives de perfectionnement des systèmes RAG par la conception de nouvelles approches d'amélioration des entrées et des extraits et de nouvelles techniques d'intégration, cette architecture est aussi concernée par les problématiques de la gestion des données multimodales ou à flux continu, la résolution de tâches nécessitant un raisonnement long ou poussé et les enjeux d'interprétabilité et d'impact environnemental.
...
...
@@ -83,13 +84,13 @@ caractéristiques de ces modèles : [R24/04] [R16/02]
\subsection{Architecture et Modèles utilisées au cours du stage}
\begin{verbatim}
Dans le cadre du stage,
- travailler sur une adaptation du modèle RAG4HN. [Tran+25]
- _description de l'architecture RAG4HN_ + parallèle avec l'architecture générique
de [Fan+23]
- L'extracteur de RAG4HN est mE5 [Wang+25b] (version multilingue de E5 [Whang+25a])
\end{verbatim}
% \begin{verbatim}
% Dans le cadre du stage,
% - travailler sur une adaptation du modèle RAG4HN. [Tran+25]
% - _description de l'architecture RAG4HN_ + parallèle avec l'architecture générique
% de [Fan+23]
% - L'extracteur de RAG4HN est mE5 [Wang+25b] (version multilingue de E5 [Whang+25a])
% \end{verbatim}
Dans la suite, nous utilisons une version simplifiée de l'architecture RAG4HistoricalNewspaper conçue par \cite{tran_retrieval_2024}. Cette architecture est conçue pour faciliter l'exploration d'archives de journaux historiques. Comme illustré dans le Figure~\ref{fig:RAG4HN}, un premier extracteur récupère les articles pertinents au regard de leur titre. Ces informations sont utilisées pour orienter l'extraction des extraits articles. Dans le cas où aucun titre ou document ne sont extraits, des ressources sont récupérées via une recherche Web. La première extraction peut être vue comme une amélioration de la requête pour l'extraction des extraits d'articles. Les deux extracteurs utilisent le modèle mE5-small de \cite{wang_multilingual_2024} et ChromaDB pour la gestion des données. Après l'extraction, les articles obtenus sont reclassés. Le score utilisé est issu d'une combinaison linéaire entre le score de Cohere et le TF-IDF des titres concaténés avec les étiquettes des entités nommées qu'ils contiennent. Seuls les trois meilleurs documents au dessus d'un certain seuil sont conservés. Ce reclassement est une technique d'amélioration des ressources extraites. Pour finir, les documents et la question initiale sont fournis à travers une prompt template à LLaMa3 \cite{touvron_llama_2023} qui est utilisé comme générateur.
...
...
@@ -107,13 +108,13 @@ de [Fan+23]
\subsection{Trustworthy AI}
\begin{verbatim}
La définition d'IA de confiance (Trustworthy AI) tend à varier en fonction des situation
et des utilisations de cette expression. Danss le contexte du Machine Learning, on désigne
l'IA de confiance comme l'ensembles des systèmes d'IA dans lesquels il est légitime (dans
le sens humainement entendable) d'avoir confiance. Le NIST (National Institute of Standards
and Technology (US)) propose différents axes ou composantes de l'IA de confiance : ... [Ni+25] + [Ref citée par Ni+25 du NIST]
\end{verbatim}
% \begin{verbatim}
% La définition d'IA de confiance (Trustworthy AI) tend à varier en fonction des situation
% et des utilisations de cette expression. Danss le contexte du Machine Learning, on désigne
% l'IA de confiance comme l'ensembles des systèmes d'IA dans lesquels il est légitime (dans
% le sens humainement entendable) d'avoir confiance. Le NIST (National Institute of Standards
% and Technology (US)) propose différents axes ou composantes de l'IA de confiance : ... [Ni+25] + [Ref citée par Ni+25 du NIST]
% \end{verbatim}
La définition d'IA de confiance (Trustworthy AI) n'est pas fixée et change souvent en fonction des contextes d'utilisations de cette expression. Dans le cas du Machine Learning, on désigne l'IA de confiance comme l'ensemble des systèmes d'IA dans lesquels il est légitime (dans le sens humainement entendable) d'avoir confiance. \cite{ni_towards_2025} rappèle les composantes de l'IA de confiance proposés par Le NIST (National Institute of Standards and Technology (USA)):
...
...
@@ -130,21 +131,23 @@ and Technology (US)) propose différents axes ou composantes de l'IA de confianc
\subsection{Explicabilité pour le RAG}
\begin{verbatim}
Dans la suite, nous nous concentrons sur l'explicabilité dans le contexte du RAG. [Ni+25]
distingue deux temps pour l'explicabilité : Extraction et génération ... (prévoir la question
de l'association/intégration des deux)
- Métrique ??
\end{verbatim}
\md{Je pensais initialement rédiger cette partie en calquant sur la partie \cite{ni_towards_2025} correspondante comme je l'ai fait pour la sous-section précédente. Certains éléments de sa version des fait ne me plaisent plus autant donc j'ai préféré une version plus gros grain avec une part de jugement personnel. Je ne sais pas si ce format est adapté pour un état de l'art.}
% \begin{verbatim}
% Dans la suite, nous nous concentrons sur l'explicabilité dans le contexte du RAG. [Ni+25]
% distingue deux temps pour l'explicabilité : Extraction et génération ... (prévoir la question
% de l'association/intégration des deux)
% - Métrique ??
% \end{verbatim}
L'explicabilité de l'intelligence artificielle, vise à rendre humainement compréhensible les raisons pour lesquelles un modèle ou système génère une certaine sortie. \cite{garouani_investigating_2024,bell_its_2022}.
\color{gray}
Dans le contexte de l'explicabilité des systèmes RAG, \cite{ni_towards_2025} distingue trois temps : l'explication de l'extracteur, l'explication du générateur et la mise en perspective de ces deux éléments. \md{Sachant qu'il faut aussi compter les autres composants, il ne faut peut être pas garder cette idée.}
% \color{gray}
% Dans le contexte de l'explicabilité des systèmes RAG, \cite{ni_towards_2025} distingue trois temps : l'explication de l'extracteur, l'explication du générateur et la mise en perspective de ces deux éléments. \md{Sachant qu'il faut aussi compter les autres composants, il ne faut peut être pas garder cette idée.}
\paragraph{Explicabilité pour les extracteurs} Lorsqu'on se concentre sur l'extraction des document dans un modèle de RAG, on retrouve une tâche d'extraction d'information. \cite{ni_towards_2025} distingue quatre approches d'explication des modèles d'extraction d'information. Les méthodes \textit{post-hoc} construisent des explications à partir des résultats fournis par le modèle sans s'intéresser à l'entraînement ni la conception du modèle étudié. Les méthodes \textit{basées sur les axiomes}, exportent les méthode d'extraction d'information axiomatique pour expliquer d'autres modèles. Les méthodes de \textit{probing} cherchent à localiser les connaissances et les compétences dans les poids et l'espace latent d'un modèle. Pour finir, Certains modèles sont \textit{interprétables by-design} : leur définition est une explication de leur fonctionnement.
% \paragraph{Explicabilité pour les extracteurs} Lorsqu'on se concentre sur l'extraction des document dans un modèle de RAG, on retrouve une tâche d'extraction d'information. \cite{ni_towards_2025} distingue quatre approches d'explication des modèles d'extraction d'information. Les méthodes \textit{post-hoc} construisent des explications à partir des résultats fournis par le modèle sans s'intéresser à l'entraînement ni la conception du modèle étudié. Les méthodes \textit{basées sur les axiomes}, exportent les méthode d'extraction d'information axiomatique pour expliquer d'autres modèles. Les méthodes de \textit{probing} cherchent à localiser les connaissances et les compétences dans les poids et l'espace latent d'un modèle. Pour finir, Certains modèles sont \textit{interprétables by-design} : leur définition est une explication de leur fonctionnement.
\color{black}
% \color{black}
Dans le contexte de l'explicabilité des systèmes RAG, \cite{ni_towards_2025} propose de distinguer l'explication du modèle d'extraction et l'explication du modèle génératif. De façon plus générale, une approche naïve d'explication des systèmes RAG est de construire des explications pour chaque composant du modèle (extraction, génération, améliorations, ...). La difficulté intervient au moment de mettre en perspective les explications fournies entre elles. \cite{ni_towards_2025} souligne l'absence de de méthode d'explication pour l'extraction d'information spécifique contexte du RAG ni d'étude de l'application des méthodes génériques à ce cas. La même question se pose pour l'explication des modèle génératifs : les méthodes d'explications classiques sont-elles capable de prendre en compte la présence des autres composants?
...
...
@@ -154,12 +157,12 @@ de l'association/intégration des deux)
\subsection{Interprétabilité Mécaniste}
\begin{verbatim}
[Somvanshi+25]
- Interprétabilité vs Explicabilité
- Définition d'Interprétabilité Mécaniste et approches (Manual Circuit Tracing,
*Intervention-based technique*, Representation analysis, Toy Model and synthetic tasks)
\end{verbatim}
% \begin{verbatim}
% [Somvanshi+25]
% - Interprétabilité vs Explicabilité
% - Définition d'Interprétabilité Mécaniste et approches (Manual Circuit Tracing,
% *Intervention-based technique*, Representation analysis, Toy Model and synthetic tasks)
% \end{verbatim}
L'explicabilité de l'intelligence artificielle est constituée de deux branches. Certains modèles contiennent leur explication. On parle de modèle \textit{explicable by-design}. C'est le cas des premiers modèles de machine learning tels que les arbres de décision mais aussi de modèles plus récents comme les Sparse Auto-Encodeurs.\\
Les modèles explicables by-design s'opposent à des modèles plus opaques tels que les réseaux de neurones profonds. Le processus de décision de ces modèles n'est pas directement accessible. Les méthodes d'\textit{explicabilité post-hoc} permettent de construire des explications à partir de l'étude de leur comportement.
...
...
@@ -179,12 +182,12 @@ de l'association/intégration des deux)
\subsection{Activation Patching}
\begin{verbatim}
- Définition de activation patching [Chen+24] [R30/04] [Séminaire CA]
- MechIR [Parry+25]
- Perturbation
- Données produites, visualisation et interprétation des graphiques
\end{verbatim}
% \begin{verbatim}
% - Définition de activation patching [Chen+24] [R30/04] [Séminaire CA]
% - MechIR [Parry+25]
% - Perturbation
% - Données produites, visualisation et interprétation des graphiques
% \end{verbatim}
\subsubsection{Définiton et fonctionnement de l'Activation Patching}
L'activation patching est une méthode d'interprétabilité mécaniste intervention-based pour les modèles profond. Elle identifie les composants d'un modèle sensibles à une famille de perturbations des entrées minimales pour changer la sortie \cite{geiger_causal_2021}. Pour cela, on effectue trois passes du dataset par perturbation : une sur les entrées non perturbées, une sur les entrées perturbées pour lesquelles on sauvegarde toutes les activations intermédiaires et une sur les entrées perturbées mais dans une version du modèle avec une activation remplacée par l'activation équivalente de la passe sur les données non perturbées. On s'intéresse alors à combien ce remplacement rapproche la sortie de celle attendue.
...
...
@@ -226,7 +229,7 @@ de l'association/intégration des deux)
\subsubsection{Implémentation de l'Activation Patching}
\cite{parry_mechir_2025} propose MechIR\md{\cite{mechir}}, une implémentation en python des outils permettant d'appliquer les méthodes d'interprétabilité mécaniste à des modèles PyTorch et des modèles issus de HuggingFace. MechIR permet notamment de mettre en place l'activation patching comme proposé par \cite{chen_axiomatic_2024}.
\cite{parry_mechir_2025} propose MechIR, une implémentation en python des outils permettant d'appliquer les méthodes d'interprétabilité mécaniste à des modèles PyTorch et des modèles issus de HuggingFace. MechIR permet notamment de mettre en place l'activation patching comme proposé par \cite{chen_axiomatic_2024}.
MechIR permet à l'heure actuelle d'appliquer trois formes de perturbation sur les documents: