Commit 52a44d19 authored by Delvallez Delvallez's avatar Delvallez Delvallez

SOTA.autresArchiEtInnovations

parent 21d9aa93
@inproceedings{chen_seeing_2025,
address = {Abu Dhabi, UAE},
title = {Seeing {Beyond}: {Enhancing} {Visual} {Question} {Answering} with {Multi}-{Modal} {Retrieval}},
shorttitle = {Seeing {Beyond}},
url = {https://aclanthology.org/2025.coling-industry.35/},
abstract = {Multi-modal Large language models (MLLMs) have made significant strides in complex content understanding and reasoning. However, they still suffer from model hallucination and lack of specific knowledge when facing challenging questions. To address these limitations, retrieval augmented generation (RAG) has emerged as an effective solution. While incorporating knowledge has led to improvements, it also highlights the need for a more robust knowledge selection strategy. For multi-modal tasks, such as visual question answering (VQA), integrating all modalities is crucial in providing comprehensive information for accurate answers. Therefore, we propose to construct an encoder model for extracting joint embedding from all modalities, enabling alignment between the corresponding query and knowledge through contrastive learning. To further improve performance, we introduce an additional MLLM re-selection step, which selects the best matching knowledge from the top-k retrieved results of our alignment model. We evaluated our method, SeBe-VQA, on the Encyclopedic VQA dataset. Our knowledge retrieval results demonstrate the benefit of our multi-modal framework. By incorporating the retrieved knowledge along with the question, we achieve a significant performance improvement compared with the previous method and scenarios without knowledge provision.},
urldate = {2026-08-19},
booktitle = {Proceedings of the 31st {International} {Conference} on {Computational} {Linguistics}: {Industry} {Track}},
publisher = {Association for Computational Linguistics},
author = {Chen, Boqi and Khare, Anuj and Kumar, Gaurav and Akula, Arjun and Narayana, Pradyumna},
editor = {Rambow, Owen and Wanner, Leo and Apidianaki, Marianna and Al-Khalifa, Hend and Eugenio, Barbara Di and Schockaert, Steven and Darwish, Kareem and Agarwal, Apoorv},
month = jan,
year = {2025},
pages = {410--421},
}
@inproceedings{macavaney_simplified_2021,
title = {Simplified {Data} {Wrangling} with ir\_datasets},
booktitle = {{SIGIR}},
......@@ -173,6 +189,24 @@
keywords = {Computer Science - Artificial Intelligence, Computer Science - Information Retrieval},
}
@inproceedings{prouteau_sinr_2021,
address = {Porto, Portugal},
series = {Lecture {Notes} in {Computer} {Science}},
title = {{SINr}: {Fast} {Computing} of {Sparse} {Interpretable} {Node} {Representations} is not a {Sin}!},
shorttitle = {{SINr}},
url = {https://hal.science/hal-03197434},
doi = {10.1007/978-3-030-74251-5_26},
abstract = {While graph embedding aims at learning low-dimensional representations of nodes encompassing the graph topology, word embedding focus on learning word vectors that encode semantic properties of the vocabulary. The first finds applications on tasks such as link prediction and node classification while the latter is systematically considered in natural language processing. Most of the time, graph and word embeddings are considered on their own as distinct tasks. However, word co-occurrence matrices, widely used to extract word embeddings, can be seen as graphs. Furthermore, most network embedding techniques rely either on a word embedding methodology (Word2vec) or on matrix factorization, also widely used for word embedding. These methods are usually computationally expensive, parameter dependant and the dimensions of the embedding space are not interpretable. To circumvent these issues, we introduce the Lower Dimension Bipartite Graphs Framework (LDBGF) which takes advantage of the fact that all graphs can be described as bipartite graphs, even in the case of textual data. This underlying bipartite structure may be explicit, like in coauthor networks. However, with LDBGF, we focus on uncovering latent bipartite structures, lying for instance in social or word co-occurrence networks, and especially such structures providing conciser and interpretable representations of the graph at hand. We further propose SINr, an efficient implementation of the LDBGF approach that extracts Sparse Interpretable Node Representations using community structure to approximate the underlying bipartite structure. In the case of graph embedding, our near-linear time method is the fastest of our benchmark, parameter-free and provides state-of-the-art results on the classical link prediction task. We also show that low-dimensional vectors can be derived from SINr using singular value decomposition. In the case of word embedding, our approach proves to be very efficient considering the classical similarity evaluation.},
urldate = {2026-03-16},
booktitle = {Lecture {Notes} in {Computer} {Science},},
publisher = {Springer, Cham},
author = {Prouteau, Thibault and Connes, Victor and Dugué, Nicolas and Perez, Anthony and Lamirel, Jean-Charles and Camelin, Nathalie and Meignier, Sylvain},
month = apr,
year = {2021},
keywords = {Community detection, Graph embedding, Linear-time algorithm, Link prediction, Network science, Word embedding},
pages = {325--337},
}
@article{hou_advancing_2025,
title = {Advancing continual lifelong learning in neural information retrieval: {Definition}, dataset, framework, and empirical evaluation},
volume = {687},
......
......@@ -70,7 +70,15 @@ caractéristiques de ces modèles : [R24/04] [R16/02]
- BDD sparse et interprétable [Prouteau]???
\end{verbatim}
Au delà des tentatives de perfectionnement des systèmes RAG par la conception de nouvelles approches d'amélioration des entrées et des extraits et de nouvelles techniques d'intégration, cette architecture est aussi concernée par les problématiques de la gestion des données multimodales ou à flux continu, la résolution de tâches nécessitant un raisonnement long ou poussé et les enjeux d'interprétabilité et d'impact environnemental.
\cite{chen_seeing_2025} propose un système RAG avec une base de données multi-modales où chaque entrée est un couple (image, texte). Les paires extraites à partir de la requête, elle aussi bi-modale, sont ré-ordonnées avant d'être fournies comme contexte au générateur.
Pour traiter les tâches à forte intensité de raisonnement (reasoning intensive tasks), \cite{xu_search---chain_2024} propose un système RAG combiné à un modèle de décomposition de raisonnement (Chain-of-Query). La requête de l'utilisateur est décomposé en sous-requêtes résolues une à une. Elles sont en suite vérifiées à l'aide des documents extraits. Le raisonnement est vérifié, complété et éventuellement repris en fonction du score de crédibilité obtenu. Une trace complète du raisonnement est restituée en sortie.
Les systèmes RAG sont aussi intéressants à intégrer à une architecture agentique en tant que source d'information. \cite{liu_hm-rag_2025} présente un framework Hiérarchique Multi-agent Multi-modal composé d'un agent de décomposition des requêtes utilisateur, d'un agent RAG pour des données structurées, non-structurées et sous forme de graphes et d'un agent de prise de décision construisant la sortie finale.
\cite{zhu_static_2025} s'intéresse au cas particulier des bases de données dynamiques. Lorsque le flux d'apport de donné est important, le besoin de restructuration de la base de donnée est régulier or le coût calculatoire et énergétique associé est dissuasif. \cite{zhu_static_2025} propose StreamingRAG, une architecture composée d'une base de données dynamique qui maintien un ensemble de prototypes compact représentatif du flux de données tout en évitant sa reconstruction permanente.
\subsection{Architecture et Modèles utilisées au cours du stage}
......@@ -205,7 +213,7 @@ de l'association/intégration des deux)
\label{box:activationPatchingIR}
\end{tcolorbox}
L'activation patching fourni trois performances par noeud avec lesquelles on peut estimer la sensibilité de chaque noeud à la perturbation. Si la sensibilité est élevée en valeur absolue, le noeud est sensible à la perturbation. Si la sensibilité est positive, le patch effectué attendue la perturbation. Si la sensibilité est négative, le patch accentue la perturbation. \md{Nouveauté à utiliser pour l'interpretation des matrices...}
L'activation patching fourni trois performances par noeud avec lesquelles on peut estimer la sensibilité de chaque noeud à la perturbation. Si la sensibilité est élevée en valeur absolue, le noeud est sensible à la perturbation. Si la sensibilité est positive, le patch effectué atténue la perturbation. Si la sensibilité est négative, le patch accentue la perturbation. \md{Nouveauté à utiliser pour l'interpretation des matrices...}
\subsubsection{Implémentation de l'Activation Patching}
......@@ -220,7 +228,7 @@ de l'association/intégration des deux)
Pour qu'une perturbation soit pertinente, elle doit changer significativement la sortie du modèle (ie. perturbe significativement le score) sans dénaturer excessivement l'entrée. MechIR propose une visualisation préalable de la distribution des scores de pertinence attribué par le modèle sur les données et les données perturbées (voir Figure~\ref{fig:PerturbationVizMechIRDemo})pour estimer la capacité de la perturbation à impacter les scores. Une perturbation impacte significativement les sorties des paires question, document si les distributions des scores de pertinence pour les documents perturbés et non-perturbés sont significativement différentes.
Par exemple, la Figure~\ref{fig:PerturbationVizMechIRDemo} Visualise les distribution des scores de pertinences pour trois perturbation (ajouter \textit{microwave} au début du document, ajouter \textit{microwave} à la fin du document et remplacer \textit{microwave} par \textit{toaster}). Le dataset utilisé est une partie du dataset Vaswani issu de la librairie irdataset \cite{hou_advancing_2025} et le modèle analysé est TAS-B \cite{hofstatter_efficiently_2021}.\\
Par exemple, la Figure~\ref{fig:PerturbationVizMechIRDemo} visualise les distributions des scores de pertinence pour trois perturbations (ajouter \textit{microwave} au début du document, ajouter \textit{microwave} à la fin du document et remplacer \textit{microwave} par \textit{toaster}). Le dataset utilisé est une partie du dataset Vaswani issu de la librairie irdataset \cite{hou_advancing_2025} et le modèle analysé est TAS-B \cite{hofstatter_efficiently_2021}.\\
L'axe des abscisses correspond à la valeur prise par les scores et l'axe des ordonnées à leur densité. Plus la densité est élevée, plus il y a de scores proche de la valeur en ordonnée. La distribution des scores de pertinence des documents vis à vis des question est représentée en jaune et celle des scores pour les documents perturbés est en vert. La distribution des scores pour les documents non perturbés est identique pour les trois perturbation étant donné qu'on manipule le même dataset. Les perturbations de type \append et \replace impactent un peu les distribution des scores mais elles continuent à suivre la mème tendance. La perturbation de type \prepend impacte plus la distribution des scores de pertinence : les densité sont élevées pour les scores différent et le profil de la courbe est très différent pour les scores de documents perturbés et non perturbés.
\begin{figure}\begin{center}
......@@ -229,7 +237,7 @@ de l'association/intégration des deux)
\label{fig:PerturbationVizMechIRDemo}
\end{center}\end{figure}
Une fois la perturbation choisie, on peut appliquer l'activation patching pour chaque noeud du modèle choisi et visualiser les sensibilité à la perturbation de chacun d'entre eux (voir Figure~\ref{fig:SensibiliteVizMechIRDemo}).
Une fois la perturbation choisie, on peut appliquer l'activation patching pour chaque noeud du modèle choisi et visualiser les sensibilité à la perturbation de chacun d'entre eux (voir Figure~\ref{fig:SensibiliteVizMechIRDemo}). Chaque noeud du modèle est identifié à l'aide ses coordonnées (numéro de couche, position dans la couche). Le score du noeud correspond à la moyenne des sensibilité obtenu pour chaque document. Plus le noeuds à un score élevé en valeur absolue (ie. plus la couleur est foncée), plus la perturbation impacte son comportement. Cela signifie que la modification porte sur une information utilisée par le noeud dans le modèle. Si le score est positif (resp. négatif), le patching atténue (resp. accentue) la perturbation en moyenne.
\begin{figure}
\includegraphics[width=0.8\textwidth]{images/ActivationPatchingAllHeadExempleMechIR.png}
......@@ -237,4 +245,5 @@ de l'association/intégration des deux)
\label{fig:SensibiliteVizMechIRDemo}
\end{figure}
Dans la Figure~\ref{fig:SensibiliteVizMechIRDemo}, on identifie chaque noeud du modèle à l'aide ses coordonnées (numéro de couche, position dans la couche). Le score affiché correspond à la moyenne des sensibilité obtenu pour chaque document Plus le noeuds à un score élevé en valeur absolue (ie. plus la couleur est foncée), plus la perturbation impacte le comportement du noeuds. Cela signifie que la modification portait sur une information utilisée par le noeud dans le modèle. \md{à finir}
Dans la Figure~\ref{fig:SensibiliteVizMechIRDemo}, on remarque principalement le noeud (1,6). Une interprétation possible est que le patching du noeud diminue fortement l'estimation de pertinence effectuée par le modèle sur les documents non perturbé. \md{pas satisfaisant}
Markdown is supported
0% or
You are about to add 0 people to the discussion. Proceed with caution.
Finish editing this message first!
Please register or to comment