Commit 98493744 authored by Delvallez Delvallez's avatar Delvallez Delvallez

Initialisation du dépot

parent 22fe2085
# RAGRights # RAGRights
Support de travail du stage de Marine Delvallez sur les projets du CRIJ et ARTESU.
Archi,Source (github),Publi,Année,Type,Tâche,DB/Bench d'éval,Objet,Commentaires
TF-IDf,,,,Lexical,,,Extraction,
BM25,multiples biblio python,,,Lexical,,,Extraction,Performant sur l'extraction de données avec bonne supperposition lexicale
DeepCT,https://github.com/AdeDZY/DeepCT,,2020,Sparse,,,,
Dense Pasage Retrieval,https://github.com/facebookresearch/DPR,https://aclanthology.org/2020.emnlp-main.550.pdf,2020,Dense,"Open Dom QA","Données Wikipédia traitées maison
Natural Questions, TriviaQA, WebQuestions, CuratedTREC, SQuAD v1.1","Extraction","Un peu ancien..
Retriever seulement
Bi-encodeur
Apprentissage supervisé"
PaperQA2,https://github.com/Future-House/paper-qa,https://arxiv.org/pdf/2409.13740,2024,Agent,"Summarization, Contradiction detection, QA",LitQA2 (bench aussi publié dans le même papier),Full Pipeline,"Coût de calcul énorme, Adaptation non garantie"
HM-RAG,https://github.com/ocean-luna/HMRAG,https://dl.acm.org/doi/10.1145/3746027.3754761,2025,Agent,"ScienceQA, CrisisMMD","ScienceQA, CrisisMMD",Full Pipeline,Multimodal
"[Lewis et al., 2020]","https://github.com/huggingface/transformers/blob/master/examples/rag/
https://huggingface.co/rag/","[Lewis et al., 2020]
https://arxiv.org/abs/2005.11401",2020,Dense,"Open-domain QA, Jeopardy Question Generation","Natural Question, TriviaQA, WebQuestions, CuratedTrec, MSMARCO NLG task v2.1, SearchQA, FEVER","Full-Pipeline
DPR+BART","mémoire paramétrique (BART) et non-paramétrique (RAG) en mm temps
Rédaction orientée très ingénierie
Finetuning supervisé "
Contriever,https://github.com/facebookresearch/contriever,https://arxiv.org/abs/2112.09118,2022,Dense,,"Data: Wikipedia, CCNet (50/50)
Bench (0-shot learn) : BEIR",Retriever + entrainement par contrastive Learning,"Démonstration de l'entrainement de dense retrieval par constrastive learning (auto-supervisé)
2022..."
Atlas,https://github.com/facebookresearch/atlas,https://dl.acm.org/doi/epdf/10.5555/3648699.3648950,2023,Dense,"Knowledge Intensive tasks (QA, fact checking,...)","Natural Questions, MMLU, KILT, TriviaQA, FEVER, TempLAMA (extraits)",FullPipeline,Few-shot learning with RAG
Search in the Chain (SearChain),https://github.com/xsc1234/Search-in-the-Chain,https://arxiv.org/abs/2304.14732,2024,framework,"Knowledge intensive tasks (QA, slot filling, fact checking, long-form QA)","HotpotQA, Musique, WikiMultiHopQA, StrategyQA, zsRE, T-REx, FEVER, ELI5,... ",Framework d'interaction entre Retriever et Generator,"Multiples allez-retours entre IR et LLM pour construire une chaine de raisonnement (suite de sous taches déterminées par le LLM) qui est vérifiée, documentée et réorientée par le IR. Cela nourri le LLM (et retour au début de la boucle)."
\ No newline at end of file
BDD/ Bench,Publi,Source,Données,Statistiques,Commentaire
BIRCO,https://arxiv.org/abs/2402.14151,https://github.com/BIRCO-benchmark/BIRCO,"5 BDD pré-existantes:
- DORIS-MAE
- ArguAna
- WhatsThatBook
- RECLIC
- Clinical-Trial","60 + 100 + 100 + 100 + 100 questions
110/ 50/ 50-100/ 50? passages positifs par entrée",Évaluation de LLM based Information Retriever
Bright,https://arxiv.org/abs/2407.12883v4,"https://github.com/xlang-ai/BRIGHT
https://huggingface.co/datasets/xlangai/BRIGHT","- 7 BDD StackExchange fait main
- TheoremQA + AoPS (Pb de maths + solutions récoltés)
- 2 BDD codage",,Tâche reasoning intensive -> pas ce qu'on veut
BEIR,https://arxiv.org/abs/2104.08663v4,"https://github.com/beir-cellar/beir
https://huggingface.co/BeIR
","18 datasets :
- Fact-checking : FEVER, Climate-FEVER, SciFact
- Citation prediction : SCIDOCS
- Dup Question Retrieval : Quora, CQADupStack
- Argument Retrieval : Touche-2020, ArgAna
- News Retrieval : TREC-NEWS, Robust04
- QA: NQ, HotpotQA, FiQA-2018
- Tweet Retrieval : Signal-1M
- Bio-MedicalIR : TREC-COVID, BioASQ, NFCorpus
- Entity Retrieval : DBPedia
-
",,Zero-shot learning en IR
MS-MARCO,https://arxiv.org/abs/1611.09268,https://huggingface.co/datasets/microsoft/ms_marco,,"1M questions
8,841,823 passages issus de 3,563,535 pages web
182,669 human generated answers
",Reading comprehension
KILT,https://arxiv.org/abs/2009.02252,https://github.com/facebookresearch/KILT,"
Fact checking: FEVER
Open domain QA: Natural Questions, HotpotQA, TriviaQA, ELI5
Slot filling: Zero Shot RE, T-REx
Entity linking : AIDA CoNLL-YAGO, WNED-WIKI, WNED-CWEB
Dialogue: Wizard of Wikipedia
",5.9M Articles wikipedia 2019/08/01,"Knowledge Intensive Language Tasks
task-agnostic knowledge representation model
propose un sourcing des éléments de réponse issus des docs pour chaque question
jsonLine
"
\ No newline at end of file
# Tâche de l'IA du projet du CRIJ
## Biblio - Tâches existantes
- Extraction de documents & synthèse
- Outils
- [PaperQA2](https://github.com/Future-House/paper-qa) - [[Skarlinski et al., 2024](https://arxiv.org/abs/2409.13740)]
- Bench
-
- Extraction de d'informations/ de passage
- *Open Domain* Question Answer
- Entity linking
## Pistes des attendus
### Entrée
- documents hautement hétérogènes (JO, comm publique)
### Action - Attendu
- pas du reasoning -> laissé à l'humain
- extraction de document
- résumé de document (et du dispositifs décrit)
### Sortie
- bon retour de document (rappel > précision)
- répond au problème
- correspond au profil
- est une approx du profil (des paramètres possible à adapter différents [demandeur d'emploi, lieu de résidence,...])
- détection de contradiction/ complémentarité des dispositifs / incitation au changement de situation (être suffisamment flou / hors sujet pour inciter à proposition d'un changement de situation (demande d'emploi, déménagement, établissement d'inscription,...))
- cartographie des documents en sortie
- situer les dispositifs les uns par rapports aux autres
- situer le dispositifs dans l'ensemble des dispositifs (problématique traitées, problématiques connexes)
- résumé de dispositif
## Démarche de résolution
1. Selection de documents/dispositifs correspondant à la problématique [Doc Extraction]
- Peut être traité via bonne représentation interprétable
2. Écartement des dispositifs dont le profil est non-éligible (sauf à un critère souple prêt)
- besoin de trouver les infos dans le(s) descriptif(s) [Summary]
- besoin de les comparer [Fact Checking??]
- Récapitulatif des dispositifs trouvés
\ No newline at end of file
# Pistes de problématiques scientifiques
## Représentation des données
### Des données multimodales ?
**PB** : BDD avec texte (page web, description), infographie (image&texte), représentations logiques
**Biblio**:
- [Liu et al., 2025](https://dl.acm.org/doi/10.1145/3746027.3754761) HM-RAG :Hierarchical Multi-Agent Multimodal Retrieval Augmented Generation
### Variabilité de la BDD - base de données dynamique
**PB** :
- Des données nouvelles et nouvellement périmées régulièrement.
- Changement partiel du contenu de la BDD
- coût de calcul associé (si dense)
- représentation plus ou moins adaptée pour les nouvelles données (si dense)
*Lorsque le contenu de la base de donnée est soumis à un changement régulier, l'espace de représentation adéquat peu aussi varier (notamment dans le cas du retrieval dense).*
**Biblio**:
- [[Prouteau et al. 2021](https://hal.science/hal-03197434v1)] SINr: Fast Computing of Sparse Interpretable Node Representations is not a Sin!
- Séminaire 23/04/2025 - Nicolas Dugué
- Comment l'ajout après construction de l'espace l'impacte-t-il?
- [[Zhu 2025](https://arxiv.org/abs/2508.05662)] From Static to Dynamic: A Streaming RAG Approach to Real-time Knowledge Base
- traite l'entretien de BDD issu streams de données à fort débit (peu intéressant pour nous)
- peu d'autres propositions
### Représentation permettant une bonne capture de la validité des données
**PB** : La pertinence des données dépends du contenu mais aussi du public visé. Comment capturer ces éléments rare dans la donnée mais important?
**Biblio**:
- [Prouteau et al. 2021](https://hal.science/hal-03197434v1) SINr: Fast Computing of Sparse Interpretable Node Representations is not a Sin!
- [Guillot et al. 2023](https://hal.science/hal-04321407v1) Sparser is better: one step closer to word embedding interpretability
- des axes pour le temps, l'espace, selon plusieurs niveau de granularité de l'espace (ville, département,...), les types de problématique,...
**Parallèle**:
- identification d'essai clinique pour un patient (Clinical-Trial dans BIRCO)
- article (défini par la pub) intéressant pour un profil client
### Frugalité
**PB**:
- exploitation de plusieurs LLM (extraction + génération) : est-il envisageable d'exploiter la représentation de l'extracteur pour la génération ?
**Biblio**
## Explicabilité pour les systèmes à base de RAG
**PB** :
- besoin de récupérer les données qui ont servi à la production de la sortie
- besoin de justifier le résultat
- les données extraites
- fiabilité de la generation
- faible présence de raisonnement dans l'outil -> comment exploiter les graphs dans ce contexte?
**Biblio**:
- [[Prouteau et al. 2021](https://hal.science/hal-03197434v1)] SINr: Fast Computing of Sparse Interpretable Node Representations is not a Sin!
- [Guillot et al. 2023](https://hal.science/hal-04321407v1) Sparser is better: one step closer to word embedding interpretability
Markdown is supported
0% or
You are about to add 0 people to the discussion. Proceed with caution.
Finish editing this message first!
Please register or to comment