**Contexte et problématique** : Lorsqu'on manipule des bases de données dynamique, on est confronté à la *suppression et l'ajout régulier d'éléments* dans cette base qui peut impacter significativement sa représentation <fontcolor="red">**à justifier par citation**</font>. Un espace de représentation de telles bases de données calculé à l'aide des données contenue à un instant fixé T peut perdre en pertinence au fur à mesure des ajouts et suppressions dans la base de données. Pour que cet espace continue à capturer au mieux la base de documents, ce dernier doit *aussi s'adapter à ces changements*. Mettre en place une représentation compatible avec le *continual learning* permettrait de conserver une bonne capture de l'espace des documents disponibles.
-[[Gracianne 2023](https://theses.hal.science/tel-04633635v2)] Exploration de micro-posts d'actualité : représentation, structuration et description
-[[Zhu 2025](https://arxiv.org/abs/2508.05662)] From Static to Dynamic: A Streaming RAG Approach to Real-time Knowledge Base
### Variabilité de la BDD - base de données dynamique
## Interprétabilité
**PB** :
- Des données nouvelles et nouvellement périmées régulièrement.
- Changement partiel du contenu de la BDD
- coût de calcul associé (si dense)
- représentation plus ou moins adaptée pour les nouvelles données (si dense)
*Lorsque le contenu de la base de donnée est soumis à un changement régulier, l'espace de représentation adéquat peu aussi varier (notamment dans le cas du retrieval dense).*
**Contexte et problématique** : Les récents outils d'extraction de connaissances actuels qui utilisent des *approches denses* sont souvent entraînés à l'aide de *méthodes opaques*<fontcolor="red">citations</font>. Dans certaines situations, il est problématique d'exploiter une telle représentation car il y a un fort *besoin d'accessibilité des processus de décision* afin de légitimer ou modérer par l'humain les résultats obtenus. Les approches *interprétables* proposent des modèles dont le fonctionnement est humainement accessible ce qui permet de justifier le choix des données extraites ainsi que leur traitement et exploitation.
**Biblio**:
**Bibliographie** :
-[[Prouteau et al. 2021](https://hal.science/hal-03197434v1)] SINr: Fast Computing of Sparse Interpretable Node Representations is not a Sin!
-[[Prouteau et al. 2021](https://hal.science/hal-03197434v1)] SINr: Fast Computing of Sparse Interpretable Node Representations is not a Sin!
- Séminaire 23/04/2025 - Nicolas Dugué
- Comment l'ajout après construction de l'espace l'impacte-t-il?
-[[Zhu 2025](https://arxiv.org/abs/2508.05662)] From Static to Dynamic: A Streaming RAG Approach to Real-time Knowledge Base
- traite l'entretien de BDD issu streams de données à fort débit (peu intéressant pour nous)
- peu d'autres propositions
### Représentation permettant une bonne capture de la validité des données
**PB** : La pertinence des données dépends du contenu mais aussi du public visé. Comment capturer ces éléments rare dans la donnée mais important?
**Biblio**:
-[Prouteau et al. 2021](https://hal.science/hal-03197434v1) SINr: Fast Computing of Sparse Interpretable Node Representations is not a Sin!
-[Guillot et al. 2023](https://hal.science/hal-04321407v1) Sparser is better: one step closer to word embedding interpretability
-[Guillot et al. 2023](https://hal.science/hal-04321407v1) Sparser is better: one step closer to word embedding interpretability
- des axes pour le temps, l'espace, selon plusieurs niveau de granularité de l'espace (ville, département,...), les types de problématique,...
**Parallèle**:
- identification d'essai clinique pour un patient (Clinical-Trial dans BIRCO)
- article (défini par la pub) intéressant pour un profil client
### Frugalité
## Frugalité
**PB**:
**Contexte et problématique** : Les architectures de RAG récentes exploitant des LLM se composent généralement de plusieurs LLMs. Ces modèles de grande taille sont assez demandant en calcul et donc en énergie lors de leur entraînement et de leur utilisation. Leur présence multiple dans une architecture pose des problème d'un point de vue matériel (besoin d'ordinateurs très puissant) et en terme de consommation. Mettre en commun les représentations des différents modèles présent dans un système RAG pourrait permette de réduire le coût d'entraînement et d'utilisation.
- exploitation de plusieurs LLM (extraction + génération) : est-il envisageable d'exploiter la représentation de l'extracteur pour la génération ?
**Biblio**
## Explicabilité pour les systèmes à base de RAG
**PB** :
- besoin de récupérer les données qui ont servi à la production de la sortie
- besoin de justifier le résultat
- les données extraites
- fiabilité de la generation
- faible présence de raisonnement dans l'outil -> comment exploiter les graphs dans ce contexte?
**Biblio**:
-[[Prouteau et al. 2021](https://hal.science/hal-03197434v1)] SINr: Fast Computing of Sparse Interpretable Node Representations is not a Sin!
-[Guillot et al. 2023](https://hal.science/hal-04321407v1) Sparser is better: one step closer to word embedding interpretability