<fontcolor="blue"> Les nouvelles informations sont en bleu dans le document.</font>
## Administratif et organisationnel
- Audition blanche en visio pour Thèse à Lannion prévue le 22/05 de 9h30 à 10h30 -> J'aurai besoin d'une salle de réunion
<fontcolor="blue">
- Rendez-vous de mercredi 29/04 14h-16h : J'ai redécouvert un RDV dans mon agenda à 16h30 donc on ne pourra pas dépasser 16h10
</font>
## Bibliographie pour le projet
### Dataset
...
...
@@ -14,6 +18,8 @@ J'ai identifié plusieurs datasets en plus des benchmarks repérés. Voici ce qu
Je ne pense pas que les données en français proposées par BERGEN soient intéressantes. Par contre, **MIRACL** et **TyDi-QA** sont des ressources de données pour la tache de QA utiles.
<fontcolor="blue"> Après relecture, il n'y a pas de données en français dans TyDi-QA. On ne pourra pas l'exploiter.</font>
### Modèles de RAG
J'ai exploré deux modèles parmi ceux que nous avons trouvés et ceux que j'ai récupéré des proceedings :
-[[Bellart & Deleruyelle 2025](https://editions-rnti.fr/?inprocid=1003045)] *TalanSeeker : Application de l'architecture RAG pour la sélection de profils en conseil* La tache visée est l'extraction de CV correspondant aux besoins de recrutement exprimés via un chatbot. Le [github](https://github.com/TalanRecherche/Talanseeker-Backend) fourni presque tout ce qu'il faut pour faire fonctionner l'application qui contient le modèle mais je n'ai pas trouvé sa définition dans le code.
...
...
@@ -32,4 +38,31 @@ J'ai retenu 4 publications que je compte reprendre en profondeur plus tard (2 su
-[[Vast et al., 2025](https://talnarchives.atala.org/ateliers/2025/CORIA/1.html)] Comprendre la Nature des Signaux de Correspondance dans les Modèles Neuronaux pour la RI
## Prise en main
Je me suis lancée dans la prise en main du code fourni par [[Tran et al., 2025]](https://inrap.hal.science/INSA-CVL/hal-04796088v1) sur ce [github](https://github.com/trungv28/Retrieval-Augmented-Generation-for-historical-newspapers/tree/main). Pour cela, je me suis remise sur la prise en main des outils de CaSciModOT. J'ai passé la journée de mardi sur la résolution de conflit de dépendances liés aux problèmes de disponibilités des librairies sur conda-forge. Il semble que deux librairies (langchain-community et langchain-classic) aient besoin d'une version différente d'un même dépendance (langchain-text-splitters). Je continue à investiguer cela dans les prochains jours. Par conséquent, je n'ai toujours pas fait tourner le code fourni sur le github à l'heure actuelle.
\ No newline at end of file
Je me suis lancée dans la prise en main du code fourni par [[Tran et al., 2025]](https://inrap.hal.science/INSA-CVL/hal-04796088v1) sur ce [github](https://github.com/trungv28/Retrieval-Augmented-Generation-for-historical-newspapers/tree/main). Pour cela, je me suis remise sur la prise en main des outils de CaSciModOT. J'ai passé la journée de mardi sur la résolution de conflit de dépendances liés aux problèmes de disponibilités des librairies sur conda-forge. Il semble que deux librairies (langchain-community et langchain-classic) aient besoin d'une version différente d'un même dépendance (langchain-text-splitters). Je continue à investiguer cela dans les prochains jours. Par conséquent, je n'ai toujours pas fait tourner le code fourni sur le github à l'heure actuelle.
<fontcolor="blue">
Après plusieurs tentatives de résolution des problèmes de mise en place de l'environnement, j'ai choisi de reprendre le code pour utiliser les versions récentes les librairies langchain (dont la structure a été refondue depuis la publication du [github RAG4historical-newspapers](https://github.com/trungv28/Retrieval-Augmented-Generation-for-historical-newspapers/tree/main)). J'ai donc
- mis de coté les imports non utilisés dans les notebooks et scripts python
- mis à jour la liste des librairies à importer
- déduit les librairies requises pour executer les documents
- repris la liste des librairies pour rester compatibles avec le catalogue forge-conda. Une partie des librairies est à installer via conda et une autre via pip. Les listes de librairies sont dans les fichiers `ragrights/ChallengeEvalLLM/req_rag4hn_conda.txt`et `ragrights/ChallengeEvalLLM/req_rag4hn_pip.txt`.
- installé le nouvel environnement sur la grappe de calcul
Je suis actuellement en train de vérifier que la code fonctionne toujours avec les modifications d'installation que j'ai effectuées. Cela permettra d'avoir une première quasi reproduction du modèle proposé par [[Tran et al., 2025]](https://inrap.hal.science/INSA-CVL/hal-04796088v1).
Je me suis permise d'écarter la partie websearch (voir image après) d'office car elle ne nous sert pas et n'est pas commentée dans l'évaluation présentée dans la publication.
J'ai lancé une execution du script qui génère les données. Ce qui prendra de l'ordre de 4h d'après mes précédentes tentatives Je passerai les notebooks dessus dans la foulée.
</font>
![Pipeline de RAG4HN proposé par [Tran et al., 2025]](../images/pipe_RAG4HN.png)
<fontcolor="blue">
En attendant, j'ai commencé à reprendre plus sérieusement les données ciblées. Je compte
- repérer la structure des données
- en extraire (au moins une partie) pour les mettre au format pour l'usage de MechIR