A Study of Sentence-Level Simplification of French Medical Texts

(2025)

Files

FADDA_63462200_2025.pdf
  • Open access
  • Adobe PDF
  • 2.33 MB

Details

Supervisors
Faculty
Degree label
Abstract
This thesis investigates a hybrid methodology for semantic textual similarity (STS) in French, applied to the medical domain to support text simplification (TS). TS seeks to make complex texts more understandable, benefiting diverse audiences such as patients, second-language learners, or people with cognitive impairments. However, in French, and particularly in specialised fields like medicine, there is a scarcity of domain-specific parallel corpora essential for developing automatic simplification systems. The methodology studied combines sentence embeddings from large French language models with a set of classical similarity measures. Experiments include a regression task using the DEFT’20 corpus and a classification task on CLEAR data. The hybrid model achieved a Spearman correlation of 0.91, surpassing the best DEFT 2020 results by 0.11. In classification, it reached 97.8% accuracy, confirming the validity of the model that outperformed models based solely on embeddings or measures.
Ce mémoire explore une méthodologie hybride pour la similarité sémantique textuelle (STS) en français, appliquée au domaine médical afin de faciliter la simplification de textes (TS). La TS vise à rendre les textes complexes plus compréhensibles, ce qui profite à divers publics tels que les patients, les apprenants d'une langue étrangère ou les personnes souffrant de troubles cognitifs. Cependant, en français, et en particulier dans des domaines spécialisés comme la médecine, il existe une pénurie de corpus parallèles spécifiques au domaine, essentiels pour développer des systèmes de simplification automatique. La méthodologie étudiée combine l'intégration de phrases issues de grands modèles linguistiques français avec un ensemble de mesures de similarité classiques. Les expériences comprennent une tâche de régression utilisant le corpus DEFT'20 et une tâche de classification sur les données CLEAR. Le modèle hybride a atteint une corrélation de Spearman de 0,91, surpassant de 0,11 les meilleurs résultats du DEFT 2020. En classification, il a atteint une précision de 97,8 %, confirmant la validité du modèle qui a surpassé les modèles basés uniquement sur les plongements ou les mesures.