Files
Delhoute_20632000_2026.pdf
UCLouvain restricted access - Adobe PDF
- 2.96 MB
Details
- Supervisors
- Faculty
- Degree label
- Abstract
- Ce mémoire se concentre sur la conception d’un pipeline séquentiel capable de transformer des CV en données structurées au sein d’une entreprise de conseil de données du nom de Beyond Data Group. La conception de cet outil combine la vision par ordinateur, la classification textuelle et la reconnaissance d'entités nommées avec pour objectif d’extraire et de structurer automatiquement les informations contenues dans des CV. Lors de la construction de ce pipeline deux questions de recherche ont guidé ce travail. Premièrement, « Dans quelle mesure un pipeline séquentiel combinant détection visuelle de blocs de texte, classification sémantique et reconnaissance d'entités nommées constitue-t-il une approche viable et fiable pour l'extraction structurée d'informations à partir de CV multilingues aux mises en page hétérogènes ? » et deuxièmement, « Dans quelle mesure l'intégration d'un modèle de classification basé sur BERT multilingue améliore-t-elle la précision de classification de segments textuels issus de CV hétérogènes par rapport aux algorithmes d'apprentissage supervisé traditionnels et ce gain de performance justifie-t-il le surcoût computationnel qu'il implique ? » Ce mémoire est structuré en différentes parties. La première partie présente un contexte théorique afin de comprendre les fondements de la détection de régions dans les documents visuels, de la classification de segments textuels et de la reconnaissance d'entités nommées. Ensuite, la méthodologie mise en œuvre ainsi que les choix techniques retenus pour la construction du pipeline sont présentées et justifiées. Pour finir, les résultats obtenus à chaque étape du pipeline ainsi que l'évaluation de bout en bout sont analysés, avant de répondre aux deux questions de recherche et de discuter des limites et des perspectives de ce travail.