Alignement de sources de données disparates à l’aide de grands modèles de langage
- Kired, Nour Elhouda (2000-....) (2025)
Thèse
- Numéro national de thèse
- 2025TLSEJ141
- Titre en français
- Alignement de sources de données disparates à l’aide de grands modèles de langage
- Titre en anglais
- Aligning disparate data sources using large language models
- Directeur de recherche
- Teste, Olivier (1972-....)
- Date de soutenance
- 2 décembre 2025
- École doctorale
- MITT : Mathématiques Informatique Télécommunications de Toulouse
- Unité de recherche
- Institut de Recherche en Informatique de Toulouse - IRIT
- Mots-clés en français
- Appariement de données
- Données tabulaires disparates
- Génération d'information auxiliaire
- Apprentissage automatique
- Méta-espace
- Mots-clés en anglais
- Data Matching
- Disparate Tabular Data
- Auxiliary Information Generation
- Machine Learning
- Meta Space
- Résumé
-
Cette thèse s’inscrit dans le domaine de l’intégration de données, et plus particulièrement dans l’alignement de schémas de données tabulaires hétérogènes et incomplets. Dans des environnements tels que les lacs de données, les systèmes fédérés ou les bases multi-modèles, les sources de données présentent souvent des disparités : certaines ne disposent que d’un schéma (colonnes sans instances), d’autres uniquement d’instances (valeurs sans attributs), ou encore des versions partielles et bruitées. Ces situations compliquent considérablement les tâches classiques de correspondance de schémas, qui supposent habituellement des sources complètes et symétriques.
Pour relever ce défi, nous introduisons le concept de génération de contexte, consistant à produire automatiquement les éléments manquants (par exemple, générer des instances plausibles à partir d’un schéma, ou inférer des noms de colonnes à partir de valeurs). Grâce aux avancées des modèles de langage de grande taille (LLMs), il devient possible de synthétiser des contextes réalistes et pertinents, puis de les exploiter dans des processus de mise en correspondance.
La contribution principale de cette recherche est le développement d’un cadre unifié de correspondance de schémas capable de fonctionner dans des scénarios variés, qu’ils soient conformes (sources complètes, uniquement schéma, uniquement instances) ou disparates (sources partiellement ou asymétriquement spécifiées). Deux approches sont proposées :
1. une approche non supervisée, combinant plusieurs algorithmes de correspondance enrichis par contexte généré,
2. une approche supervisée, qui exploite des représentations vectorielles (embeddings) et un ensemble riche de méta-caractéristiques pour entraîner un classifieur de correspondances.
Les résultats expérimentaux, obtenus notamment sur le benchmark Valentine et sur des jeux de données réels, montrent que nos méthodes atteignent ou dépassent l’état de l’art, y compris dans les cas les plus difficiles de sources disparates. Nous mettons également à disposition une implémentation open source, ainsi que les ressources expérimentales utilisées.
En résumé, cette thèse propose des solutions innovantes pour améliorer la résilience et l’autonomie des systèmes d’intégration de données, en s’appuyant sur la génération et l’exploitation de contexte pour dépasser les limites des approches traditionnelles. -
This thesis addresses the challenge of schema matching for heterogeneous and incomplete tabular datasets, a recurring problem in data lakes, federated systems, and multi-model environments. Real-world data sources are often structurally disparate: some provide schema definitions without instance data, others contain raw values without headers, while many present partial, noisy, or inconsistent information. Such conditions significantly compromise traditional schema matching methods, which typically assume well-structured and symmetric sources.
To overcome these challenges, we propose the notion of context generation, i.e., automatically synthesizing missing elements to enrich datasets before alignment. Examples include generating representative values for schema-only tables, or inferring attribute names from instance-only tables. Recent advances in large language models (LLMs) make this generative reasoning feasible, enabling more robust comparisons even under severe data disparities.
Building on this idea, we develop a unified schema matching framework that handles both compliant (complete, schema-only, instance-only) and disparate (asymmetric or incomplete) scenarios. Our contributions include:
1. an unsupervised matching framework that ensembles multiple matchers enriched by generated context, and
2. a supervised approach that embeds enriched attributes into a common semantic space, extracts a comprehensive set of meta-features, and trains a classifier for accurate correspondence prediction.
Extensive experiments on the Valentine benchmark and additional real-world datasets demonstrate that our methods achieve state-of-the-art performance, including in previously intractable scenarios such as schema-only vs. instance-only matching. Moreover, we release an open-source implementation, datasets, and evaluation resources to support reproducibility and further research.
In summary, this thesis advances schema matching by leveraging context generation with LLMs, enabling more resilient, autonomous, and accurate data integration strategies. - Accès au document
- Accès libre
Citation bibliographique
Kired, Nour Elhouda (2000-....) (2025), Alignement de sources de données disparates à l’aide de grands modèles de langage [Thèse]