| Titre : | ASK-Data : Conception et Évaluation d'un Assistant Local Text-to-SQL Basé sur les Small Language Models |
| Auteurs : | MAHSAR Sara, Auteur ; TAHRI Imane, Auteur ; Chaibi Hassen, Directeur de thèse |
| Type de document : | texte manuscrit |
| Editeur : | جامعة سعيدة د.مولاي الطاهر -كلية الرياضيات والاعلام الالي والاتصالات السلكية واللاسلكية -قسم الاعلام الالي, 2025/2026 |
| Format : | 134ص |
| Accompagnement : | CD |
| Langues: | Français |
| Index. décimale : | BUC-M 008513 |
| Catégories : |
Mémoire de Master en informatique Spécialité : Réseaux Informatiques et Systèmes Répartis (RISR) |
| Mots-clés: | : Text-to-SQL ; SLM (Small Language Models) ; Intelligence artifi- cielle appliquée aux bases de données ; Assistants intelligents locaux. ﺗﺣﻭﻳﻝ ﺍﻟﻧﺹ ﺇﻟﻰ ؛SQL ﺍﻟﻧﻣﺎﺫﺝ ﺍﻟﻠﻐﻭﻳﺔ ﺍﻟﺻﻐﻳﺭﺓ ؛)SLMs( ﺍﻟﺫﻛﺎء : ﺍﻻﺻﻁﻧﺎﻋﻲ ﻟﻘﻭﺍﻋﺩ ﺍﻟﺑﻳﺎﻧﺎﺕ؛ ﻣﺳﺎﻋﺩﻳﻥ ﺫﻛﻳﻳﻥ ﻣﺣﻠﻳﻳﻥ. iv : Text-to-SQL ; Small Language Models (SLMs) ; Artificial intelli- gence for databases ; Local intelligent assistants. v |
| Résumé : |
Résumé
Ce mémoire s’inscrit dans le domaine de l’intelligence artificielle appliquée à l’interrogation des bases de données en langage naturel, et plus précisément dans la tâche de Text-to-SQL. L’objectif principal est de concevoir et d’évaluer un as- sistant local basé sur des Small Language Models (SLM) capable de traduire des requêtes en langage naturel en requêtes SQL exploitables, tout en garantis- sant des performances adaptées à des environnements à ressources limitées. L’étude propose une évaluation comparative approfondie de plusieurs modèles de langage exécutés en local via LM Studio, incluant des modèles spécialisés SQL (SQLCoder-7B, SLM-SQL-1.5B, Gemma Text-to-SQL), des modèles gé- néralistes (Qwen 3.5, DeepSeek-R1-Distill-Qwen) ainsi que des modèles Edge optimisés pour faible consommation (Ministral 3B, IBM Granite Tiny). Ces mo- dèles couvrent différentes tailles, architectures et stratégies de quantification, permettant une analyse fine du compromis entre performance, précision et coût computationnel. La méthodologie repose sur un protocole expérimental reproductible intégrant des scénarios de génération SQL à partir de requêtes multilingues, incluant des cas simples et complexes. Les performances sont évaluées selon plusieurs cri- tères, notamment la précision syntaxique des requêtes générées, la validité sé- mantique, la capacité de généralisation ainsi que le temps d’inférence sur CPU. Les résultats montrent que les modèles spécialisés SQL offrent une meilleure précision sur les requêtes structurées, tandis que certains modèles généralistes à plus grande capacité présentent de meilleures performances en raisonnement complexe. Les modèles Edge, bien que limités en précision, se distinguent par leur efficacité en termes de rapidité et de consommation de ressources, les ren- dant adaptés aux environnements embarqués. Enfin, cette étude met en évidence l’importance du choix du modèle en fonction du contexte d’utilisation et souligne le potentiel des architectures hybrides et des techniques de distillation pour améliorer les systèmes Text-to-SQL locaux. ﺍﻟﻣﻠﺧﺹ ﻳﻧﺩﺭﺝ ﻫﺫﺍ ﺍﻟﺑﺣﺙ ﺿﻣﻥ ﻣﺟﺎﻝ ﺍﻟﺫﻛﺎء ﺍﻻﺻﻁﻧﺎﻋﻲ ﺍﻟﻣﻁﺑﻖ ﻋﻠﻰ ﺍﻻﺳﺗﻌﻼﻡ ﻋﻥ ﻗﻭﺍﻋﺩ ﺍﻟﺑﻳﺎﻧﺎﺕ ﺑﺎﺳﺗﺧﺩﺍﻡ ﺍﻟﻠﻐﺔ ﺍﻟﻁﺑﻳﻌﻳﺔ، ﻭﺑﺎﻟﺗﺣﺩﻳﺩ ﻓﻲ ﻣﻬﻣﺔ ﺗﺣﻭﻳﻝ ﺍﻟﻧﺹ ﺇﻟﻰ Text-to-SQL). SQL( ﻳﺗﻣﺛﻝ ﺍﻟﻬﺩﻑ ﺍﻟﺭﺋﻳﺳﻲ ﻓﻲ ﺗﺻﻣﻳﻡ ﻭﺗﻘﻳﻳﻡ ﻣﺳﺎﻋﺩ ﻣﺣﻠﻲ ﻳﻌﺗﻣﺩ ﻋﻠﻰ ﻧﻣﺎﺫﺝ ﻟﻐﻭﻳﺔ ﺻﻐﻳﺭﺓ Small( SLMs) - Models Language ﻗﺎﺩﺭ ﻋﻠﻰ ﺗﺣﻭﻳﻝ ﺍﻻﺳﺗﻌﻼﻣﺎﺕ ﺍﻟﻣﻛﺗﻭﺑﺔ ﺑﺎﻟﻠﻐﺔ ﺍﻟﻁﺑﻳﻌﻳﺔ ﺇﻟﻰ ﺃﻭﺍﻣﺭ SQL ﻗﺎﺑﻠﺔ ﻟﻠﺗﻧﻔﻳﺫ، ﻣﻊ ﺿﻣﺎﻥ ﺃﺩﺍء ﻣﻧﺎﺳﺏ ﻟﻠﺑﻳﺋﺎﺕ ﺫﺍﺕ ﺍﻟﻣﻭﺍﺭﺩ ﺍﻟﻣﺣﺩﻭﺩﺓ. ﺗﻘﺩﻡ ﻫﺫﻩ ﺍﻟﺩﺭﺍﺳﺔ ﺗﻘﻳﻳﻣﺎ ًﻣﻘﺎﺭﻧﺎ ًﻣﻌﻣﻘﺎ ًﻟﻌﺩﺓ ﻧﻣﺎﺫﺝ ﻟﻐﻭﻳﺔ ﺗﻌﻣﻝ ﻣﺣﻠﻳﺎ ًﻋﺑﺭ ﻣﻧﺻﺔ Studio، LM ﺑﻣﺎ ﻓﻲ ﺫﻟﻙ ﻧﻣﺎﺫﺝ ﻣﺗﺧﺻﺻﺔ ﻓﻲ SQL ﻣﺛﻝ SQLCoder-7B ﻭSLM-SQL-1.5B -DeepSeek-R1-Distill3.5 ﻭ Qwen ﻭﻧﻣﺎﺫﺝ ﻋﺎﻣﺔ ﻣﺛﻝ Text-to-SQL، Gemmaﻭ ،Qwen ﺑﺎﻹﺿﺎﻓﺔ ﺇﻟﻰ ﻧﻣﺎﺫﺝ ﺧﻔﻳﻔﺔ ﻣﻭﺟﻬﺔ ﻟﻠﺣﺎﻓﺔ )Edge( ﻣﺛﻝ 3B Ministral ﻭIBM Tiny. Granite ﻭﺗﻐﻁﻲ ﻫﺫﻩ ﺍﻟﻧﻣﺎﺫﺝ ﺃﺣﺟﺎﻣﺎ ًﻭﺑﻧﻰ ﻣﻌﻣﺎﺭﻳﺔ ﻭﺍﺳﺗﺭﺍﺗﻳﺟﻳﺎﺕ ﻛﻡ ّﻣﺧﺗﻠﻔﺔ، ﻣﻣﺎ ﻳﺳﻣﺢ ﺑﺗﺣﻠﻳﻝ ﺩﻗﻳﻖ ﻟﻠﻣﻔﺎﺿﻠﺔ ﺑﻳﻥ ﺍﻷﺩﺍء ﻭﺍﻟﺩﻗﺔ ﻭﺍﻟﺗﻛﻠﻔﺔ ﺍﻟﺣﺳﺎﺑﻳﺔ. ﺗﻌﺗﻣﺩ ﺍﻟﻣﻧﻬﺟﻳﺔ ﻋﻠﻰ ﺑﺭﻭﺗﻭﻛﻭﻝ ﺗﺟﺭﻳﺑﻲ ﻗﺎﺑﻝ ﻹﻋﺎﺩﺓ ﺍﻹﻧﺗﺎﺝ ﻳﺗﺿﻣﻥ ﺳﻳﻧﺎﺭﻳﻭﻫﺎﺕ ﺗﻭﻟﻳﺩ SQL ﻣﻥ ﺍﺳﺗﻌﻼﻣﺎﺕ ﻣﺗﻌﺩﺩﺓ ﺍﻟﻠﻐﺎﺕ، ﺗﺷﻣﻝ ﺣﺎﻻﺕ ﺑﺳﻳﻁﺔ ﻭﻣﻌﻘﺩﺓ. ﻭﻳﺗﻡ ﺗﻘﻳﻳﻡ ﺍﻷﺩﺍء ﻭﻓﻖ ﻋﺩﺓ ﻣﻌﺎﻳﻳﺭ، ﻣﻥ ﺑﻳﻧﻬﺎ ﺍﻟﺩﻗﺔ ﺍﻟﺗﺭﻛﻳﺑﻳﺔ ﻟﻼﺳﺗﻌﻼﻣﺎﺕ ﺍﻟﻧﺎﺗﺟﺔ، ﻭﺍﻟﺻﺣﺔ ﺍﻟﺩﻻﻟﻳﺔ، ﻭﺍﻟﻘﺩﺭﺓ ﻋﻠﻰ ﺍﻟﺗﻌﻣﻳﻡ، ﺇﺿﺎﻓﺔ ﺇﻟﻰ ﺯﻣﻥ ﺍﻻﺳﺗﺟﺎﺑﺔ ﻋﻠﻰ ﻭﺣﺩﺓ ﺍﻟﻣﻌﺎﻟﺟﺔ ﺍﻟﻣﺭﻛﺯﻳﺔ. ﺗُﻅﻬﺭ ﺍﻟﻧﺗﺎﺋﺞ ﺃﻥ ﺍﻟﻧﻣﺎﺫﺝ ﺍﻟﻣﺗﺧﺻﺻﺔ ﻓﻲ SQL ﺗﺣﻘﻖ ﺩﻗﺔ ﺃﻋﻠﻰ ﻓﻲ ﺍﻻﺳﺗﻌﻼﻣﺎﺕ ﺍﻟﻣﻬﻳﻛﻠﺔ، ﺑﻳﻧﻣﺎ ﺗﻘﺩﻡ ﺑﻌﺽ ﺍﻟﻧﻣﺎﺫﺝ ﺍﻟﻌﺎﻣﺔ ﺫﺍﺕ ﺍﻟﻘﺩﺭﺓ ﺍﻷﻛﺑﺭ ﺃﺩﺍء ًﺃﻓﺿﻝ ﻓﻲ ﻣﻬﺎﻡ ﺍﻻﺳﺗﺩﻻﻝ ﺍﻟﻣﻌﻘﺩﺓ. ﺃﻣﺎ ﻧﻣﺎﺫﺝ ﺍﻟﺣﺎﻓﺔ، ﻭﺭﻏﻡ ﻣﺣﺩﻭﺩﻳﺔ ﺩﻗﺗﻬﺎ، ﻓﺗﺗﻣﻳﺯ ﺑﻛﻔﺎءﺗﻬﺎ ﻣﻥ ﺣﻳﺙ ﺍﻟﺳﺭﻋﺔ ﻭﺍﺳﺗﻬﻼﻙ ﺍﻟﻣﻭﺍﺭﺩ، ﻣﻣﺎ ﻳﺟﻌﻠﻬﺎ ﻣﻧﺎﺳﺑﺔ ﻟﻠﺑﻳﺋﺎﺕ ﺍﻟﻣﺩﻣﺟﺔ. ﻭﺃﺧﻳﺭﺍً، ﺗﺅﻛﺩ ﻫﺫﻩ ﺍﻟﺩﺭﺍﺳﺔ ﺃﻫﻣﻳﺔ ﺍﺧﺗﻳﺎﺭ ﺍﻟﻧﻣﻭﺫﺝ ﻭﻓﻘﺎ ًﻟﺳﻳﺎﻕ ﺍﻻﺳﺗﺧﺩﺍﻡ، ﻭﺗﺑﺭﺯ ﺇﻣﻛﺎﻧﺎﺕ ﺍﻟﺑﻧﻰ ﺍﻟﻬﺟﻳﻧﺔ ﻭﺗﻘﻧﻳﺎﺕ ﺍﻟﺗﻘﻁﻳﺭ ﻟﺗﺣﺳﻳﻥ ﺃﻧﻅﻣﺔ Text-to-SQL ﺍﻟﻣﺣﻠﻳﺔ. Abstract This thesis falls within the field of artificial intelligence applied to natural lan- guage database querying, specifically addressing the Text-to-SQL task. The main objective is to design and evaluate a local assistant based on Small Language Models (SLMs) capable of translating natural language queries into executable SQL statements, while ensuring performance suitable for resource-constrained environments. The study provides an in-depth comparative evaluation of several language mo- dels executed locally via LM Studio, including SQL-specialized models (SQLCoder- 7B, SLM-SQL-1.5B, Gemma Text-to-SQL), general-purpose models (Qwen 3.5, DeepSeek-R1-Distill-Qwen), as well as edge-optimized models designed for low resource consumption (Ministral 3B, IBM Granite Tiny). These models cover different sizes, architectures, and quantization strategies, enabling a fine-grained analysis of the trade-off between performance, accuracy, and computational cost. The methodology is based on a reproducible experimental protocol involving multilingual SQL generation scenarios, including both simple and complex cases. Performance is evaluated according to several criteria, including syntactic cor- rectness of generated queries, semantic validity, generalization capability, as well as CPU inference time. The results show that SQL-specialized models achieve higher accuracy on struc- tured queries, while some larger general-purpose models perform better in com- plex reasoning tasks. Edge models, although less accurate, stand out for their efficiency in terms of speed and resource consumption, making them suitable for embedded environments. Finally, this study highlights the importance of model selection depending on the use case context and emphasizes the potential of hybrid architectures and distillation techniques to improve local Text-to-SQL systems. |
Exemplaires
| Code-barres | Cote | Support | Localisation | Section | Disponibilité |
|---|---|---|---|---|---|
| aucun exemplaire |
Documents numériques (1)
BUC-M 008513 Adobe Acrobat PDF |

