Improving TEXT-TO-SQL translation through direct schema linking and synthetic data driven fine-tuning
Metinden SQL'e çevirinin doğrudan şema eşlemesi ve sentetik veri odaklı ince ayar ile iyileştirilmesi
- Tez No: 1018849
- Danışmanlar: PROF. DR. ÖZGÜR ULUSOY
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İhsan Doğramacı Bilkent Üniversitesi
- Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Yapay Zeka ve Veri Bilimi Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Translating natural language queries into Structured Query Language (Text-to-SQL or NLQ-to-SQL) is a fundamental problem at the intersection of natural language processing and databases, with the goal of enabling natural language interfaces to databases and making data access more accessible to non-expert users. Although recent advances in large language models have substantially improved Text-to-SQL systems, major challenges remain, including handling complex database schemas, resolving ambiguity in user queries, generating SQL queries with intricate structures that accurately reflect user intent, and providing high-quality supervision for database-specific adaptation. These challenges arise both at inference time, where the model must accurately align the user question to the underlying database structure, and at training time, where effective adaptation requires reliable and sufficiently diverse supervision tailored to the target database. To address these two complementary aspects of the Text-to-SQL problem, two lines of research on large language model based Text-to-SQL systems are presented. The first, E-SQL, investigates direct schema linking through a pipeline composed of candidate SQL generation, candidate predicate generation, question enrichment, and SQL refinement, where the natural language question is reformulated with schema-aware information such as relevant tables, columns, values, possible predicates, and SQL construction cues in order to better align user intent with database structure and reduce ambiguity over complex schemas. Experimental results show that this approach achieves competitive performance on standard benchmarks, particularly on complex queries, while also indicating that a basic schema filtering technique may degrade performance when advanced proprietary large language models are used. The second study, SING-SQL, introduces a fully automated two-stage framework for generating high-quality synthetic Text-to-SQL data for a target relational database without relying on SQL logs or manual annotation. The framework first hierarchically partitions the database schema into diverse sub-schemas for systematic coverage, and then synthesizes SQL-text pairs across controlled complexity levels through a quality-aware process involving validation, executability checks, automatic repair, reasoning trace generation, and column-focused balancing. The generated synthetic data is then used to fine-tune compact models for database-specific adaptation, and the results demonstrate that such models can achieve strong in-domain performance under database-specialized evaluation settings. Together, these studies address both schema-aware SQL generation at inference time and scalable supervision for in-domain adaptation, advancing Text-to-SQL systems across both general-purpose and database-specialized settings.
Özet (Çeviri)
Doğal dil sorgularının Yapılandırılmış Sorgu Dili'ne (Text-to-SQL ya da NLQ-to-SQL) dönüştürülmesi, doğal dil işleme ile veritabanı alanlarının kesişiminde yer alan temel bir problemdir ve veritabanları için doğal dil arayüzleri sunmayı ve veri erişimini uzman olmayan kullanıcılar için daha erişilebilir hale getirmeyi amaçlar. Büyük dil modellerindeki son gelişmeler Text-to-SQL sistemlerini önemli ölçüde iyileştirmiş olsa da, karmaşık veritabanı şemalarının ele alınması, kullanıcı sorgularındaki belirsizliğin giderilmesi, kullanıcı niyetini doğru biçimde yansıtan karmaşık yapılı SQL sorgularının üretilmesi ve veritabanına özgü uyarlama için yüksek kaliteli denetimin sağlanması gibi temel zorluklar varlığını sürdürmektedir. Bu zorluklar hem çıkarım aşamasında, yani modelin kullanıcı sorusunu altta yatan veritabanı yapısıyla doğru biçimde ilişkilendirmesi gereken durumda, hem de eğitim aşamasında, yani etkili uyarlamanın hedef veritabanına uygun, güvenilir ve yeterince çeşitli denetim verisi gerektirdiği durumda ortaya çıkmaktadır. Text-to-SQL probleminin bu birbirini tamamlayan iki yönünü ele almak amacıyla, büyük dil modeli tabanlı Text-to-SQL sistemleri üzerine iki araştırma doğrultusu sunulmaktadır. Bunlardan ilki olan E-SQL, aday SQL üretimi, aday koşul üretimi, soru zenginleştirme ve SQL iyileştirme modüllerinden oluşan bir ardışık düzen aracılığıyla doğrudan şema eşlemeyi incelemektedir. Bu yaklaşımda doğal dil sorusu; ilgili tablolar, sütunlar, değerler, olası koşullar ve SQL kurulum ipuçları gibi şema farkındalıklı bilgilerle yeniden biçimlendirilerek kullanıcı niyeti ile veritabanı yapısı arasındaki uyumun güçlendirilmesi ve karmaşık şemalardan kaynaklanan belirsizliğin azaltılması amaçlanmaktadır. Deneysel sonuçlar, bu yaklaşımın özellikle karmaşık sorgularda standart karşılaştırma kümeleri üzerinde rekabetçi bir başarı elde ettiğini ve ayrıca gelişmiş kapalı kaynak büyük dil modelleri kullanıldığında açık şema filtrelemesinin başarımı düşürebileceğini göstermektedir. İkinci çalışma olan SING-SQL, SQL kayıtlarına ya da elle açıklanmış verilere ihtiyaç duymadan, hedef bir ilişkisel veritabanı için yüksek kaliteli sentetik Text-to-SQL verisi üreten tam otomatik iki aşamalı bir çerçeve sunmaktadır. Bu çerçevede önce veritabanı şeması, sistematik kapsama sağlamak amacıyla çeşitli alt şemalara hiyerarşik olarak ayrılmakta, ardından doğrulama, çalıştırılabilirlik kontrolleri, otomatik düzeltme, akıl yürütme izi üretimi ve sütun odaklı dengeleme içereren kalite farkındalıklı bir süreç ile kontrollü karmaşıklık seviyelerinde SQL-metin çiftleri sentezlenmektedir. Üretilen sentetik veri daha sonra veritabanına özgü uyarlama amacıyla küçük ölçekli modellerin ince ayarında kullanılmakta ve sonuçlar bu modellerin veritabanına özgü değerlendirme koşulları altında güçlü kurum-içi başarı elde edebildiğini göstermektedir. Birlikte ele alındığında bu çalışmalar, hem çıkarım aşamasında şema farkındalıklı SQL üretimini hem de kurum-içi uyarlama için ölçeklenebilir denetim sağlamayı hedeflemekte ve Text-to-SQL sistemlerinin hem genel amaçlı hem de veritabanına özgü ortamlarda iyileştirilmesine ilişkin bir bakış açısı sunmaktadır.
Benzer Tezler
- Çoklu ortam veri tabanı yönetim sistemi için görüntü sorgulama algoritması
An image query algorithm for multimedia database management system
RAGIP SAVAŞ
- Metadata-based and peronalized WEB querying
Metadataya dayalı ve kişiselleştirilmiş WEB sorgulaması
SELMA AYŞE ÖZEL
Doktora
İngilizce
2004
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF.DR. ÖZGÜR ULUSOY
- Türkçe E-ticaret yorumlarının çok etiketli analizi için derin öğrenme modellerinin uygulanması
Applying deep learning models for multi-label analysis of Turkish E-commerce comments
ABDULKADİR ŞEN
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKonya Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ FATMA ZEHRA SOLAK
- İstanbul-Paşaköy-B.Bakkalköy arası enerji nakil hattı kamulaştırma bilgi sistemi pilot çalışması
Başlık çevirisi yok
NURAY BAŞ
Yüksek Lisans
Türkçe
1998
Jeodezi ve Fotogrametriİstanbul Teknik ÜniversitesiJeodezi ve Fotogrametri Mühendisliği Ana Bilim Dalı
DOÇ. DR. GONCA COŞKUN
- Improving text classification performance with the analysis of lexical dependencies and class-based feature selection
Sözcüksel bağımlılıkların ve sınıf bazlı öznitelik seçiminin analizi ile metin sınıflandırma performansında iyileştirme
LEVENT ÖZGÜR
Doktora
İngilizce
2010
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. TUNGA GÜNGÖR