Natural language querying for databases: Cross-domain datasets and retrieval-augmented approaches to query generation
Veritabanları için doğal dil ile sorgulama: Alanlar arası veri kümeleri ve sorgu üretimine yönelik geri getirmeyle zenginleştirilmiş yaklaşımlar
- Tez No: 1004240
- Danışmanlar: PROF. DR. İSMAİL HAKKI TOROSLU, PROF. DR. PINAR KARAGÖZ
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Doğal Dil ile Sorgulama (Natural Language Querying – NLQ), kullanıcıların veritabanlarıyla doğal dil üzerinden etkileşim kurmasını sağlayarak biçimsel sorgu dilleri ve veritabanı şemalarına yönelik uzmanlık gereksinimini azaltmayı amaçlamaktadır. İlişkisel veritabanları için metinden SQL'e çeviri alanında önemli ilerlemeler kaydedilmiş olsa da, mevcut yaklaşımlar büyük ölçüde SQL merkezli kıyaslama veri kümelerine bağımlı kalmakta ve alanlar ile şemalar arasında genelleme yapamayan, yüksek veri gereksinimli ince ayar süreçlerine dayanmaktadır. Bu tez, söz konusu sınırlamaları iki tamamlayıcı katkı ile ele almaktadır. İlk olarak, alanlar arası ilk herkese açık metinden MongoDB sorgusuna çeviri veri kümesi olan DocSpider sunulmaktadır. DocSpider, Spider veri kümesindeki altın standart SQL sorgularının, özgün doğal dil soruları ve veritabanı şemaları korunarak MongoDB Sorgu Dili'ne (MQL) sistematik biçimde dönüştürülmesiyle oluşturulmuştur. Bu veri kümesi, belge odaklı NoSQL veritabanları için NLQ sistemlerinin büyük ölçekli ve sistematik olarak değerlendirilmesini mümkün kılmakta ve ilişkisel ayarların ötesinde alanlar arası genellemenin incelenmesi için bir temel sağlamaktadır. İkinci olarak, tez metinden SQL'e görevine yönelik, göreve özel ince ayar gerektirmeyen hafif bir Geri Getirmeyle Zenginleştirilmiş Üretim (Retrieval-Augmented Generation) çerçevesi olan LWRAG-SQL'i önermektedir. Bu yaklaşım, veritabanı şema bileşenleri için anlamsal açıklamalar üretmekte ve çıkarım aşamasında benzerlik temelli bir geri getirme mekanizmasıyla en ilgili şema bağlamını seçerek büyük dil modeli istemlerine dâhil etmektedir. Böylece sorgu üretimi şema farkındalığıyla yönlendirilirken, kaynak verimliliği korunmakta ve daha önce görülmemiş alanlara doğal dilden bağımsız şekilde uyarlanabilirlik sağlanmaktadır. Deneysel sonuçlar, DocSpider'ın NoSQL sistemleri için anlamlı alanlar arası NLQ analizlerine olanak tanıdığını ve LWRAG-SQL'in etiketli eğitim verisi ya da önceden model eğitimi gerektirmeksizin metinden SQL'e kıyaslama görevlerinde rekabetçi bir performans sunduğunu göstermektedir. Bu çalışma, NLQ araştırmalarının kapsamını belge odaklı veritabanlarını içerecek şekilde genişletmekte ve ince ayara yoğun biçimde dayanan yaklaşımlara pratik ve ölçeklenebilir bir alternatif sunmaktadır.
Özet (Çeviri)
Natural Language Querying (NLQ) aims to enable users to access and interact with databases using natural language, reducing the need for expertise in formal query languages and database schemas. While substantial progress has been made in text-to-SQL research for relational databases, existing approaches remain limited in two key respects: their strong dependence on SQL-centric benchmarks and their reliance on data-intensive, fine-tuned models that often fail to generalize across domains and schemas. This thesis addresses these challenges by advancing NLQ research along two complementary directions. First, it introduces DocSpider, the first publicly available cross-domain text-to-MongoDB dataset. DocSpider is constructed by systematically translating gold-standard SQL queries from the Spider benchmark into MongoDB Query Language (MQL) while preserving the original natural language questions and database schemas. This dataset enables, for the first time, large-scale and systematic evaluation of NLQ systems for document-oriented NoSQL databases and provides a foundation for studying cross-domain generalization beyond relational settings. Second, the thesis proposes LWRAG-SQL, a lightweight Retrieval-Augmented Generation (RAG) framework for text-to-SQL that entirely avoids task-specific fine-tuning. The framework generates semantic descriptions of database schema elements and employs similarity-based retrieval to select relevant schema context at inference time. By injecting this retrieved context into large language model prompts, LWRAG-SQL guides query generation in a schema-aware manner while remaining resource-efficient, natural language-agnostic and adaptable to unseen domains. Extensive experimental evaluations demonstrate that DocSpider enables meaningful cross-paradigm NLQ analysis for NoSQL systems and that LWRAG-SQL achieves competitive performance on text-to-SQL benchmarks despite requiring no annotated training data or pre-training. Together, these contributions broaden the scope of NLQ research to document-oriented databases and present a practical alternative to fine-tuning-heavy approaches, advancing more general, scalable, and deployable natural language interfaces to databases.
Benzer Tezler
- Mantıksal programlama ile doğal dilde sorgu işleme
Natural language query processing by logic programming
MURAT ÇİNKAYA
Yüksek Lisans
Türkçe
2005
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÇanakkale Onsekiz Mart ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ.DR. ALİ SALAHLI
- Etkileşimli, bir soru cevap tabii dil arayüzü programı tasarımı
Başlık çevirisi yok
HAKAN ACU
Yüksek Lisans
Türkçe
1995
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiPROF.DR. M. YAHYA KARSLIGİL
- Profile processing in continuous query systems for mobile clients
Mobil kullanıcılar için devamlı sorgular sistemlerinde profil işleme
T. BAHATTİN ÖZEN
Yüksek Lisans
İngilizce
2001
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. ASUMAN DOĞAÇ
- İlişkisel veritabanları üzerinde bulanık sorgulama aracı
A Fuzzy query tool for relational database systems
CEM AKKUŞ
- Kural tabanlı şüpheli işlem önleme sistemlerinde kullanılmak üzere çizge veritabanı modeli önerisi
A graph database model proposal for use in rule based fraud transaction prevention systems
BAHADIR ESAD DEMİR
Yüksek Lisans
Türkçe
2024
BankacılıkSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ VEYSEL HARUN ŞAHİN