Geri Dön

Natural language querying for databases: Cross-domain datasets and retrieval-augmented approaches to query generation

Veritabanları için doğal dil ile sorgulama: Alanlar arası veri kümeleri ve sorgu üretimine yönelik geri getirmeyle zenginleştirilmiş yaklaşımlar

  1. Tez No: 1004240
  2. Yazar: ARİF GÖRKEM ÖZER
  3. Danışmanlar: PROF. DR. İSMAİL HAKKI TOROSLU, PROF. DR. PINAR KARAGÖZ
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Orta Doğu Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Doğal Dil ile Sorgulama (Natural Language Querying – NLQ), kullanıcıların veritabanlarıyla doğal dil üzerinden etkileşim kurmasını sağlayarak biçimsel sorgu dilleri ve veritabanı şemalarına yönelik uzmanlık gereksinimini azaltmayı amaçlamaktadır. İlişkisel veritabanları için metinden SQL'e çeviri alanında önemli ilerlemeler kaydedilmiş olsa da, mevcut yaklaşımlar büyük ölçüde SQL merkezli kıyaslama veri kümelerine bağımlı kalmakta ve alanlar ile şemalar arasında genelleme yapamayan, yüksek veri gereksinimli ince ayar süreçlerine dayanmaktadır. Bu tez, söz konusu sınırlamaları iki tamamlayıcı katkı ile ele almaktadır. İlk olarak, alanlar arası ilk herkese açık metinden MongoDB sorgusuna çeviri veri kümesi olan DocSpider sunulmaktadır. DocSpider, Spider veri kümesindeki altın standart SQL sorgularının, özgün doğal dil soruları ve veritabanı şemaları korunarak MongoDB Sorgu Dili'ne (MQL) sistematik biçimde dönüştürülmesiyle oluşturulmuştur. Bu veri kümesi, belge odaklı NoSQL veritabanları için NLQ sistemlerinin büyük ölçekli ve sistematik olarak değerlendirilmesini mümkün kılmakta ve ilişkisel ayarların ötesinde alanlar arası genellemenin incelenmesi için bir temel sağlamaktadır. İkinci olarak, tez metinden SQL'e görevine yönelik, göreve özel ince ayar gerektirmeyen hafif bir Geri Getirmeyle Zenginleştirilmiş Üretim (Retrieval-Augmented Generation) çerçevesi olan LWRAG-SQL'i önermektedir. Bu yaklaşım, veritabanı şema bileşenleri için anlamsal açıklamalar üretmekte ve çıkarım aşamasında benzerlik temelli bir geri getirme mekanizmasıyla en ilgili şema bağlamını seçerek büyük dil modeli istemlerine dâhil etmektedir. Böylece sorgu üretimi şema farkındalığıyla yönlendirilirken, kaynak verimliliği korunmakta ve daha önce görülmemiş alanlara doğal dilden bağımsız şekilde uyarlanabilirlik sağlanmaktadır. Deneysel sonuçlar, DocSpider'ın NoSQL sistemleri için anlamlı alanlar arası NLQ analizlerine olanak tanıdığını ve LWRAG-SQL'in etiketli eğitim verisi ya da önceden model eğitimi gerektirmeksizin metinden SQL'e kıyaslama görevlerinde rekabetçi bir performans sunduğunu göstermektedir. Bu çalışma, NLQ araştırmalarının kapsamını belge odaklı veritabanlarını içerecek şekilde genişletmekte ve ince ayara yoğun biçimde dayanan yaklaşımlara pratik ve ölçeklenebilir bir alternatif sunmaktadır.

Özet (Çeviri)

Natural Language Querying (NLQ) aims to enable users to access and interact with databases using natural language, reducing the need for expertise in formal query languages and database schemas. While substantial progress has been made in text-to-SQL research for relational databases, existing approaches remain limited in two key respects: their strong dependence on SQL-centric benchmarks and their reliance on data-intensive, fine-tuned models that often fail to generalize across domains and schemas. This thesis addresses these challenges by advancing NLQ research along two complementary directions. First, it introduces DocSpider, the first publicly available cross-domain text-to-MongoDB dataset. DocSpider is constructed by systematically translating gold-standard SQL queries from the Spider benchmark into MongoDB Query Language (MQL) while preserving the original natural language questions and database schemas. This dataset enables, for the first time, large-scale and systematic evaluation of NLQ systems for document-oriented NoSQL databases and provides a foundation for studying cross-domain generalization beyond relational settings. Second, the thesis proposes LWRAG-SQL, a lightweight Retrieval-Augmented Generation (RAG) framework for text-to-SQL that entirely avoids task-specific fine-tuning. The framework generates semantic descriptions of database schema elements and employs similarity-based retrieval to select relevant schema context at inference time. By injecting this retrieved context into large language model prompts, LWRAG-SQL guides query generation in a schema-aware manner while remaining resource-efficient, natural language-agnostic and adaptable to unseen domains. Extensive experimental evaluations demonstrate that DocSpider enables meaningful cross-paradigm NLQ analysis for NoSQL systems and that LWRAG-SQL achieves competitive performance on text-to-SQL benchmarks despite requiring no annotated training data or pre-training. Together, these contributions broaden the scope of NLQ research to document-oriented databases and present a practical alternative to fine-tuning-heavy approaches, advancing more general, scalable, and deployable natural language interfaces to databases.

Benzer Tezler

  1. Mantıksal programlama ile doğal dilde sorgu işleme

    Natural language query processing by logic programming

    MURAT ÇİNKAYA

    Yüksek Lisans

    Türkçe

    Türkçe

    2005

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÇanakkale Onsekiz Mart Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ.DR. ALİ SALAHLI

  2. Profile processing in continuous query systems for mobile clients

    Mobil kullanıcılar için devamlı sorgular sistemlerinde profil işleme

    T. BAHATTİN ÖZEN

    Yüksek Lisans

    İngilizce

    İngilizce

    2001

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ASUMAN DOĞAÇ

  3. İlişkisel veritabanları üzerinde bulanık sorgulama aracı

    A Fuzzy query tool for relational database systems

    CEM AKKUŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2000

    Mühendislik Bilimleriİstanbul Teknik Üniversitesi

    DOÇ.DR. GAZANFER ÜNAL

  4. Kural tabanlı şüpheli işlem önleme sistemlerinde kullanılmak üzere çizge veritabanı modeli önerisi

    A graph database model proposal for use in rule based fraud transaction prevention systems

    BAHADIR ESAD DEMİR

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    BankacılıkSakarya Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ VEYSEL HARUN ŞAHİN