Geri Dön

An LLM-powered conversational analytic system for intelligent data discovery across mesh-fabric data environments

Mesh-fabrıc veri ortamlarında akıllı veri keşfi için büyük dil modeli tabanlı konuşmaya dayalı analitik sistem

  1. Tez No: 1020077
  2. Yazar: ELİF BERİL ŞAYLİ
  3. Danışmanlar: PROF. DR. ALTAN KOÇYİĞİT
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Orta Doğu Teknik Üniversitesi
  10. Enstitü: Enformatik Enstitüsü
  11. Ana Bilim Dalı: Bilişim Sistemleri Ana Bilim Dalı (disiplinlerarası)
  12. Bilim Dalı: Bilişim Teknolojileri Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Günümüzde modern kuruluşlar, geleneksel merkezi mimarilerin ölçeklenebilirlik ve çeviklik taleplerini karşılamakta zorlandıkları, giderek karmaşıklaşan veri ortamlarında faaliyet göstermektedir. Bu ortamlarda süregelen bir zorluk, üstveri yönetimi ve sezgisel veri keşfidir. Bu zorluk özellikle, yabancı anahtar kısıtlamalarının açıkça tanımlanmadığı ham göl evleri üzerinde doğal dilde ifade edilen soruların çalıştırılabilir sorgulara çevrilmesi gerektiğinde belirginleşir. Geleneksel veritabanı sistemleri kullanıcıların yapılandırılmış sorgu dillerini bilmesini gerektirir ve bu durum, teknik uzmanlığı olmayan paydaşlar için bir engel oluşturur.Bu tez, alanlar arası veri keşfi, zenginleştirme, kataloglama ve yapılandırmayı desteklemek için büyük dil modeli (BDM) tabanlı metadata ajanları kullanan ve doğal dil sorularını keşfedilmiş üstveriye dayanan SQL sorgularına çeviren bir yaklaşım sunmaktadır. Amaç, Veri Örgüsü ve Veri Dokusu ilkelerinden faydalanılan bir mimari içinde, kataloglama ve şema keşfi için gereken eforu azaltmaktır. Önerilen sistem, sürümlü ve makine tarafından okunabilir biçimlerde saklanan yapılandırılmış çıktılar üretmek için BDM destekli üstveri çıkarımı ve ilişki keşfi sağlar. Bu yaklaşım, hem merkezi olmayan sahipliği hem de sistemler arası birlikte çalışabilirliği gerektiren ortamlarda, tutarlılık ve yeniden üretilebilirliği destekleyerek faydalı olur. Önerilen sistem; şema ve tablo üstverisini katalog ve sorgu katmanları aracılığıyla toplar ve bunları üstveri zenginleştirme ile LLM destekli SQL üretimi için kullanır.Yaklaşım, ilişki çıkarsama üstverisi olan ve olmayan yapılandırmaların karşılaştırıldığı denetimli çok alanlı bir kıyaslama üzerinde değerlendirilmiştir. İlişki farkındalıklı yapılandırma, belirli analitik sorgu desenlerinde istatistiksel olarak anlamlı bir doğruluk iyileşmesi sağlamıştır. Ayrıca, çoklu çalıştırma deneyleri ve sürümlü katalog durumu altında yapılan testler, sistemin tutarlı sonuçlar ürettiğini göstermiştir. Sonuçlar, sürümlü ve incelenebilir ilişki üstverisinin test edilen koşullar altında göl evi ortamlarında doğal dilden SQL üretimini destekleyebileceğini göstermektedir.

Özet (Çeviri)

Today, modern organizations operate in increasingly complex data environments where traditional centralized architectures struggle to meet demands for scalability and agility. A persistent challenge is the effective management of metadata and intuitive data discovery, particularly when natural-language questions must be translated into executable queries over raw lakehouse storage where foreign-key constraints are not explicitly declared. This thesis presents an approach that uses LLM-based metadata agents to support data discovery, enrichment, cataloging, and structuring across domains, and translates natural-language questions into SQL queries grounded in inferred metadata. The goal is to reduce the manual effort required for cataloging and schema exploration within an architecture informed by Data Mesh and Data Fabric principles. The system provides LLM-assisted metadata extraction and relationship inference to generate structured artifacts stored in versioned machine-readable formats so they can be inspected, reused, and updated as datasets evolve. This approach is useful in environments that require both decentralized ownership and cross-system interoperability while supporting consistency and reproducibility. The proposed system gathers schema and table metadata through the catalog and query layers and uses it for metadata enrichment and LLM-assisted SQL generation. The approach is evaluated on a controlled multi-domain benchmark by comparing configurations with and without inferred relationship metadata. The relation-aware configuration achieves a statistically significant correctness improvement on a specific set of analytical query patterns. The results show that versioned, inspectable relationship metadata can support NL to SQL generation in lakehouse environments under the tested conditions.

Benzer Tezler

  1. Büyük dil modeli tabanlı üniversite sanal asistanı geliştirilmesi

    Development of a university assistant based on large language model

    FADİME ZELİHA SEYHAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Elektrik ve Elektronik MühendisliğiSakarya Uygulamalı Bilimler Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. ALİ FURKAN KAMANLI

  2. Effectiveness of gamification on engagement with conversational AI-based systems: A cost–benefit model

    Yapay zekâ tabanlı sohbete dayalı sistemlerde oyunlaştırmanın kullanıcı katılımına etkisi: Bir maliyet–fayda modeli

    AHMET İSTEMİHAN OKTAY

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    İletişim BilimleriYıldız Teknik Üniversitesi

    Sanat ve Tasarım Ana Sanat Dalı

    DOÇ. DR. UMUT BURCU TASA YURTSEVER

  3. Dengesiz sınıflandırma problemleri için LLM tabanlı otomatik analiz sistemi

    LLM-based automatic analysis system for imbalanced classification problems

    MEHMET BARAN ÖZKAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Biyoistatistikİnönü Üniversitesi

    Biyoistatistik ve Tıp Bilişimi Ana Bilim Dalı

    DOÇ. DR. AHMET KADİR ARSLAN

  4. An agent-based framework for systematic generative feature engineering in financial markets

    Finansal piyasalarda sistematik üretici değişken mühendisliği için yapay zekâ ajanları temelli bir yaklaşım

    MUSTAFA ENES KARAMAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Büyük Veri ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. ALP ÜSTÜNDAĞ

  5. A contract-driven automated unit test maintenance approach with generative artificial intelligence for backend software projects

    Arka uç yazılım projeleri için üretken yapay zeka tabanlı, sözleşme odaklı otomatik birim testi bakım yaklaşımı

    FURKAN SAMET AKINCI

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİzmir Yüksek Teknoloji Enstitüsü

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. TUĞKAN TUĞLULAR