Geri Dön

Veri temsili yöntemlerinin hibrit kullanımının dil modeli başarısına etkileri

The impact of hybrid usage of data representation methods on the success of language models

  1. Tez No: 964381
  2. Yazar: HÜSEYİN ERDEM
  3. Danışmanlar: PROF. DR. MEHMET SERDAR GÜZEL
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Soru yanıtlama sistemleri, Question answering systems
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Ankara Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez, büyük dil modellerinde (LLM) yanıt kalitesini doğrudan etkileyen doğru bağlam geri getirme sorununu, bilgi grafiği (KG), yoğun vektör dizinleri ve ters indekslerin hibrit kullanımıyla incelemiştir. 4 810 Türkçe ve 190 İngilizce sorudan oluşan iki soru cevap kümesi, anlamsal parçalama sonrasında 37 095 metin birimine dönüştürülmüş, GPT-4o destekli tam otomatik şema keşfi ile 61 650 düğüm ve 134 087 ilişkiden oluşan bir KG oluşturulmuştur. Sadece bağlam taşıyan 42 602 düğüm için 3 072 boyutlu gömmeler üretilmiş ve Neo4j'de HNSW vektör ile BM25 tam metin dizinleri kurulmuştur. Beş geri getirme stratejisi karşılaştırılmıştır: yalnızca metin (Sparse Only), yalnızca vektör (Dense Only), vektör-metin hibriti (Document Only Dual Norm), KG merkezli hibrit (Cypher Hybrid) ve araştırmacı tarafından tasarlanan hibrit yaklaşım olan İlişki Farkındalıklı Çift Norm Birleşimi (Relation-Aware Dual-Norm Fusion / RADNF). Değerlendirme metrikleri“Doğru Kaynak Sayısı”,“İlk Doğru Kaynağın Sırası”ve“Doğru Kaynak Bulunamayan Soru”olarak seçilmiştir. RADNF, ortalama 1,93 doğru belge ve yalnızca 497 başarısız soru ile en düşük hata oranına ulaşmış, paralel dizin çağrısı sayesinde Dense Only çözüme denk bir bağlam hazırlama süresi sağlamıştır. Çalışma, KG sinyalini çift min-max normlu skor birleştirmeyle entegre eden RADNF tasarımının hibrit RAG literatürüne özgün katkısını göstermekte, tam otomatik KG inşası, çok dilli deney kurgusu ve maliyet raporlaması ile üretim senaryoları için pratik bir yol haritası sunmaktadır.

Özet (Çeviri)

This thesis explores the problem of accurate context retrieval, a decisive factor for answer quality in large language models (LLMs), by hybrid-combining knowledge graphs (KG), dense vector indices and sparse inverted indices. Two QA corpora, which have 4,810 Turkish and 190 English questions, were semantically chunked into 37,095 passages. A fully automated GPT-4o-driven schema discovery step produced a KG containing 61,650 nodes and 134,087 relations. Only the context-bearing nodes (42,602) were embedded with 3,072-dimensional vectors, and Neo4j was equipped with an HNSW vector index and a BM25 full-text index. Five retrieval strategies were evaluated: Sparse Only, Dense Only, Document-Only Dual-Norm, Cypher Hybrid, and the proposed Relation-Aware Dual-Norm Fusion (RADNF). Evaluation metrics comprised Correct Source Count, Earliest Correct Rank, and Missed-Document Questions. RADNF achieved the lowest error, with 497 questions with no correct document, and an average of 1.93 correct passages per query, while matching the latency of the Dense Only baseline via parallel index calls. This study demonstrates the unique contribution of the RADNF design to the hybrid RAG literature by integrating KG signals through dual min–max normalization. It also presents a fully automated KG construction pipeline, a multilingual experimental setup, cost reporting and offers a practical roadmap for production scenarios.

Benzer Tezler

  1. Efficient estimation of Shrinkage parameters in fuzzy Ridge and fuzzy Liu regression models using α-cut-based methods under multicollinearity

    Çoklu bağıntı durumunda bulanık Ridge ve bulanık Liu regresyon modellerinde α-kesim tabanlı yöntemler kullanılarak Shrinkage parametrelerinin etkin tahmini

    AMMAR HOMAIDA

    Doktora

    İngilizce

    İngilizce

    2025

    İstatistikGazi Üniversitesi

    İstatistik Ana Bilim Dalı

    PROF. DR. MERAL EBEGİL

  2. Comressıon of convolutıonal neural networks vıa hıgh dımensıonal model representatıon

    Yüksek boyutlu model gösterilimi aracılığıyla evrişimsel sinir ağlarının sıkıştırılması

    BERNA YILMAZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Hesaplamalı Bilim ve Mühendislik Ana Bilim Dalı (disiplinlerarası)

    DR. ÖĞR. ÜYESİ SÜHA TUNA

  3. Kuyruk modelleri ve analizi üzerine bir uygulama

    Başlık çevirisi yok

    DİDEM ÖZPULAT

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    İstatistikEge Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    DOÇ. DR. FİKRET İKİZ

  4. Dokuma kumaşlarda örgü tipinin ham kumaşın boyutları ve geometrik özellikleri üzerindeki etkilerinin araştırılması

    Başlık çevirisi yok

    EMEL ÖNDER

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    Tekstil ve Tekstil MühendisliğiEge Üniversitesi

    Tekstil Mühendisliği Ana Bilim Dalı

    DOÇ. DR. GÜNGÖR BAŞER