Geri Dön

İnce ayarlanmış RAG bileşenlerini kullanarak Türkçe veri setleri için yeni bir füzyon yöntemi ile yeniden sıralama konfigürasyonu

A new fusion reranking pipeline for Turkish datasets using fine-tuned RAG components

  1. Tez No: 981197
  2. Yazar: ERDOĞAN BIKMAZ
  3. Danışmanlar: DR. ÖĞR. ÜYESİ SERDAR ARSLAN
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Metin erişim, Sentetik veriler, Yeniden sıralama, İnsan-yapay zeka etkileşimi, Text retrieval, Synthetic dataset, Reordering, Human-artificial intelligence interaction
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Çankaya Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, Türkçe için, özellikle de tıp alanında, Retrieval-Augmented Generation (RAG) sistemlerinin çok dilli yeteneklerindeki boşluğu ele almaktadır. Büyük Dil Modellerinin (LLM'ler) yükselişi ve yaygın uygulamalarıyla, halüsinasyonları azaltmak ve yanıt doğruluğunu artırmak için, harici bilgilere dayalı retrieval (geri çağırma) bileşenlerinin kullanımı kritik bir hale gelmiştir. Ancak, mevcut retrieval bileşenlerinin çoğu (embedding'ler ve reranker'lar dahil olmak üzere) ağırlıklı olarak İngilizce veri setleri üzerinde eğitilmiştir, bu da çok dilli ve alana özgü yetenekler açısından önemli bir sınırlamayı ortaya koymaktadır. Bu durumu ele almak için, bu çalışma kapsamında Türkçe tıbbi bir veri seti olan Pubmed-RAG-TR ve popüler bir Türkçe RAG veri seti olan WikiRAG-TR [36] kullanılarak retrieval bileşenleri ince ayar (fine-tuning) ile geliştirilmiştir. Ayrıca, LLM'ler için bağlam oluşturmayı iyileştirmek amacıyla yeni bir RRF (Reciprocal Rank Fusion) tabanlı reranker pipeline'ı geliştirilmiştir. Deneysel sonuçlar, retrieval bileşenlerinin alana özgü veri setleri üzerinde ince ayar yapılmasının, retrieval ve post-retrieval kalitesini önemli ölçüde artırdığını ve LLM yanıtlarının doğruluğunu iyileştirdiğini göstermiştir. Çalışma, alana özgü semantiğin retrieval ve reranking modellerine dahil edilmesinin, çok dilli bağlamlarda RAG sistemlerinin performansını önemli ölçüde artırabileceği sonucuna varmaktadır.

Özet (Çeviri)

This study addresses the gap in the multilingual capabilities of Retrieval Augmented Generation (RAG) systems for the Turkish language, particularly in the medical domain. With the rise of Large Language Models (LLMs) and their widespread applications, the reliance on external knowledge through retrieval components has become crucial to mitigate hallucinations and improve response accuracy. However, most existing retrieval components, including embeddings and rerankers, are predominantly trained on English datasets, highlighting a significant limitation in multilingual and domain-specific capabilities. To address this, the study introduced Pubmed-RAG-TR, a Turkish-language medical dataset, and fine-tuned retrieval components on both Pubmed-RAG-TR and WikiRAG-TR, a Turkish RAG dataset. A novel RRF-based reranker pipeline was also developed to improve the context construction for LLMs. Experimental results demonstrated that fine-tuning retrieval components on domain-specific datasets significantly enhanced the retrieval and post-retrieval quality, improving the accuracy of LLM responses. The study concludes that incorporating domain-specific semantics into retrieval and reranking models can substantially boost the performance of RAG systems in multilingual contexts.

Benzer Tezler

  1. Lightweight meta-relevance classifier for fusing retrieval signals in retrieval augmented generation processes

    Bilgi getirme destekli üretim süreçlerinde getirme sinyallerinin birleştirilmesi için hafif meta-ilgi sınıflandırıcı

    ERDOĞAN YILDIZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. AHMET SELMAN BOZKIR

  2. A distributed human identification system for indoor environments

    Kapalı ortamlar için dağıtık mimarili insan tanıma sistemi

    EMRE SERCAN ASLAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2016

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. GÖKHAN İNCE

  3. Developing ai agents that extract metadata using the rag method with fine-tuned large language models

    İnce ayar yapılmış büyük dil modellerini kullanarak, rag yöntemiyle metaveri çıkaran yapay zekâ ajanları geliştirmek

    TAMAM ALHASAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara Üniversitesi

    Yapay Zeka Teknolojileri Ana Bilim Dalı

    DOÇ. DR. SAVAŞ TAKAN

  4. ArGemma: Gemma'nın Arapçaya uyarlanddırılması için ince ayar ve çok görevli öğrenme mimarisi

    ArGemma: A fine-tuning and multi-task learning architecture for adapting Gemma to Arabic

    TAHA AL-SELWI

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ SERAP ÇAKAR KAMAN

  5. Bir jeodezik ağın farklı bölgelerindeki uyuşumsuz ölçülerin değişik yöntemlerle saptanması ve dengeleme sonuçlarına etkilerinin araştırılması

    On the detection of outliers in the different parts of a geodetic network by different methods and the analysis of their inflence on the adjustment results

    GÜLSÜM HALE KARASU

    Doktora

    Türkçe

    Türkçe

    1994

    Jeodezi ve Fotogrametriİstanbul Teknik Üniversitesi

    PROF.DR. AHMET AKSOY