İnce ayarlanmış RAG bileşenlerini kullanarak Türkçe veri setleri için yeni bir füzyon yöntemi ile yeniden sıralama konfigürasyonu
A new fusion reranking pipeline for Turkish datasets using fine-tuned RAG components
- Tez No: 981197
- Danışmanlar: DR. ÖĞR. ÜYESİ SERDAR ARSLAN
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Metin erişim, Sentetik veriler, Yeniden sıralama, İnsan-yapay zeka etkileşimi, Text retrieval, Synthetic dataset, Reordering, Human-artificial intelligence interaction
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Çankaya Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışma, Türkçe için, özellikle de tıp alanında, Retrieval-Augmented Generation (RAG) sistemlerinin çok dilli yeteneklerindeki boşluğu ele almaktadır. Büyük Dil Modellerinin (LLM'ler) yükselişi ve yaygın uygulamalarıyla, halüsinasyonları azaltmak ve yanıt doğruluğunu artırmak için, harici bilgilere dayalı retrieval (geri çağırma) bileşenlerinin kullanımı kritik bir hale gelmiştir. Ancak, mevcut retrieval bileşenlerinin çoğu (embedding'ler ve reranker'lar dahil olmak üzere) ağırlıklı olarak İngilizce veri setleri üzerinde eğitilmiştir, bu da çok dilli ve alana özgü yetenekler açısından önemli bir sınırlamayı ortaya koymaktadır. Bu durumu ele almak için, bu çalışma kapsamında Türkçe tıbbi bir veri seti olan Pubmed-RAG-TR ve popüler bir Türkçe RAG veri seti olan WikiRAG-TR [36] kullanılarak retrieval bileşenleri ince ayar (fine-tuning) ile geliştirilmiştir. Ayrıca, LLM'ler için bağlam oluşturmayı iyileştirmek amacıyla yeni bir RRF (Reciprocal Rank Fusion) tabanlı reranker pipeline'ı geliştirilmiştir. Deneysel sonuçlar, retrieval bileşenlerinin alana özgü veri setleri üzerinde ince ayar yapılmasının, retrieval ve post-retrieval kalitesini önemli ölçüde artırdığını ve LLM yanıtlarının doğruluğunu iyileştirdiğini göstermiştir. Çalışma, alana özgü semantiğin retrieval ve reranking modellerine dahil edilmesinin, çok dilli bağlamlarda RAG sistemlerinin performansını önemli ölçüde artırabileceği sonucuna varmaktadır.
Özet (Çeviri)
This study addresses the gap in the multilingual capabilities of Retrieval Augmented Generation (RAG) systems for the Turkish language, particularly in the medical domain. With the rise of Large Language Models (LLMs) and their widespread applications, the reliance on external knowledge through retrieval components has become crucial to mitigate hallucinations and improve response accuracy. However, most existing retrieval components, including embeddings and rerankers, are predominantly trained on English datasets, highlighting a significant limitation in multilingual and domain-specific capabilities. To address this, the study introduced Pubmed-RAG-TR, a Turkish-language medical dataset, and fine-tuned retrieval components on both Pubmed-RAG-TR and WikiRAG-TR, a Turkish RAG dataset. A novel RRF-based reranker pipeline was also developed to improve the context construction for LLMs. Experimental results demonstrated that fine-tuning retrieval components on domain-specific datasets significantly enhanced the retrieval and post-retrieval quality, improving the accuracy of LLM responses. The study concludes that incorporating domain-specific semantics into retrieval and reranking models can substantially boost the performance of RAG systems in multilingual contexts.
Benzer Tezler
- Lightweight meta-relevance classifier for fusing retrieval signals in retrieval augmented generation processes
Bilgi getirme destekli üretim süreçlerinde getirme sinyallerinin birleştirilmesi için hafif meta-ilgi sınıflandırıcı
ERDOĞAN YILDIZ
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. AHMET SELMAN BOZKIR
- A distributed human identification system for indoor environments
Kapalı ortamlar için dağıtık mimarili insan tanıma sistemi
EMRE SERCAN ASLAN
Yüksek Lisans
İngilizce
2016
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. GÖKHAN İNCE
- Developing ai agents that extract metadata using the rag method with fine-tuned large language models
İnce ayar yapılmış büyük dil modellerini kullanarak, rag yöntemiyle metaveri çıkaran yapay zekâ ajanları geliştirmek
TAMAM ALHASAN
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara ÜniversitesiYapay Zeka Teknolojileri Ana Bilim Dalı
DOÇ. DR. SAVAŞ TAKAN
- ArGemma: Gemma'nın Arapçaya uyarlanddırılması için ince ayar ve çok görevli öğrenme mimarisi
ArGemma: A fine-tuning and multi-task learning architecture for adapting Gemma to Arabic
TAHA AL-SELWI
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SERAP ÇAKAR KAMAN
- Bir jeodezik ağın farklı bölgelerindeki uyuşumsuz ölçülerin değişik yöntemlerle saptanması ve dengeleme sonuçlarına etkilerinin araştırılması
On the detection of outliers in the different parts of a geodetic network by different methods and the analysis of their inflence on the adjustment results
GÜLSÜM HALE KARASU