Büyük dil modelleri tabanlısoru-cevap sistemlerinin performans karşılaştırması
Performance comparison of large language model-based question answering systems
- Tez No: 977070
- Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET ALİ ALTUNCU
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Kocaeli Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez çalışmasında, DDİ alanında sıklıkla başvurulan bağlamsal soru-cevaplama görevine odaklanılmış ve transformer tabanlı dil modellerinin bu alandaki başarıları Stanford Question Answering Dataset'in ikinci versiyonu (SQuAD v2.0) üzerinde karşılaştırmalı olarak değerlendirilmiştir. SQuAD v2.0, içinde hem cevaplanabilir hem de cevapsız bırakılması gereken soruların yer aldığı karmaşık bir veri yapısına sahiptir ve bu yönüyle modellerin yalnızca bilgiye ulaşma değil, aynı zamanda“cevap verilemez”durumlarını da doğru şekilde tespit edebilme becerilerini test etmeye imkân tanır. Bu kapsamda, BERT, RoBERTa, ALBERT ve DistilBERT olmak üzere dört farklı transformer tabanlı model, aynı eğitim parametreleri ve önişleme adımlarıyla eğitilmiştir. Eğitim süreci, Google Colab platformunda karma hassasiyetli hesaplama (mixed precision / FP16) desteği ile optimize edilmiş, modellerin performansları ise Exact Match (EM) ve F1 skoru metrikleriyle ölçülmüştür. Değerlendirme sonuçlarına göre RoBERTa modeli, %85,90 EM ve %88,69 F1 skorlarıyla en yüksek başarıyı sağlamış; onu sırasıyla BERT, ALBERT ve DistilBERT takip etmiştir. Bireysel model performanslarının yanı sıra, bu tezde topluluk (ensemble) öğrenme yöntemleri de uygulanmıştır. RoBERTa ve BERT modellerinin çıktıları, naive metin birleştirme, logit skoru tabanlı güven ölçümü (confidence voting) ve ağırlıklı birleştirme (weighted voting) gibi stratejilerle bir araya getirilmiştir. Ancak elde edilen bulgular, bu topluluk öğrenme yaklaşımlarının RoBERTa'nın tek başına sunduğu başarıyı anlamlı şekilde aşamadığını göstermiştir. Özellikle hatalı feature eşleştirmelerinden kaynaklanan performans kayıpları ve modellerin tahmin hatalarının benzerlik göstermesi, topluluk öğrenme yöntemlerinin beklenen katkıyı sağlayamamasına neden olmuştur. Ek olarak, tezde veri kümesine dair istatistiksel analizler yapılmış; soru ve cevap uzunlukları, cevapların metin içindeki konumları ve sık kullanılan soru başlangıç kelimeleri gibi yapılar incelenmiştir. Bu analizler, modellerin kısa ve öz cevaplar üretmeye daha uygun olduğunu ve metinlerin başındaki bilgileri daha iyi öğrendiğini ortaya koymuştur. Sonuç olarak, bu çalışma transformer tabanlı dil modellerinin SQuAD v2.0 gibi zorlu benchmark veri kümelerinde sundukları performansı ayrıntılı biçimde ortaya koymakta; aynı zamanda topluluk öğrenme yöntemlerinin dikkatli planlanmadığı takdirde yüksek performanslı bireysel modellerin gerisinde kalabileceğini göstermektedir. Gelecek çalışmalar için önerilen yol haritası, model çeşitliliği, stacking tabanlı topluluk öğrenme yapıları, dil çeşitliliği ve metrik odaklı değerlendirme stratejileri gibi başlıklar üzerinden yönlendirilmiştir.
Özet (Çeviri)
This thesis focuses on the contextual question answering task, which is widely used in the field of Natural Language Processing (NLP), and presents a comparative evaluation of the performance of transformer-based language models on the second version of the Stanford Question Answering Dataset (SQuAD v2.0). SQuAD v2.0 contains both answerable and unanswerable questions, providing a complex data structure that enables testing not only the information retrieval capability of models but also their ability to detect when a question is unanswerable. In this context, four different transformer-based models—BERT, RoBERTa, ALBERT, and DistilBERT—were trained using identical preprocessing steps and training parameters. The training process was optimized on the Google Colab platform using mixed-precision (FP16) support, and model performance was measured with the Exact Match (EM) and F1 score metrics. According to the evaluation results, RoBERTa achieved the highest performance with 85,90% EM and 88,69% F1, followed by BERT, ALBERT, and DistilBERT, respectively. In addition to evaluating individual model performance, ensemble learning methods were also applied in this thesis. The outputs of RoBERTa and BERT were combined using strategies such as naive text merging, logit score-based confidence voting, and weighted voting. However, the findings revealed that these ensemble approaches did not significantly outperform RoBERTa's standalone performance. In particular, performance losses caused by incorrect feature alignments and the similarity of prediction errors across models limited the benefits of ensemble methods. Furthermore, the thesis includes statistical analyses of the dataset, examining aspects such as question and answer lengths, answer positions within the context, and the most frequently used question starters. These analyses showed that the models are more suited to generating short and concise answers and tend to better learn information located at the beginning of the context. In conclusion, this study provides a detailed analysis of transformer-based language models' performance on a challenging benchmark dataset like SQuAD v2.0 and demonstrates that ensemble strategies, if not carefully designed, may underperform compared to strong individual models. The roadmap for future work is outlined around topics such as model diversity, stacking-based ensemble architectures, language diversity, and metric-focused evaluation strategies.
Benzer Tezler
- Performance comparison of large language models for Turkish natural language processing in higher education
Yükseköğretimde Türkçe doğal dil işleme için büyük dil modellerinin performans karşılaştırması
EGECAN ÇETİN
Yüksek Lisans
İngilizce
2025
Elektrik ve Elektronik Mühendisliğiİzmir Ekonomi ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ AYÇA TOPALLI
- RAG tabanlı büyük dil modelleriyle kurumsal sohbet robotu tasarımı ve uygulaması
Design and implementation of a enterprise chatbot with RAG based big language models
EMİNE NİDA HANBAY
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFırat ÜniversitesiYazılım Mühendisliği Ana Bilim Dalı
PROF. DR. ENGİN AVCI
- Multimodal medical visual question answering: Knowledge spaces and semantic segmentation for improved and explainable AI
Çok-kipli tıbbi görsel soru cevaplama: Bilgi uzayları ve anlamsal bölütleme ile gelişmiş ve açıklanabilir yapay zekâ
ZİYA ATA YAZICI
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Turkuaz Türkçe anlamsal temsil modeli ve çok bağlamlı bilgi getirimi kıyaslama veri kümesi
Turkuaz Turkish semantic representation model and multi-context information retrieval benchmark
ENES SADİ UYSAL
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET FATİH AMASYALI
- Multimodal machine comprehension of how-to instructions with images and text
Görüntü ve metin içeren çok kipli nasıl yapılır talimatlarının makine ile kavranması
SEMİH YAĞCIOĞLU
Doktora
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MEHMET ERKUT ERDEM
DOÇ. DR. İBRAHİM AYKUT ERDEM