Geri Dön

Büyük dil modelleri tabanlısoru-cevap sistemlerinin performans karşılaştırması

Performance comparison of large language model-based question answering systems

  1. Tez No: 977070
  2. Yazar: OĞUZHAN KIRLAR
  3. Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET ALİ ALTUNCU
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Kocaeli Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez çalışmasında, DDİ alanında sıklıkla başvurulan bağlamsal soru-cevaplama görevine odaklanılmış ve transformer tabanlı dil modellerinin bu alandaki başarıları Stanford Question Answering Dataset'in ikinci versiyonu (SQuAD v2.0) üzerinde karşılaştırmalı olarak değerlendirilmiştir. SQuAD v2.0, içinde hem cevaplanabilir hem de cevapsız bırakılması gereken soruların yer aldığı karmaşık bir veri yapısına sahiptir ve bu yönüyle modellerin yalnızca bilgiye ulaşma değil, aynı zamanda“cevap verilemez”durumlarını da doğru şekilde tespit edebilme becerilerini test etmeye imkân tanır. Bu kapsamda, BERT, RoBERTa, ALBERT ve DistilBERT olmak üzere dört farklı transformer tabanlı model, aynı eğitim parametreleri ve önişleme adımlarıyla eğitilmiştir. Eğitim süreci, Google Colab platformunda karma hassasiyetli hesaplama (mixed precision / FP16) desteği ile optimize edilmiş, modellerin performansları ise Exact Match (EM) ve F1 skoru metrikleriyle ölçülmüştür. Değerlendirme sonuçlarına göre RoBERTa modeli, %85,90 EM ve %88,69 F1 skorlarıyla en yüksek başarıyı sağlamış; onu sırasıyla BERT, ALBERT ve DistilBERT takip etmiştir. Bireysel model performanslarının yanı sıra, bu tezde topluluk (ensemble) öğrenme yöntemleri de uygulanmıştır. RoBERTa ve BERT modellerinin çıktıları, naive metin birleştirme, logit skoru tabanlı güven ölçümü (confidence voting) ve ağırlıklı birleştirme (weighted voting) gibi stratejilerle bir araya getirilmiştir. Ancak elde edilen bulgular, bu topluluk öğrenme yaklaşımlarının RoBERTa'nın tek başına sunduğu başarıyı anlamlı şekilde aşamadığını göstermiştir. Özellikle hatalı feature eşleştirmelerinden kaynaklanan performans kayıpları ve modellerin tahmin hatalarının benzerlik göstermesi, topluluk öğrenme yöntemlerinin beklenen katkıyı sağlayamamasına neden olmuştur. Ek olarak, tezde veri kümesine dair istatistiksel analizler yapılmış; soru ve cevap uzunlukları, cevapların metin içindeki konumları ve sık kullanılan soru başlangıç kelimeleri gibi yapılar incelenmiştir. Bu analizler, modellerin kısa ve öz cevaplar üretmeye daha uygun olduğunu ve metinlerin başındaki bilgileri daha iyi öğrendiğini ortaya koymuştur. Sonuç olarak, bu çalışma transformer tabanlı dil modellerinin SQuAD v2.0 gibi zorlu benchmark veri kümelerinde sundukları performansı ayrıntılı biçimde ortaya koymakta; aynı zamanda topluluk öğrenme yöntemlerinin dikkatli planlanmadığı takdirde yüksek performanslı bireysel modellerin gerisinde kalabileceğini göstermektedir. Gelecek çalışmalar için önerilen yol haritası, model çeşitliliği, stacking tabanlı topluluk öğrenme yapıları, dil çeşitliliği ve metrik odaklı değerlendirme stratejileri gibi başlıklar üzerinden yönlendirilmiştir.

Özet (Çeviri)

This thesis focuses on the contextual question answering task, which is widely used in the field of Natural Language Processing (NLP), and presents a comparative evaluation of the performance of transformer-based language models on the second version of the Stanford Question Answering Dataset (SQuAD v2.0). SQuAD v2.0 contains both answerable and unanswerable questions, providing a complex data structure that enables testing not only the information retrieval capability of models but also their ability to detect when a question is unanswerable. In this context, four different transformer-based models—BERT, RoBERTa, ALBERT, and DistilBERT—were trained using identical preprocessing steps and training parameters. The training process was optimized on the Google Colab platform using mixed-precision (FP16) support, and model performance was measured with the Exact Match (EM) and F1 score metrics. According to the evaluation results, RoBERTa achieved the highest performance with 85,90% EM and 88,69% F1, followed by BERT, ALBERT, and DistilBERT, respectively. In addition to evaluating individual model performance, ensemble learning methods were also applied in this thesis. The outputs of RoBERTa and BERT were combined using strategies such as naive text merging, logit score-based confidence voting, and weighted voting. However, the findings revealed that these ensemble approaches did not significantly outperform RoBERTa's standalone performance. In particular, performance losses caused by incorrect feature alignments and the similarity of prediction errors across models limited the benefits of ensemble methods. Furthermore, the thesis includes statistical analyses of the dataset, examining aspects such as question and answer lengths, answer positions within the context, and the most frequently used question starters. These analyses showed that the models are more suited to generating short and concise answers and tend to better learn information located at the beginning of the context. In conclusion, this study provides a detailed analysis of transformer-based language models' performance on a challenging benchmark dataset like SQuAD v2.0 and demonstrates that ensemble strategies, if not carefully designed, may underperform compared to strong individual models. The roadmap for future work is outlined around topics such as model diversity, stacking-based ensemble architectures, language diversity, and metric-focused evaluation strategies.

Benzer Tezler

  1. Performance comparison of large language models for Turkish natural language processing in higher education

    Yükseköğretimde Türkçe doğal dil işleme için büyük dil modellerinin performans karşılaştırması

    EGECAN ÇETİN

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Elektrik ve Elektronik Mühendisliğiİzmir Ekonomi Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ AYÇA TOPALLI

  2. RAG tabanlı büyük dil modelleriyle kurumsal sohbet robotu tasarımı ve uygulaması

    Design and implementation of a enterprise chatbot with RAG based big language models

    EMİNE NİDA HANBAY

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFırat Üniversitesi

    Yazılım Mühendisliği Ana Bilim Dalı

    PROF. DR. ENGİN AVCI

  3. Multimodal medical visual question answering: Knowledge spaces and semantic segmentation for improved and explainable AI

    Çok-kipli tıbbi görsel soru cevaplama: Bilgi uzayları ve anlamsal bölütleme ile gelişmiş ve açıklanabilir yapay zekâ

    ZİYA ATA YAZICI

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. HAZIM KEMAL EKENEL

  4. Turkuaz Türkçe anlamsal temsil modeli ve çok bağlamlı bilgi getirimi kıyaslama veri kümesi

    Turkuaz Turkish semantic representation model and multi-context information retrieval benchmark

    ENES SADİ UYSAL

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. MEHMET FATİH AMASYALI

  5. Multimodal machine comprehension of how-to instructions with images and text

    Görüntü ve metin içeren çok kipli nasıl yapılır talimatlarının makine ile kavranması

    SEMİH YAĞCIOĞLU

    Doktora

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MEHMET ERKUT ERDEM

    DOÇ. DR. İBRAHİM AYKUT ERDEM