Derin öğrenmeden büyük dil modellerine: Soru cevaplama sistemleri için yenilikçi çözümler
From deep learning to large language models: Novel solutions for question answering systems
- Tez No: 887134
- Danışmanlar: PROF. DR. MEHMET FATİH AMASYALI
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2024
- Dil: Türkçe
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Tez çalışması kapsamında, soru cevaplama (QA) sistemleri için özgün yöntemler önerilmiştir. Çoktan seçmeli QA (MCQA) ve matematik kelime problemleri (MWPs) gibi farklı QA problemleri üzerinde çalışmalar yapılmıştır. Çalışmalar, çeşitli veri kümeleri üzerinde test edilmiş ve yenilikçi yöntemler geliştirilmiştir. Kapılı Tekrarlayan Birimler'in (GRU) varyantları önerilmiş ve QA problemi dahil olmak üzere farklı problemler üzerinde karşılaştırmalı olarak değerlendirilmiştir. Önerilen GRU varyantları ile mevcut girişin etkisini artırmanın performansı olumlu yönde etkilediği bulunmuştur. Tez çalışmasının bir sonraki çalışmasında, derin öğrenme tabanlı bir QA sistemi tasarlanmıştır. Önerilen model, Xiong ve diğerleri'nin çalışmalarından esinlenilmiş ve çeşitli iyileştirmeler içermektedir. Deneylerde kullanılan Facebook'un bAbitasks veri kümesi Türkçe'ye çevrilerek Türkçe QA veri kümelerine katkıda bulunulmuştur. Tez çalışmasının ilerleyen çalışmalarında, MCQA veri kümeleri üzerine odaklanılmış ve dil modellerinin (LM) tek bir ince ayar işlemi yerine birçok veri kümesi üzerinde sıralı bir ince ayar işlemi yaklaşımı önerilmiştir. Ayrıca, planlı öğrenmenin etkisi de incelenmiştir. Kapsamlı deneyler, kaynak veri kümelerinden hedef veri kümelerine veri aktarımının önemini açıkça ortaya koymuştur. Veri artırma teknikleri, MWPs çözücüleri için uygulanmış ve problem metni ile doğru cevap denklemi üzerinde değişiklikler yapılarak çeşitli yöntemler önerilmiştir. Kapsamlı deneyler sonucunda, önerilen yöntemlerin performansı olumlu yönde etkilediği saptanmıştır. Ayrıca, metin ve çok kipli QA sistemleri için karşıt örnek üretimi sistematik bir şekilde incelenmiş ve kullanılan yöntemler, veri kümeleri, değerlendirme ölçütleri ve savunma mekanizmaları detaylı bir şekilde ele alınmıştır. Bu tezde, ayrıca Çoktan Seçmeli Soru Üretimi'ne (MCQG) yönelik olarak, karşıt yanlış seçenek üretimi araştırılmış ve bağlam içi öğrenme ve kural tabanlı yaklaşımlar önerilmiştir. Önerilen yaklaşımlar, modelin performansını belirgin bir şekilde düşürmüş ve güvenilir QA sistemlerinin geliştirilmesinin önemi vurgulanmıştır. Özetle, bu tez çalışması kapsamında, derin öğrenme yöntemlerinden güncel LM'leri de kapsayan geniş bir yelpazede QA sistemleri için özgün yaklaşımlar geliştirilmiştir. Bu süreçte, derin öğrenme, ince ayar işlemleri, planlı öğrenme, veri artırma teknikleri ve bağlam içi öğrenme gibi çeşitli yöntemler kullanılmıştır.
Özet (Çeviri)
In this thesis, novel methods for question answering (QA) systems have been proposed. Research has been carried out on various QA problems, including multiple-choice QA (MCQA) and math word problems (MWPs). Experiments have been conducted on various datasets, and novel methods have been developed. Gated Recurrent Units (GRU) variants have been proposed and comparatively evaluated on different problems. It's found that increasing the impact of the current input of GRU positively affected performance. In the subsequent study of the thesis, a deep learning-based QA system is designed. This system is inspired by the model proposed by Xiong, etc., and includes several improvements. The Turkish version of Facebook's bAbitasks dataset was created by machine translation to contribute to Turkish QA datasets. The subsequent study of the thesis is focused on MCQA datasets. A multi-stage fine-tuning approach was proposed instead of a single fine-tuning process on language models (LMs) over multiple MCQA datasets. Furthermore, the impact of curriculum learning was also examined. It was found that multi-stage fine-tuning and curriculum learning improved the performance. Various data augmentation methods have been proposed on MWPs by changing the problem text and the correct answer equation. Comprehensive experiments showed that the proposed methods positively affect performance. Moreover, adversarial example generation for text and multimodal QA systems was systematically examined, and the methods used, adversarial datasets, evaluation metrics, and defense mechanisms were discussed in detail. This thesis also investigated adversarial distractor generation for Multiple-Choice Question Generation (MCQG), and in-context learning and rule-based approaches were proposed. The proposed approaches significantly reduced the model's performance, and the development of secure QA systems was emphasized. In summary, this thesis study has developed novel approaches for various QA systems. Various methods, such as deep learning, fine-tuning, curriculum learning, data augmentation techniques, and in-context learning, have been utilized in this process.
Benzer Tezler
- Word2vec temsillerini kullanarak Türkçede soru sınıflandırmasında derin öğrenme analizi
A deep learning analysis on Turkish question classification task using word2vec representations
ŞEYHMUS YILMAZ
Doktora
Türkçe
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDüzce ÜniversitesiElektrik-Elektronik ve Bilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SİNAN TOKLU
- Essays on estimation methods
Tahmin yöntemleri üzerine makaleler
YASİN KÜTÜK
Doktora
İngilizce
2019
Ekonomiİstanbul Teknik Üniversitesiİktisat Ana Bilim Dalı
PROF. DR. BÜLENT GÜLOĞLU
- Exposing data leakage in ligand binding site prediction
Ligand bağlanma bölgesi tahmininde veri sızıntısının ortaya çıkarılması
BARIŞ HASDEMİR
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
DOÇ. DR. SEFER BADAY
- Sentiment-driven forecasting of short-term asset price directions using large language models
Büyük dil modelleri kullanarak varlık fiyatlarının kısa vadeli yönlerinin duygu odaklı tahmini
AHMET BERKAY GÜLTEKİN
Yüksek Lisans
İngilizce
2025
Mühendislik Bilimleriİstanbul Teknik ÜniversitesiVeri Mühendisliği ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)
PROF. DR. ALP ÜSTÜNDAĞ