Developing a Turkish question answering system with deep learning models
Derin öğrenme modelleriyle Türkçe soru cevaplama sistemi geliştirme
- Tez No: 995350
- Danışmanlar: PROF. DR. OLCAY TANER YILDIZ
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Yapay Zeka Endeksi, Artificial Intelligence Index
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Özyeğin Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Doğal Dil İşleme çalışma alanı; okuduğunu anlama, çoktan-seçmeli, evet-hayır ve diğer soru tiplerini kapsayan soru-cevap alt alanı altında çözülmesi zor birçok problemi içermektedir. Bu alandaki önemli engellerden bir tanesi de Türkçe gibi dillerde veri setlerinin kısıtlı olmasıdır. Bu çalışmada, makina çevirisi kullanılarak İngilizce SQuAD veri setinden çevrilen bir Türkçe soru-cevap veri seti geliştirilmiştir. Tüm çeviri çıktıları değerlendirilerek manuel ve otomatik yöntemler ile SQuAD veri setinin \%78'i soru cevap sistemlerin geliştirilmesi amacıyla Türkçe'ye çevrilmiştir. Bir diğer zorluk ise yapay zeka derin öğrenme modellerinin soru-cevap sistemler üzerindeki performansıdır. Yeni oluşturulan veri seti ile farklı derin öğrenme modelleri geliştirilmiştir. Modellerin sonuçları doğal dil işleme perspektifleri ile farklı yönlerden analiz edilerek modellerin güçlü ve zayıf yönleri birçok açıdan değerlendirilmiştir. Modellerin verinin derinliğine bağlı olarak başarılarının da değiştiği tespit edilmiştir. Veriler derin öğrenme ile çizge veri yapısı üzerinde yeniden yapılandırılarak modellerin yapısal veri seti ile eğitimi ve çalışması sağlanmıştır. Verilerin yapılandırılmasının ve zenginleştirilmesinin modelin başarısına önemli ölçüde katkıda bulunduğu tespit edilmiştir. Geliştirilen yeni modeller, önceki temel modellere kıyasla EM ve F1 üzerinde +\%10 varan daha iyi performanslar elde edilmiştir. Bu yaklaşım sayesinde, büyük dil modellerinin ve derin öğrenme modellerinin kapalı-kutu mimarisi değiştirilmeden başarı oranı arttırılmıştır.
Özet (Çeviri)
The field of Natural Language Processing presents several challenges, including question answering, which encompasses understanding reading comprehension, multiple-choice, yes-no, and other question types. A significant challenge in these studies is the creation of question answering datasets. While there are many examples of question answering datasets in English, they are limited, especially in languages like Turkish. To address this issue, the study developed a Turkish question answering dataset derived from the comprehensive English Stanford Question Answering Dataset (SQuAD) using a machine translation tool. Translator outputs were evaluated, and the data were then refined to increase the dataset size. Consequently, 78\% of the SQuAD was effectively converted into Turkish. Another challenge is the success of deep learning models. We developed baseline models using deep learning techniques on the newly created dataset and conducted analyses from multiple perspectives. The strengths and weaknesses of the models were examined through detailed error analysis. When our dataset was structured as a knowledge graph, our models were trained on it and run with it. We have shown that the structuralization and enrichment of the data contribute significantly to the model's success (EM and F1: +10\% accuracy compared to other baselines). This approach enabled us to enhance the learning capacity of the system without altering the underlying closed-box architecture of the large language models and deep learning systems employed.
Benzer Tezler
- Nature of literary discussions in an advanced-level foreign language literature course in a Turkish EFL setting
Başlık çevirisi yok
DOĞAN YÜKSEL
Doktora
İngilizce
2007
Eğitim ve ÖğretimFlorıda State UnıversıtyOrtaöğretim Sosyal Alanlar Eğitimi Ana Bilim Dalı
PROF. DEBORAH J. HASSON
- Doğal dil işleme tabanlı akıllı üniversite asistanı geliştirme: Bilgetekin chatbot
Developing a natural language processing-based smart university assistant: Bilgetekin chatbot
TELAT KAYA
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÇankırı Karatekin ÜniversitesiElektronik ve Bilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MUSTAFA KARHAN
DR. ÖĞR. ÜYESİ FATİH ISSI
- Yazılım sektöründe yetenek yönetimi için uzman sistem geliştirme
An expert system for talent management in the software industry
EMİNE KURUOĞLU
Doktora
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. MUSTAFA ERSEL KAMAŞAK
- Birleştirilmiş ve müstakil sınıf öğretmenlerinin ilköğretim programına ilişkin görüşleri
Multigrade class teachers and class teachers? opinions about curriculum for primary schools
ŞEYMA GÜR
Yüksek Lisans
Türkçe
2010
Eğitim ve ÖğretimFırat ÜniversitesiEğitim Bilimleri Bölümü
YRD. DOÇ. DR. NURİYE SEMERCİ
- İnternet servis ve kaynakları üzerinden işlenmiş veri sağlayan bir platform geliştirilmesi
Developing a platform that supplies processed information from internet resources and services
NİCAT SÜLEYMANOV
Yüksek Lisans
Türkçe
2015
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. İLYAS ÇİÇEKLİ