Geri Dön

Developing a Turkish question answering system with deep learning models

Derin öğrenme modelleriyle Türkçe soru cevaplama sistemi geliştirme

  1. Tez No: 995350
  2. Yazar: KADİR TUTAR
  3. Danışmanlar: PROF. DR. OLCAY TANER YILDIZ
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Yapay Zeka Endeksi, Artificial Intelligence Index
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Özyeğin Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Doğal Dil İşleme çalışma alanı; okuduğunu anlama, çoktan-seçmeli, evet-hayır ve diğer soru tiplerini kapsayan soru-cevap alt alanı altında çözülmesi zor birçok problemi içermektedir. Bu alandaki önemli engellerden bir tanesi de Türkçe gibi dillerde veri setlerinin kısıtlı olmasıdır. Bu çalışmada, makina çevirisi kullanılarak İngilizce SQuAD veri setinden çevrilen bir Türkçe soru-cevap veri seti geliştirilmiştir. Tüm çeviri çıktıları değerlendirilerek manuel ve otomatik yöntemler ile SQuAD veri setinin \%78'i soru cevap sistemlerin geliştirilmesi amacıyla Türkçe'ye çevrilmiştir. Bir diğer zorluk ise yapay zeka derin öğrenme modellerinin soru-cevap sistemler üzerindeki performansıdır. Yeni oluşturulan veri seti ile farklı derin öğrenme modelleri geliştirilmiştir. Modellerin sonuçları doğal dil işleme perspektifleri ile farklı yönlerden analiz edilerek modellerin güçlü ve zayıf yönleri birçok açıdan değerlendirilmiştir. Modellerin verinin derinliğine bağlı olarak başarılarının da değiştiği tespit edilmiştir. Veriler derin öğrenme ile çizge veri yapısı üzerinde yeniden yapılandırılarak modellerin yapısal veri seti ile eğitimi ve çalışması sağlanmıştır. Verilerin yapılandırılmasının ve zenginleştirilmesinin modelin başarısına önemli ölçüde katkıda bulunduğu tespit edilmiştir. Geliştirilen yeni modeller, önceki temel modellere kıyasla EM ve F1 üzerinde +\%10 varan daha iyi performanslar elde edilmiştir. Bu yaklaşım sayesinde, büyük dil modellerinin ve derin öğrenme modellerinin kapalı-kutu mimarisi değiştirilmeden başarı oranı arttırılmıştır.

Özet (Çeviri)

The field of Natural Language Processing presents several challenges, including question answering, which encompasses understanding reading comprehension, multiple-choice, yes-no, and other question types. A significant challenge in these studies is the creation of question answering datasets. While there are many examples of question answering datasets in English, they are limited, especially in languages like Turkish. To address this issue, the study developed a Turkish question answering dataset derived from the comprehensive English Stanford Question Answering Dataset (SQuAD) using a machine translation tool. Translator outputs were evaluated, and the data were then refined to increase the dataset size. Consequently, 78\% of the SQuAD was effectively converted into Turkish. Another challenge is the success of deep learning models. We developed baseline models using deep learning techniques on the newly created dataset and conducted analyses from multiple perspectives. The strengths and weaknesses of the models were examined through detailed error analysis. When our dataset was structured as a knowledge graph, our models were trained on it and run with it. We have shown that the structuralization and enrichment of the data contribute significantly to the model's success (EM and F1: +10\% accuracy compared to other baselines). This approach enabled us to enhance the learning capacity of the system without altering the underlying closed-box architecture of the large language models and deep learning systems employed.

Benzer Tezler

  1. Nature of literary discussions in an advanced-level foreign language literature course in a Turkish EFL setting

    Başlık çevirisi yok

    DOĞAN YÜKSEL

    Doktora

    İngilizce

    İngilizce

    2007

    Eğitim ve ÖğretimFlorıda State Unıversıty

    Ortaöğretim Sosyal Alanlar Eğitimi Ana Bilim Dalı

    PROF. DEBORAH J. HASSON

  2. Doğal dil işleme tabanlı akıllı üniversite asistanı geliştirme: Bilgetekin chatbot

    Developing a natural language processing-based smart university assistant: Bilgetekin chatbot

    TELAT KAYA

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÇankırı Karatekin Üniversitesi

    Elektronik ve Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MUSTAFA KARHAN

    DR. ÖĞR. ÜYESİ FATİH ISSI

  3. Yazılım sektöründe yetenek yönetimi için uzman sistem geliştirme

    An expert system for talent management in the software industry

    EMİNE KURUOĞLU

    Doktora

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. MUSTAFA ERSEL KAMAŞAK

  4. Birleştirilmiş ve müstakil sınıf öğretmenlerinin ilköğretim programına ilişkin görüşleri

    Multigrade class teachers and class teachers? opinions about curriculum for primary schools

    ŞEYMA GÜR

    Yüksek Lisans

    Türkçe

    Türkçe

    2010

    Eğitim ve ÖğretimFırat Üniversitesi

    Eğitim Bilimleri Bölümü

    YRD. DOÇ. DR. NURİYE SEMERCİ

  5. İnternet servis ve kaynakları üzerinden işlenmiş veri sağlayan bir platform geliştirilmesi

    Developing a platform that supplies processed information from internet resources and services

    NİCAT SÜLEYMANOV

    Yüksek Lisans

    Türkçe

    Türkçe

    2015

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. İLYAS ÇİÇEKLİ