Geri Dön

Evaluating the impact of training data quality and synthetic summaries on abstractive text summarization

Eğitim verisinin kalitesi ve sentetik özetlerin soyut metin özetleme üzerindeki etkisi

  1. Tez No: 969648
  2. Yazar: MEHMET ÇALIKUŞ
  3. Danışmanlar: PROF. DR. MEHMET FATİH AMASYALI
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Yıldız Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, eğitimin gerçekleştirildiği verinin niteliği ve kaynağının, Türkçe soyut özetleme modellerinin performansına olan etkisini incelemektedir. İki ana deneysel faz tasarlanmıştır. Birinci fazda, modeller Türkçe MLSUM veri kümesinin filtrelenmemiş ve sözcüksel olarak filtrelenmiş versiyonları ile eğitilmiştir. Filtreleme işlemi, kaynak metinler ile özetleri arasındaki sözcüksel örtüşmeyi azaltarak aşırı derecede çıkarımsal örnekleri veri setinden çıkarmayı hedeflemiştir. İkinci fazda ise, MLSUM veri kümesinin %25'lik bir alt kümesi kullanılarak paralel iki eğitim verisi oluşturulmuştur: biri orijinal insan yazımı özetleri, diğeri ise Gemini 2.0 Flash adlı büyük dil modeli tarafından oluşturulan sentetik özetleri içermektedir. Tüm modeller—mT5-small ve GPT-2'nin küçük, orta ve büyük versiyonları—tüm deneylerde aynı koşullar altında eğitilmiştir. Değerlendirme sürecinde MLSUM'ın orijinal test kümesi yerine, daha zorlayıcı bir değerlendirme ortamı sağlamak amacıyla özel olarak oluşturulmuş bir test kümesi kullanılmıştır. Bu test kümesi, çevrimiçi haber sitelerinden toplanan makalelerden elde edilmiş ve kaynak metin ile özet arasındaki sözcüksel örtüşmenin en düşük olduğu örnekler seçilerek oluşturulmuştur. Böylece, özetleme modellerinin daha soyutlayıcı ve üretken metin üretme yetenekleri daha doğru bir şekilde değerlendirilebilmiştir. Ek olarak, büyük dil modeli tarafından üretilmiş sentetik özetlerle eğitilen modellerin performansını daha kapsayıcı biçimde test edebilmek amacıyla, aynı test kümesindeki örnekler için Gemini 2.0 Flash kullanılarak sentetik referans özetler oluşturulmuştur. Böylece, modeller hem insan yazımı özetler hem de büyük dil modeli tarafından oluşturulan sentetik özetler üzerinden ayrı ayrı ROUGE metrikleriyle değerlendirilmiştir. Bu yaklaşım, yalnızca mutlak performansı değil, aynı zamanda modellerin farklı türde referanslarla nasıl genelleme yaptığına dair daha zengin bir karşılaştırma imkânı sunmuştur. Bir diğer test aşamasında ise N-gram örtüşmesinin ötesine geçmek amacıyla, özetlerin kalitesi GPT-4o tarafından dört niteliksel kriter üzerinden puanlanmıştır: üretkenlik, içeriği kapsama, doğruluk ve anlam bütünlüğü. Ayrıca, daha küçük bir örneklem kümesi insanlar tarafından değerlendirilmiş ve GPT4o modelinden bu örneklemdeki özetlerden en başarılı olanı tercih etmesi istenmiş ve model tercihleri ile insan değerlendiricilerin tercihleri arasında karşılaştırmalı analiz yapılmıştır. Bulgular, eğitim verisinin sözcüksel filtrelemeye tabi tutulmasının ROUGE skorlarında ve niteliksel değerlendirmelerde özellikle üretkenlik açısından mütevazı iyileşmelere yol açtığını göstermektedir. Ayrıca, LLM tarafından oluşturulan sentetik özetlerle eğitilen modellerin, insan yazımı özetlerle eğitilen modellere kıyasla rekabetçi sonuçlar verdiği gözlemlenmiştir. Bu durum, dikkatli şekilde oluşturulmuş sentetik verilerin, özetleme modeli eğitimi için geçerli bir alternatif olabileceğini ortaya koymaktadır. Sonuçlar, veri soyutlamasının ve çeşitlendirilmiş değerlendirme yaklaşımlarının, sağlam özetleme modelleri eğitmede önemli olduğunu vurgulamaktadır.

Özet (Çeviri)

This study investigates how the quality and origin of training data affect the performance of abstractive text summarization models in Turkish. Two main experimental phases were designed. In the first phase, models were fine-tuned on both unfiltered and lexically filtered versions of the Turkish portion of the MLSUM dataset. The filtering process aimed to eliminate extractive examples by reducing lexical overlap between source documents and their summaries. In the second phase, a 25% subset of MLSUM was used to create parallel training sets: one containing the original human-written summaries, and the other containing synthetic summaries generated by Gemini 2.0 Flash, a large language model. All models—mT5-small and GPT-2 (small, medium, large)—were trained under the same conditions across all experiments. Instead of using the original MLSUM test set, a custom test set was created to provide a more challenging evaluation environment. This set was constructed from Turkish news articles collected online and filtered to include examples with the lowest lexical overlap between the source text and the reference summary. As a result, the test set better reflects the models' ability to generate abstract and non-extractive summaries. Additionally, in order to fairly evaluate the models trained on synthetic data, LLM-generated summaries were created for the same test set using Gemini 2.0 Flash. ROUGE scores were then computed using both the original human-written summaries and the LLM-generated synthetic references. This dual-reference evaluation allowed for a more comprehensive assessment of model performance and helped highlight how well models generalize across different types of reference summaries. To assess output quality beyond n-gram overlap, GPT-4o was used to score model outputs across four qualitative criteria: creativity, content coverage, factual accuracy, and coherence. Additionally, a smaller sample set was evaluated by humans and GPT-4o model was asked to choose the most successful summaries from this sample, and comparative analysis was performed between the model preferences and the preferences of human annotators. Findings show that lexical filtering of the training data leads to modest improvements in ROUGE scores and qualitative evaluations, particularly in creativity. Furthermore, models trained on LLM-generated summaries performed competitively compared to those trained on human-written data, suggesting that synthetic data can be a viable alternative when carefully constructed. The results highlight the importance of data abstraction and evaluation diversity in training robust summarization models.

Benzer Tezler

  1. On real-world face super-resolution and face image synthesis evaluation

    Gerçek dünya yüz süper çözünürlüğü ve yüz görüntüsü sentezi değerlendirmesi üzerine

    ERDİ SARITAŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. HAZIM KEMAL EKENEL

  2. Assessıng the ımpact of synthetıc data generatıon vıa generatıve aı on clınıcal text classıfıcatıon

    Üretken yapay zeka yoluyla sentetı̇k verı̇ oluşturmanınklı̇nı̇k metı̇n sınıflandırması üzerı̇ndekı̇ etkı̇sı̇nı̇değerlendı̇rmek

    ENİS KÖSEOĞLU

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir Üniversitesi

    Mühendislik Ana Bilim Dalı (disiplinlerarası)

    DOÇ. DR. CEMAL OKAN SAKAR

  3. Finans alanında veri mahremiyeti yöntemleri: Federe öğrenme ve sentetik veri üretimi

    Data privacy methods in finance: Federated learning and synthetic data generation

    ELİF ÖZCAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. YUSUF YASLAN

  4. Makine öğrenmesi yöntemleri ile yangın verilerinin analizi ve sınıflandırılması

    Analysis and classification of fire data using machine learning methods

    ZEYNEP NAZLI ASLAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    İlk ve Acil YardımSakarya Üniversitesi

    Afet Yönetimi Ana Bilim Dalı

    DOÇ. DR. BEYTULLAH EREN

  5. Palmprint recognition using gabor wavelet transform

    Başlık çevirisi yok

    MOHAMMED ABDULAZEEZ HAYDER MUSAWI

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilgi ve Belge YönetimiAltınbaş Üniversitesi

    Elektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ AYÇA KURNAZ TÜRKBEN