Evaluating the impact of training data quality and synthetic summaries on abstractive text summarization
Eğitim verisinin kalitesi ve sentetik özetlerin soyut metin özetleme üzerindeki etkisi
- Tez No: 969648
- Danışmanlar: PROF. DR. MEHMET FATİH AMASYALI
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışma, eğitimin gerçekleştirildiği verinin niteliği ve kaynağının, Türkçe soyut özetleme modellerinin performansına olan etkisini incelemektedir. İki ana deneysel faz tasarlanmıştır. Birinci fazda, modeller Türkçe MLSUM veri kümesinin filtrelenmemiş ve sözcüksel olarak filtrelenmiş versiyonları ile eğitilmiştir. Filtreleme işlemi, kaynak metinler ile özetleri arasındaki sözcüksel örtüşmeyi azaltarak aşırı derecede çıkarımsal örnekleri veri setinden çıkarmayı hedeflemiştir. İkinci fazda ise, MLSUM veri kümesinin %25'lik bir alt kümesi kullanılarak paralel iki eğitim verisi oluşturulmuştur: biri orijinal insan yazımı özetleri, diğeri ise Gemini 2.0 Flash adlı büyük dil modeli tarafından oluşturulan sentetik özetleri içermektedir. Tüm modeller—mT5-small ve GPT-2'nin küçük, orta ve büyük versiyonları—tüm deneylerde aynı koşullar altında eğitilmiştir. Değerlendirme sürecinde MLSUM'ın orijinal test kümesi yerine, daha zorlayıcı bir değerlendirme ortamı sağlamak amacıyla özel olarak oluşturulmuş bir test kümesi kullanılmıştır. Bu test kümesi, çevrimiçi haber sitelerinden toplanan makalelerden elde edilmiş ve kaynak metin ile özet arasındaki sözcüksel örtüşmenin en düşük olduğu örnekler seçilerek oluşturulmuştur. Böylece, özetleme modellerinin daha soyutlayıcı ve üretken metin üretme yetenekleri daha doğru bir şekilde değerlendirilebilmiştir. Ek olarak, büyük dil modeli tarafından üretilmiş sentetik özetlerle eğitilen modellerin performansını daha kapsayıcı biçimde test edebilmek amacıyla, aynı test kümesindeki örnekler için Gemini 2.0 Flash kullanılarak sentetik referans özetler oluşturulmuştur. Böylece, modeller hem insan yazımı özetler hem de büyük dil modeli tarafından oluşturulan sentetik özetler üzerinden ayrı ayrı ROUGE metrikleriyle değerlendirilmiştir. Bu yaklaşım, yalnızca mutlak performansı değil, aynı zamanda modellerin farklı türde referanslarla nasıl genelleme yaptığına dair daha zengin bir karşılaştırma imkânı sunmuştur. Bir diğer test aşamasında ise N-gram örtüşmesinin ötesine geçmek amacıyla, özetlerin kalitesi GPT-4o tarafından dört niteliksel kriter üzerinden puanlanmıştır: üretkenlik, içeriği kapsama, doğruluk ve anlam bütünlüğü. Ayrıca, daha küçük bir örneklem kümesi insanlar tarafından değerlendirilmiş ve GPT4o modelinden bu örneklemdeki özetlerden en başarılı olanı tercih etmesi istenmiş ve model tercihleri ile insan değerlendiricilerin tercihleri arasında karşılaştırmalı analiz yapılmıştır. Bulgular, eğitim verisinin sözcüksel filtrelemeye tabi tutulmasının ROUGE skorlarında ve niteliksel değerlendirmelerde özellikle üretkenlik açısından mütevazı iyileşmelere yol açtığını göstermektedir. Ayrıca, LLM tarafından oluşturulan sentetik özetlerle eğitilen modellerin, insan yazımı özetlerle eğitilen modellere kıyasla rekabetçi sonuçlar verdiği gözlemlenmiştir. Bu durum, dikkatli şekilde oluşturulmuş sentetik verilerin, özetleme modeli eğitimi için geçerli bir alternatif olabileceğini ortaya koymaktadır. Sonuçlar, veri soyutlamasının ve çeşitlendirilmiş değerlendirme yaklaşımlarının, sağlam özetleme modelleri eğitmede önemli olduğunu vurgulamaktadır.
Özet (Çeviri)
This study investigates how the quality and origin of training data affect the performance of abstractive text summarization models in Turkish. Two main experimental phases were designed. In the first phase, models were fine-tuned on both unfiltered and lexically filtered versions of the Turkish portion of the MLSUM dataset. The filtering process aimed to eliminate extractive examples by reducing lexical overlap between source documents and their summaries. In the second phase, a 25% subset of MLSUM was used to create parallel training sets: one containing the original human-written summaries, and the other containing synthetic summaries generated by Gemini 2.0 Flash, a large language model. All models—mT5-small and GPT-2 (small, medium, large)—were trained under the same conditions across all experiments. Instead of using the original MLSUM test set, a custom test set was created to provide a more challenging evaluation environment. This set was constructed from Turkish news articles collected online and filtered to include examples with the lowest lexical overlap between the source text and the reference summary. As a result, the test set better reflects the models' ability to generate abstract and non-extractive summaries. Additionally, in order to fairly evaluate the models trained on synthetic data, LLM-generated summaries were created for the same test set using Gemini 2.0 Flash. ROUGE scores were then computed using both the original human-written summaries and the LLM-generated synthetic references. This dual-reference evaluation allowed for a more comprehensive assessment of model performance and helped highlight how well models generalize across different types of reference summaries. To assess output quality beyond n-gram overlap, GPT-4o was used to score model outputs across four qualitative criteria: creativity, content coverage, factual accuracy, and coherence. Additionally, a smaller sample set was evaluated by humans and GPT-4o model was asked to choose the most successful summaries from this sample, and comparative analysis was performed between the model preferences and the preferences of human annotators. Findings show that lexical filtering of the training data leads to modest improvements in ROUGE scores and qualitative evaluations, particularly in creativity. Furthermore, models trained on LLM-generated summaries performed competitively compared to those trained on human-written data, suggesting that synthetic data can be a viable alternative when carefully constructed. The results highlight the importance of data abstraction and evaluation diversity in training robust summarization models.
Benzer Tezler
- On real-world face super-resolution and face image synthesis evaluation
Gerçek dünya yüz süper çözünürlüğü ve yüz görüntüsü sentezi değerlendirmesi üzerine
ERDİ SARITAŞ
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Assessıng the ımpact of synthetıc data generatıon vıa generatıve aı on clınıcal text classıfıcatıon
Üretken yapay zeka yoluyla sentetı̇k verı̇ oluşturmanınklı̇nı̇k metı̇n sınıflandırması üzerı̇ndekı̇ etkı̇sı̇nı̇değerlendı̇rmek
ENİS KÖSEOĞLU
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir ÜniversitesiMühendislik Ana Bilim Dalı (disiplinlerarası)
DOÇ. DR. CEMAL OKAN SAKAR
- Finans alanında veri mahremiyeti yöntemleri: Federe öğrenme ve sentetik veri üretimi
Data privacy methods in finance: Federated learning and synthetic data generation
ELİF ÖZCAN
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. YUSUF YASLAN
- Makine öğrenmesi yöntemleri ile yangın verilerinin analizi ve sınıflandırılması
Analysis and classification of fire data using machine learning methods
ZEYNEP NAZLI ASLAN
Yüksek Lisans
Türkçe
2025
İlk ve Acil YardımSakarya ÜniversitesiAfet Yönetimi Ana Bilim Dalı
DOÇ. DR. BEYTULLAH EREN
- Palmprint recognition using gabor wavelet transform
Başlık çevirisi yok
MOHAMMED ABDULAZEEZ HAYDER MUSAWI
Yüksek Lisans
İngilizce
2022
Bilgi ve Belge YönetimiAltınbaş ÜniversitesiElektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ AYÇA KURNAZ TÜRKBEN