Metin sınıflandırılmasında özetleme ve yeniden ifade etme tekniklerinin değerlendirilmesi
Evaluation of summarising and paraphrasing techniques in text classification
- Tez No: 971276
- Danışmanlar: DR. ÖĞR. ÜYESİ DİDEM ÖLÇER
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Başkent Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez çalışmasında, haber metinleri üzerinde gerçekleştirilen özetleme, yeniden ifade etme (parafrazlama) ve semantik benzerlik ölçme yöntemlerinin performansları kapsamlı biçimde incelenmiştir. Çalışma kapsamında öncelikle metinler, ön işleme adımlarından geçirilmiş ve Bag of Words (BoW) ile temsil edilmiştir. Ardından, farklı makine öğrenmesi modelleri (Lojistik Regresyon, Destek Vektör Makineleri, Rastgele Orman ve Tek Katmanlı Yapay Sinir Ağı üzerinde katmanlı k-kat çapraz doğrulama yöntemiyle sınıflandırma deneyleri yapılmış; en yüksek başarımı gösteren model sonraki aşamalarda kullanılmıştır. Özetleme aşamasında yalnızca çıkarımsal(extractive) yöntemler tercih edilmiş; TextRank, LexRank, TF-IDF tabanlı özetleme ve kural tabanlı (rule-based) yöntemler uygulanmıştır. Yeniden ifade etme aşamasında ise iki farklı yöntem—WordNet tabanlı ve Back-Translation—kullanılmıştır. Üretilen özetler ve yeniden ifade edilen metinler hem kosinüs benzerliği hem de BERTScore ölçütleriyle değerlendirilmiştir. Analizler, ham metinler ile özetlenmiş metinlerin; ham metinler ile özetlenip yeniden ifade edilmiş metinlerin ve ham metinler ile doğrudan yeniden ifade edilmiş metinlerin karşılaştırılması esas alınarak yürütülmüştür. Bulgular, bazı yöntemlerde özetlenip yeniden ifade edilmiş metinlerin semantik benzerlik skorlarının yalnızca özetlenmiş metinlerden yüksek olabildiğini, ancak genel olarak doğrudan yeniden ifade edilen metinlerin en yüksek benzerlik değerlerine ulaştığını ortaya koymuştur. Bu çalışma, özetleme ve yeniden ifade etme yöntemlerinin birlikte kullanıldığında semantik benzerlik üzerindeki etkilerini ortaya koymakta ve metin işleme uygulamalarında yöntem seçiminde yol gösterici bulgular sunmaktadır.
Özet (Çeviri)
In this thesis, the performances of summarization, paraphrasing, and semantic similarity measurement methods applied to news articles are comprehensively examined. Initially, the texts were preprocessed and represented using the Bag of Words (BoW) model. Subsequently, classification experiments were conducted on different machine learning models (Logistic Regression, Support Vector Machines, Random Forest, and Perceptron) using the stratified k-fold cross-validation method; the model with the highest performance was employed in the subsequent stages. In the summarization stage, only extractive methods were preferred, and TextRank, LexRank, TF-IDF-based summarization, and rule-based methods were applied. In the paraphrasing stage, two different methods—WordNet-based and Back-Translation—were used. The generated summaries and paraphrased texts were evaluated using both the Cosine Similarity and BERTScore metrics. The analyses were carried out by comparing raw texts with summarized texts; raw texts with summarised and paraphrased texts; and raw texts with directly paraphrased texts. The findings revealed that, in some cases, the semantic similarity scores of summarised-and-paraphrased texts could be higher than those of solely summarized texts; however, in general, directly paraphrased texts achieved the highest similarity scores. This study demonstrates the effects of using summarization and paraphrasing methods together on semantic similarity and provides guiding insights for method selection in text processing applications.
Benzer Tezler
- Development of mirna biomarkers for the differentiation between gingivitis and periodontitis: A pilot study
Gingivitis ve periodontitis ayrımı için mirna biyobelirteçlerinin geliştirilmesi: Pilot çalışma
DHAFIR LATIEF FAYADH FAYADH
Doktora
İngilizce
2023
BiyokimyaSüleyman Demirel ÜniversitesiKimya Ana Bilim Dalı
PROF. DR. MUSTAFA CALAPOĞLU
- Promptshıeld: polıcy-aware data loss preventıon framework for generatıve AI prompts
Promptshıeld: Politika farkındalıklı üretken yapay zekâ istemleri için veri kaybı önleme çerçevesi
EZGİ KELEŞ
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. ŞERİF BAHTİYAR
- Word2vec temsillerini kullanarak Türkçede soru sınıflandırmasında derin öğrenme analizi
A deep learning analysis on Turkish question classification task using word2vec representations
ŞEYHMUS YILMAZ
Doktora
Türkçe
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDüzce ÜniversitesiElektrik-Elektronik ve Bilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SİNAN TOKLU
- Identification of discourse relations in Turkish discourse bank
Türkçe söylem bankasında söylem bağıntılarının belirlenmesi
FERHAT KUTLU
Doktora
İngilizce
2023
DilbilimOrta Doğu Teknik ÜniversitesiBilişsel Bilim Ana Bilim Dalı (disiplinlerarası)
PROF. DR. DENİZ ZEYREK BOZŞAHİN
DR. MURATHAN KURFALI
- Explainable Turkish text classification for internet media discourses on brain drain and migration attitudes
Beyin göçü ve göç tutumları üzerine Türk internet medyası söylemlerinde açıklanabilir Türkçe metin sınıflandırması
BATUHAN YILDIRIM
Yüksek Lisans
İngilizce
2025
Bilim ve TeknolojiKadir Has ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. TANER ARSAN