Geri Dön

Metin sınıflandırılmasında özetleme ve yeniden ifade etme tekniklerinin değerlendirilmesi

Evaluation of summarising and paraphrasing techniques in text classification

  1. Tez No: 971276
  2. Yazar: CEZMİ ERDÖR
  3. Danışmanlar: DR. ÖĞR. ÜYESİ DİDEM ÖLÇER
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Başkent Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez çalışmasında, haber metinleri üzerinde gerçekleştirilen özetleme, yeniden ifade etme (parafrazlama) ve semantik benzerlik ölçme yöntemlerinin performansları kapsamlı biçimde incelenmiştir. Çalışma kapsamında öncelikle metinler, ön işleme adımlarından geçirilmiş ve Bag of Words (BoW) ile temsil edilmiştir. Ardından, farklı makine öğrenmesi modelleri (Lojistik Regresyon, Destek Vektör Makineleri, Rastgele Orman ve Tek Katmanlı Yapay Sinir Ağı üzerinde katmanlı k-kat çapraz doğrulama yöntemiyle sınıflandırma deneyleri yapılmış; en yüksek başarımı gösteren model sonraki aşamalarda kullanılmıştır. Özetleme aşamasında yalnızca çıkarımsal(extractive) yöntemler tercih edilmiş; TextRank, LexRank, TF-IDF tabanlı özetleme ve kural tabanlı (rule-based) yöntemler uygulanmıştır. Yeniden ifade etme aşamasında ise iki farklı yöntem—WordNet tabanlı ve Back-Translation—kullanılmıştır. Üretilen özetler ve yeniden ifade edilen metinler hem kosinüs benzerliği hem de BERTScore ölçütleriyle değerlendirilmiştir. Analizler, ham metinler ile özetlenmiş metinlerin; ham metinler ile özetlenip yeniden ifade edilmiş metinlerin ve ham metinler ile doğrudan yeniden ifade edilmiş metinlerin karşılaştırılması esas alınarak yürütülmüştür. Bulgular, bazı yöntemlerde özetlenip yeniden ifade edilmiş metinlerin semantik benzerlik skorlarının yalnızca özetlenmiş metinlerden yüksek olabildiğini, ancak genel olarak doğrudan yeniden ifade edilen metinlerin en yüksek benzerlik değerlerine ulaştığını ortaya koymuştur. Bu çalışma, özetleme ve yeniden ifade etme yöntemlerinin birlikte kullanıldığında semantik benzerlik üzerindeki etkilerini ortaya koymakta ve metin işleme uygulamalarında yöntem seçiminde yol gösterici bulgular sunmaktadır.

Özet (Çeviri)

In this thesis, the performances of summarization, paraphrasing, and semantic similarity measurement methods applied to news articles are comprehensively examined. Initially, the texts were preprocessed and represented using the Bag of Words (BoW) model. Subsequently, classification experiments were conducted on different machine learning models (Logistic Regression, Support Vector Machines, Random Forest, and Perceptron) using the stratified k-fold cross-validation method; the model with the highest performance was employed in the subsequent stages. In the summarization stage, only extractive methods were preferred, and TextRank, LexRank, TF-IDF-based summarization, and rule-based methods were applied. In the paraphrasing stage, two different methods—WordNet-based and Back-Translation—were used. The generated summaries and paraphrased texts were evaluated using both the Cosine Similarity and BERTScore metrics. The analyses were carried out by comparing raw texts with summarized texts; raw texts with summarised and paraphrased texts; and raw texts with directly paraphrased texts. The findings revealed that, in some cases, the semantic similarity scores of summarised-and-paraphrased texts could be higher than those of solely summarized texts; however, in general, directly paraphrased texts achieved the highest similarity scores. This study demonstrates the effects of using summarization and paraphrasing methods together on semantic similarity and provides guiding insights for method selection in text processing applications.

Benzer Tezler

  1. Development of mirna biomarkers for the differentiation between gingivitis and periodontitis: A pilot study

    Gingivitis ve periodontitis ayrımı için mirna biyobelirteçlerinin geliştirilmesi: Pilot çalışma

    DHAFIR LATIEF FAYADH FAYADH

    Doktora

    İngilizce

    İngilizce

    2023

    BiyokimyaSüleyman Demirel Üniversitesi

    Kimya Ana Bilim Dalı

    PROF. DR. MUSTAFA CALAPOĞLU

  2. Promptshıeld: polıcy-aware data loss preventıon framework for generatıve AI prompts

    Promptshıeld: Politika farkındalıklı üretken yapay zekâ istemleri için veri kaybı önleme çerçevesi

    EZGİ KELEŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ŞERİF BAHTİYAR

  3. Word2vec temsillerini kullanarak Türkçede soru sınıflandırmasında derin öğrenme analizi

    A deep learning analysis on Turkish question classification task using word2vec representations

    ŞEYHMUS YILMAZ

    Doktora

    Türkçe

    Türkçe

    2020

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDüzce Üniversitesi

    Elektrik-Elektronik ve Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ SİNAN TOKLU

  4. Identification of discourse relations in Turkish discourse bank

    Türkçe söylem bankasında söylem bağıntılarının belirlenmesi

    FERHAT KUTLU

    Doktora

    İngilizce

    İngilizce

    2023

    DilbilimOrta Doğu Teknik Üniversitesi

    Bilişsel Bilim Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. DENİZ ZEYREK BOZŞAHİN

    DR. MURATHAN KURFALI

  5. Explainable Turkish text classification for internet media discourses on brain drain and migration attitudes

    Beyin göçü ve göç tutumları üzerine Türk internet medyası söylemlerinde açıklanabilir Türkçe metin sınıflandırması

    BATUHAN YILDIRIM

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilim ve TeknolojiKadir Has Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. TANER ARSAN