Geri Dön

Çoklu metin temsillerinin sezgisel algoritmalarla birleştirilmesine dayalı yazar tanıma yaklaşımı

An author identification approach based on integration of multiple text representations using heuristic algorithms

  1. Tez No: 980457
  2. Yazar: KEREM ÖZMEN
  3. Danışmanlar: DOÇ. DR. AYSUN GÜRAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Doğuş Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Bilimleri Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Yapay zekâ ve doğal dil işleme (NLP) alanındaki gelişmeler, metinlerden yazar kimliğinin belirlenmesini mümkün kılmaktadır. Bu tez çalışmasında, farklı yazarlara ait metinler üzerinde yazar tanıma uygulaması gerçekleştirilmiştir. Çalışmada, yazarlara ait metinler üç farklı yöntem olan TF-IDF, Word2Vec ve BERT modelleri kullanılarak ayrı ayrı vektörleştirilmiştir. Elde edilen bu vektör temsilleri, çeşitli sezgisel algoritmalar aracılığıyla birleştirilerek hibrit bir temsil sistemi önerilmiştir. Bu hibrit yapının amacı; kelimelerin frekans bilgisini, anlamsal ilişkilerini ve cümle düzeyindeki bağlamsal anlamlarını bir arada değerlendirerek modelin genel performansını artırmaktır. Hibrit vektörlerin oluşturulmasında, hem ince ayar yapılmış (fine-tuned) BERT modeli hem de ince ayar yapılmamış BERT Mean Pooling tabanlı modelden elde edilen metin temsilleri kullanılmıştır. Oluşturulan bu hibrit temsiller, farklı sınıflandırma algoritmaları ile test edilmiştir. Deneysel sonuçlar, vektör temsillerinin sezgisel algoritmalarla birleştirilmesinin sistem performansını anlamlı şekilde iyileştirdiğini göstermiştir. Özellikle kelimelerin frekans bilgisinin yüksek katkısı, kelimelerin anlamsal katkısının ele alınması ve cümle düzeyindeki incelemeleri de içeren hibrit sistemi kullanımı optimum performans için kritik bileşenler olarak öne çıkmaktadır. Sonuç olarak, önerilen hibrit vektör gösterimi yaklaşımı, yazar kimliği belirleme probleminde yüksek doğruluk oranı sağlamış ve metin sınıflandırma alanında etkili, genellenebilir bir yöntem olarak değerlendirilmiştir.

Özet (Çeviri)

Advancements in artificial intelligence (AI) and natural language processing (NLP) have made it possible to identify authorship from textual data. In this thesis study, an authorship attribution application was developed using texts belonging to different authors. In the study, the texts were vectorized separately using three different methods: TF-IDF, Word2Vec, and BERT models. The obtained vector representations were then combined through various heuristic (sezgisel) algorithms, and a hybrid representation system was proposed. The purpose of this hybrid structure is to enhance the overall performance of the model by jointly considering the frequency information of words, their semantic relationships, and the contextual meanings at the sentence level. In constructing the hybrid vectors, text representations obtained from both a fine-tuned BERT model and a non-fine-tuned BERT Mean Pooling-based model were utilized. The resulting hybrid representations were evaluated using different classification algorithms. Experimental results demonstrated that combining vector representations through heuristic algorithms significantly improved system performance. In particular, the strong contribution of word frequency information, the incorporation of semantic relationships, and the inclusion of sentence-level contextual analysis emerged as critical components for achieving optimal performance. As a result, the proposed hybrid vector representation approach achieved high accuracy in the authorship identification task and was found to be an effective and generalizable method in the field of text classification.

Benzer Tezler

  1. Convolutional auto encoders for sentence representation generation

    Evrişimsel otomatik kodlayıcı ile cümle temsili oluşturulması

    ALİ MERT CEYLAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2018

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEge Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. VECDİ AYTAÇ

  2. Yapay zekâ tekniklerinin hukuk alanında uygulanması

    Application of artificial intelligence techniques in the field of law

    MUSTAFA EMİRKAN OKURSOY

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Endüstri ve Endüstri MühendisliğiBursa Uludağ Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    PROF. DR. TÜLİN İNKAYA

    DR. ÖĞR. ÜYESİ EMİNE GÖKÇE KARABEL

  3. How online small groups co-construct mathematical artifacts to do collaborative problem solving

    Çevrimiçi küçük gruplar ışbirlikli problem çözme yapmak ıçin matematiksel yapıları nasıl birlikte oluşturur

    MURAT PERİT ÇAKIR

    Doktora

    İngilizce

    İngilizce

    2009

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDrexel Unıversıty

    Enformatik Ana Bilim Dalı

    PROF. DR. GERRY STAHL

  4. Automatic, integrated and structured reporting for radiology image examinations

    Radyoloji görüntü incelemeleri için otomatik, entegre ve yapılandırılmış raporlama

    NURBANU AKSOY

    Doktora

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolUnıversıty Of Leeds

    Mühendislik Bilimleri Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ NISHANT RAVIKUMAR

    PROF. DR. SERGE SHAROFF

  5. Canavar bedenler, canavar mekanlar

    Monster bodies, monster spaces

    BUSE ÖZÇELİK

    Yüksek Lisans

    Türkçe

    Türkçe

    2018

    Mimarlıkİstanbul Teknik Üniversitesi

    Mimarlık Ana Bilim Dalı

    DOÇ. DR. SIDIKA ASLIHAN ŞENEL