Author identification with transfer learning
Transfer öğrenimi ile yazar tanıma
- Tez No: 829066
- Danışmanlar: DR. ÖĞR. ÜYESİ FERİŞTAH DALKILIÇ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2023
- Dil: İngilizce
- Üniversite: Dokuz Eylül Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: 64
Özet
Yazar tanıma, metin madenciliğinin uygulama alanlarından biridir. Bir elektronik metnin potansiyel yazarının önceden tanımlanmış yazar adayları arasından yazara özgü yazı stilleri kullanılarak otomatik olarak tahmin edilmesi ile ilgilenir. Bu çalışmada, Türkçe bir metnin yazarının belirlenmesi için transfer öğrenme yöntemleri ve ayrıca transfer öğrenme yöntemlerinin performansını karşılaştırmak için makine öğrenmesi algoritmaları kullanılmıştır. GPT-2, BERT ve Support Vector Machines, Gaussian Naive Bayes, Multi Layer Perceptron, Logistic Regression, Stokastik Gradient Descent gibi klasik makine öğrenimi algoritmalarından bazılarını ve Extremely Randomized Trees ve eXtreme Gradient Boosting dahil topluluk öğrenme yöntemlerini kullandık. Önerilen yöntem, yeni bir gazete makalesi veri setinden elde edilen 10, 15 ve 20 yazar olmak üzere üç farklı büyüklükteki yazar grubuna uygulanmıştır. 1-gram ve 2- gram kelime belirteçleri kullanılarak terim frekansı-ters belge frekans vektörleri oluşturulmuştur. Sonuçlarımız, en başarılı yöntemin 10 yazarda %98,6 sınıflandırma performans doğruluğu ile BERT olduğunu göstermektedir. SGD %97,5 ve %97,1 doğruluk performansı ile 15 ve 20 yazar arasında en başarılı yöntemdir.
Özet (Çeviri)
Author identification is one of the application areas of text mining. It deals with the automatic prediction of the potential author of an electronic text among predefined author candidates by using author specific writing styles. In this study, we conducted an experiment for the identification of the author of a Turkish language text by using transfer learning methods and also machine learning algorithms are used to compare the performance of transfer learning methods. We used GPT-2, BERT and some of classical machine learning algorithms such as Support Vector Machines, Gaussian Naive Bayes, Multi Layer Perceptron, Logistic Regression, Stochastic Gradient Descent and ensemble learning methods including Extremely Randomized Trees and eXtreme Gradient Boosting. The proposed method was applied on three different sizes of author groups including 10, 15 and 20 authors obtained from a new dataset of newspaper articles. Term frequency-inverse document frequency vectors were created by using 1-gram and 2-gram word tokens. Our results show that the most successful method is the BERT with a classification performance accuracy of 98.6% in 10 authors. SGD is the most successful method in 15 and 20 authors with 97.5% and 97.1% accuracy performance.
Benzer Tezler
- Sarcasm detection from text with context information using deep learning
Derin öğrenme kullanarak bağlam bilgisi ile metinden açılama tespiti
MUHAMMAD USMAN
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş ÜniversitesiElektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. ABDULLAH ABDU IBRAHIM
- Aytül Akal'ın çocuk romanlarının değerler aktarımı açısından incelenmesi
Examination of Aytül Akal's children's novels in terms of values transfer
VEYSİ ÇELEBİ
Yüksek Lisans
Türkçe
2018
Eğitim ve ÖğretimGaziantep ÜniversitesiTürkçe ve Sosyal Bilimler Eğitimi Ana Bilim Dalı
DR. ÖĞR. ÜYESİ AHMET İHSAN KAYA
- Ortaöğretim Türkiye Cumhuriyeti Tarihi ders kitaplarında dönüşüm: İstiklal Harbi örneği (1960-1980)
Transformation of secondary education the republic of Turkey history textbooks: The case of war of independence (1960-1980)
MEDİNE NUR KILINÇ
Yüksek Lisans
Türkçe
2019
Eğitim ve ÖğretimGazi ÜniversitesiTürkçe ve Sosyal Bilimler Eğitimi Ana Bilim Dalı
PROF. DR. NEJLA GÜNAY
- Sinân'ın Hoca-nâme Mesnevîsi: Metin - inceleme - dizin
Sinân Hoca-nâme text with transcription - analysis - index
NİHAL YAVUZ
Doktora
Türkçe
2015
Türk Dili ve EdebiyatıGazi ÜniversitesiTürk Dili ve Edebiyatı Ana Bilim Dalı
PROF. DR. AHMET MERMER
- Asanbek Stamov'un Çüy Bayanı hikâyesi üzerine bir dil incelemesi (aktarma-inceleme-dizin)
A language study on the Çüy Bayanı story of Asanbek Stamov's (transfer-examination-index)
CEM CEBECİ
Yüksek Lisans
Türkçe
2018
DilbilimMuğla Sıtkı Koçman ÜniversitesiÇağdaş Türk Lehçeleri ve Edebiyatları Ana Bilim Dalı
DR. ÖĞR. ÜYESİ GÜLSİNE UZUN