Augmenting a Turkish dataset for spam filtering using natural language processing techniques
Doğal dil işleme teknikleri kullanılarak spam filtreleme için Türkçe veri kümesinin genişletilmesi
- Tez No: 755523
- Danışmanlar: PROF. DR. BANU GÜNEL KILIÇ, DOÇ. DR. CENGİZ ACARTÜRK
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Doğal dil işleme, Filtreleme, Spam tespiti, Veri setleri, Natural language processing, Filtration, Spam detection, Data sets
- Yıl: 2022
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Enformatik Enstitüsü
- Ana Bilim Dalı: Siber Güvenlik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Günümüzde, internetin evriminin bir sonucu olarak iletişim kurma şeklimiz de değişiyor. İnternetin temel iletişim yollarından biri olan e-posta sistemleri; kullanımının kolay, ucuz ve hızlı olması ve geniş bir kullanıcı kitlesine sahip olması, kötü niyetli aktörlerin de içinde hareket edebileceği geniş bir ortam haline gelmiştir. Buna bağlı olarak istenmeyen ve toplu olarak gönderilen her türlü e-posta olarak tanımlanan spam e-postalar, internetteki kötü niyetli aktörlerin başlıca araçlarından biri haline gelmiştir. İstenmeyen e-postaları durdurmanın henüz kesin bir yolu olmasa da, filtreleme teknikleri her zaman gelişmeye devam etmektedir. Dolayısıyla, istenmeyen e-posta filtreleme, Doğal Dil İşleme'de de en sık kullanılan metin sınıflandırma konularından biri haline geldi. Bu amaçla kullanılan makine öğrenme yöntemlerinin sınıflandırma başarısını artırmanın ise birden çok yolu vardır ve veri artırma bunlardan biridir. Artırma, eldeki veri kümesinden daha fazla veri ve örnek oluşturmaya hizmet eder ve eğitim veri kümelerine benzersiz örnekler ekleyerek makine öğrenme modellerinin işlevselliğini ve doğruluğunu artırır. Veri kümesi yeterli ve yeterince büyükse, makine öğrenme modeli de daha iyi performans gösterir. Bu çalışmada, Türkçe bir veri setini anlamsal olarak büyütmenin spam filtreleme yöntemlerinin doğruluğuna etkisini inceledik ve araştırmalarda kullanılabilecek verimli sonuçlar gözlemledik.
Özet (Çeviri)
Today, how we communicate is altering as a consequence of the evolution of the internet. Since one of the main communication ways of the internet is e-mail systems and they are easy to use, cheap and fast, and have a wide user base, they have also become a broad environment for malicious actors to act within. Correspondingly, spam e-mails, defined as any kind of unwanted, unwelcomed e-mails sent in bulk, are one of the main tools for these malicious actors. Even if there is not yet a definitive way to stop spam e-mails, filtering techniques are improving all the time. In time, spam filtering became one of the most commonly used text classification issues in Natural Language Processing, too. There are multiple ways to improve the classification success of the machine learning methods, one of them is data augmentation. Augmentation serves to generate more unique data from the dataset at hand and improves the functionality and accuracy of machine learning models. A machine learning model improves if the dataset is sufficient and large enough. In this study, we examined the effects of semantically augmenting a Turkish dataset on the accuracy of spam filtering methods and observed efficient results that can be used in research.
Benzer Tezler
- Deep learning based offline handwritten character recognizer systems with a multilingual handwritten character dataset
Derin öğrenme tabanlı çevirimdışı etkileşimsiz el yazılı karakter tanıma sistemleri ile çok dilli el yazısı karakter veri seti
GAYE EDİBOĞLU BARTOS
Doktora
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEskişehir Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. YAŞAR HOŞCAN
DOÇ. DR. ÉVA NAGYNÉ HAJNAL
- Çevrim içi yabancılara Türkçe öğretimi etkileşiminde gülmecenin işlevi
The functions of humor in online Turkish as a foreign language classroom
HATİCE SUMRUK
Doktora
Türkçe
2025
Eğitim ve ÖğretimHacettepe ÜniversitesiTürkiyat Araştırmaları Ana Bilim Dalı
PROF. DR. MUSTAFA DURMUŞ
- Türkçe e-ticaret yorumlarında transformer tabanlı duygu analizi
Transformer-based sentiment analysis on Turkish e-commerce reviews
MUHAMMET ŞAMİL İKİZOĞLU
Yüksek Lisans
Türkçe
2026
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesiİşletme Mühendisliği Ana Bilim Dalı
DOÇ. DR. TUNCAY ÖZCAN
- A stress testıng framework for the Turkısh bankıng sector: an augmented approach
Türk bankacılık sektörü için bir stres testi çerçevesi: Bir genişletilmiş yaklaşım
BAHADIR ÇAKMAK
- Elasticity of substitution between capital and labour: An industry-level estimation for Turkey
Sermaye ve emek arasındaki ikame esnekliği: Türkiye için sektör düzeyinde bir tahmin
İBRAHİM ENGİN KILIÇ
Yüksek Lisans
İngilizce
2019
EkonomiYıldız Teknik Üniversitesiİktisat Ana Bilim Dalı
PROF. DR. ENSAR YILMAZ