SMS spam tespitinde belirsizlik duyarlı çok- görünümlü yığınlama yaklaşımı
An uncertainty-aware multi-view stacking approach for SMS spam detection
- Tez No: 1025382
- Danışmanlar: DR. ÖĞR. ÜYESİ ŞEYMA YÜCEL ALTAY
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Atatürk Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Amaç: Bu tez çalışmasının amacı, SMS spam tespitinde tek bir temsil düzeyine dayalı sınıflandırma yaklaşımlarının sınırlılıklarını azaltmak amacıyla belirsizlik duyarlı çok-görünümlü bir yığınlama modeli geliştirmektir. Çalışmada SMS mesajlarının sözcüksel, stilometrik ve anlamsal özelliklerini birlikte değerlendiren çok-görünümlü bir yapı önerilmiştir. Ayrıca uzman modellerin kararlarına ilişkin belirsizlik bilgisinin meta-öğrenme sürecine dâhil edilmesiyle daha güvenilir bir spam tespiti gerçekleştirilmesi hedeflenmiştir. Çalışmanın ana deneysel değerlendirmesi UCI SMS Spam Collection veri seti üzerinde gerçekleştirilmiş, önerilen modelleme akışının Türkçe kısa mesajlar üzerindeki davranışını gözlemlemek amacıyla Turkish SMS Collection veri seti üzerinde de ek değerlendirme yapılmıştır. Yöntem: Önerilen mimari, üç farklı görünümden elde edilen uzman model çıktılarının yığınlama tabanlı bir meta-öğrenici aracılığıyla birleştirilmesine dayanmaktadır. Sözcüksel görünümde SMS mesajları TF-IDF yöntemiyle temsil edilmiş, stilometrik görünümde mesaj uzunluğu, kelime sayısı, büyük harf kullanımı, rakam oranı, noktalama işaretleri, özel karakterler ve bağlantı benzeri yapısal özellikler çıkarılmıştır. Anlamsal görünümde ise önceden eğitilmiş DeBERTa modelinden elde edilen bağlamsal temsil vektörleri kullanılmıştır. Her görünüm için ayrı uzman modeller aracılığıyla sınıf olasılıkları üretilmiş ve bu olasılıklar üzerinden Shannon entropisi hesaplanarak karar belirsizliği elde edilmiştir. Elde edilen olasılık ve entropi değerleri, nihai sınıflandırma kararını üretmek üzere XGBoost meta-öğrenicisine aktarılmıştır. Veri setindeki sınıf dengesizliğinin model üzerindeki etkisini azaltmak amacıyla aşırı örnekleme yöntemi uygulanmıştır. Aşırı örnekleme işlemi yalnızca eğitim verisi üzerinde gerçekleştirilmiş, test verisi ise orijinal sınıf dağılımıyla korunmuştur. Böylece veri sızıntısının önlenmesi ve model başarımının daha güvenilir biçimde ölçülmesi sağlanmıştır. Bulgular: Deneysel sonuçlar, önerilen belirsizlik duyarlı çok-görünümlü yığınlama yaklaşımının tekil görünüm modellerine göre daha yüksek performans sağladığını göstermiştir. UCI SMS Spam Collection veri seti üzerinde yapılan ablasyon çalışmaları, sözcüksel, stilometrik ve anlamsal görünümlerin SMS spam tespitinde birbirini tamamlayıcı bilgiler sunduğunu ortaya koymuştur. Bu görünümlerin Shannon entropisiyle hesaplanan belirsizlik bilgisiyle birlikte meta-öğrenme sürecine dâhil edilmesi, tekil görünüm modellerinden daha başarılı sonuçlar üretmiştir. Meta-öğrenici adayları arasında XGBoost modeli en yüksek genel başarımı göstermiştir. UCI SMS Spam Collection veri seti üzerinde önerilen hibrit yapı 0.9961 doğruluk, 0.9847 F1-skoru, 0.9913 makro F1-skoru ve 0.9961 ağırlıklı F1-skoru değerlerine ulaşmıştır. Bu tez çalışmasında spam sınıfı pozitif sınıf olarak ele alındığından, F1-skoru spam sınıfının doğru tespit edilme başarımını ifade etmektedir. Ayrıca önerilen model için ROC-AUC değeri 0.9998 olarak hesaplanmış ve modelin sınıflar arasında yüksek ayırt edicilik sağladığı görülmüştür. Turkish SMS Collection veri seti üzerinde ise aynı modelleme akışı 0.9989 doğruluk, 0.999 F1-skoru, 0.9989 makro F1-skoru ve 0.9989 ağırlıklı F1-skoru değerlerine ulaşmıştır. Bu bulgular, önerilen modelin yalnızca tek bir güçlü temsil düzeyine dayanmadığını; sözcüksel, stilometrik, anlamsal ve belirsizlik tabanlı bilgileri birlikte değerlendirerek daha kararlı bir sınıflandırma performansı sağladığını göstermektedir. Sonuçlar: Bu tez çalışması, SMS spam tespitinde TF-IDF tabanlı sözcüksel özellikler, stilometrik özellikler, DeBERTa tabanlı anlamsal temsiller, Shannon entropisi ve XGBoost tabanlı meta-öğrenmeyi bütünleşik bir yapı altında bir araya getirmiştir. Elde edilen sonuçlar, farklı temsil düzeylerinden gelen tamamlayıcı bilgilerin birlikte değerlendirilmesinin SMS spam tespitinde sınıflandırma başarımını artırabileceğini göstermektedir. Shannon entropisiyle hesaplanan belirsizlik bilgisinin meta-öğrenme sürecine eklenmesi, uzman model tahminlerinin yalnızca sınıf yönüyle değil, karar güvenilirliği açısından da değerlendirilmesine olanak sağlamıştır. Önerilen yaklaşım, UCI SMS Spam Collection veri setinde tekil görünüm modellerine ve seçili referans çalışmalara göre yüksek doğruluk ve F1-skoru değerleri üretmiştir. Turkish SMS Collection veri seti üzerinde elde edilen ek bulgular ise modelleme akışının Türkçe kısa mesajlar üzerinde de uygulanabilir olduğunu göstermektedir. Bununla birlikte, veri setleri arasındaki dil, sınıf dağılımı ve mesaj içeriği farklılıkları nedeniyle sonuçların birebir deneysel eşdeğerlikten ziyade önerilen modelleme akışının farklı veri koşullarındaki davranışını göstermesi açısından değerlendirilmesi gerekmektedir.
Özet (Çeviri)
Purpose: The aim of this thesis is to develop an uncertainty-aware multi-view stacking model to reduce the limitations of classification approaches that rely on a single representation level in SMS spam detection. In this study, a multi-view framework is proposed to jointly evaluate the lexical, stylometric, and semantic characteristics of SMS messages. In addition, the study aims to achieve more reliable spam detection by incorporating the uncertainty information associated with expert model decisions into the meta-learning process. The main experimental evaluation was conducted on the UCI SMS Spam Collection dataset. Furthermore, an additional evaluation was carried out on the Turkish SMS Collection dataset to examine the behavior of the proposed modeling pipeline on Turkish short messages. Method: The proposed architecture is based on combining the outputs of expert models obtained from three different views through a stacking-based meta-learner. In the lexical view, SMS messages were represented using the TF-IDF method. In the stylometric view, structural features such as message length, word count, uppercase letter usage, digit ratio, punctuation marks, special characters, and link-like patterns were extracted. In the semantic view, contextual representation vectors obtained from a pre-trained DeBERTa model were used. For each view, class probabilities were generated through separate expert models, and decision uncertainty was calculated from these probabilities using Shannon entropy. The resulting probability and entropy values were then transferred to the XGBoost meta-learner to produce the final classification decision. To reduce the effect of class imbalance on the model, an oversampling method was applied. Oversampling was performed only on the training data, while the test data were preserved with their original class distribution. Thus, data leakage was prevented and model performance was measured more reliably. Findings: The experimental results showed that the proposed uncertainty-aware multi-view stacking approach achieved higher performance than single-view models. The ablation studies conducted on the UCI SMS Spam Collection dataset indicated that lexical, stylometric, and semantic views provide complementary information for SMS spam detection. Incorporating these views into the meta-learning process together with uncertainty information calculated through Shannon entropy produced better results than single-view models. Among the meta-learner candidates, the XGBoost model achieved the highest overall performance. On the UCI SMS Spam Collection dataset, the proposed hybrid structure reached 0.9961 accuracy, 0.9847 F1-score, 0.9913 macro F1-score, and 0.9961 weighted F1-score. Since the spam class was considered as the positive class in this thesis, the F1-score represents the detection performance of the spam class. In addition, the ROC-AUC value of the proposed model was calculated as 0.9998, indicating a high discriminative capability between the classes. On the Turkish SMS Collection dataset, the same modeling pipeline achieved 0.9989 accuracy, 0.999 F1-score, 0.9989 macro F1-score, and 0.9989 weighted F1-score. These findings indicate that the proposed model does not rely solely on a single strong representation level; rather, it provides a more stable classification performance by jointly evaluating lexical, stylometric, semantic, and uncertainty-based information. Results: This thesis brought together TF-IDF-based lexical features, stylometric features, DeBERTa-based semantic representations, Shannon entropy, and XGBoost-based meta-learning within an integrated framework for SMS spam detection. The results show that jointly evaluating complementary information from different representation levels can improve classification performance in SMS spam detection. Adding uncertainty information calculated through Shannon entropy to the meta-learning process enabled expert model predictions to be evaluated not only in terms of their predicted class direction but also in terms of decision reliability. The proposed approach produced high accuracy and F1-score values compared with single-view models and selected reference studies on the UCI SMS Spam Collection dataset. The additional findings obtained on the Turkish SMS Collection dataset also indicate that the modeling pipeline is applicable to Turkish short messages. However, due to differences between datasets in terms of language, class distribution, and message content, these results should be interpreted as evidence of the proposed modeling pipeline's behavior under different data conditions rather than as a claim of direct experimental equivalence.
Benzer Tezler
- Makine öğrenmesi yöntemleriyle doğruluğu yüksek SMS spam tespiti
Highly accuracy SMS spam detection with machine learning methods
TUĞÇE ŞENOL
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSivas Cumhuriyet ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HİDAYET TAKCI
- SMS spam filtering on mobile communication
Mobil iletişimde SMS filtreleme yöntemleri
ISRAA HUSSAIN
Yüksek Lisans
İngilizce
2017
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. SIRMA YAVUZ
- Etkili spam mesaj (SMS) tespiti için makine öğrenmesi yaklaşımları
Machine learning approaches for effective spam message (SMS) detection
ŞÜHEDA ÖZKAYNAK
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiAdli Bilişim Ana Bilim Dalı
DR. ÖĞR. ÜYESİ URAZ YAVANOĞLU
- Email and SMS spam detection based on deep learning
Derin öğrenmeye dayalı istenmeyen email ve SMS belirleme
ABDULLAHI ABBA ABDULLAHI
Yüksek Lisans
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFırat ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET KAYA
- Makine öğrenmesi yöntemleri ile içerik tabanlı sms filtreleme uygulaması geliştirilmesi
Development of content based sms filtering application with machine learning methods
ONUR KARASOY
Yüksek Lisans
Türkçe
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMuğla Sıtkı Koçman ÜniversitesiBilişim Sistemleri Mühendisliği Ana Bilim Dalı
DOÇ. DR. SERKAN BALLI