Türkçe doğal dil işleme ile ofansif sosyal medya video içeriklerinin sınıflandırılması
Classification of offensive social media video texts using turkish natural language processing
- Tez No: 977926
- Danışmanlar: DOÇ. DR. MURAT KÖKLÜ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Dil sınıflandırma modeli, Doğal dil, Sosyal medya platformları, Yapay zeka, Language classification model, Natural language, social mediaplatforms, Artificial intelligence
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Selçuk Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Türkçe sosyal medya ekosisteminde giderek görünür hale gelen hakaret, küfür, cinsiyetçilik ve ırkçılık içeren söylemler, özellikle video tabanlı platformlarda anlık ölçekte denetlenmesi güç bir güvenlik sorunu yaratmaktadır. Bu tez, söz konusu boşluğu kapatmak amacıyla YouTube kaynaklı içeriklerden derlenen 5725 örnekten oluşan, beş sınıflı (PROFANITY, INSULT, SEXIST, RACIST, OTHER) orta ölçekli bir metin veri seti inşa ederek işe başlamıştır. Veri setinin sınıf dağılımı; 4810 örnek (%84,0) toksik olmayan içerik (OTHER), 631 örnek (%11,0) hakaret/kışkırtıcı söylem (INSULT), 104 örnek (%1,8) küfür (PROFANITY), 100 örnek (%1,7) ırkçı ifade (RACIST) ve 80 örnek (%1,4) cinsiyetçi ifade (SEXIST) biçimindedir. Bu dağılım, toksik içeriklerin sosyal medya ortamında azınlık sınıflar halinde yoğunlaştığını, dolayısıyla sınıf dengesizliği probleminin kritik önem taşıdığını ortaya koymaktadır. Modelleme safhasında, ≈110M parametreli BERTurk (uncased-base, 128k) ile 17 milyar parametreli LLaMA-4 Maverick modellerinin doğruluk, makro-F1 ve alt sınıf duyarlılık metrikleri ayrıntılı biçimde karşılaştırılmıştır. Sonuçlar, LLaMA-4'ün genel doğruluğu %88,7'ye, ağırlıklı F1 değerini ise 0,896'ya yükselterek BERTurk'e kıyasla ≈11 puanlık kayda değer bir üstünlük sağladığını göstermiştir. Ayrıca makro F1 skorundaki +0,267 puanlık artış, özellikle azınlık sınıflar olan PROFANITY, RACIST ve SEXIST kategorilerinde dengeleyici etkisini ortaya koymuştur. Bununla birlikte gecikme ve maliyet ölçümleri, BERTurk'ün p50 ≈ 100 ms yanıt süresi ve düşük çağrı maliyetiyle yüksek hacimli ön tarama senaryolarında verimli olduğunu; LLaMA-4'ün ise p50 ≈ 350 ms gecikmeye karşın riskli içeriklerde ikincil doğrulama katmanı olarak devreye sokulduğunda bütçe ve performansı dengeli biçimde optimize edebileceğini göstermektedir. Çalışma, pratikte uygulanabilir çift katmanlı bir moderasyon mimarisi önermekte ve akademik bulguları doğrudan sektörel çözüme dönüştürmektedir. 2018-2025 döneminde çevrimiçi nefret söylemi literatürüne ait kapsamlı bibliyometrik analizlerle temellendirilen bu teknik çalışma; bir yandan Türkçe ofansif dil tespitine yönelik güvenilir bir veri seti ve operasyonel modelleme çerçevesi sunarken, öte yandan araştırmacılar ve politika yapıcılar için literatürün yapısal dinamiklerini özetleyen yol gösterici bir atlas oluşturmuştur.
Özet (Çeviri)
In the Turkish social media ecosystem, offensive expressions such as insults, profanity, sexism, and racism are becoming increasingly visible, creating a security challenge that is difficult to monitor in real time, especially on video-based platforms. This thesis addresses this gap by constructing a medium-scale text dataset of 5,725 samples, categorized into five classes (PROFANITY, INSULT, SEXIST, RACIST, OTHER), compiled from YouTube content. The class distribution of the dataset is as follows: 4,810 samples (84.0%) non-toxic content (OTHER), 631 samples (11.0%) insults/inciting expressions (INSULT), 104 samples (1.8%) profanity (PROFANITY), 100 samples (1.7%) racist expressions (RACIST), and 80 samples (1.4%) sexist expressions (SEXIST). This distribution shows that toxic content mainly appears as minority classes in social media, highlighting the critical importance of the class imbalance problem. In the modeling phase, ≈110M parameter BERTurk (uncased-base, 128k) and the 17-billion-parameter LLaMA-4 Maverick were compared in terms of accuracy, macro-F1, and sub-class recall metrics. The results demonstrated that LLaMA-4 achieved an overall accuracy of 88.7% and a weighted F1 score of 0.896, providing a ≈11-point improvement compared to BERTurk. Moreover, the +0.267 increase in macro-F1 reflects a balancing effect, especially in the minority classes PROFANITY, RACIST, and SEXIST. Furthermore, latency and cost analyses revealed that BERTurk, with a p50 latency of ≈100 ms and low operational cost, is efficient for high-volume pre-screening tasks. On the other hand, LLaMA-4, despite its ≈350 ms p50 latency, can be used as a secondary verification layer in risky content detection scenarios, achieving a balanced optimization of cost and performance. The study thus proposes a practically applicable two-layer moderation architecture, turning academic findings directly into sectoral solutions. Supported by a comprehensive bibliometric analysis of online hate speech literature between 2018 and 2025, this technical research provides a reliable dataset and operational modeling framework for Turkish offensive language detection, while also offering a guiding atlas that summarizes the structural dynamics of the field for researchers and policymakers.
Benzer Tezler
- Türkçe doğal dil işleme ile çoklu gezgin robot sistemlerinin formasyon kontrolü
Formation control of multiple mobile robot systems by Turkish natural language processing
KADİR ARAM
Doktora
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Sabahattin Zaim ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. DR. BURHANETTİN CAN
DOÇ. DR. GÖKHAN ERDEMİR
- Doğal dil işleme ile Türkçe yazım hatalarının denetlenmesi
Turkish spell check with natural language processing
AYNUR DELİBAŞ
Yüksek Lisans
Türkçe
2008
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. EŞREF ADALI
- Doğal dil işleme ile Türkçe içerikli paylaşımlardan sosyal medya kullanıcılarının duygu analizi
Sentiment analysis of social medial users from Turkish content with natural language processing
ÇAĞLA BALLI
Yüksek Lisans
Türkçe
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MEHMET SERDAR GÜZEL
- Sözlük tabanlı yaklaşım ve makine öğrenmesi ile Türkçe doğal dil işleme: Eğitim kurumlarında duygu analizi
Turkish natural language processing using dictionary based approach and machine learning: Sentiment analysis in educational institutions
HARUN AKSAYA
- Doğal dil işleme ve derin öğrenme teknikleri ile duygu analizi: Türkçe metinler üzerine bir çalışma
Sentiment analysis with natural language processing and deep learning techniques: A study on Turkish texts
ZEYNEP SENA PEKEL
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Beykent ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. ATINÇ YILMAZ