Geri Dön

Türkçe doğal dil işleme ile ofansif sosyal medya video içeriklerinin sınıflandırılması

Classification of offensive social media video texts using turkish natural language processing

  1. Tez No: 977926
  2. Yazar: ELİF SARIGİL KARA
  3. Danışmanlar: DOÇ. DR. MURAT KÖKLÜ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Dil sınıflandırma modeli, Doğal dil, Sosyal medya platformları, Yapay zeka, Language classification model, Natural language, social mediaplatforms, Artificial intelligence
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Selçuk Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Türkçe sosyal medya ekosisteminde giderek görünür hale gelen hakaret, küfür, cinsiyetçilik ve ırkçılık içeren söylemler, özellikle video tabanlı platformlarda anlık ölçekte denetlenmesi güç bir güvenlik sorunu yaratmaktadır. Bu tez, söz konusu boşluğu kapatmak amacıyla YouTube kaynaklı içeriklerden derlenen 5725 örnekten oluşan, beş sınıflı (PROFANITY, INSULT, SEXIST, RACIST, OTHER) orta ölçekli bir metin veri seti inşa ederek işe başlamıştır. Veri setinin sınıf dağılımı; 4810 örnek (%84,0) toksik olmayan içerik (OTHER), 631 örnek (%11,0) hakaret/kışkırtıcı söylem (INSULT), 104 örnek (%1,8) küfür (PROFANITY), 100 örnek (%1,7) ırkçı ifade (RACIST) ve 80 örnek (%1,4) cinsiyetçi ifade (SEXIST) biçimindedir. Bu dağılım, toksik içeriklerin sosyal medya ortamında azınlık sınıflar halinde yoğunlaştığını, dolayısıyla sınıf dengesizliği probleminin kritik önem taşıdığını ortaya koymaktadır. Modelleme safhasında, ≈110M parametreli BERTurk (uncased-base, 128k) ile 17 milyar parametreli LLaMA-4 Maverick modellerinin doğruluk, makro-F1 ve alt sınıf duyarlılık metrikleri ayrıntılı biçimde karşılaştırılmıştır. Sonuçlar, LLaMA-4'ün genel doğruluğu %88,7'ye, ağırlıklı F1 değerini ise 0,896'ya yükselterek BERTurk'e kıyasla ≈11 puanlık kayda değer bir üstünlük sağladığını göstermiştir. Ayrıca makro F1 skorundaki +0,267 puanlık artış, özellikle azınlık sınıflar olan PROFANITY, RACIST ve SEXIST kategorilerinde dengeleyici etkisini ortaya koymuştur. Bununla birlikte gecikme ve maliyet ölçümleri, BERTurk'ün p50 ≈ 100 ms yanıt süresi ve düşük çağrı maliyetiyle yüksek hacimli ön tarama senaryolarında verimli olduğunu; LLaMA-4'ün ise p50 ≈ 350 ms gecikmeye karşın riskli içeriklerde ikincil doğrulama katmanı olarak devreye sokulduğunda bütçe ve performansı dengeli biçimde optimize edebileceğini göstermektedir. Çalışma, pratikte uygulanabilir çift katmanlı bir moderasyon mimarisi önermekte ve akademik bulguları doğrudan sektörel çözüme dönüştürmektedir. 2018-2025 döneminde çevrimiçi nefret söylemi literatürüne ait kapsamlı bibliyometrik analizlerle temellendirilen bu teknik çalışma; bir yandan Türkçe ofansif dil tespitine yönelik güvenilir bir veri seti ve operasyonel modelleme çerçevesi sunarken, öte yandan araştırmacılar ve politika yapıcılar için literatürün yapısal dinamiklerini özetleyen yol gösterici bir atlas oluşturmuştur.

Özet (Çeviri)

In the Turkish social media ecosystem, offensive expressions such as insults, profanity, sexism, and racism are becoming increasingly visible, creating a security challenge that is difficult to monitor in real time, especially on video-based platforms. This thesis addresses this gap by constructing a medium-scale text dataset of 5,725 samples, categorized into five classes (PROFANITY, INSULT, SEXIST, RACIST, OTHER), compiled from YouTube content. The class distribution of the dataset is as follows: 4,810 samples (84.0%) non-toxic content (OTHER), 631 samples (11.0%) insults/inciting expressions (INSULT), 104 samples (1.8%) profanity (PROFANITY), 100 samples (1.7%) racist expressions (RACIST), and 80 samples (1.4%) sexist expressions (SEXIST). This distribution shows that toxic content mainly appears as minority classes in social media, highlighting the critical importance of the class imbalance problem. In the modeling phase, ≈110M parameter BERTurk (uncased-base, 128k) and the 17-billion-parameter LLaMA-4 Maverick were compared in terms of accuracy, macro-F1, and sub-class recall metrics. The results demonstrated that LLaMA-4 achieved an overall accuracy of 88.7% and a weighted F1 score of 0.896, providing a ≈11-point improvement compared to BERTurk. Moreover, the +0.267 increase in macro-F1 reflects a balancing effect, especially in the minority classes PROFANITY, RACIST, and SEXIST. Furthermore, latency and cost analyses revealed that BERTurk, with a p50 latency of ≈100 ms and low operational cost, is efficient for high-volume pre-screening tasks. On the other hand, LLaMA-4, despite its ≈350 ms p50 latency, can be used as a secondary verification layer in risky content detection scenarios, achieving a balanced optimization of cost and performance. The study thus proposes a practically applicable two-layer moderation architecture, turning academic findings directly into sectoral solutions. Supported by a comprehensive bibliometric analysis of online hate speech literature between 2018 and 2025, this technical research provides a reliable dataset and operational modeling framework for Turkish offensive language detection, while also offering a guiding atlas that summarizes the structural dynamics of the field for researchers and policymakers.

Benzer Tezler

  1. Türkçe doğal dil işleme ile çoklu gezgin robot sistemlerinin formasyon kontrolü

    Formation control of multiple mobile robot systems by Turkish natural language processing

    KADİR ARAM

    Doktora

    Türkçe

    Türkçe

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Sabahattin Zaim Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    PROF. DR. BURHANETTİN CAN

    DOÇ. DR. GÖKHAN ERDEMİR

  2. Doğal dil işleme ile Türkçe yazım hatalarının denetlenmesi

    Turkish spell check with natural language processing

    AYNUR DELİBAŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2008

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. EŞREF ADALI

  3. Doğal dil işleme ile Türkçe içerikli paylaşımlardan sosyal medya kullanıcılarının duygu analizi

    Sentiment analysis of social medial users from Turkish content with natural language processing

    ÇAĞLA BALLI

    Yüksek Lisans

    Türkçe

    Türkçe

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MEHMET SERDAR GÜZEL

  4. Sözlük tabanlı yaklaşım ve makine öğrenmesi ile Türkçe doğal dil işleme: Eğitim kurumlarında duygu analizi

    Turkish natural language processing using dictionary based approach and machine learning: Sentiment analysis in educational institutions

    HARUN AKSAYA

    Doktora

    Türkçe

    Türkçe

    2021

    Adli Tıpİstanbul Üniversitesi

    Enformatik Ana Bilim Dalı

    PROF. DR. SEVİNÇ GÜLSEÇEN

  5. Doğal dil işleme ve derin öğrenme teknikleri ile duygu analizi: Türkçe metinler üzerine bir çalışma

    Sentiment analysis with natural language processing and deep learning techniques: A study on Turkish texts

    ZEYNEP SENA PEKEL

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Beykent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ATINÇ YILMAZ