Geri Dön

Hate speech detection in obfuscated iraqi arabic using arabert and hierarchical attention networks

Arabert ve hiyeraşik dikkat ağları kullanılarak bozulmuş ırak arapçasında nefret söylemi tespiti

  1. Tez No: 1016993
  2. Yazar: DHEYAULDEEN ABED MARZOOG MARZOOG
  3. Danışmanlar: PROF. DR. HASAN ÇAKIR
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Computer Engineering and Computer Science and Control, Science and Technology
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Gazi Üniversitesi
  10. Enstitü: Bilişim Enstitüsü
  11. Ana Bilim Dalı: Bilişim Sistemleri Ana Bilim Dalı (disiplinlerarası)
  12. Bilim Dalı: Bilişim Sistemleri Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Sosyal medya, özellikle Arapçanın lehçe bağlamlarında, dilsel çok yönlülük ve kasıtlı bulanıklaştırmanın nefret söyleminin otomatik olarak tanımlanmasını engellediği durumlarda, nefret söyleminin yayılmasını artırmıştır. Irak Arapçasında bulunan Arapça öğeler, mevcut nefret söylemi veri kümelerinde büyük ölçüde yetersiz temsil edilmiştir; bu da mevcut modellerin gücünü ve uygulanabilirliğini kısıtlamıştır. Bu çalışma, Irak sosyal medya konuşmalarından 11.720 tweet'ten oluşan, elle etiketlenmiş bir veri kümesi olan Irak Lehçesi Nefret Söylemi (IDHS) veri kümesini sağlayarak bu boşlukları doldurmaktadır. Dahası, ortografik bozulmaları ve bağlamsal bağımlılıkları birleştirmek için, leetspeak normalizasyonu, AraBERT kullanarak bağlamsal gömme ve karakter düzeyinde kodlama ile hiyerarşik dikkat modellemesini birleştiren hibrit bir çerçeve sunulmaktadır. Deneysel analiz, bulanıklaştırma koşullarını manipüle etmeyi ve bunları derin transformatör tabanlı temel modellerle karşılaştırmayı içermektedir. Bulgular, önerilen modelin AraBERT temel modeline kıyasla 0,958'lik bir makro-F1 puanı elde etmesi ve belirtilen bozuk metin durumunda tutarlı bir performans sergilemesi nedeniyle daha iyi performans gösterdiğini kanıtlamaktadır. Normalizasyonun ve hiyerarşik dikkat mekanizmalarının performans istikrarındaki rolü, ablasyon analiziyle de doğrulanmıştır. Genel olarak, sonuçlar, özellikle gürültülü ve düşmanca kullanıcı tarafından oluşturulan veriler ortamında, dilbilimsel temelli hibrit mimarilere sahip bir modelin, Arapça lehçeye özgü nefret söylemini tespit etme görevine sağlamlık açısından büyük katkı sağlayabileceğini göstermektedir.

Özet (Çeviri)

The social media has increased the propagation of hate speech, especially in dialectal contexts of Arabic where linguistic versatility and deliberate blurring undermine the automatic identification of hate speech. The Arabic items found in the Iraqi Arabic language have been greatly underrepresented in the available hate speech corpora, which constrained the strength and applicability of present models. This work fills in these gaps by providing the Iraqi Dialect Hate Speech (IDHS) dataset, which is a manually labeled corpus of 11,720 tweets of authentic Iraqi social media conversation. Moreover, to combine orthographic distortions and contextual dependencies, a hybrid framework is offered that combines leetspeak normalization, contextual embedding using AraBERT, and hierarchical attention modeling with character-level encoding. The experimental analysis consists of manipulating obfuscation conditions and comparing them to deep transformer-based baselines. Findings prove that the proposed model has better performance as it obtains a macro-F1 score of 0.958 and a consistent performance on the indicated situation of distorted texts in opposition to the AraBERT baseline. The role of normalization as well as the hierarchical attention mechanisms in the stability of performance is also confirmed by ablation analysis. In general, the results show that a linguistically based model of hybrid architectures can greatly contribute to robustness to the task of detecting dialectal Arabic hate speech, especially in a setting of noisy and adversarial user-generated data.

Benzer Tezler

  1. Hate speech detection in turkish news using a transformer-based model enhanced with linguistic features

    Dilbilimsel özellikler ile desteklenen dönüştürücü tabanlı model kullanılarak türkçe haberler üzerinde nefret söylemi tespiti

    ATIF EMRE YÜKSEL

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi Üniversitesi

    Bilgisayar Bilimleri Ana Bilim Dalı

    DOÇ. DR. ARZUCAN ÖZGÜR TÜRKMEN

  2. Türkçe hakaret ve nefret söylemi tespiti

    Offensive language and hate speech detection in Turkish

    MEHMET SALİH KURT

    Doktora

    Türkçe

    Türkçe

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Üniversitesi-Cerrahpaşa

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. EYLEM YÜCEL DEMİREL

  3. Çevrimiçi sosyal ağlarda derin öğrenme ve hibrit metasezgisel algoritma tabanlı nefret söylemi tespit sistemi

    Deep learning and hybrid metaheuristic algorithm based hate speech detection system in online social networks

    VAHTETTİN CEM BAYDOĞAN

    Doktora

    Türkçe

    Türkçe

    2022

    Bilim ve TeknolojiFırat Üniversitesi

    Yazılım Mühendisliği Ana Bilim Dalı

    PROF. DR. BİLAL ALATAŞ

  4. Çevrimiçi sosyal ağlarda rahatsız edici davranış tespiti ve azaltma stratejileri

    Misbehaviour detection and mitigation strategies in online social networks

    SEMA ŞAHİN

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. AYŞE BERNA ALTINEL GİRGİN

  5. Detecting hate speech in Turkish texts

    Türkçe metinlerde nefret söylemi tespiti

    ZEHRA MELCE HÜSÜNBEYİ

    Yüksek Lisans

    İngilizce

    İngilizce

    2020

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ARZUCAN ÖZGÜR TÜRKMEN