Hate speech detection in obfuscated iraqi arabic using arabert and hierarchical attention networks
Arabert ve hiyeraşik dikkat ağları kullanılarak bozulmuş ırak arapçasında nefret söylemi tespiti
- Tez No: 1016993
- Danışmanlar: PROF. DR. HASAN ÇAKIR
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Computer Engineering and Computer Science and Control, Science and Technology
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Gazi Üniversitesi
- Enstitü: Bilişim Enstitüsü
- Ana Bilim Dalı: Bilişim Sistemleri Ana Bilim Dalı (disiplinlerarası)
- Bilim Dalı: Bilişim Sistemleri Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Sosyal medya, özellikle Arapçanın lehçe bağlamlarında, dilsel çok yönlülük ve kasıtlı bulanıklaştırmanın nefret söyleminin otomatik olarak tanımlanmasını engellediği durumlarda, nefret söyleminin yayılmasını artırmıştır. Irak Arapçasında bulunan Arapça öğeler, mevcut nefret söylemi veri kümelerinde büyük ölçüde yetersiz temsil edilmiştir; bu da mevcut modellerin gücünü ve uygulanabilirliğini kısıtlamıştır. Bu çalışma, Irak sosyal medya konuşmalarından 11.720 tweet'ten oluşan, elle etiketlenmiş bir veri kümesi olan Irak Lehçesi Nefret Söylemi (IDHS) veri kümesini sağlayarak bu boşlukları doldurmaktadır. Dahası, ortografik bozulmaları ve bağlamsal bağımlılıkları birleştirmek için, leetspeak normalizasyonu, AraBERT kullanarak bağlamsal gömme ve karakter düzeyinde kodlama ile hiyerarşik dikkat modellemesini birleştiren hibrit bir çerçeve sunulmaktadır. Deneysel analiz, bulanıklaştırma koşullarını manipüle etmeyi ve bunları derin transformatör tabanlı temel modellerle karşılaştırmayı içermektedir. Bulgular, önerilen modelin AraBERT temel modeline kıyasla 0,958'lik bir makro-F1 puanı elde etmesi ve belirtilen bozuk metin durumunda tutarlı bir performans sergilemesi nedeniyle daha iyi performans gösterdiğini kanıtlamaktadır. Normalizasyonun ve hiyerarşik dikkat mekanizmalarının performans istikrarındaki rolü, ablasyon analiziyle de doğrulanmıştır. Genel olarak, sonuçlar, özellikle gürültülü ve düşmanca kullanıcı tarafından oluşturulan veriler ortamında, dilbilimsel temelli hibrit mimarilere sahip bir modelin, Arapça lehçeye özgü nefret söylemini tespit etme görevine sağlamlık açısından büyük katkı sağlayabileceğini göstermektedir.
Özet (Çeviri)
The social media has increased the propagation of hate speech, especially in dialectal contexts of Arabic where linguistic versatility and deliberate blurring undermine the automatic identification of hate speech. The Arabic items found in the Iraqi Arabic language have been greatly underrepresented in the available hate speech corpora, which constrained the strength and applicability of present models. This work fills in these gaps by providing the Iraqi Dialect Hate Speech (IDHS) dataset, which is a manually labeled corpus of 11,720 tweets of authentic Iraqi social media conversation. Moreover, to combine orthographic distortions and contextual dependencies, a hybrid framework is offered that combines leetspeak normalization, contextual embedding using AraBERT, and hierarchical attention modeling with character-level encoding. The experimental analysis consists of manipulating obfuscation conditions and comparing them to deep transformer-based baselines. Findings prove that the proposed model has better performance as it obtains a macro-F1 score of 0.958 and a consistent performance on the indicated situation of distorted texts in opposition to the AraBERT baseline. The role of normalization as well as the hierarchical attention mechanisms in the stability of performance is also confirmed by ablation analysis. In general, the results show that a linguistically based model of hybrid architectures can greatly contribute to robustness to the task of detecting dialectal Arabic hate speech, especially in a setting of noisy and adversarial user-generated data.
Benzer Tezler
- Hate speech detection in turkish news using a transformer-based model enhanced with linguistic features
Dilbilimsel özellikler ile desteklenen dönüştürücü tabanlı model kullanılarak türkçe haberler üzerinde nefret söylemi tespiti
ATIF EMRE YÜKSEL
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
DOÇ. DR. ARZUCAN ÖZGÜR TÜRKMEN
- Türkçe hakaret ve nefret söylemi tespiti
Offensive language and hate speech detection in Turkish
MEHMET SALİH KURT
Doktora
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Üniversitesi-CerrahpaşaBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. EYLEM YÜCEL DEMİREL
- Çevrimiçi sosyal ağlarda derin öğrenme ve hibrit metasezgisel algoritma tabanlı nefret söylemi tespit sistemi
Deep learning and hybrid metaheuristic algorithm based hate speech detection system in online social networks
VAHTETTİN CEM BAYDOĞAN
Doktora
Türkçe
2022
Bilim ve TeknolojiFırat ÜniversitesiYazılım Mühendisliği Ana Bilim Dalı
PROF. DR. BİLAL ALATAŞ
- Çevrimiçi sosyal ağlarda rahatsız edici davranış tespiti ve azaltma stratejileri
Misbehaviour detection and mitigation strategies in online social networks
SEMA ŞAHİN
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. AYŞE BERNA ALTINEL GİRGİN
- Detecting hate speech in Turkish texts
Türkçe metinlerde nefret söylemi tespiti
ZEHRA MELCE HÜSÜNBEYİ
Yüksek Lisans
İngilizce
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. ARZUCAN ÖZGÜR TÜRKMEN