Geri Dön

Büyük dil modeli tabanlı veri artırma ile dengesiz veri setlerinde sahte haber sınıflandırma

Fake news classification in imbalanced datasets with llm-based data augmentation

  1. Tez No: 1011453
  2. Yazar: AHMET OKAN ARIK
  3. Danışmanlar: DOÇ. DR. GİZEM PARLAYANDEMİR SAYAN, DR. SERRA ÇELİK
  4. Tez Türü: Doktora
  5. Konular: Bilim ve Teknoloji, Yönetim Bilişim Sistemleri, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Science and Technology, Management Information Systems, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: İstanbul Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Enformatik Ana Bilim Dalı
  12. Bilim Dalı: Enformatik Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Yeni medya ekosisteminde sahte haberin yayılım hızı ve hacmi otomatik tespit modellerinin geliştirilmesini gerekli kılmaktadır. Öte yandan, Türkçe gibi morfolojik açıdan zengin ve düşük kaynaklı diller üzerine yürütülen sahte haber tespiti çalışmaları, kısıtlı etiketli veri ve sınıf dengesizliği gibi temel zorluklarla karşı karşıyadır. Gerçek dünya verilerinde sahte haberlerin azınlık sınıfını temsil etmesi, gözetimli öğrenme algoritmalarının çoğunluk sınıfına yönelik yanlılık geliştirmesine ve dolayısıyla tespit performansının düşmesine yol açmaktadır. Sınıf dengesini sağlamaya yönelik geleneksel yaklaşımların semantik çeşitlilikten yoksun olması ve metnin doğal yapısına uyum sağlayamaması, daha nitelikli ve bağlamsal yöntemlerin geliştirilmesi ihtiyacını doğurmuştur. Bu tez çalışması; söz konusu kısıtları aşmak amacıyla, politik alana özgü yeni bir veri seti ve büyük dil modelleri (LLM) tabanlı bir veri artırma çerçevesi önermektedir. Araştırma kapsamında, 2013-2024 yıllarını kapsayan ve yerel politik jargonu yansıtan Türkçe Politik Sahte Haber Veri Seti (TPFND) oluşturulmuştur. TPFND, doğruluk kontrol platformlarınca teyit edilmiş temel gerçeklik referansı, tematik odaklılığı ve belirli olaylarla sınırlı kalmayan kapsayıcı yapısıyla bu nitelikleri bir arada sunan, bilindiği kadarıyla literatürdeki ilk kaynak olma özelliği taşımaktadır. Ayrıca, Türkçe dijital medya ekosistemindeki sahte haberlerin karakteristik özellikleri analiz edilmiş; elde edilen bulgular tek örnekli öğrenme prensibi çerçevesinde yapılandırılarak, Türkçe Llama-3 modeli vasıtasıyla bağlamsal uyumu yüksek sentetik veriler üretilmiştir. Önerilen yaklaşımın etkinliğini doğrulamak amacıyla transfer öğrenmesi stratejisi benimsenmiş; BERTurk sınıflandırma modeli; ham veri seti, rastgele yeniden örnekleme (ROS) ile artırılmış veri seti ve LLM tabanlı sentetik verilerle zenginleştirilmiş veri kümeleri üzerinde ince ayar işlemine tabi tutulmuştur. Bu yönüyle çalışma, büyük dil modellerini Türkçe sahte haber tespitinde bir veri dengeleme aracı olarak konumlandırması bakımından da literatürde bilinen ilk çalışma niteliğindedir. Sonuçlar, önerilen LLM tabanlı üretken yaklaşımın hem temel modele hem de ROS yöntemine kıyasla karar sınırlarını azınlık sınıfı lehine iyileştirdiğini göstermektedir. Önerilen yöntemle sahte haber sınıfına ait tespit oranı %91,1'den %93,5'e yükselirken; yanlış negatif sayısında %26 oranında bir azalma kaydedilmiştir. Elde edilen bulgular ışığında bu tez, literatüre kapsamlı bir veri seti kazandırmanın yanı sıra, üretken yapay zekânın veri dengesizliği problemini gidermedeki etkinliğini somut metriklerle ortaya koymaktadır. Çalışma ayrıca, sahte haber ekosistemini haritalandırarak medya okuryazarlığı çalışmaları için kanıta dayalı bir zemin sunmakta ve düşük kaynaklı diller için özgün bir metodolojik adaptasyon modeli oluşturmaktadır.

Özet (Çeviri)

The speed and volume of fake news dissemination in the new media ecosystem necessitate the development of automated detection models. However, fake news detection studies conducted on morphologically rich and low-resource languages such as Turkish face fundamental challenges, including limited labeled data and class imbalance. The representation of fake news as the minority class in real-world data causes supervised learning algorithms to develop a bias towards the majority class, thereby degrading detection performance. The fact that traditional approaches aimed at mitigating class imbalance lack semantic diversity and fail to adapt to the natural structure of the text has given rise to the need for developing more sophisticated and contextual methods. To overcome these limitations, this thesis proposes a novel, domain-specific political dataset and a large language model (LLM)-based data augmentation framework. Within the scope of the research, the Turkish Political Fake News Dataset (TPFND), spanning the years 2013-2024 and reflecting local political jargon, was created. TPFND stands out as the first resource in the literature, to the best of our knowledge, to simultaneously offer a ground truth reference verified by fact-checking platforms, a thematic focus, and a comprehensive structure not limited to specific events. Furthermore, the characteristic features of fake news in the Turkish digital media ecosystem were analyzed; the findings were structured within the framework of the one-shot learning principle, and highly contextually coherent synthetic data were generated via the Turkish Llama-3 model. To validate the effectiveness of the proposed approach, a transfer learning strategy was adopted; the BERTurk classification model was fine-tuned on the raw dataset, the dataset augmented with random over-sampling (ROS), and the dataset enriched with LLM-based synthetic data. In this respect, the study is the first known research in the literature to position large language models as a data balancing tool in Turkish fake news detection. The results demonstrate that the proposed LLM-based generative approach improves the decision boundaries in favor of the minority class compared to both the baseline model and the ROS method. With the proposed method, the detection rate for the fake news class increased from 91.1% to 93.5%, while a 26% reduction was recorded in the number of false negatives. In light of these findings, this thesis not only introduces a comprehensive dataset to the literature but also demonstrates the effectiveness of generative artificial intelligence in mitigating the data imbalance problem through concrete metrics. The study also maps the fake news ecosystem, providing an evidence-based foundation for media literacy studies and establishing a novel methodological adaptation model for low-resource languages.

Benzer Tezler

  1. AI-powered web application security mechanisms

    Yapay zeka destekli ağ uygulaması güvenliği düzenekleri

    DİLEK YILMAZER DEMİREL

    Doktora

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ MEHMET TAHİR SANDIKKAYA

  2. Land cover segmentation of very high-resolution remotely sensed data using CNN and transformer models

    Transformer ve CNN modelleri kullanarak çok yüksek çözünürlüklü uzaktan algılama görüntülerinin arazi örtüsü segmentasyonu

    CENGİZ AVCI

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    İletişim Sistemleri Ana Bilim Dalı

    PROF. DR. ELİF SERTEL

  3. Veri artırımında küçük modellerin eğitimi ile büyük modelleri kullanmanın karşılaştırılması

    Comparison of training small models and using large models in data augmentation

    ENES DOĞAN ŞANLI

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Elektrik Tesisleri Ana Bilim Dalı

    PROF. DR. MEHMET FATİH AMASYALI

  4. A new framework for decentralized social networks: Harnessing blockchain, deep learning, and natural language processing

    Merkezsiz sosyal ağlar için yeni bir çerçeve: Blok zinciri, derin öğrenme ve doğal dil işlemeyi kullanmak

    AMIR AL KADAH

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Yazılım Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ DENİZ BALTA

  5. Vision-based detection and recognition of maritime objects for autonomous surface navigation

    Otonom deniz seyrüseferi için görüntü tabanlı engel tespiti ve gemi sınıflandırma

    SEVDA SAYAN YONCA

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. HAZIM KEMAL EKENEL