Geri Dön

Büyük dil modelleri tabanlı veri artırımı ile duygu analizi: ham ve sentetik veri konfigürasyonlarının performans ve tutarlılık açısından karşılaştırmalı analizi

Large language model–based data augmentation for sentiment analysis: a comparative analysis of raw and synthetic data configurations in terms of performance and consistency

  1. Tez No: 1018197
  2. Yazar: BÜŞRA TEKİNAY
  3. Danışmanlar: DR. ÖĞR. ÜYESİ MANSUR ALP TOÇOĞLU
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: İzmir Katip Çelebi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, büyük dil modelleri tabanlı veri artırmanın Türkçe duygu analizi üzerindeki etkisini, sentetik verinin farklı veri kümesi yapılandırmaları altında model performansını nasıl etkilediğini inceleyerek ele almaktadır. Pozitif ve negatif olarak etiketlenmiş otel ve film yorumlarından oluşan dengeli bir veri kullanılarak altı farklı veri seti yapılandırılması oluşturulmuştur: Ham, Ham+GPT, Ham+Claude, Ham+GPT+Claude, GPT ve Claude. Sentetik örnekler, GPT-4o ve Claude modelleri kullanılarak zero-shot prompting yöntemiyle üretilmiş ve sadece eğitim veri kümesine dâhil edilmiştir. NB, SVM, LR, CNN, LSTM ve BERT dâhil olmak üzere birden fazla sınıflandırıcı; doğruluk (accuracy), kesinlik (precision), geri çağırım (recall) ve F1-skoru ölçütleri kullanılarak eğitilmiş ve değerlendirilmiştir. Deneysel sonuçlar, yalnızca sentetik verilerden oluşan veri kümelerinin model performansında belirgin bir düşüşe yol açtığını; buna karşın hibrit veri kümelerinin (Ham + Sentetik), Ham veri kümesiyle istatistiksel olarak karşılaştırılabilir sonuçlar elde ettiğini göstermektedir. Bu bulgular, büyük dil modelleri tarafından üretilen sentetik verilerin, gerçek verilerle birlikte kullanıldığında model sağlamlığını korurken eğitim çeşitliliğini artırabildiğini ve düşük kaynaklı diller için pratik bir çözüm sunduğunu ortaya koymaktadır.

Özet (Çeviri)

This study examines the impact of large language model-based data augmentation on Turkish sentiment analysis by analyzing how synthetic data influences model performance across different dataset configurations. A balanced corpus of hotel and movie reviews labeled with positive and negative sentiments was used to construct six dataset variants: Raw, Raw+GPT, Raw+Claude, Raw+GPT+Claude, GPT, and Claude. Synthetic samples were generated through zero-shot prompting using GPT-4o and Claude models and incorporated exclusively into the training set. Multiple classifiers—including NB, SVM, LR, CNN, LSTM, and BERT—were trained and evaluated using accuracy, precision, recall, and F1-score metrics. Experimental results reveal that while synthetic-only datasets lead to substantial performance degradation, hybrid datasets (Raw + Synthetic) achieve results statistically comparable to the Raw dataset, demonstrating that synthetic reviews can effectively complement real data. These findings highlight that large language model-generated synthetic data, when combined with authentic samples, preserves model robustness while expanding training diversity, offering a practical solution for low-resource language datasets.

Benzer Tezler

  1. Sosyal ağlarda görsel duygu analizi

    Visual sentiment analysis on social networks

    MEHMET YILMAZ

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBandırma Onyedi Eylül Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ARZUM KARATAŞ

  2. Veri artırımında küçük modellerin eğitimi ile büyük modelleri kullanmanın karşılaştırılması

    Comparison of training small models and using large models in data augmentation

    ENES DOĞAN ŞANLI

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Elektrik Tesisleri Ana Bilim Dalı

    PROF. DR. MEHMET FATİH AMASYALI

  3. Cevap seçimi için derin öğrenme tabanlı bir melez zeki sistem tasarımı ve gerçekleştirimi

    Design and implementation of deep learning-based hybrid intelligent system for answer selection

    CANER ULUTÜRK

    Doktora

    Türkçe

    Türkçe

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEge Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. AYBARS UĞUR

  4. Vision-based detection and recognition of maritime objects for autonomous surface navigation

    Otonom deniz seyrüseferi için görüntü tabanlı engel tespiti ve gemi sınıflandırma

    SEVDA SAYAN YONCA

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. HAZIM KEMAL EKENEL

  5. Comressıon of convolutıonal neural networks vıa hıgh dımensıonal model representatıon

    Yüksek boyutlu model gösterilimi aracılığıyla evrişimsel sinir ağlarının sıkıştırılması

    BERNA YILMAZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Hesaplamalı Bilim ve Mühendislik Ana Bilim Dalı (disiplinlerarası)

    DR. ÖĞR. ÜYESİ SÜHA TUNA