Geri Dön

Assessıng the ımpact of synthetıc data generatıon vıa generatıve aı on clınıcal text classıfıcatıon

Üretken yapay zeka yoluyla sentetı̇k verı̇ oluşturmanınklı̇nı̇k metı̇n sınıflandırması üzerı̇ndekı̇ etkı̇sı̇nı̇değerlendı̇rmek

  1. Tez No: 981265
  2. Yazar: ENİS KÖSEOĞLU
  3. Danışmanlar: DOÇ. DR. CEMAL OKAN SAKAR
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Bahçeşehir Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Mühendislik Ana Bilim Dalı (disiplinlerarası)
  12. Bilim Dalı: Büyük Veri Analitiği ve Yönetimi Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez, büyük bir dil modeli (GPT-4.1) tarafından üretilen sentetik semptom verilerinin hastalık sınıflandırma performansına etkisini incelemektedir. Çalışmada, her biri 50 gerçek semptom açıklaması içeren 24 hastalık kategorisinden oluşan Symptom2Disease veri seti kullanılarak, on bir farklı eğitim konfigürasyonu altında kontrollü deneyler yapılmıştır. Bu konfigürasyonlar; yalnızca gerçek veri, hibrit (gerçek + sentetik) ve yalnızca sentetik veri senaryolarını; ayrıca üç farklı istem stratejisini kapsamaktadır: sıfır-atış (zero-shot), az-atış (few-shot) ve çok-atış (multi-shot). Sentetik veriler GPT-4.1 ile farklı ayarlarda üretilmiştir. Sıfır-atış örnekleri yalnızca hastalık adları kullanılarak oluşturulmuş, az-atış örneklerinde her hastalık için beş gerçek örnek ve yüksek sıcaklık (0.95) kullanılmış, çok-atış örnekleri ise ince ayar yapılmış GPT-4.1 modeliyle üretilmiştir. Tüm konfigürasyonlar, BERT tabanlı bir sınıflandırıcı ile 10 katlı çapraz doğrulama yöntemiyle değerlendirilmiş ve sonuçlar katlar arasında ortalaması alınmıştır. Performans değerlendirmesinde doğruluk, kesinlik, duyarlılık ve makro F1-skoru kullanılmıştır. Düşük kaynaklı bir senaryoda (her sınıf için yalnızca 20 gerçek örnek), en iyi sonucu yalnızca gerçek verilerle eğitilen model vermiştir. Sentetik veriler eklemek (zero-shot, few-shot veya multi-shot) performansı iyileştirmemiştir. Az-atış yaklaşımı gerçek veriye en yakın sonucu verirken, sıfır-atış ve çok-atış daha düşük başarı göstermiştir. Sonuçlarımız, yalnızca sentetik verilerle eğitilen modellerin genellikle gerçek veriyle eğitilenlerden düşük performans gösterdiğini ortaya koymaktadır. Ancak, özellikle az-atış ve çok-atış istemleriyle üretilen bazı hibrit konfigürasyonlar, gerçek veriyle elde edilen başarılara yaklaşmıştır. Ayrıca, istem tasarımı ve model ayarları, sınıflandırmayı güçlendirecek kaliteli ve çeşitli örnekler üretmede kritik rol oynamaktadır. Çok-atış yöntemi, daha ayrıntılı ve çeşitli semptom açıklamaları oluşturduğu için az-atış yöntemine kıyasla daha iyi sonuç vermiştir.

Özet (Çeviri)

This thesis investigates the impact of synthetic symptom data generated by a large language model (GPT-4.1) on the performance of disease classification. Using the Symptom2Disease dataset comprising 24 disease categories with 50 real symptom descriptions per class—we conducted a series of controlled experiments under eleven distinct training configurations. These include real-only, hybrid (real + synthetic), and synthetic-only setups across three prompting strategies: zero-shot, few-shot, and multi-shot. Synthetic data was generated using GPT-4.1 in different settings. Zero-shot samples were produced using only disease names; few-shot samples used five real examples per disease with high-temperature sampling (0.95); and multi-shot samples were created using a fine-tuned GPT-4.1 model. Each configuration was evaluated using 10-fold cross-validation with a BERT-based classifier, and results were averaged across folds. Standard evaluation metrics accuracy, precision, recall, macro F1-score were used to assess model performance. In a low-resource setting with only 20 real samples per class, the real-only baseline performed best. Adding synthetic data with zero-shot, few-shot, or multi-shot strategies did not improve the results. The few-shot variant came closest to the baseline, while zero-shot and multi-shot showed lower performance. Our results indicate that synthetic-only models generally underperform compared to real-data-trained models, but certain hybrid configurations especially those generated through few-shot and multi-shot prompting approach real-data baselines. Moreover, prompt design and model configuration play a critical role in generating high-quality, diverse samples that enhance downstream classification. Among the prompting methods, multi-shot prompting gave better results than few-shot prompting, likely because it produced more detailed and varied symptom descriptions.

Benzer Tezler

  1. Development of iron cobalt bimetallic fischer-tropsch catalysts for production of light olefins

    Hafif olefinlerin üretimi için demir kobalt bimetalik fıscher-tropsch katalizörlerinin geliştirilmesi

    DENİZ UYKUN MANGALOĞLU

    Doktora

    İngilizce

    İngilizce

    2025

    Kimya Mühendisliğiİstanbul Teknik Üniversitesi

    Kimya Mühendisliği Ana Bilim Dalı

    PROF. DR. HÜSNÜ ATAKÜL

  2. Geç kuvaterner çökellerinin kronolojisinin sentetik sismogramlarla rekonstrüksiyonu; Marmara denizi ve salda gölü örnekler

    Reconstruction of the chronology of late quaternary sediments with synthetic seismograms; examples from the sea of Marmara and lake salda

    ASEN SABUNCU

    Doktora

    Türkçe

    Türkçe

    2025

    Jeofizik Mühendisliğiİstanbul Teknik Üniversitesi

    Katı Yer Bilimleri Ana Bilim Dalı

    PROF. DR. KÜRŞAD KADİR ERİŞ

  3. Pertübasyon yöntemi ile hassas veri güvenliğine yönelik çok değişkenli veriler için tahmin analizi

    Prediction analysis for multivariate data with respect to sensitive data security using the perturbation method

    İLKER İLTER

    Yüksek Lisans

    Türkçe

    Türkçe

    2023

    Endüstri ve Endüstri MühendisliğiSakarya Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. SAFİYE SENCER

  4. Türkiye enerji piyasasının makine öğrenmesi uygulamasıyla düşük-karbon salımına geçişte ajan temelli modellenmesi

    Turkish energy market agent-based modeling for low-carbon transition with machine learning application

    BURAK GÖKÇE

    Doktora

    Türkçe

    Türkçe

    2026

    Enerjiİstanbul Teknik Üniversitesi

    Enerji Bilimi ve Teknolojileri Ana Bilim Dalı

    PROF. DR. GÜLGÜN KAYAKUTLU

  5. Assessing the impact of the EU emissions trading system on Co2 emissions: A synthetic control approach

    Avrupa Birligi emisyon ticareti sisteminin Co2 salımına etkisinin ıncelenmesi: Sentetik kontrol yaklaşımı

    MERVE BEYDEMİR

    Yüksek Lisans

    İngilizce

    İngilizce

    2016

    Siyasal BilimlerSabancı Üniversitesi

    Siyaset Bilimi Ana Bilim Dalı

    PROF. DR. MELTEM MÜFTÜLER BAÇ