Assessıng the ımpact of synthetıc data generatıon vıa generatıve aı on clınıcal text classıfıcatıon
Üretken yapay zeka yoluyla sentetı̇k verı̇ oluşturmanınklı̇nı̇k metı̇n sınıflandırması üzerı̇ndekı̇ etkı̇sı̇nı̇değerlendı̇rmek
- Tez No: 981265
- Danışmanlar: DOÇ. DR. CEMAL OKAN SAKAR
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Bahçeşehir Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Mühendislik Ana Bilim Dalı (disiplinlerarası)
- Bilim Dalı: Büyük Veri Analitiği ve Yönetimi Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez, büyük bir dil modeli (GPT-4.1) tarafından üretilen sentetik semptom verilerinin hastalık sınıflandırma performansına etkisini incelemektedir. Çalışmada, her biri 50 gerçek semptom açıklaması içeren 24 hastalık kategorisinden oluşan Symptom2Disease veri seti kullanılarak, on bir farklı eğitim konfigürasyonu altında kontrollü deneyler yapılmıştır. Bu konfigürasyonlar; yalnızca gerçek veri, hibrit (gerçek + sentetik) ve yalnızca sentetik veri senaryolarını; ayrıca üç farklı istem stratejisini kapsamaktadır: sıfır-atış (zero-shot), az-atış (few-shot) ve çok-atış (multi-shot). Sentetik veriler GPT-4.1 ile farklı ayarlarda üretilmiştir. Sıfır-atış örnekleri yalnızca hastalık adları kullanılarak oluşturulmuş, az-atış örneklerinde her hastalık için beş gerçek örnek ve yüksek sıcaklık (0.95) kullanılmış, çok-atış örnekleri ise ince ayar yapılmış GPT-4.1 modeliyle üretilmiştir. Tüm konfigürasyonlar, BERT tabanlı bir sınıflandırıcı ile 10 katlı çapraz doğrulama yöntemiyle değerlendirilmiş ve sonuçlar katlar arasında ortalaması alınmıştır. Performans değerlendirmesinde doğruluk, kesinlik, duyarlılık ve makro F1-skoru kullanılmıştır. Düşük kaynaklı bir senaryoda (her sınıf için yalnızca 20 gerçek örnek), en iyi sonucu yalnızca gerçek verilerle eğitilen model vermiştir. Sentetik veriler eklemek (zero-shot, few-shot veya multi-shot) performansı iyileştirmemiştir. Az-atış yaklaşımı gerçek veriye en yakın sonucu verirken, sıfır-atış ve çok-atış daha düşük başarı göstermiştir. Sonuçlarımız, yalnızca sentetik verilerle eğitilen modellerin genellikle gerçek veriyle eğitilenlerden düşük performans gösterdiğini ortaya koymaktadır. Ancak, özellikle az-atış ve çok-atış istemleriyle üretilen bazı hibrit konfigürasyonlar, gerçek veriyle elde edilen başarılara yaklaşmıştır. Ayrıca, istem tasarımı ve model ayarları, sınıflandırmayı güçlendirecek kaliteli ve çeşitli örnekler üretmede kritik rol oynamaktadır. Çok-atış yöntemi, daha ayrıntılı ve çeşitli semptom açıklamaları oluşturduğu için az-atış yöntemine kıyasla daha iyi sonuç vermiştir.
Özet (Çeviri)
This thesis investigates the impact of synthetic symptom data generated by a large language model (GPT-4.1) on the performance of disease classification. Using the Symptom2Disease dataset comprising 24 disease categories with 50 real symptom descriptions per class—we conducted a series of controlled experiments under eleven distinct training configurations. These include real-only, hybrid (real + synthetic), and synthetic-only setups across three prompting strategies: zero-shot, few-shot, and multi-shot. Synthetic data was generated using GPT-4.1 in different settings. Zero-shot samples were produced using only disease names; few-shot samples used five real examples per disease with high-temperature sampling (0.95); and multi-shot samples were created using a fine-tuned GPT-4.1 model. Each configuration was evaluated using 10-fold cross-validation with a BERT-based classifier, and results were averaged across folds. Standard evaluation metrics accuracy, precision, recall, macro F1-score were used to assess model performance. In a low-resource setting with only 20 real samples per class, the real-only baseline performed best. Adding synthetic data with zero-shot, few-shot, or multi-shot strategies did not improve the results. The few-shot variant came closest to the baseline, while zero-shot and multi-shot showed lower performance. Our results indicate that synthetic-only models generally underperform compared to real-data-trained models, but certain hybrid configurations especially those generated through few-shot and multi-shot prompting approach real-data baselines. Moreover, prompt design and model configuration play a critical role in generating high-quality, diverse samples that enhance downstream classification. Among the prompting methods, multi-shot prompting gave better results than few-shot prompting, likely because it produced more detailed and varied symptom descriptions.
Benzer Tezler
- Development of iron cobalt bimetallic fischer-tropsch catalysts for production of light olefins
Hafif olefinlerin üretimi için demir kobalt bimetalik fıscher-tropsch katalizörlerinin geliştirilmesi
DENİZ UYKUN MANGALOĞLU
Doktora
İngilizce
2025
Kimya Mühendisliğiİstanbul Teknik ÜniversitesiKimya Mühendisliği Ana Bilim Dalı
PROF. DR. HÜSNÜ ATAKÜL
- Geç kuvaterner çökellerinin kronolojisinin sentetik sismogramlarla rekonstrüksiyonu; Marmara denizi ve salda gölü örnekler
Reconstruction of the chronology of late quaternary sediments with synthetic seismograms; examples from the sea of Marmara and lake salda
ASEN SABUNCU
Doktora
Türkçe
2025
Jeofizik Mühendisliğiİstanbul Teknik ÜniversitesiKatı Yer Bilimleri Ana Bilim Dalı
PROF. DR. KÜRŞAD KADİR ERİŞ
- Pertübasyon yöntemi ile hassas veri güvenliğine yönelik çok değişkenli veriler için tahmin analizi
Prediction analysis for multivariate data with respect to sensitive data security using the perturbation method
İLKER İLTER
Yüksek Lisans
Türkçe
2023
Endüstri ve Endüstri MühendisliğiSakarya ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. SAFİYE SENCER
- Türkiye enerji piyasasının makine öğrenmesi uygulamasıyla düşük-karbon salımına geçişte ajan temelli modellenmesi
Turkish energy market agent-based modeling for low-carbon transition with machine learning application
BURAK GÖKÇE
Doktora
Türkçe
2026
Enerjiİstanbul Teknik ÜniversitesiEnerji Bilimi ve Teknolojileri Ana Bilim Dalı
PROF. DR. GÜLGÜN KAYAKUTLU
- Assessing the impact of the EU emissions trading system on Co2 emissions: A synthetic control approach
Avrupa Birligi emisyon ticareti sisteminin Co2 salımına etkisinin ıncelenmesi: Sentetik kontrol yaklaşımı
MERVE BEYDEMİR
Yüksek Lisans
İngilizce
2016
Siyasal BilimlerSabancı ÜniversitesiSiyaset Bilimi Ana Bilim Dalı
PROF. DR. MELTEM MÜFTÜLER BAÇ