Geri Dön

Dengesiz sınıflandırma problemleri için LLM tabanlı otomatik analiz sistemi

LLM-based automatic analysis system for imbalanced classification problems

  1. Tez No: 1002377
  2. Yazar: MEHMET BARAN ÖZKAN
  3. Danışmanlar: DOÇ. DR. AHMET KADİR ARSLAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Biyoistatistik, Biostatistics
  6. Anahtar Kelimeler: SMOTE, Büyük Dil Modelleri, Makine Öğrenmesi, Python, Dengesiz Sınıf Problemi, SMOTE, Large Language Models, Machine Learning, Python, Class Imbalance Problem
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: İnönü Üniversitesi
  10. Enstitü: Sağlık Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Biyoistatistik ve Tıp Bilişimi Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Amaç: Sağlık alanındaki verilerin karmaşık ve heterojen yapısı, makine öğrenmesi algoritmalarının başarısını doğrudan etkileyen sınıf dengesizliği problemini beraberinde getirmektedir. Bu çalışmanın amacı; sağlık verilerindeki sınıf dengesizliği problemine yönelik en uygun dengeleme yöntemini otomatik olarak seçen ve analiz sonuçlarını Büyük Dil Modelleri (LLM) desteğiyle yorumlayan entegre ve otonom bir sistem geliştirmektir. Materyal ve Metot: Çalışmada, 1:100'e varan ekstrem dengesizlik oranlarına sahip üç farklı klinik veri seti kullanılmıştır. Geliştirilen otonom analiz hattı; SMOTE türevleri, CTGAN ve Difüzyon Modelleri (TabDDPM) gibi çeşitli dengeleme stratejilerini LLM tabanlı bir döngü ile yönetmektedir. Ayrıca, veri setindeki nadir ancak klinik değeri olan vakaları korumak amacıyla“Sigma Guardrails”adı verilen özgün bir aykırı değer yönetim mekanizması sisteme entegre edilmiştir. Model performansları F1-Skor, MCC, ROC-AUC ve Brier Skoru gibi çok boyutlu metriklerle değerlendirilmiştir. Bulgular: Elde edilen bulgular, otonom sistemin ekstrem dengesizlik durumlarında dahi başarılı olabileceğini göstermiştir. Ayrıca, Sigma Guardrails protokolü sayesinde verilerdeki istatistiksel aykırıların bazılarının klinik olarak anlamlı bulunarak veri setinde korunduğu saptanmıştır. Düşük Brier skorları, sistemin ürettiği olasılık tahminlerinin klinik güvenilirliğinin yüksek olduğunu göstermiştir. Sonuç: Sonuç olarak, geliştirilen LLM destekli otonom hat, teknik karmaşıklığı minimize ederek ve yanlış negatif maliyetlerini gözeterek klinik karar destek süreçlerinde etkin bir çözüm sunmaktadır.

Özet (Çeviri)

Objective: The complex and heterogeneous nature of healthcare data introduces the problem of class imbalance, which directly impacts the performance of machine learning algorithms. The aim of this study is to develop an integrated and autonomous system that automatically selects the optimal balancing method for class imbalance in healthcare data and interprets analysis results with the support of Large Language Models (LLMs). Material and Methods: Three different clinical datasets with extreme imbalance ratios of up to 1:100 were employed in this study. The developed autonomous analysis pipeline manages various balancing strategies, such as SMOTE derivatives, CTGAN, and Diffusion Models (TabDDPM), through an LLM-based loop. Additionally, a novel outlier management mechanism termed“Sigma Guardrails”was integrated into the system to preserve rare but clinically valuable cases within the dataset. Model performance was evaluated using multidimensional metrics including F1-Score, MCC, ROC-AUC, and Brier Score. Results: The findings demonstrate that the autonomous system can be successful even under conditions of extreme imbalance. Furthermore, it was determined that through the Sigma Guardrails protocol, some statistical outliers in the data were deemed clinically significant and preserved within the dataset. Low Brier scores indicated the high clinical reliability of the probability estimates generated by the system. Conclusion: In conclusion, the developed LLM-powered autonomous pipeline offers an effective solution for clinical decision support processes by minimizing technical complexity and accounting for false negative costs.

Benzer Tezler

  1. Dengesiz sınıflandırma problemleri için aiNet algoritması tabanlı yeni bir az örnekleme yöntemi: Ainus

    AiNet algorithm-based undersampling method for imbalanced classification problems: Ainus

    KÜBRANUR GÜMÜŞLÜ

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolNecmettin Erbakan Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ AYŞE MERVE ACILAR

  2. Dengesiz veri kümelerinde sınıflandırma problemleri için bulanık tip-2 tabanlı yeni bir algoritma

    A new fuzzy type-2 based algorithm for classification problems in imbalanced datasets

    MELİKE AYGÜN ÇAKIROĞLU

    Doktora

    Türkçe

    Türkçe

    2024

    Endüstri ve Endüstri MühendisliğiErciyes Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    PROF. DR. EMEL KIZILKAYA AYDOĞAN

  3. Dengesiz metin sınıflandırma için yeni yaklaşımlar

    New approaches to imbalanced text classification

    HANDE TİRYAKİ

    Doktora

    Türkçe

    Türkçe

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEskişehir Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ALPER KÜRŞAT UYSAL

  4. SVM classification for imbalanced datasets with multi objective optimization framework

    Dengesiz veri kümelerinde çok ölçütlü optimizasyon çerçevesinde SVM ile sınıflandırma

    AYŞEGÜL ÖZTÜRK

    Yüksek Lisans

    İngilizce

    İngilizce

    2009

    Endüstri ve Endüstri MühendisliğiKoç Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    PROF. DR. SERPİL SAYIN

  5. Gelişmiş veri gizliliği için üretken çekişmeli ağlar ve federe öğrenme tabanlı görüntü üretimi ve sınıflandırması

    Image generation and classification based on generative adversarial networks and federated learning for enhanced data privacy

    MUSA YENİLMEZ

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFırat Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. İLHAN AYDIN