Geri Dön

A comprehensive comparison of machine learning models for disease classification using symptom-based textual data

Semptom tabanlı metinsel verıler kullanılarak hastalıksınıflandırması için makine öğrenmesi modellerin kapsamlıbir karşılaştırması

  1. Tez No: 1021743
  2. Yazar: MOAYAD SHAIKHAN MOHAMMED BAWAZEER
  3. Danışmanlar: DR. ÖĞR. ÜYESİ SELİN NACAKLI
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Bahçeşehir Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, makine öğrenmesi (ML), derin öğrenme (DL) ve dönüştürücü tabanlı doğal dil işleme (NLP) teknikleri kullanılarak hastalıkların otomatik sınıflandırılmasını incelemektedir. Semptomlara ilişkin metinsel açıklamalar, Kaggle platformunda herkese açık olarak sunulan bir veri setinden elde edilmiş ve belirteçleme (tokenization), durak kelimelerin kaldırılması (stopword removal), kök sözcük bulma (lemmatization) ve normalizasyon adımlarını içeren bir ön işleme sürecinden geçirilmiştir. Semptom anlatılarının hem sözcüksel hem de anlamsal temsillerini elde edebilmek amacıyla Terim Frekansı–Ters Belge Frekansı (TF-IDF), Bag-of-Words (BoW), Word2Vec, Global Vector (GloVe) ve Gizli Dirichlet Ataması (LDA) gibi çeşitli öznitelik çıkarım yöntemleri uygulanmıştır. Metinsel girdilerden hastalık tahmini yapmadaki etkinliklerini belirlemek amacıyla birden fazla sınıflandırma modeli değerlendirilmiştir. Bu modeller arasında Random Forest (RF), Destek Vektör Makineleri (SVM), Lojistik Regresyon (LR) ve Naïve Bayes (NB) gibi geleneksel ML algoritmalarının yanı sıra Evrişimli Sinir Ağları (CNN) ve Uzun Kısa Süreli Bellek ağları (LSTM) gibi derin öğrenme modelleri yer almaktadır. Ayrıca, tıbbi metin sınıflandırmasında bağlamsal dil gömülerinin katkısını değerlendirmek amacıyla BERT ve GPT gibi dönüştürücü tabanlı mimariler ince ayar (fine-tuning) yöntemiyle uygulanmıştır. Model performansları doğruluk, kesinlik, duyarlılık, F1-Skoru ve AUC ölçütleri kullanılarak değerlendirilmiştir. Elde edilen sonuçlar, sözcüksel öznitelikler kullanan geleneksel ML modellerinin semptom temelli sınıflandırmada halen oldukça etkili olduğunu ve en yüksek genel performansın SVM modeli tarafından elde edildiğini göstermektedir. Dönüştürücü modeller, özellikle BERT, güçlü sonuçlar sergilemiş ve derin öğrenme modellerini geride bırakmıştır. Buna karşılık, LDA tabanlı konu modelleme öznitelikleri daha düşük sınıflandırma doğruluğu sağlamıştır. Genel olarak bu çalışma, farklı modelleme yaklaşımlarının kapsamlı bir karşılaştırmasını sunmakta ve otomatik hastalık tespitine yönelik ilerlemeleri destekleyebilecek önemli çıkarımlar sağlamaktadır.

Özet (Çeviri)

This study investigates automated disease classification using machine learning (ML), deep learning (DL), and transformer-based natural language processing (NLP) techniques. Symptom-related textual descriptions were collected from a publicly available dataset on Kaggle and preprocessed through tokenization, stopword removal, lemmatization, and normalization. A range of feature extraction methods was applied, including Term Frequency-Inverse Document Frequency (TF-IDF), Bag-of-Words (BoW), Word2Vec, Global Vector (GloVe), and Latent Dirichlet Allocation (LDA), enabling both lexical and semantic representations of the symptom narratives. Multiple classification models were evaluated to determine their effectiveness in predicting diseases from textual input. These include traditional ML algorithms such as Random Forest (RF), Support Vector Machine (SVM), Logistic Regression (LR), and Naïve Bayes (NB), as well as DL models including Convolutional Neural Networks (CNN) and Long Short-Term Memory networks (LSTM). Transformer-based architectures, specifically Bidirectional Encoders Representation from Transformers (BERT) and Generated Pre-Trained Transformer (GPT), were also fine-tuned to assess the value of contextual language embeddings in medical text classification. Model performance was assessed using Accuracy, Precision, Recall, F1-Score, and AUC. The results show that traditional ML models using lexical features remain highly effective for symptom-based classification, with SVM achieving the highest overall performance. Transformer models, particularly BERT, also demonstrated strong results and outperformed the deep learning models. In contrast, topic modelling features from LDA provided lower classification accuracy. Overall, the study offers a comprehensive comparison of modelling techniques and provides insights that may support advancements in automated disease detection.

Benzer Tezler

  1. İris görüntüleri kullanılarak makine öğrenmesi ile koroner arter hastalığının tespiti

    Coronary artery disease detection based on iris images using machine learning

    FERDİ ÖZBİLGİN

    Doktora

    Türkçe

    Türkçe

    2023

    Elektrik ve Elektronik MühendisliğiOndokuz Mayıs Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ÇETİN KURNAZ

  2. Predicting HIV1 drug resistance of reverse transcriptase inhibitors using artificial neural networks

    Yapay sinir ağlarını kullanarak ters transkriptaz inhibitörlerinin HIV1 ilaç direncini tahmin etme

    SÜMEYYE YILMAZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    MatematikYıldız Teknik Üniversitesi

    Matematik Ana Bilim Dalı

    PROF. DR. MURAT SARI

    DR. ÖĞR. ÜYESİ HÜSEYİN TUNÇ

  3. Metabolism-oriented multiomics data integration

    Farklı omı̇k verı̇lerı̇n metabolı̇zma odaklı entegrasyonu

    AYCAN ŞAHİN

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. ALİ ÇAKMAK

  4. Makine öğrenmesi yöntemleriyle kanser ile ilgili yeni biyobelirteçlerin tespit edilmesi

    Identification of novel systems biomarkers for cancer diagnosis using machine learning techniques

    FIRAT KURT

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MUSTAFA AĞAOĞLU

    PROF. DR. KAZIM YALÇIN ARĞA

  5. Train set complexity tunning for imbalance learning

    Dengesiz öğrenme için eğitim seti karmaşıklığının ayarlanması

    MEHMET ULAŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DR. MEHMET ALİ ERGÜN