A comprehensive comparison of machine learning models for disease classification using symptom-based textual data
Semptom tabanlı metinsel verıler kullanılarak hastalıksınıflandırması için makine öğrenmesi modellerin kapsamlıbir karşılaştırması
- Tez No: 1021743
- Danışmanlar: DR. ÖĞR. ÜYESİ SELİN NACAKLI
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Bahçeşehir Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışma, makine öğrenmesi (ML), derin öğrenme (DL) ve dönüştürücü tabanlı doğal dil işleme (NLP) teknikleri kullanılarak hastalıkların otomatik sınıflandırılmasını incelemektedir. Semptomlara ilişkin metinsel açıklamalar, Kaggle platformunda herkese açık olarak sunulan bir veri setinden elde edilmiş ve belirteçleme (tokenization), durak kelimelerin kaldırılması (stopword removal), kök sözcük bulma (lemmatization) ve normalizasyon adımlarını içeren bir ön işleme sürecinden geçirilmiştir. Semptom anlatılarının hem sözcüksel hem de anlamsal temsillerini elde edebilmek amacıyla Terim Frekansı–Ters Belge Frekansı (TF-IDF), Bag-of-Words (BoW), Word2Vec, Global Vector (GloVe) ve Gizli Dirichlet Ataması (LDA) gibi çeşitli öznitelik çıkarım yöntemleri uygulanmıştır. Metinsel girdilerden hastalık tahmini yapmadaki etkinliklerini belirlemek amacıyla birden fazla sınıflandırma modeli değerlendirilmiştir. Bu modeller arasında Random Forest (RF), Destek Vektör Makineleri (SVM), Lojistik Regresyon (LR) ve Naïve Bayes (NB) gibi geleneksel ML algoritmalarının yanı sıra Evrişimli Sinir Ağları (CNN) ve Uzun Kısa Süreli Bellek ağları (LSTM) gibi derin öğrenme modelleri yer almaktadır. Ayrıca, tıbbi metin sınıflandırmasında bağlamsal dil gömülerinin katkısını değerlendirmek amacıyla BERT ve GPT gibi dönüştürücü tabanlı mimariler ince ayar (fine-tuning) yöntemiyle uygulanmıştır. Model performansları doğruluk, kesinlik, duyarlılık, F1-Skoru ve AUC ölçütleri kullanılarak değerlendirilmiştir. Elde edilen sonuçlar, sözcüksel öznitelikler kullanan geleneksel ML modellerinin semptom temelli sınıflandırmada halen oldukça etkili olduğunu ve en yüksek genel performansın SVM modeli tarafından elde edildiğini göstermektedir. Dönüştürücü modeller, özellikle BERT, güçlü sonuçlar sergilemiş ve derin öğrenme modellerini geride bırakmıştır. Buna karşılık, LDA tabanlı konu modelleme öznitelikleri daha düşük sınıflandırma doğruluğu sağlamıştır. Genel olarak bu çalışma, farklı modelleme yaklaşımlarının kapsamlı bir karşılaştırmasını sunmakta ve otomatik hastalık tespitine yönelik ilerlemeleri destekleyebilecek önemli çıkarımlar sağlamaktadır.
Özet (Çeviri)
This study investigates automated disease classification using machine learning (ML), deep learning (DL), and transformer-based natural language processing (NLP) techniques. Symptom-related textual descriptions were collected from a publicly available dataset on Kaggle and preprocessed through tokenization, stopword removal, lemmatization, and normalization. A range of feature extraction methods was applied, including Term Frequency-Inverse Document Frequency (TF-IDF), Bag-of-Words (BoW), Word2Vec, Global Vector (GloVe), and Latent Dirichlet Allocation (LDA), enabling both lexical and semantic representations of the symptom narratives. Multiple classification models were evaluated to determine their effectiveness in predicting diseases from textual input. These include traditional ML algorithms such as Random Forest (RF), Support Vector Machine (SVM), Logistic Regression (LR), and Naïve Bayes (NB), as well as DL models including Convolutional Neural Networks (CNN) and Long Short-Term Memory networks (LSTM). Transformer-based architectures, specifically Bidirectional Encoders Representation from Transformers (BERT) and Generated Pre-Trained Transformer (GPT), were also fine-tuned to assess the value of contextual language embeddings in medical text classification. Model performance was assessed using Accuracy, Precision, Recall, F1-Score, and AUC. The results show that traditional ML models using lexical features remain highly effective for symptom-based classification, with SVM achieving the highest overall performance. Transformer models, particularly BERT, also demonstrated strong results and outperformed the deep learning models. In contrast, topic modelling features from LDA provided lower classification accuracy. Overall, the study offers a comprehensive comparison of modelling techniques and provides insights that may support advancements in automated disease detection.
Benzer Tezler
- İris görüntüleri kullanılarak makine öğrenmesi ile koroner arter hastalığının tespiti
Coronary artery disease detection based on iris images using machine learning
FERDİ ÖZBİLGİN
Doktora
Türkçe
2023
Elektrik ve Elektronik MühendisliğiOndokuz Mayıs ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. ÇETİN KURNAZ
- Predicting HIV1 drug resistance of reverse transcriptase inhibitors using artificial neural networks
Yapay sinir ağlarını kullanarak ters transkriptaz inhibitörlerinin HIV1 ilaç direncini tahmin etme
SÜMEYYE YILMAZ
Yüksek Lisans
İngilizce
2023
MatematikYıldız Teknik ÜniversitesiMatematik Ana Bilim Dalı
PROF. DR. MURAT SARI
DR. ÖĞR. ÜYESİ HÜSEYİN TUNÇ
- Metabolism-oriented multiomics data integration
Farklı omı̇k verı̇lerı̇n metabolı̇zma odaklı entegrasyonu
AYCAN ŞAHİN
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. ALİ ÇAKMAK
- Makine öğrenmesi yöntemleriyle kanser ile ilgili yeni biyobelirteçlerin tespit edilmesi
Identification of novel systems biomarkers for cancer diagnosis using machine learning techniques
FIRAT KURT
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MUSTAFA AĞAOĞLU
PROF. DR. KAZIM YALÇIN ARĞA
- Train set complexity tunning for imbalance learning
Dengesiz öğrenme için eğitim seti karmaşıklığının ayarlanması
MEHMET ULAŞ
Yüksek Lisans
İngilizce
2024
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DR. MEHMET ALİ ERGÜN