Geri Dön

Kan testi parametrelerinden makine öğrenmesine dayalı tanı tahmini: Klinik karar desteği için kapsamlı çok algoritmalı analiz

Machine learning-based diagnosis prediction from blood test parameters: A comprehensive multi-algorithm analysis for clinical decision support

  1. Tez No: 986340
  2. Yazar: RUMEYSA NUR ŞENOL NEHRİ
  3. Danışmanlar: DOÇ. DR. METE YAĞANOĞLU
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Mühendislik Bilimleri, Computer Engineering and Computer Science and Control, Engineering Sciences
  6. Anahtar Kelimeler: Makine öğrenmesi, Makine öğrenmesi yöntemleri, Yapay zeka, Machine learning, Machine learning methods, Artificial intelligence
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Atatürk Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Bilimleri Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Amaç: Kan ve kan yapıcı organları etkileyen hematolojik hastalıkların tanısı, günümüzde kemik iliği biyopsisi gibi vücuda girişim gerektiren yöntemlerle konulmaktadır. Bu yöntemler hasta açısından ağrılı olabilmekte, komplikasyon riski taşımakta ve sonuçların elde edilmesi zaman almaktadır. Bu tez çalışmasında, hastanelerde rutin olarak yapılan kan testlerinden elde edilen sayısal verilerin makine öğrenmesi algoritmaları ile analiz edilerek hematolojik hastalıkların yüksek doğrulukla tahmin edilip edilemeyeceği araştırılmıştır. Çalışmanın temel amacı, hekimlere tanı sürecinde yardımcı olabilecek, kararlarını açıklayabilen ve yüksek başarım gösteren bir tahmin sistemi geliştirmektir. Yöntem: Çalışmada, etik kurul onayı ile elde edilen 2018-2024 yıllarına ait geçmişe dönük hasta kayıtları kullanılmıştır. Veri seti, 41.385 farklı hastaya ait 2.834.967 laboratuvar test kaydını kapsamaktadır. Hastane bilgi sisteminden elde edilen ham veri, her hastanın tek satırda tutulduğu geniş formatından, her test kaydının ayrı satırda yer aldığı uzun formata dönüştürülmüştür. Ardından 839 farklı kan testi parametresi sayısal değerlere kodlanarak 193 özellikten oluşan bir veri seti elde edilmiştir. Özellik sayısını azaltmak amacıyla, özyinelemeli özellik eliminasyonu ve L1 regülarizasyonu yöntemlerini bir arada kullanan hibrit bir özellik seçimi stratejisi uygulanmıştır. Sınıflandırma başarımı; Random Forest, XGBoost, LightGBM, çok katmanlı algılayıcı ve lojistik regresyon algoritmaları kullanılarak değerlendirilmiştir. Model doğrulaması, verilerin yüzde 70'inin eğitim yüzde 30'unun test için ayrıldığı tabakalı örnekleme ve 5 katlı çapraz doğrulama ile gerçekleştirilmiştir. On farklı ICD-10 tanı kategorisi için ayrı modeller geliştirilmiştir. Bulgular: Random Forest algoritmasının tüm tanı kategorilerinde en yüksek başarımı sergilediği belirlenmiştir. Ortalama başarım ölçütleri yüzde 99,43 doğruluk, 0,954 F1 skoru ve 0,9897 ROC-AUC olarak hesaplanmıştır. En yüksek ayırt edicilik akut lenfoblastik lösemi ve akut miyeloid lösemi için elde edilmiştir. Hibrit özellik seçimi ile 193 özellikten 12-15 özelliğe indirgeme sağlanmıştır. SHAP temelli açıklanabilirlik analizi ile her tanı için model kararlarını etkileyen en önemli özellikler belirlenmiştir. Sonuç: Rutin kan testi parametrelerinin hematolojik hastalıkların tahmini için güçlü bir öngörü değeri taşıdığı gösterilmiştir. Geliştirilen sistem, vücuda girişim gerektirmeyen bir ön tarama aracı olarak klinik karar destek süreçlerine entegre edilme potansiyeline sahiptir. Sistemin farklı hastane verilerinde doğrulanması ve ileriye dönük klinik çalışmalarla desteklenmesi, gerçek sağlık ortamlarında uygulanabilirliğini artıracaktır.

Özet (Çeviri)

Purpose: The diagnosis of hematological diseases affecting blood and blood-forming organs is currently made through invasive procedures such as bone marrow biopsy. These methods can be painful for patients, carry complication risks, and require time to obtain results. In this thesis study, it was investigated whether hematological diseases can be predicted with high accuracy by analyzing numerical data obtained from routine blood tests performed in hospitals using machine learning algorithms. The main objective of the study is to develop a prediction system that can assist physicians in the diagnostic process, explain its decisions, and demonstrate high performance. Method: In the study, retrospective patient records from 2018-2024 obtained with ethics committee approval were used. The dataset comprises 2,834,967 laboratory test records from 41,385 different patients. Raw data obtained from the hospital information system was transformed from wide format where each patient is kept in a single row to long format where each test record is in a separate row. Then, 839 different blood test parameters were encoded into numerical values, obtaining a a dataset with 193 features. To reduce the number of features, a hybrid feature selection strategy combining recursive feature elimination and L1 regularization methods was applied. Classification performance was evaluated using Random Forest, XGBoost, LightGBM, multi-layer perceptron, and logistic regression algorithms. Model validation was performed using stratified sampling with 70 percent training and 30 percent testing data split and 5-fold cross-validation. Separate models were developed for 10 different ICD-10 diagnosis categories. Results: Random Forest algorithm was determined to exhibit the highest performance across all diagnosis categories. Average performance metrics were calculated as 99.43 percent accuracy, 0.954 F1-score, and 0.9897 ROC-AUC. The highest discrimination was achieved for acute lymphoblastic leukemia and acute myeloid leukemia. Feature reduction from 193 features to 12-15 features was achieved through hybrid feature selection. SHAP-based explainability analysis identified the most important features affecting model decisions for each diagnosis. Conclusion: It has been demonstrated that routine blood test parameters carry strong predictive value for hematological disease prediction. The developed system has the potential to be integrated into clinical decision support processes as a non-invasive screening tool. Validation of the system with different hospital datasets and support with prospective clinical studies will increase its applicability in real healthcare settings.

Benzer Tezler

  1. Prediction of COVID 19 disease using chest X-ray images based on deep learning

    Derin öğrenmeye dayalı göğüs röntgen görüntüleri kullanarak COVID 19 hastalığının tahmini

    ISMAEL ABDULLAH MOHAMMED AL-RAWE

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ADEM TEKEREK

  2. Streptozotosin ile diyabet oluşturulan ratlarda biyokimyasal belirteçlerin incelenmesi ve diyabet hastalığının yapay zekâ (makine öğrenmesi) algoritmaları ile tahmini

    Examination of biochemical markers in rats injected with diabetes with streptozotocin and prediction of diabetes disease with artificial intelligence (machine learning) algorithms

    HİTAME HACIBEYOĞLU

    Doktora

    Türkçe

    Türkçe

    2025

    Veteriner HekimliğiSelçuk Üniversitesi

    Veterinerlik Biyokimyası Ana Bilim Dalı

    PROF. DR. VAHDETTİN ALTUNOK

  3. Pıhtı dalga formu analizi kullanarak makine öğrenmesi temelli mortalite tahminleme modeli geliştirilmesi

    Development of a machine learning based mortality prediction model using clot waveform analysis

    VELİ İYİLİKCİ

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2023

    BiyokimyaSağlık Bilimleri Üniversitesi

    Tıbbi Biyokimya Ana Bilim Dalı

    PROF. DR. AYFER ÇOLAK

  4. Türkçe sözcük anlam belirsizliği giderme

    Word sense disambiguation for Turkish

    BAHAR İLGEN

    Doktora

    Türkçe

    Türkçe

    2015

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. EŞREF ADALI

    YRD. DOÇ. DR. AHMET CÜNEYD TANTUĞ

  5. Kenar koruyan görüntü ayrışım yöntemleri ile SAR görüntülerinde otomatik hedef sınıflama performansının arttırılması

    Increasing automatic target recognition rate of SAR images via edge preserving image decomposition methods

    HALDUN BOZKURT

    Yüksek Lisans

    Türkçe

    Türkçe

    2016

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. IŞIN ERER