Geri Dön

Sağdan sansürlü sağkalım verilerinde Cox regresyon modeli ve makine öğrenmesi yöntemlerinin karşılaştırılması: Bir simülasyon çalışması

Comparison of Cox regression model and machine learning methods in right-censored survival data: A simulation study

  1. Tez No: 993033
  2. Yazar: BUKET İPEK BERK
  3. Danışmanlar: DOÇ. DR. PINAR GÜNEL
  4. Tez Türü: Doktora
  5. Konular: Biyoistatistik, Biostatistics
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Sanko Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Biyoistatistik Ana Bilim Dalı
  12. Bilim Dalı: Biyoistatistik Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez çalışması, sağdan sansürlü sağkalım verilerinin modellenmesinde klasik istatistiksel yöntemler ile farklı makine öğrenmesi yaklaşımlarının performanslarını karşılaştırmayı amaçlamaktadır. Çalışma kapsamında Cox orantısal hazard (CoxPH) modeli, CoxBoost, sağkalım ağaçları, destek vektör makineleri, Naive Bayes, rastgele sağkalım ormanları, XGBoost ve Bagging yöntemleri karşılaştırmalı olarak değerlendirilmiştir. Araştırma süreci; farklı örneklem büyüklükleri, bağımsız değişken sayıları ve sansür oranlarını içeren 27 simülasyon senaryosunun yanı sıra meme kanseri tanısı almış bireylere ait klinik bir veri seti üzerinde yürütülmüştür. Modellerin başarısı Harrell'in uyum indeksi (C-indeks) ve genelleme farkı (GAP) gibi performans ölçütleri kullanılarak analiz edilmiştir. Simülasyon sonuçlarından elde edilen bulgular, örneklem büyüklüğündeki artışın tüm model tahminlerinde belirgin bir stabilizasyon sağladığını ve güven aralıklarını daralttığını göstermektedir. Veri setindeki bağımsız değişken sayısının artması, model performansını genel olarak iyileştirmiştir. Sansür oranının yükselmesi ise bilgi kaybına bağlı olarak tahmin belirsizliğini tetiklemiş ve performans metriklerinde dalgalanmalara yol açmıştır. Özellikle yüksek boyutlu ve karmaşık senaryolarda XGBoost yönteminin güçlü bir öngörü kapasitesi sergilediği, ancak Cox tabanlı yöntemlerin (CoxPH ve CoxBoost) tüm sansür ve örneklem düzeylerinde en istikrarlı ve en iyi performansı verdiği saptanmıştır.Destek vektör makineleri ve sağkalım ağaçları çoğu senaryoda diğer yöntemlerin gerisinde kalmıştır. Sonuç olarak, sağkalım verilerinde model seçiminin örnekleme büyüklüğü ve sansür oranına son derece duyarlı olduğu; Cox tabanlı yöntemlerin yüksek sansür altında dahi güvenilirliğini koruduğu sonucuna ulaşılmıştır.

Özet (Çeviri)

This thesis aims to compare the performance of classical statistical methods and different machine learning approaches in modeling right-censored survival data. The study comparatively evaluates the Cox proportional hazard (CoxPH) model, CoxBoost, survival trees, support vector machines, Naive Bayes, random survival forests, XGBoost, and Bagging methods. The research process was conducted on a clinical dataset of individuals diagnosed with breast cancer, as well as 27 simulation scenarios involving different sample sizes, numbers of independent variables, and censoring ratios. The success of the models was analyzed using performance metrics such as Harrell's fit index (C-index) and difference in generalization (GAP). The findings from the simulation results show that increasing the sample size significantly stabilizes all model predictions and narrows confidence intervals. Increasing the number of independent variables in the dataset generally improved model performance. Increasing the censorship rate triggered prediction uncertainty due to information loss and led to fluctuations in performance metrics. It was found that the XGBoost method exhibited strong predictive capacity, especially in high-dimensional and complex scenarios, but Cox-based methods (CoxPH and CoxBoost) provided the most stable and best performance at all censorship and sample sizes. Support vector machines and survival trees lagged behind other methods in most scenarios. In conclusion, it was determined that model selection in survival data is highly sensitive to sample size and censorship rate; Cox-based methods maintain their reliability even under high censorship.

Benzer Tezler

  1. Sağdan sansürlü sağkalım analizinde makine öğrenmesinde sınıflandırma algoritmaların kullanımı

    Using of classification algorithms in machine learning for right censored survival analysis

    PELİN AKIN

    Doktora

    Türkçe

    Türkçe

    2020

    İstatistikOndokuz Mayıs Üniversitesi

    İstatistik Ana Bilim Dalı

    PROF. DR. YÜKSEL TERZİ

  2. Soldan budanmış sağdan sansürlü HIV sağkalım verilerinin analizi

    An analysis of left-truncated and right-censored HIV survival data

    TUBA ŞANLI

    Doktora

    Türkçe

    Türkçe

    2022

    İstatistikOndokuz Mayıs Üniversitesi

    İstatistik Ana Bilim Dalı

    PROF. DR. YÜKSEL TERZİ

  3. Sağkalım verilerinde kullanılan ağaç tabanlı yöntemlerin karşılaştırılması

    Comparison of tree-based methods used in survival data

    AYŞEGÜL YABACI

    Yüksek Lisans

    Türkçe

    Türkçe

    2017

    BiyoistatistikUludağ Üniversitesi

    Biyoistatistik ve Tıbbi Bilişim Ana Bilim Dalı

    DOÇ. DR. DENİZ SIĞIRLI

  4. Modelling and analyzing bivariate survival data based on copulas

    İki değişkenli yaşam verilerinin kopulaya dayalı modellemesi ve analizi

    ECE GORCEĞİZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2020

    İstatistikDokuz Eylül Üniversitesi

    İstatistik Ana Bilim Dalı

    PROF. DR. BURCU HÜDAVERDİ AKTAŞ

  5. Sağdan sansürlü verilerde iki grubun sağkalım eğrilerinin karşılaştırılmasında kullanılan testlerin incelenmesi

    Examining tests for comparing of survival curves with right censored data

    PINAR GÜNEL KARADENİZ

    Doktora

    Türkçe

    Türkçe

    2015

    BiyoistatistikUludağ Üniversitesi

    Biyoistatistik Ana Bilim Dalı

    PROF. DR. İLKER ERCAN