Sağdan sansürlü sağkalım verilerinde Cox regresyon modeli ve makine öğrenmesi yöntemlerinin karşılaştırılması: Bir simülasyon çalışması
Comparison of Cox regression model and machine learning methods in right-censored survival data: A simulation study
- Tez No: 993033
- Danışmanlar: DOÇ. DR. PINAR GÜNEL
- Tez Türü: Doktora
- Konular: Biyoistatistik, Biostatistics
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Sanko Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Biyoistatistik Ana Bilim Dalı
- Bilim Dalı: Biyoistatistik Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez çalışması, sağdan sansürlü sağkalım verilerinin modellenmesinde klasik istatistiksel yöntemler ile farklı makine öğrenmesi yaklaşımlarının performanslarını karşılaştırmayı amaçlamaktadır. Çalışma kapsamında Cox orantısal hazard (CoxPH) modeli, CoxBoost, sağkalım ağaçları, destek vektör makineleri, Naive Bayes, rastgele sağkalım ormanları, XGBoost ve Bagging yöntemleri karşılaştırmalı olarak değerlendirilmiştir. Araştırma süreci; farklı örneklem büyüklükleri, bağımsız değişken sayıları ve sansür oranlarını içeren 27 simülasyon senaryosunun yanı sıra meme kanseri tanısı almış bireylere ait klinik bir veri seti üzerinde yürütülmüştür. Modellerin başarısı Harrell'in uyum indeksi (C-indeks) ve genelleme farkı (GAP) gibi performans ölçütleri kullanılarak analiz edilmiştir. Simülasyon sonuçlarından elde edilen bulgular, örneklem büyüklüğündeki artışın tüm model tahminlerinde belirgin bir stabilizasyon sağladığını ve güven aralıklarını daralttığını göstermektedir. Veri setindeki bağımsız değişken sayısının artması, model performansını genel olarak iyileştirmiştir. Sansür oranının yükselmesi ise bilgi kaybına bağlı olarak tahmin belirsizliğini tetiklemiş ve performans metriklerinde dalgalanmalara yol açmıştır. Özellikle yüksek boyutlu ve karmaşık senaryolarda XGBoost yönteminin güçlü bir öngörü kapasitesi sergilediği, ancak Cox tabanlı yöntemlerin (CoxPH ve CoxBoost) tüm sansür ve örneklem düzeylerinde en istikrarlı ve en iyi performansı verdiği saptanmıştır.Destek vektör makineleri ve sağkalım ağaçları çoğu senaryoda diğer yöntemlerin gerisinde kalmıştır. Sonuç olarak, sağkalım verilerinde model seçiminin örnekleme büyüklüğü ve sansür oranına son derece duyarlı olduğu; Cox tabanlı yöntemlerin yüksek sansür altında dahi güvenilirliğini koruduğu sonucuna ulaşılmıştır.
Özet (Çeviri)
This thesis aims to compare the performance of classical statistical methods and different machine learning approaches in modeling right-censored survival data. The study comparatively evaluates the Cox proportional hazard (CoxPH) model, CoxBoost, survival trees, support vector machines, Naive Bayes, random survival forests, XGBoost, and Bagging methods. The research process was conducted on a clinical dataset of individuals diagnosed with breast cancer, as well as 27 simulation scenarios involving different sample sizes, numbers of independent variables, and censoring ratios. The success of the models was analyzed using performance metrics such as Harrell's fit index (C-index) and difference in generalization (GAP). The findings from the simulation results show that increasing the sample size significantly stabilizes all model predictions and narrows confidence intervals. Increasing the number of independent variables in the dataset generally improved model performance. Increasing the censorship rate triggered prediction uncertainty due to information loss and led to fluctuations in performance metrics. It was found that the XGBoost method exhibited strong predictive capacity, especially in high-dimensional and complex scenarios, but Cox-based methods (CoxPH and CoxBoost) provided the most stable and best performance at all censorship and sample sizes. Support vector machines and survival trees lagged behind other methods in most scenarios. In conclusion, it was determined that model selection in survival data is highly sensitive to sample size and censorship rate; Cox-based methods maintain their reliability even under high censorship.
Benzer Tezler
- Sağdan sansürlü sağkalım analizinde makine öğrenmesinde sınıflandırma algoritmaların kullanımı
Using of classification algorithms in machine learning for right censored survival analysis
PELİN AKIN
Doktora
Türkçe
2020
İstatistikOndokuz Mayıs Üniversitesiİstatistik Ana Bilim Dalı
PROF. DR. YÜKSEL TERZİ
- Soldan budanmış sağdan sansürlü HIV sağkalım verilerinin analizi
An analysis of left-truncated and right-censored HIV survival data
TUBA ŞANLI
Doktora
Türkçe
2022
İstatistikOndokuz Mayıs Üniversitesiİstatistik Ana Bilim Dalı
PROF. DR. YÜKSEL TERZİ
- Sağkalım verilerinde kullanılan ağaç tabanlı yöntemlerin karşılaştırılması
Comparison of tree-based methods used in survival data
AYŞEGÜL YABACI
Yüksek Lisans
Türkçe
2017
BiyoistatistikUludağ ÜniversitesiBiyoistatistik ve Tıbbi Bilişim Ana Bilim Dalı
DOÇ. DR. DENİZ SIĞIRLI
- Modelling and analyzing bivariate survival data based on copulas
İki değişkenli yaşam verilerinin kopulaya dayalı modellemesi ve analizi
ECE GORCEĞİZ
Yüksek Lisans
İngilizce
2020
İstatistikDokuz Eylül Üniversitesiİstatistik Ana Bilim Dalı
PROF. DR. BURCU HÜDAVERDİ AKTAŞ
- Sağdan sansürlü verilerde iki grubun sağkalım eğrilerinin karşılaştırılmasında kullanılan testlerin incelenmesi
Examining tests for comparing of survival curves with right censored data
PINAR GÜNEL KARADENİZ
Doktora
Türkçe
2015
BiyoistatistikUludağ ÜniversitesiBiyoistatistik Ana Bilim Dalı
PROF. DR. İLKER ERCAN