Üç sınıflı dengesiz verilerde veri dengeleme algoritmalarının performanslarını değerlendirme
Evaluation of the performance of data balancing algorithms on three-class unbalanced data
- Tez No: 993039
- Danışmanlar: PROF. DR. VİLDAN SÜMBÜLOĞLU, PROF. DR. İLKAY DOĞAN
- Tez Türü: Doktora
- Konular: Biyoistatistik, Biostatistics
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Sanko Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Biyoistatistik Ana Bilim Dalı
- Bilim Dalı: Biyoistatistik Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Üç sınıflı dengesiz veri yapıları, özellikle azınlık sınıflarının yetersiz temsili ve yüksek boyutluluk nedeniyle makine öğrenmesi tabanlı sınıflandırmada önemli performans ve genellenebilirlik sorunları doğurabilmektedir. Bu çalışmanın amacı, üç sınıflı dengesiz ve yüksek boyutlu veri yapılarında topluluk tabanlı veri dengeleme algoritmalarının ve özellik seçimi yaklaşımlarının, farklı makine öğrenmesi modelleri üzerindeki etkisini senaryo tabanlı simülasyonlar ve gerçek klinik veri analizi ile sistematik olarak değerlendirmektir. Simülasyon veri setleri; üç sınıflı bağımlı değişken ve 1000 bağımsız değişkenden (750 nicel, 250 nitel) oluşmaktadır. Nicel değişkenlerin dördü bağımlı değişken ile güçlü ilişkili olacak biçimde (0,6–0,8 aralığında), kalan nicel değişkenler zayıf ilişkili olacak biçimde (00,3 aralığında) oluşturulmuştur. Nitel değişkenlerde ise bir değişken güçlü ilişki, diğerleri düşük ilişki yapısında oluşturulmuştur. Sınıf dengesizliği için bu çalışmada tanımlanan algoritma kullanılarak örneklem büyüklüğü n=50 ve n=100 olacak şekilde tüm simülasyonlar 100 tekrar ve 5 katlı çapraz doğrulama ile yürütülmüştür. Çalışmada veri dengeleme için UnderBagging, OverBagging, SMOTEBagging, RUSBoost, SMOTEBoost, RAMOBoost ve EasyEnsemble yöntemleri; özellik seçimi için LASSO ve Karşılıklı Bilgi (MI) yöntemleri kullanılmıştır. Sınıflandırma algoritmaları olarak Rastgele Orman (RO), Destek Vektör Makineleri (DVM) ve Naive Bayes (NB) kullanılmıştır. Performans değerlendirmesinde Makro Ortalama F1, Macro-AUC, Dengeli Doğruluk ve Çok Sınıflı Matthews Korelasyon Katsayısı (MMCC) ölçütleri kullanılmıştır. Gerçek veri uygulamasında The Cancer Genome Atlas (TCGA) platformundan indirilen renal hücreli karsinom (RCC) RNA-Seq veri seti kullanılmıştır. Veri setinden 1020 olgu ve 1000 RNA ifadesini içeren (5 RNA yüksek ilişkili) bir alt küme oluşturulmuş olgular KIRP (n=606), KIRC (n=323) ve KICH (n=91) alt tiplerine ayrılmaktadır. Simülasyon sonuçları, üç sınıflı dengesizlik oranı arttıkça ham veride eğitilen modellerin azınlık sınıfını yakalamada zorlanabildiğini; buna karşın topluluk yöntemlerinin birçok koşulda performansı yükselten bir yaklaşım olduğunu göstermiştir. Çalışma bulguları, evrensel tek çözüm yaklaşımının üç sınıflı dengesiz ve yüksek boyutlu yapılarda güvenilir olmadığını; başarı ve kararlılığın model-yöntem kombinasyonuna bağlı olduğunu göstermektedir. Özellikle yüksek boyutlu ve gürültülü yapılarda özellik seçiminin (LASSO/MI) yalnızca hesaplama maliyetini değil, aynı zamanda performansın stabilitesini de belirgin biçimde etkilediği; bazı dengeleme stratejilerinin ise belirli model aileleriyle daha uyumlu çalıştığı görülmüştür. Sonuç olarak, üç sınıflı dengesiz ve yüksek boyutlu problemlerde performans artışı çoğu zaman tek bir yöntemden değil; özellik seçimi + dengeleme + sınıflandırıcı kombinasyonundan doğmaktadır. Uygulayıcılar için önerilen yaklaşım; yüksek boyutlu dengesiz yapılarda önce etkili bir özellik seçimi ile gürültünün azaltılması, ardından seçilen model ailesiyle uyumlu dengeleme stratejisinin seçilmesi ve performansın birden çok ölçütle birlikte raporlanmasıdır.
Özet (Çeviri)
Three-class imbalanced data structures can lead to substantial performance and generalizability problems in machine-learning-based classification, particularly due to the insufficient representation of minority classes and high dimensionality. The aim of this study is to systematically evaluate, through scenario-based simulations and real clinical data analysis, the effects of ensembling techniques, data balancing algorithms and feature selection approaches on different machine learning models in three-class imbalanced, highdimensional settings. The simulated datasets consist of a three-class dependent variable and 1,000 independent (750 continuous and 250 categorical). Four continuous independent variables were generated to be strongly associated with the dependent variable (correlation range 0.6–0.8), while the remaining continuous independent variables were generated to have weak associations (0–0.3). For the categorical independent variables, one variable was generated to have a strong association and the others to have low association structures. All simulations were conducted using a study-defined algorithm for class imbalance with sample sizes of n=50 and n=100, under 100 repetitions and 5-fold cross-validation. For data balancing, UnderBagging, OverBagging, SMOTEBagging, RUSBoost, SMOTEBoost, RAMOBoost, and EasyEnsemble were employed; for feature selection, LASSO and Mutual Information (MI) were used. The classification algorithms included Random Forest (RF), Support Vector Machines (SVM), and Naive Bayes (NB). Model performance was assessed using Macroaveraged F1, Macro-AUC, Balanced Accuracy, and the Multiclass Matthews Correlation Coefficient (MMCC). In the real-data application, the renal cell carcinoma (RCC) RNA-Seq dataset downloaded from The Cancer Genome Atlas (TCGA) platform was used. A subset containing 1,020 cases and 1,000 RNA expression features (including 5 highly associated RNAs) was constructed, and cases were categorized into KIRP (n=606), KIRC (n=323), and KICH (n=91) subtypes. Simulation results indicated that as the degree of three-class imbalance increased, models trained on the raw data tended to struggle in detecting the minority class; in contrast, ensembling techniques improved performance under many conditions. The findings demonstrate that a universal“one-size-fits-all”solution is not reliable for three-class imbalanced, high-dimensional problems, and that success and stability depend on the specific model–method combination. Especially, in high-dimensional and noisy settings, feature selection (LASSO/MI) was observed to influence not only computational cost but also the stability of predictive performance, while certain balancing strategies were more compatible with specific model families. In conclusion, performance increase in three-class imbalanced data, high-dimensional problems typically arise not from a single method but from the combined use of feature selection, balancing, and classifier choice. For practitioners, the recommended workflow is to first reduce noise via an effective feature selection step in high-dimensional imbalanced settings, then select a balancing strategy aligned with the chosen model family, and finally report performance using multiple evaluation measures.
Benzer Tezler
- On balancing social networks
Sosyal ağların dengelenmesi
ARANIYOS TEREFE WELDEGEBRIEL
Doktora
İngilizce
2019
Matematikİstanbul Teknik ÜniversitesiMatematik Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ BURAK YILDIRAN STODOLSKY
- İnsansız hava aracı görüntüleri üzerinden derin öğrenme tabanlı yabani ot tespiti ve sınıflandırılması
Deep learning based weed detection and classification via unmanned aerial vehicle imagery
FATİH ÇELİK
Doktora
Türkçe
2026
Jeodezi ve FotogrametriYıldız Teknik ÜniversitesiHarita Mühendisliği Ana Bilim Dalı
PROF. DR. FUSUN BALIK ŞANLI
PROF. DR. YUSUF KURUCU
- Generalized multi-view data proliferator (gem-vip) for boosting classification
Genelleştirilmiş çok boyutlu veri üretimi ile sınıflandırma hassaslığının yükseltilmesi
MUSTAFA ÇELİK
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ISLEM REKIK
- Savaş nesnelerinin interneti (IoBT) ortamında makine öğrenmesi tabanlı siber saldırı tespit sistemi
Savaş nesnelerinin interneti (IoBT) ortamında makine öğrenmesi tabanlı siber saldırı tespit sistemi
SAMET ÇİFCİ
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ EYÜP EMRE ÜLKÜ
DOÇ. DR. BUKET DOĞAN
- Fully supervised and semi-supervised semantic segmentation of cardiac mr using deep learning
Tam denetımlı ve yarı denetımlı semantık segmentasyon derın öğrenmeyı kullanan kardıyak mr'nın
MAHYAR BOLHASSANI
Yüksek Lisans
İngilizce
2021
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
ASST. ASSOC. DR. İLKAY ÖKSÜZ