Geri Dön

Makine öğrenmesinde eksik veri ile başa çıkma yöntemlerinin karşılaştırmalı analizi: Diş hekimliği verisi üzerine bir uygulama

A comparative analysis of missing data handling methods in machine learning: An application on dental data

  1. Tez No: 1004220
  2. Yazar: RABİA AKTAŞ
  3. Danışmanlar: DOÇ. DR. NACİ MURAT
  4. Tez Türü: Yüksek Lisans
  5. Konular: Endüstri ve Endüstri Mühendisliği, Industrial and Industrial Engineering
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Ondokuz Mayıs Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Akıllı Sistemler Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tezde, makine öğrenmesi uygulamalarında sık karşılaşılan eksik veri probleminin, diş hekimliği verisi üzerinde yaş tahmini performansına etkisi karşılaştırmalı olarak incelenmiştir. Araştırma problemi, verideki eksiklik oranı, imputasyon yöntemi ve tahmin modeline göre kronolojik yaş ile tahmin edilen yaş arasındaki sapmanın farklılaşıp farklılaşmadığının belirlenmesidir. Çalışma, yeni veri toplanmaksızın, Nepal popülasyonunda Demirjian'ın sekiz diş yöntemine göre skorlanan kesitsel bir araştırmadan elde edilen verilerin ikincil analiziyle yürütülmüştür. Veri seti n=353 bireyden oluşmakta; cinsiyet, kronolojik yaş (4,08–25,72 yıl) ve FDI 31–38 mandibular dişlerin 0–9 arası ordinal gelişim evrelerini içermektedir. Eksik değerler Tamamen Rastgele Eksik mekanizması altında rastgele üretilmiş ve %5, %10, %20 ve %30 eksiklik senaryoları oluşturulmuştur. Veri setleri k-En Yakın Komşu, MissForest, Zincirlenmiş Denklemlerle Çoklu Atama ve Hot-deck yöntemleriyle tamamlanmış; ardından Doğrusal Regresyon, Rastgele Orman, Destek Vektör Regresyonu ve Gauss Süreç Regresyonu modelleriyle yaş tahmini yapılmıştır. Performans, k-katlı çapraz doğrulama kapsamında MAE, RMSE ve R² ölçütleriyle değerlendirilmiş; yöntem ve model etkileri %5 budanmış ortalamaya dayalı robust ANOVA ile karşılaştırılmıştır. Model uyumu Sınıf İçi Korelasyon Katsayısı ve Bland–Altman yaklaşımlarıyla desteklenmiştir. Bulgular, eksiklik oranı arttıkça performansın genel olarak azaldığını; ancak bu azalmanın imputasyon yöntemi ve modele göre anlamlı biçimde farklılaştığını göstermiştir. kNN ve MissForest, yüksek eksiklik düzeylerinde dahi daha istikrarlı sonuçlar üretirken, Hot-deck özellikle eksiklik arttığında belirgin performans kaybına yol açmıştır. En iyi performans örnek olarak %5 eksiklikte MissForest+RF kombinasyonunda elde edilmiştir (MAE=1,129; R²=0,949). Buna karşılık Hot-deck ile özellikle GPR'de performans belirgin düşmüş ve %20–%30 eksiklikte negatif R² değerleri gözlenmiştir. Sonuç olarak, yaş tahmininde güvenilirlik için imputasyon–model kombinasyonunun eksiklik düzeyine duyarlı biçimde seçilmesi gerektiği ortaya konmuştur.

Özet (Çeviri)

This thesis comparatively examined the impact of the missing-data problem, which is frequently encountered in machine learning applications, on age-estimation performance using dental data. The research question was whether the deviation between chronological age and predicted age differs according to the missingness rate, the imputation method, and the prediction model. Without collecting new data, the study was conducted as a secondary analysis of data obtained from a cross-sectional study in the Nepalese population, in which dental development was scored using Demirjian's eight-tooth method. The dataset comprised 353 individuals and included sex, chronological age (4.08–25.72 years), and ordinal developmental stages (0–9) of mandibular teeth 31–38 according to the FDI two-digit tooth numbering system. Missing values were generated at random under the Missing Completely at Random mechanism, and missingness scenarios of 5%, 10%, 20%, and 30% were created. The datasets were completed using k-Nearest Neighbors, MissForest, Multiple Imputation by Chained Equations, and Hot-deck methods; subsequently, age prediction was performed using Linear Regression, Random Forest, Support Vector Regression, and Gaussian Process Regression models. Performance was evaluated via k-fold cross-validation using MAE, RMSE, and R² metrics, and the effects of imputation method and model were compared using robust ANOVA based on a 5% trimmed mean. Model agreement was further supported by Intraclass Correlation Coefficient and Bland–Altman approaches. The findings indicated that performance generally decreased as the missingness rate increased; however, the magnitude of this decrease differed significantly by imputation method and model. While kNN and MissForest produced more stable results even at higher missingness levels, Hot-deck led to a marked performance loss particularly as missingness increased. As an illustrative example, the best performance was obtained with the MissForest+RF combination at 5% missingness (MAE=1.129; R²=0.949). In contrast, performance declined substantially for GPR with Hot-deck, and negative R² values were observed at 20–30% missingness. Overall, the study concludes that, to achieve reliable age estimation, the imputation–model combination should be selected in a manner that is sensitive to the level of missingness.

Benzer Tezler

  1. Cryptocurrency price prediction by using social media data

    Makine öğrenmesi teknikleri kullanılarak sosyal medya verileri ile kripto para fiyat tahmini

    ÖZLEM GÜL PAMUK

    Yüksek Lisans

    İngilizce

    İngilizce

    2019

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Bilişim Uygulamaları Ana Bilim Dalı

    DOÇ. DR. SEFER BADAY

  2. Post-transplant survival prediction in liver transplantation: implications for organ acceptance

    Karaciğer nakli sonrası sağkalım tahmini: organ kabulüne yönelik etkileri

    SERRA BERŞAN GENGEÇ

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    PROF. DR. BURHANEDDİN SANDIKÇI

  3. Makine öğrenmesi kullanılarak endüstriyel pres makinesi için kestirimci bakım uygulaması

    Predictive maintenance application for industrial press machine using machine learning

    ERKUT YİĞİT

    Yüksek Lisans

    Türkçe

    Türkçe

    2021

    Elektrik ve Elektronik MühendisliğiKocaeli Üniversitesi

    Elektrik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MEHMET ZEKİ BİLGİN

  4. Therapeutic planning based on the storytelling of individual traumas: Narratives from veddel neighbourhood

    Bireysel travmaların hikaye anlatımına dayalı terapötik planlama: Veddel mahallesinden anlatımlar

    AMIRHOSSEIN ETEMADI

    Doktora

    İngilizce

    İngilizce

    2023

    Şehircilik ve Bölge Planlamaİstanbul Teknik Üniversitesi

    Şehir ve Bölge Planlama Ana Bilim Dalı

    DOÇ. DR. EDA BEYAZIT İNCE

  5. Unveiling the performance of pre-processing approaches in machine learning based flood susceptibility mapping

    Makine öğrenmesi tabanlı sel duyarlılık haritalamasında ön işleme yöntemlerinin performansının açıklanması

    NİHAL GÜLCAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    İnşaat Mühendisliğiİstanbul Teknik Üniversitesi

    İnşaat Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ÖMER EKMEKCİOĞLU