Various weighting schemes for imbalanced regression
Dengesiz regresyonda ağırlıklandırma çalışmaları
- Tez No: 975702
- Danışmanlar: PROF. DR. BARIŞ SÜRÜCÜ
- Tez Türü: Yüksek Lisans
- Konular: İstatistik, Statistics
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: İstatistik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Makine öğrenimi algoritmaları, özellikle veri koşulları dengesiz olduğunda, regres- yon modellemesinde veri noktası eksikliği olan alanlarda sıklıkla düşük performans gösterir. Bu durumlar, e-ticaret, sağlık veya bankacılık gibi alana bağlı olarak çok önemli olabilir. Nadir ancak önemli durumlar, birçok algoritmanın temel yapısı ne- deniyle model eğitimi sırasında yeterince temsil edilmez ve bu da daha yüksek veri yoğunluğuna sahip bölgeleri tercih eder. Bu araştırmanın amacı, alaka düzeyine dayalı ağırlıklandırma tekniklerinin yanı sıra amaç fonksiyonlarını da inceleyerek bu alanlardaki tahmin doğruluğunu artırmaktır. Ilk aşamada, üç popüler regresyon algoritması olan Random Forest, XGBoost ve LightGBM kullanılarak bir dizi amaç fonksiyonu Ortalama Karesel Hata (MSE), Or- talama Karesel Logaritmik Hata (MSLE) ve Kantil incelenmiştir. Dengesiz regresyon ayarlarıyla başa çıkmak için en iyi model mimarisini ve kayıp fonksiyonu kombi- nasyonunu bulmak bu aşamanın amacıydı. XGBoost ve LightGBM modelleri, nadir hedef değerlere karşı duyarlılığı artırmak için farklı alaka düzeyine dayalı ağırlık- landırma yöntemlerinin kullanıldığı sonraki aşamada araştırmanın odak noktasıydı. Incelenen ağırlıklandırma yöntemleri arasında kantil tabanlı ağırlıklandırma, sıra is- tatistikleriyle türetilen ağırlıklandırmalar, enterpolasyon tabanlı alaka düzeyi fonksi- yonları ve Yoğun Kayıp Ağırlığı adı verilen yoğunluk tabanlı bir şema bulunmakta- dır. Her bir yaklaşımın, modeli nadir değer konumlarında gelişmiş performansa yön- lendirmedeki başarısı değerlendirildi. Küresel hata ölçümlerinin aksi takdirde göz- den kaçırabileceği kritik alanlarda yerelleştirilmiş performansı yakalamak için MSE, MAE ve MAPE standart değerlendirme metriklerine ek olarak Komşu-Toplam met- riği önerildi. Uygun kayıp fonksiyonları ve algoritmalarla birleştirildiğinde, deneysel sonuçlar, alaka düzeyine dayalı ağırlıklandırma fonksiyonlarının, modelin genel per- formansından ödün vermeden nadir olayları tahmin etme kapasitesini büyük ölçüde artırdığını göstermektedir.
Özet (Çeviri)
Machine learning algorithms frequently perform poorly in areas with a lack of data points in regression modeling, especially when data conditions are imbalanced. These occurrences could be significant depending on the field, such as e-commerce, health, or banking. Rare, however important, occurrences are underrepresented during model training because of the underlying structure of many algorithms, which favors regions with higher data densities. The goal of this research is to increase predicted accu- racy in these areas by examining relevance-based weighting techniques and objective functions. Using three popular regression algorithms, Random Forest, XGBoost, and LightGBM, several objective functions, Mean Squared Error (MSE), Mean Squared Logarithmic Error (MSLE), and Quantile, were examined in the first stage. Find- ing the best model architecture and loss function combination for handling imbal- anced regression settings was the goal of this phase. The XGBoost and LightGBM models were the focus of the investigation in the following phase, when different relevance-based weighting methods were used to boost sensitivity toward rare target values. Among the weighing methods examined are quantile-based weighting, order- statistics-derived weights, interpolation-based relevance functions, and a density-based scheme called DenseLoss Weight. The success of each approach to steer the model oward improved performance in rare value locations was assessed. Neighbourhood- Total metric was suggested in addition to the standard evaluation metrics of MSE, MAE, and MAPE to capture localized performance in crucial areas that global er- ror measures could otherwise miss. When combined with suitable loss functions and algorithms, the experimental results show that relevance-based weighting functions significantly improve the model's capacity to predict rare occurrences without com- promising overall performance.
Benzer Tezler
- Metin sınıflandırma için terim ağırlıklandırma
Term weighting for text classification
TURGUT DOĞAN
Doktora
Türkçe
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEskişehir Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ALPER KÜRŞAT UYSAL
- Use of equivalent single porosity medium and automated lumped fluid composition in naturally fractured gas condensate reservoir simulations
Doğal çatlaklı gaz kondensat rezervuarlarında eşdeğer tek gözenekli ortam ve otomatik toplu akışkan kompozisyonu simülasyonu kullanımı
MEHMET CİHAN ERTÜRK
Doktora
İngilizce
2018
Petrol ve Doğal Gaz MühendisliğiOrta Doğu Teknik ÜniversitesiPetrol ve Doğal Gaz Mühendisliği Ana Bilim Dalı
DOÇ. DR. ÇAĞLAR SINAYUÇ
- Su kaynakları yönetiminde gıda-enerji-su bağlantısının optimizasyonu
Optimizing the food-energy-water nexus in water resources management
VOLKAN HACISÜLEYMAN
Doktora
Türkçe
2025
İnşaat Mühendisliğiİstanbul Teknik Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET ÖZGER
- Makine öğrenmesi ile fotovoltaik dizilerde elektriksel arıza tespiti
Machine learning based fault detection in PV arrays
HEYBET KILIÇ
Doktora
Türkçe
2021
Elektrik ve Elektronik MühendisliğiDicle ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. BİLAL GÜMÜŞ
DR. ÖĞR. ÜYESİ MUSA YILMAZ
- Mekansal analiz teknikleri ile çok kriterli karar verme yaklaşımı kullanılarak raylı sistem güzergah analizi
Rail system route analysis using multi criteria decision making with spatial analysis techniques
BERNA ÇALIŞKAN
Doktora
Türkçe
2023
Ulaşımİstanbul Teknik Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
PROF. DR. ALİ OSMAN ATAHAN