Overlapping region-driven sample generation for imbalanced learning
Dengesiz öğrenme için örtüşen bölge odaklı örnek yaratılması
- Tez No: 996517
- Danışmanlar: PROF. DR. CEM İYİGÜN
- Tez Türü: Yüksek Lisans
- Konular: Endüstri ve Endüstri Mühendisliği, Industrial and Industrial Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Endüstri Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Dengesiz veri kümelerinin sınıflandırılması, makine öğrenmesindeki en zorlu uygulamalardan biridir. Bu uygulamanın zorluğu, veri kümesindeki azınlık sınıfının yetersiz temsil edilmesinden kaynaklanmaktadır. Bu durum, sınıflandırma algoritmasının performansını düşürmekte, algoritmayı çoğunluk sınıfına karşı taraflı hale getirmekte ve azınlık sınıfını baskılamaktadır. Bu sorunu çözmek için çeşitli aşırı örnekleme algoritmaları sunulmuş olsa da, bunların çoğu veri kümesinin içsel yapısını, özellikle de veri kümesinin örtüşen bölgesini göz ardı etmektedir. Örtüşen bölge, dengesiz öğrenme problemini tetikleyen birincil faktördür. Bu tez, örneklem üretiminde örtüşen bölgenin özelliklerine öncelik veren bir yaklaşım önermektedir. Ek olarak, önerilen yaklaşım, örtüşen bölgedeki yerel yapıları keşfetmek için kümeleme ile geliştirilmiştir. Önerilen yaklaşıma dayanarak; 6'sı kümeleme tabanlı olmayan ve 10'u kümeleme tabanlı algoritmadan oluşan, dört farklı örnekleme stratejisi altında kategorize edilebilen toplam 16 algoritma tanıtılmıştır. Bu algoritmalar örtüşen bölgeyi belirlemekte, örneklemlere bulundukları konuma göre ağırlık atamakta ve sunulan örnekleme stratejilerini kullanarak örneklemler üretmektedir. Önerilen algoritmaların etkinliği; 20 farklı veri kümesi üzerinde ve genel doğruluk, azınlık ve çoğunluk sınıfı doğruluğu, F1-Skoru, G-ortalama ve Eşitlikçi Doğruluk Skoru (EAS) olmak üzere 6 performans metriği kullanılarak değerlendirilmiştir. Sonuçlar, önerilen algoritmaların SMOTE, G-SMOTE ve Borderline-SMOTE'a kıyasla üstün bir performans sergilediğini kanıtlamaktadır. Bu bulgular, aşırı örneklemede örtüşen bölgeye öncelik verilmesinin, sınıflandırıcının performansını doğruluk ve sınıfların doğruluğu arasındaki adalet açısından önemli ölçüde iyileştirdiğini doğrulamaktadır.
Özet (Çeviri)
The classification of the imbalanced datasets is one of the most challenging application in the machine learning. The difficulty of this application caused by insufficient representation of the minority class in the dataset. This degrades the performance of the classification algorithm and makes it biased toward the majority class and suppresses the minority class. While several oversampling algorithms have been introduced to address this issue, most of them overlook the intrinsic structure of the dataset, specifically the overlapping region of the dataset. The overlapping region is the primary factor that triggers the imbalance learning problem. This thesis proposes an approach that prioritizes the features of the overlapping region in sample generation. Additionally, the proposed approach is enhanced by clustering to discover the local structures in the overlapping region. Based on the proposed approach, 16 algorithms are introduced, which can be categorized into four distinct sampling strategies, comprising 6 non-clustering-based and 10 clustering-based algorithms. These algorithms identify overlapping region, assign weight to samples depending on their location, and generate samples by utilizing the introduced sampling strategies. The effectiveness of the proposed algorithms is evaluated across 20 various datasets and utilizing 6 performance metrics: overall accuracy, minority and majority class accuracy, F1-Score, G-mean, and Equitable Accuracy Score (EAS). The results demonstrate the outperforming performance of the proposed algorithms compared to SMOTE, G-SMOTE, and Borderline-SMOTE. These findings validate that prioritizing the overlapping region in oversampling significantly improves the performance of the classifier in terms of accuracy and fairness between the accuracy of the classes.
Benzer Tezler
- X-ışını fındık görüntülerinde kusur belirlemeye yönelik derin öğrenme tabanlı bir yaklaşım
A deep learning based approach for defect detection in x-ray hazelnut images
SULTAN MURAT YILMAZ
Doktora
Türkçe
2025
ZiraatSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SERAP ÇAKAR KAMAN
DR. ÖĞR. ÜYESİ ERKAN GÜLER
- Determination of paratransit accessibility: A methodological and empirical study of the collective fixed-route minibus system in Djibouti city
Ara toplu taşıma erişebilirliğinin belirlenmesi: Cibuti kentindeki sabit geçkili minibüs sistemi üzerine yöntemsel ve deneysel bir çalışma
MOKTAR IBRAHIM OMAR
Doktora
İngilizce
2026
Şehircilik ve Bölge Planlamaİstanbul Teknik Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
PROF. DR. KEMAL SELÇUK ÖĞÜT
- Görünürlük, dönüşümcü liderlik ve personel güçlendirmenin proje başarısına etkisi
The effect of visibility, transformational leadership and empowerment on project success
SÜVEYBE ÖZTÜRK
Yüksek Lisans
Türkçe
2024
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÜLŞAH HANÇERLİOĞULLARI KÖKSALMIŞ
- Investigating the genomic differentiation landscape of the large mouse-eared bats
Büyük fare kulaklı yarasaların genomik farklılaşma yapılarının araştırılması
BENGİSU ŞENSOY
Yüksek Lisans
İngilizce
2024
Biyolojiİstanbul Teknik Üniversitesiİklim ve Deniz Bilimleri Ana Bilim Dalı
DOÇ. DR. EMRAH ÇORAMAN
- Plum pox virus-türkiye izolatlarının tüm genom analizleri ve filogenetik ilişkilerinin belirlenmesi
Complete genome analysis and phylogenetic relationship of turkish isolates of Plum pox virus
AHMET CEYLAN
Doktora
Türkçe
2017
GenetikErciyes ÜniversitesiBiyoloji Ana Bilim Dalı
DOÇ. DR. MİKAİL AKBULUT
YRD. DOÇ. DR. KAHRAMAN GÜRCAN