Kümeleme tabanlı yeni özellik seçimi yaklaşımları ve tip-1 bulanık fonksiyon uygulamaları
Novel clustering-based feature selection methods and applications of type-1 fuzzy functions
- Tez No: 1022086
- Danışmanlar: DR. ÖĞR. ÜYESİ DOĞAN YILDIZ, DOÇ. DR. NİHAT TAK
- Tez Türü: Doktora
- Konular: İstatistik, Statistics
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: İstatistik Ana Bilim Dalı
- Bilim Dalı: İstatistik Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Son yıllarda teknoloji ve dijitalleşme alanlarında yaşanan gelişmeler karmaşık veri setlerinin ortaya çıkmasına yol açmıştır. Bu durum, modelleme süreçlerinde aşırı öğrenme, yüksek hesaplama maliyetleri ve model yorumlanabilirliğinin azalması gibi çeşitli problemleri ortaya çıkarmaktadır. Bu problemlerin azaltılmasında yaygın olarak kullanılan yaklaşımlardan biri özellik seçimidir. Özellik seçimi, modelde daha az önemli özelliklerin elimine edilerek daha sade, yorumlanabilir ve etkin modeller elde edilmesini amaçlamaktadır. Bu tez çalışmasında, Tip-1 Bulanık Fonksiyonlar (T1BF) yönteminin tahmin performansını artırmak ve hesaplama süresini azaltmak amacıyla kümeleme tabanlı yeni özellik seçimi yöntemleri önerilmiştir. Önerilen yöntemde, veri setinde yer alan özellikler her bir önyükleme örneklemesinde kümelendirilmiş, her kümeden temsil gücü yüksek özellikler seçilmiş ve tekrarlı seçim sonuçları kullanılarak en sık seçilen özellikler belirlenmiştir. Bu kapsamda K-Ortalamalar, Bulanık C-Ortalamalar (BCO), İçgüdüsel Bulanık C-Ortalamalar (İBCO) ve Olabilirlik Bulanık C-Ortalamalar (OBCO) kümeleme yöntemlerine dayalı dört farklı özellik seçimi yöntemi geliştirilmiştir. Önerilen yöntemlerin performansları, beş gerçek dünya veri seti üzerinde Ortalama Mutlak Hata (OMH), Kök Ortalama Kare Hata (KOKH) ve Ortalama Mutlak Yüzdesel Hata (OMYH) ölçütleri kullanılarak değerlendirilmiştir. Geliştirilen yöntemler, öncelikle klasik T1BF yöntemi ile daha sonra literatürde yaygın olarak kullanılan Çoklu Doğrusal Regresyon (ÇDR), Ridge Regresyon, LASSO Regresyon, Özyinelemeli Özellik Eleme (RFE), Korelasyon Tabanlı Özellik Seçimi (CFS) ve Genetik Algoritma (GA) tabanlı özellik seçimi yöntemleri ile karşılaştırmalı olarak incelenmiştir. Elde edilen sonuçlar, önerilen kümeleme tabanlı özellik seçimi yöntemlerinin klasik T1BF yöntemine kıyasla OMH, KOKH ve OMYH açısından daha düşük veya rekabetçi performans sergilediğini göstermiştir. Hesaplama süreleri açısından, önerilen yöntemlerin T1BF yöntemine göre %6 ile %83 arasında iyileşme sağladığı gözlemlenmiştir. Literatürde yaygın olarak kullanılan bazı özellik seçimi ve regresyon yöntemleri ile yapılan karşılaştırmalarda ise önerilen yöntemlerin genel olarak daha başarılı veya rekabetçi sonuçlar elde ettiği görülmüştür. İncelenen beş veri seti genelinde ortalama sıralama sonuçlarına göre önerilen dört yöntem ilk dört sırada yer almış olup, İBCO yöntemi 3,2 ortalama sıra değeri ile en başarılı yöntem olarak öne çıkmıştır.
Özet (Çeviri)
In recent years, advances in technology and digitalization have led to the emergence of increasingly complex datasets. This situation has introduced several challenges in modeling processes, including overfitting, high computational costs, and reduced model interpretability. One of the most widely used approaches to mitigate these issues is feature selection. Feature selection aims to eliminate less informative features, thereby enabling the development of simpler, more interpretable, and more efficient models. In this study, novel clustering-based feature selection methods are proposed to improve the prediction performance of the Type-1 Fuzzy Functions (T1FF) method while reducing its computational time. In the proposed framework, features are clustered within each bootstrap sample, representative features are selected from each cluster, and the most frequently selected features across repeated sampling iterations are identified. Based on this framework, four different feature selection methods were developed using K-Means, Fuzzy C-Means (FCM), Intuitionistic Fuzzy C-Means (IFCM), and Possibilistic Fuzzy C-Means (PFCM) clustering algorithms. The performance of the proposed methods was evaluated on five real-world datasets using Mean Absolute Error (MAE), Root Mean Squared Error (RMSE) and Mean Absolute Percentage Error (MAPE) metrics. The proposed methods were first compared with the classical T1FF and subsequently with several widely used regression and feature selection techniques in the literature, including Multiple Linear Regression (MLR), Ridge Regression, LASSO Regression, Recursive Feature Elimination (RFE), Correlation-Based Feature Selection (CFS), and Genetic Algorithm (GA)-based feature selection. The experimental results demonstrated that the proposed clustering-based feature selection methods achieved lower or competitive MAE, RMSE, and MAPE values compared with the classical T1FF method. In terms of computational efficiency, the proposed methods provided improvements ranging from 6% to 83% relative to the T1FF. Comparisons with widely used feature selection and regression techniques further indicated that the proposed methods generally yielded superior or competitive predictive performance. Based on the average ranking results obtained across all five datasets, the four proposed methods occupied the top four positions, with the IFCM-based method emerging as the best-performing approach, achieving an average rank of 3.2.
Benzer Tezler
- A K-means clustering-based shape retrieval technique for 3D mesh models
Üç boyutlu çözüm ağları için K-means kümeleme tabanlı şekil araması
MOHAMMADHASSAN REZAEI
Yüksek Lisans
İngilizce
2017
Makine Mühendisliğiİstanbul Teknik ÜniversitesiMakine Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. ERKAN GÜNPINAR
- Estimation of heart disease based on data mining using patients health database
Hasta sağlığı veri tabanı kullanarak veri madenciliğine dayalı kalp hastalığı tahmini
AZHAR HATEM JEBUR AL BAIDHANI
Yüksek Lisans
İngilizce
2017
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş ÜniversitesiElektrik ve Bilgisayar Ana Bilim Dalı
Assist. Prof. YASA EKŞİOĞLU ÖZOK
- A data-driven approach to identifying and selecting temporary disaster debris management sites: The case of Istanbul
Geçici afet moloz yönetim alanlarının belirlenmesi ve seçimi için veri odaklı bir yaklaşım: İstanbul örneği
BURAK KABAKLI
Yüksek Lisans
İngilizce
2025
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. ŞEYDA SERDAR ASAN
- Detection and classification of flaws from ultrasonic tomography images of composite materials based on deep learning
Derin öğrenme tabanlı kompozit malzemelerin ultrasonik tomografi görüntülerinden kusurların tespiti ve sınıflandırılması
ABDULKADİR GÜLŞEN
Doktora
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAbdullah Gül ÜniversitesiElektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. BURCU GÜNGÖR
DR. BURAK KOLUKISA
- Gri kurt optimizasyon algoritmasının veri madenciliği problemlerine uygulanması
Application of gray wolf optimization algorithm to data mining problems
İHTİSAM AKTO
Yüksek Lisans
Türkçe
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolNecmettin Erbakan ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ONUR İNAN