Geri Dön

Kümeleme tabanlı yeni özellik seçimi yaklaşımları ve tip-1 bulanık fonksiyon uygulamaları

Novel clustering-based feature selection methods and applications of type-1 fuzzy functions

  1. Tez No: 1022086
  2. Yazar: AYLİN UÇAN
  3. Danışmanlar: DR. ÖĞR. ÜYESİ DOĞAN YILDIZ, DOÇ. DR. NİHAT TAK
  4. Tez Türü: Doktora
  5. Konular: İstatistik, Statistics
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Yıldız Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: İstatistik Ana Bilim Dalı
  12. Bilim Dalı: İstatistik Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Son yıllarda teknoloji ve dijitalleşme alanlarında yaşanan gelişmeler karmaşık veri setlerinin ortaya çıkmasına yol açmıştır. Bu durum, modelleme süreçlerinde aşırı öğrenme, yüksek hesaplama maliyetleri ve model yorumlanabilirliğinin azalması gibi çeşitli problemleri ortaya çıkarmaktadır. Bu problemlerin azaltılmasında yaygın olarak kullanılan yaklaşımlardan biri özellik seçimidir. Özellik seçimi, modelde daha az önemli özelliklerin elimine edilerek daha sade, yorumlanabilir ve etkin modeller elde edilmesini amaçlamaktadır. Bu tez çalışmasında, Tip-1 Bulanık Fonksiyonlar (T1BF) yönteminin tahmin performansını artırmak ve hesaplama süresini azaltmak amacıyla kümeleme tabanlı yeni özellik seçimi yöntemleri önerilmiştir. Önerilen yöntemde, veri setinde yer alan özellikler her bir önyükleme örneklemesinde kümelendirilmiş, her kümeden temsil gücü yüksek özellikler seçilmiş ve tekrarlı seçim sonuçları kullanılarak en sık seçilen özellikler belirlenmiştir. Bu kapsamda K-Ortalamalar, Bulanık C-Ortalamalar (BCO), İçgüdüsel Bulanık C-Ortalamalar (İBCO) ve Olabilirlik Bulanık C-Ortalamalar (OBCO) kümeleme yöntemlerine dayalı dört farklı özellik seçimi yöntemi geliştirilmiştir. Önerilen yöntemlerin performansları, beş gerçek dünya veri seti üzerinde Ortalama Mutlak Hata (OMH), Kök Ortalama Kare Hata (KOKH) ve Ortalama Mutlak Yüzdesel Hata (OMYH) ölçütleri kullanılarak değerlendirilmiştir. Geliştirilen yöntemler, öncelikle klasik T1BF yöntemi ile daha sonra literatürde yaygın olarak kullanılan Çoklu Doğrusal Regresyon (ÇDR), Ridge Regresyon, LASSO Regresyon, Özyinelemeli Özellik Eleme (RFE), Korelasyon Tabanlı Özellik Seçimi (CFS) ve Genetik Algoritma (GA) tabanlı özellik seçimi yöntemleri ile karşılaştırmalı olarak incelenmiştir. Elde edilen sonuçlar, önerilen kümeleme tabanlı özellik seçimi yöntemlerinin klasik T1BF yöntemine kıyasla OMH, KOKH ve OMYH açısından daha düşük veya rekabetçi performans sergilediğini göstermiştir. Hesaplama süreleri açısından, önerilen yöntemlerin T1BF yöntemine göre %6 ile %83 arasında iyileşme sağladığı gözlemlenmiştir. Literatürde yaygın olarak kullanılan bazı özellik seçimi ve regresyon yöntemleri ile yapılan karşılaştırmalarda ise önerilen yöntemlerin genel olarak daha başarılı veya rekabetçi sonuçlar elde ettiği görülmüştür. İncelenen beş veri seti genelinde ortalama sıralama sonuçlarına göre önerilen dört yöntem ilk dört sırada yer almış olup, İBCO yöntemi 3,2 ortalama sıra değeri ile en başarılı yöntem olarak öne çıkmıştır.

Özet (Çeviri)

In recent years, advances in technology and digitalization have led to the emergence of increasingly complex datasets. This situation has introduced several challenges in modeling processes, including overfitting, high computational costs, and reduced model interpretability. One of the most widely used approaches to mitigate these issues is feature selection. Feature selection aims to eliminate less informative features, thereby enabling the development of simpler, more interpretable, and more efficient models. In this study, novel clustering-based feature selection methods are proposed to improve the prediction performance of the Type-1 Fuzzy Functions (T1FF) method while reducing its computational time. In the proposed framework, features are clustered within each bootstrap sample, representative features are selected from each cluster, and the most frequently selected features across repeated sampling iterations are identified. Based on this framework, four different feature selection methods were developed using K-Means, Fuzzy C-Means (FCM), Intuitionistic Fuzzy C-Means (IFCM), and Possibilistic Fuzzy C-Means (PFCM) clustering algorithms. The performance of the proposed methods was evaluated on five real-world datasets using Mean Absolute Error (MAE), Root Mean Squared Error (RMSE) and Mean Absolute Percentage Error (MAPE) metrics. The proposed methods were first compared with the classical T1FF and subsequently with several widely used regression and feature selection techniques in the literature, including Multiple Linear Regression (MLR), Ridge Regression, LASSO Regression, Recursive Feature Elimination (RFE), Correlation-Based Feature Selection (CFS), and Genetic Algorithm (GA)-based feature selection. The experimental results demonstrated that the proposed clustering-based feature selection methods achieved lower or competitive MAE, RMSE, and MAPE values compared with the classical T1FF method. In terms of computational efficiency, the proposed methods provided improvements ranging from 6% to 83% relative to the T1FF. Comparisons with widely used feature selection and regression techniques further indicated that the proposed methods generally yielded superior or competitive predictive performance. Based on the average ranking results obtained across all five datasets, the four proposed methods occupied the top four positions, with the IFCM-based method emerging as the best-performing approach, achieving an average rank of 3.2.

Benzer Tezler

  1. A K-means clustering-based shape retrieval technique for 3D mesh models

    Üç boyutlu çözüm ağları için K-means kümeleme tabanlı şekil araması

    MOHAMMADHASSAN REZAEI

    Yüksek Lisans

    İngilizce

    İngilizce

    2017

    Makine Mühendisliğiİstanbul Teknik Üniversitesi

    Makine Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. ERKAN GÜNPINAR

  2. Estimation of heart disease based on data mining using patients health database

    Hasta sağlığı veri tabanı kullanarak veri madenciliğine dayalı kalp hastalığı tahmini

    AZHAR HATEM JEBUR AL BAIDHANI

    Yüksek Lisans

    İngilizce

    İngilizce

    2017

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş Üniversitesi

    Elektrik ve Bilgisayar Ana Bilim Dalı

    Assist. Prof. YASA EKŞİOĞLU ÖZOK

  3. A data-driven approach to identifying and selecting temporary disaster debris management sites: The case of Istanbul

    Geçici afet moloz yönetim alanlarının belirlenmesi ve seçimi için veri odaklı bir yaklaşım: İstanbul örneği

    BURAK KABAKLI

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ŞEYDA SERDAR ASAN

  4. Detection and classification of flaws from ultrasonic tomography images of composite materials based on deep learning

    Derin öğrenme tabanlı kompozit malzemelerin ultrasonik tomografi görüntülerinden kusurların tespiti ve sınıflandırılması

    ABDULKADİR GÜLŞEN

    Doktora

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAbdullah Gül Üniversitesi

    Elektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. BURCU GÜNGÖR

    DR. BURAK KOLUKISA

  5. Gri kurt optimizasyon algoritmasının veri madenciliği problemlerine uygulanması

    Application of gray wolf optimization algorithm to data mining problems

    İHTİSAM AKTO

    Yüksek Lisans

    Türkçe

    Türkçe

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolNecmettin Erbakan Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ONUR İNAN