Geri Dön

Cluster and sımılarıty based classıfıcatıon algorıthm

Kümeleme ve benzerlik bazlı sınıflandırma algoritması

  1. Tez No: 947988
  2. Yazar: MEHMET HAMDİ ÖZÇELİK
  3. Danışmanlar: PROF. DR. SEROL BULKAN, DR. SELAMİ BAĞRIYANIK
  4. Tez Türü: Doktora
  5. Konular: Endüstri ve Endüstri Mühendisliği, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Industrial and Industrial Engineering, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Yapay zeka ve makine öğrenmesi dersi, Artificial intelligence and machine learning course
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Marmara Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Endüstri Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tezde ikili sınıflandırma problemine yeni bir çözüm sunulmuştur. Tez iki ana fikre dayanmaktadır; mesafe hesaplamalarında kullanılan ağırlıklar her özellik için farklı olabilir ve bu ağırlıklar veri setinin farklı alt kümelerinde de farklı olabilir. Bu fikirleri gerçekleştirmek için öncelikle, özelliklerin ağırlıklandırılmasında tahmin güçleri ve sınıf içi varyansları kullanılarak En Yakın Merkez sınıflandırıcısının yeni bir türevi elde edilmiştir. Bu türev Gelişmiş En Yakın Ağırlık Merkezi (ENC) olarak adlandırılmıştır. İkinci olarak, veri seti Karar Ağacı sınıflandırıcısı aracılığıyla alt kümelere bölünmüş ve yeni türev, yeni bir model ağaç sınıflandırıcısı oluşturmak için ağacın tüm yapraklarına uygulanmıştır. Bu model ağacı sınıflandırıcısına Gelişmiş En Yakın Merkez Model Ağacı (ENCMT) sınıflandırıcısı adı verilmiştir. Literatürde yaygın olarak kullanılan 30 veri seti üzerinden sınıflandırıcıların performanslarını karşılaştırmak için bağımsız bir karşılaştırma platformu kullanılmıştır. Sonuçlar, ENCMT'nin ENC'den, Karar Ağacı sınıflandırıcısından ve Lojistik Model Ağacı sınıflandırıcısından daha üstün olduğunu göstermektedir. ENCMT'nin bir torbalama çeşidi, Gelişmiş En Yakın Merkez Model Ağaç Ormanı (ENCMTF) olarak oluşturulmuştur ve karşılaştırmalar, ENCMTF'nin Rastgele Orman sınıflandırıcısından ve Lojistik Model Ağacı sınıflandırıcısından daha üstün olduğunu göstermiştir. ENCMT ve ENCMTF'nin performansları aynı zamanda son teknoloji sınıflandırıcılar olan XGBoost ve Light GBM ile de karşılaştırılmış olup alınan sonuçlar, bunların kıyaslanabilir performansa sahip olduğunu göstermiştir.

Özet (Çeviri)

In this thesis a new solution to the binary classification problem has been introduced. It is based on two main ideas; the weights used at distance calculations should be different for each feature and these weights should be different at different subsets of the dataset. To realize these ideas, first, a novel derivative of Nearest Centroid classifier is obtained using predictive powers and in-class variances at weighting the features. This derivative is called as Enhanced Nearest Centroid (ENC). Second, the dataset is divided into subsets via Decision Tree classifier and the new derivative is applied at all leaves of the tree to form a new model tree classifier. This model tree classifier is called as Enhanced Nearest Centroid Model Tree (ENCMT) classifier. An independent comparison platform is used to compare the performances of classifiers over 30 datasets which are widely used at the literature. The results show that it is superior to its Nearest Centroid derivative, to the Decision Tree classifier and Logistic Model Tree classifier. A bagging variant of ENCMT is formed as Enhanced Nearest Centroid Model Tree Forest (ENCMTF) and comparisons show that ENCMTF is superior to Random Forest classifier and Logistic Model Tree classifier. The performances of ENCMT and ENCMTF is also compared against state-of-the art classifiers XGBoost and Light GBM and the results show that they have comparable performance.

Benzer Tezler

  1. Geodesic based hybrid similarity criteria for approximate spectral geodesic based hybrid similarity criteria for approximate spectral clustering of large medical data sets

    Büyük medikal veri setlerinin yaklaşık spektral öbeklenmesi için jeodezik tabanlı benzerlik ölçütleri

    BERNA YALÇIN

    Yüksek Lisans

    İngilizce

    İngilizce

    2015

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. İSA YILDIRIM

  2. Finans sektöründe doğal dil işleme (NLP) ile rapor kümelendirme ve talep bazlı rapor önerileri oluşturma

    Reporting clustering and creating demand-based report recommendations with natural language processing (NLP) in financial industry

    SEDA AYDİN TUZCUAY

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilişim Sistemleri Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ TUĞRUL TAŞCI

  3. On clustering and classification methods in biosequence analysis

    Biyosekans analizinde kümeleme ve sınıflandırma yöntemleri üzerine

    ÇAĞIN KANDEMİR ÇAVAŞ

    Doktora

    İngilizce

    İngilizce

    2010

    BiyomühendislikDokuz Eylül Üniversitesi

    İstatistik Ana Bilim Dalı

    PROF. DR. EFENDİ NASİBOĞLU

  4. Implementation of a specialized algorithm for clustering using minimum enclosing balls

    En küçük kürelerle demetleme problemi için özgün bir algorithmanın geliştirilmesi

    UTKU GURUŞÇU

    Yüksek Lisans

    İngilizce

    İngilizce

    2010

    Endüstri ve Endüstri Mühendisliğiİhsan Doğramacı Bilkent Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. EMRE ALPER YILDIRIM

  5. Grup teknolojisi imalat sistemi ve sezgisel bir kümelendirme yöntemi

    Group technology manufacturing system and a heuristic clustering method

    A. KAMİL ATALAR

    Yüksek Lisans

    Türkçe

    Türkçe

    1991

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. ATAÇ SOYSAL