Geri Dön

Dengesiz veri setlerinde hibrit yeniden örnekleme yöntemlerinin karşılaştırılması

Comparison of hybrid resampling methods in imbalanced datasets

  1. Tez No: 941587
  2. Yazar: HASAN ERSAN YAĞCI
  3. Danışmanlar: DR. ÖĞR. ÜYESİ NİDA GÖKÇE NARİN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Mühendislik Bilimleri, Engineering Sciences
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2024
  8. Dil: Türkçe
  9. Üniversite: Muğla Sıtkı Koçman Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Yapay Zeka Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Makine öğrenimi sınıflandırma çalışmalarında, bir sınıfın diğerine göre az temsil edilmesi, verinin dengesiz olması durumu sonuçların azınlık aleyhinde çarpık olmasına neden olmaktadır. Dengesiz veri setleriyle çalışmak için bir takım dengesiz öğrenme yöntemleri bulunmaktadır. Bu tezde, makine öğreniminde dengesiz öğrenme yöntemlerinden yeniden örnekleme yöntemleri ele alındı. Veri seti olarak trafik kazaları sonucunda hukuklaşmaya giden ve gitmeyen sınıfların olduğu, hukuklaşmaya gidenlerin %2 oranında temsil edildiği dengesiz bir veri seti kullanıldı. Veri setindeki hukuklaşmaya giden örneklerin düşük sayısı nedeniyle modelin ön yargılı davranmasını aşmak için, yeniden örnekleme yöntemleri tek başına ve hibrit olarak kullanarak çeşitli denemeler gerçekleştirilmiştir. Bu çalışmada makine öğrenimi algoritması olarak, dengesiz veri setlerinin eğitiminde başarımı yüksek olan rastgele orman kullanılmıştır. Herhangi bir dengesiz öğrenme yöntemi uygulanmadan direkt olarak rastgele orman ile geliştirilen modelde kesinlik skoru %100, duyarlılık %4 ve F1 skor %7 elde edilmiştir. Ele alınan problemde duyarlılık ve kesinlik skorlarının daha önemli olmasından dolayı bu metrikler üzerine çalışılmış ve başarılı olan hibrit modelde skorlar kesinlik skoru için %36, duyarlılık %22 ve F1 skor %28 elde edilmiştir. Bu çalışma sonucunda elde edilen bulgular, yeniden örnekleme yöntemlerinin etkinliği, hibrit yaklaşımların avantajları ve başarım kriterleri stratejilerinin katkıları üzerine odaklanmış ve trafik kazalarında hukuklaşmaya giden olayların tahmin başarısını arttırmayı amaçlamıştır. Çalışmanın amacı yüksek boyutlu ve karmaşık veri setlerinde dengesiz sınıf problemini çözecek hibrit yöntemleri belirlemektir. Bu çalışmanın sonuçları, trafik kazalarının hukuki sonuçlarını ön görmeye yönelik sınıflandırma modelleri tasarlamak isteyen araştırmacılara değerli bir yol haritası sunmaktadır.

Özet (Çeviri)

In machine learning classification studies, when one class is underrepresented compared to another, the imbalance in the data can lead to skewed results against the minority class. To address this, several imbalanced learning methods are used to work with imbalanced datasets. In this thesis, resampling methods, which are a part of imbalanced learning methods in machine learning, were examined. The dataset used was an imbalanced dataset consisting of traffic accidents that either resulted in litigation or did not, with cases that went to litigation being represented at a rate of 2%. Due to the low number of litigation cases in the dataset, various experiments were conducted using resampling methods both alone and in hybrid forms to overcome model bias. In this study, Random Forest, which is known for its high performance in training imbalanced datasets, was used as the machine learning algorithm. In the model developed directly with Random Forest without applying any imbalanced learning method, the precision score was 100%, recall was 4%, and F1 score was 7%. Given that recall and precision scores are more significant for the problem at hand, these metrics were focused on. In the successful hybrid model, the scores achieved were 36% for precision, 22% for recall, and 28% for F1 score. The findings of this study focused on the effectiveness of resampling methods, the advantages of hybrid approaches, and the contributions of performance criteria strategies, aiming to improve the prediction success of litigation cases in traffic accidents. The results of this study provide valuable guidelines for researchers designing classification models to predict the legal outcomes of traffic accidents

Benzer Tezler

  1. Effect of chymotrypsin on M1 type pyruvate kinase from rabbit muscle and L-type from sheep liver

    Başlık çevirisi yok

    NİLAY BAŞARAN

    Yüksek Lisans

    İngilizce

    İngilizce

    1987

    BiyokimyaOrta Doğu Teknik Üniversitesi

    Biyokimya Ana Bilim Dalı

    YRD. DOÇ. DR. MERAL YÜCEL

  2. 1985-1986 yıllarında Polatlı Devlet Hastanesine kaza nedeniyle başvuranların incelenmesi

    Başlık çevirisi yok

    FERHAN ŞENOL

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    İlk ve Acil YardımGazi Üniversitesi

    Kazaların Çevresel ve Teknik Araştırması Ana Bilim Dalı (disiplinlerarası)

    DOÇ. DR. HİKMET PEKCAN

  3. Çeşitli rib örgülerin boyutsal özellikleri üzerine bazı araştırmalar

    Başlık çevirisi yok

    ARZU YAĞCI

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    Tekstil ve Tekstil MühendisliğiEge Üniversitesi

    Tekstil Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. ARİF KURBAK

  4. Seçilen ekstraktif çözgenin etilasetat-etilalkol azeotropik sistemi üzerine etkisi

    Başlık çevirisi yok

    NAŞİDE FİDİ

    Yüksek Lisans

    Türkçe

    Türkçe

    1987

    Kimya MühendisliğiEge Üniversitesi

    Kimya Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ERDEN ALPAY

  5. Çocuk ve spor

    Başlık çevirisi yok

    EMEL GÜRLE

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    SporGazi Üniversitesi

    DOÇ. DR. EYÜP İSBİR