Geri Dön

Derin öğrenme yöntemi kullanarak spektrogram veri kümesinden yapılandırılmış motif çıkarımı ile açıklanabilir ses sınıflandırma

Explainable sound classification through structured motif extraction from spectrogram datasets using deep learning methods

  1. Tez No: 992898
  2. Yazar: FATMA BOZTAŞ
  3. Danışmanlar: PROF. DR. MEHMET KAYA
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Fırat Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Yakın zamanda ses sınıflandırma, derin öğrenme temelli yapay zeka uygulamaları ve sistemleri arasında önem kazanan bir araştırma alanı olmuştur. İnsan konuşmaları, çevresel sesler veya endüstriyel gürültüler gibi çeşitli akustik ve karmaşık verilerin sınıflandırılması günlük yaşamda; güvenlik, gözetleme, akıllı şehir uygulamaları, milli savunma ve istihbarat, sağlık-tanı sistemleri ve otonom araçlar gibi çok çeşitli alanlarda kritik bir rol oynamaktadır. Özellikle gürültülü ortamlarda veya sınırlı veriye sahip senaryolarda yüksek doğruluklu sınıflandırma yapmak, mevcut sistemlerin sınırlamalarını ortaya koymakta ve yeni yöntemlerin geliştirilmesini gerekli kılmaktadır. Bu bağlamda bir derin öğrenme modeliyle ses sinyallerinin görsel temsilleri olan spektrogramlar üzerinde çalışılmıştır. Spektrogramlar, zamana bağlı frekans dağılımlarını görselleştirerek karmaşık akustik özelliklerin analizini kolaylaştırmaktadır. Ancak bu görsel temsiller üzerinde doğrudan sınıflandırma yapmak genellikle modele gereksiz bilgi yüklenmesine, işlem süresinin uzamasına, daha karmaşık hesaplamalara girilmesine veya sınıflandırma hatalarına sebep olmaktadır. Bu çalışmada evrimsel bir algoritmanın yanlış sınıflandırma oranını azaltmak üzere genetik algoritma ile görüntü optimizasyonu ardından optimize edilmiş görüntülerden yapılandırılmış motif çıkarımıyla elde edilen görüntülerle bir CNN modelini eğitip yüksek doğruluğa yakınsayacak bir metodoloji önerilmiştir. CNN modeli ile sınıflandırma görevinde ağ performansını iyileştirmek için yapılandırılmış motif girdileri kullanılarak büyük veri setlerindeki veri yükünün azaltabilmesi, çok sınıflı ve karmaşık veri kümelerinde sınıf özelinde detaylı çalışmalar yapılabilmesine alan oluşturmuştur. Bu çalışma, UrbanSound8K veri seti üzerinde spektrogram tabanlı bir yaklaşım kullanarak ses sınıflandırma performansını optimize etmiş ve daha az veri ile daha optimum doğruluk oranlarına ulaşmıştır. Bu yaklaşım; ses sinyallerinde tekrar eden anlamlı desenlerin belirlenmesine odaklanarak daha yüksek yorumlanabilirlik ve verimlilik sağlamış, dikkate alınmak istenen sınıflar özelinde daha detaylı ve hassas çalışmalar yürütülebileceğini göstermiştir.

Özet (Çeviri)

Recently, audio files have become an important research area among deep learning AI applications and systems. Classification of various acoustic and complex data such as human speech, explosion sounds or industrial noises plays a critical role in a wide range of areas such as security, surveillance, smart city applications, national defense and intelligence, health-diagnostic systems and autonomous vehicles in daily life. Especially in scenarios with large or limited data, achieving high accuracy reveals the limitations of current systems and necessitates the development of new methods. This is found on spectrograms, which are visual representations of the organization of sound with a structural deep learning model. Spectrograms facilitate the analysis of complex acoustic features by visualizing frequency distributions over time. However, performing classification directly on these visual representations usually results in loading unnecessary information into the model, increasing processing time, requiring more complex calculations, or causing classification errors. In this study, a methodology is proposed to reduce the misclassification rate of an evolutionary algorithm by training a CNN model with images obtained by extracting structured motifs from optimized images followed by image optimization with a genetic algorithm and converging to high accuracy. In the classification task with the CNN model, the ability to reduce the data load in large data sets by using structured motif inputs to improve the network performance has created space for detailed studies on classspecific multi-class and complex data sets. This study optimized the sound classification performance using a spectrogram-based approach on the UrbanSound8K dataset and achieved more optimum accuracy rates with less data. This approach; It provided higher interpretability and efficiency by focusing on the determination of repetitive meaningful patterns in sound signals, and showed that more detailed and sensitive studies can be carried out on the classes to be considered.

Benzer Tezler

  1. Classification of abnormal respiratory sounds using deep learning techniques

    Solunum seslerinin derin öğrenme yöntemleri ile sınıflandırılması

    AHAMADI ABDALLAH IDRISSE

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Bilgisayar Bilimleri Ana Bilim Dalı

    DOÇ. DR. OKTAY YILDIZ

  2. Boyut arttırma yöntemleri kullanılarak eeg sinyallerinden derin öğrenme tabanlı şizofren durum tespiti

    Deep learning based schizophrenia status determination from eeg signals using dimension augmentation methods

    ZÜLFİKAR ASLAN

    Doktora

    Türkçe

    Türkçe

    2021

    Elektrik ve Elektronik MühendisliğiDicle Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. MEHMET AKIN

  3. Öksürük ses kayıtları kullanılarak COVID-19 tahmini

    Predicting COVID-19 using cough audio recordings

    NURSEN KELEŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAtatürk Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ METE YAĞANOĞLU

  4. MACHINE LEARNING-BASED FAULT DETECTION AND CLASSIFICATION FOR TRANSMISSION LINE PROTECTION

    İLETİM HATTI KORUMASI İÇİN MAKİNE ÖĞRENİMİNE DAYALI ARIZA TESPİTİ VE SINIFLANDIRMASI

    AHMED ALTAİE

    Doktora

    İngilizce

    İngilizce

    2026

    Yıldız Teknik Üniversitesi

    Elektrik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. RECEP YUMURTACI

  5. Audio visual attention for robots from a developmental perspective

    Gelişimsel perspektiften robotlar için görsel ve işitsel diıkkat

    NADA AL AZZAWI

    Yüksek Lisans

    İngilizce

    İngilizce

    2018

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. GÖKHAN İNCE