Derin öğrenme yöntemi kullanarak spektrogram veri kümesinden yapılandırılmış motif çıkarımı ile açıklanabilir ses sınıflandırma
Explainable sound classification through structured motif extraction from spectrogram datasets using deep learning methods
- Tez No: 992898
- Danışmanlar: PROF. DR. MEHMET KAYA
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Fırat Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Yakın zamanda ses sınıflandırma, derin öğrenme temelli yapay zeka uygulamaları ve sistemleri arasında önem kazanan bir araştırma alanı olmuştur. İnsan konuşmaları, çevresel sesler veya endüstriyel gürültüler gibi çeşitli akustik ve karmaşık verilerin sınıflandırılması günlük yaşamda; güvenlik, gözetleme, akıllı şehir uygulamaları, milli savunma ve istihbarat, sağlık-tanı sistemleri ve otonom araçlar gibi çok çeşitli alanlarda kritik bir rol oynamaktadır. Özellikle gürültülü ortamlarda veya sınırlı veriye sahip senaryolarda yüksek doğruluklu sınıflandırma yapmak, mevcut sistemlerin sınırlamalarını ortaya koymakta ve yeni yöntemlerin geliştirilmesini gerekli kılmaktadır. Bu bağlamda bir derin öğrenme modeliyle ses sinyallerinin görsel temsilleri olan spektrogramlar üzerinde çalışılmıştır. Spektrogramlar, zamana bağlı frekans dağılımlarını görselleştirerek karmaşık akustik özelliklerin analizini kolaylaştırmaktadır. Ancak bu görsel temsiller üzerinde doğrudan sınıflandırma yapmak genellikle modele gereksiz bilgi yüklenmesine, işlem süresinin uzamasına, daha karmaşık hesaplamalara girilmesine veya sınıflandırma hatalarına sebep olmaktadır. Bu çalışmada evrimsel bir algoritmanın yanlış sınıflandırma oranını azaltmak üzere genetik algoritma ile görüntü optimizasyonu ardından optimize edilmiş görüntülerden yapılandırılmış motif çıkarımıyla elde edilen görüntülerle bir CNN modelini eğitip yüksek doğruluğa yakınsayacak bir metodoloji önerilmiştir. CNN modeli ile sınıflandırma görevinde ağ performansını iyileştirmek için yapılandırılmış motif girdileri kullanılarak büyük veri setlerindeki veri yükünün azaltabilmesi, çok sınıflı ve karmaşık veri kümelerinde sınıf özelinde detaylı çalışmalar yapılabilmesine alan oluşturmuştur. Bu çalışma, UrbanSound8K veri seti üzerinde spektrogram tabanlı bir yaklaşım kullanarak ses sınıflandırma performansını optimize etmiş ve daha az veri ile daha optimum doğruluk oranlarına ulaşmıştır. Bu yaklaşım; ses sinyallerinde tekrar eden anlamlı desenlerin belirlenmesine odaklanarak daha yüksek yorumlanabilirlik ve verimlilik sağlamış, dikkate alınmak istenen sınıflar özelinde daha detaylı ve hassas çalışmalar yürütülebileceğini göstermiştir.
Özet (Çeviri)
Recently, audio files have become an important research area among deep learning AI applications and systems. Classification of various acoustic and complex data such as human speech, explosion sounds or industrial noises plays a critical role in a wide range of areas such as security, surveillance, smart city applications, national defense and intelligence, health-diagnostic systems and autonomous vehicles in daily life. Especially in scenarios with large or limited data, achieving high accuracy reveals the limitations of current systems and necessitates the development of new methods. This is found on spectrograms, which are visual representations of the organization of sound with a structural deep learning model. Spectrograms facilitate the analysis of complex acoustic features by visualizing frequency distributions over time. However, performing classification directly on these visual representations usually results in loading unnecessary information into the model, increasing processing time, requiring more complex calculations, or causing classification errors. In this study, a methodology is proposed to reduce the misclassification rate of an evolutionary algorithm by training a CNN model with images obtained by extracting structured motifs from optimized images followed by image optimization with a genetic algorithm and converging to high accuracy. In the classification task with the CNN model, the ability to reduce the data load in large data sets by using structured motif inputs to improve the network performance has created space for detailed studies on classspecific multi-class and complex data sets. This study optimized the sound classification performance using a spectrogram-based approach on the UrbanSound8K dataset and achieved more optimum accuracy rates with less data. This approach; It provided higher interpretability and efficiency by focusing on the determination of repetitive meaningful patterns in sound signals, and showed that more detailed and sensitive studies can be carried out on the classes to be considered.
Benzer Tezler
- Classification of abnormal respiratory sounds using deep learning techniques
Solunum seslerinin derin öğrenme yöntemleri ile sınıflandırılması
AHAMADI ABDALLAH IDRISSE
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
DOÇ. DR. OKTAY YILDIZ
- Boyut arttırma yöntemleri kullanılarak eeg sinyallerinden derin öğrenme tabanlı şizofren durum tespiti
Deep learning based schizophrenia status determination from eeg signals using dimension augmentation methods
ZÜLFİKAR ASLAN
Doktora
Türkçe
2021
Elektrik ve Elektronik MühendisliğiDicle ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET AKIN
- Öksürük ses kayıtları kullanılarak COVID-19 tahmini
Predicting COVID-19 using cough audio recordings
NURSEN KELEŞ
Yüksek Lisans
Türkçe
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAtatürk ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ METE YAĞANOĞLU
- MACHINE LEARNING-BASED FAULT DETECTION AND CLASSIFICATION FOR TRANSMISSION LINE PROTECTION
İLETİM HATTI KORUMASI İÇİN MAKİNE ÖĞRENİMİNE DAYALI ARIZA TESPİTİ VE SINIFLANDIRMASI
AHMED ALTAİE
Doktora
İngilizce
2026
Yıldız Teknik ÜniversitesiElektrik Mühendisliği Ana Bilim Dalı
DOÇ. DR. RECEP YUMURTACI
- Audio visual attention for robots from a developmental perspective
Gelişimsel perspektiften robotlar için görsel ve işitsel diıkkat
NADA AL AZZAWI
Yüksek Lisans
İngilizce
2018
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. GÖKHAN İNCE