Konuşma duygusu tanımada derin öğrenme tabanlı modellerin karşılaştırmalı analizi
Comparative analysis of deep learning-based models in speech emotion recognition
- Tez No: 1016099
- Danışmanlar: DR. ÖĞR. ÜYESİ EMRE ÖLMEZ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Mühendislik Bilimleri, Computer Engineering and Computer Science and Control, Science and Technology, Engineering Sciences
- Anahtar Kelimeler: Derin öğrenme, Makine öğrenmesi, Yapay zeka, İnsan-yapay zeka etkileşimi, Deep learning, Machine learning, Artificial intelligence, Human-artificial intelligence interaction
- Yıl: 2026
- Dil: Türkçe
- Üniversite: İzmir Bakırçay Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Biyomedikal Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Biyomedikal Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Konuşma duygu tanıma (KDT), insan-makine etkileşiminden, ruh sağlığı takibi gibi biyomedikal uygulama alanlarına kadar geniş bir yelpazede artan bir öneme sahip, zorlu bir araştırma alanıdır. Bu tez çalışmasının temel amacı, konuşma duygusu tanıma başarısını artırmak ve model verimliliğini kıyaslamak amacıyla, literatürdeki farklı yaklaşımları temsil eden dört farklı derin öğrenme mimarisini (Önerilen Hibrit ESA+ÖSA, Temel Transformer, PANNs-CNN14 ve Wav2Vec 2.0) karşılaştırmaktır. Çalışmada modellerin başarısını ve genelleme yeteneğini ölçmek için stüdyo ortamında kaydedilen RAVDESS ve gürültülü/doğal ortam koşullarını barındıran CREMA-D veri setleri kullanılmıştır. Metodolojik tutarlılık adına tüm modeller PyTorch kütüphanesi üzerinde geliştirilmiş, veri setlerinde sınıflar arası veri dengesizliğini gidermek için veri arttırma (augmentation) teknikleri uygulanmıştır. Özellik çıkarımı aşamasında ESA, ÖSA ve PANNs modelleri için Mel-Spektrogram (görüntü tabanlı) yaklaşımı benimsenirken Wav2Vec 2.0 modeli için ham ses dalgaları (raw waveform) kullanılarak uçtan uca öğrenme gerçekleştirilmektedir. Deneysel sonuçlar, transfer öğrenme tabanlı modellerin üstünlüğünü ortaya koymaktadır. Ham ses dalgalarını işleyen Wav2Vec 2.0 modeli, RAVDESS veri setinde %90.62, CREMA-D veri setinde ise %75.42 doğruluk oranıyla en yüksek başarıyı elde etmektedir. Öte yandan, bu çalışmada önerilen hibrit ESA+ ÖSA mimarisi, sadece 380 bin parametreye sahip olmasına rağmen, kendisinden yaklaşık 200 kat daha büyük olan PANNs (80 Milyon) ve Wav2Vec (90 Milyon) modellerine yaklaşan bir performans (RAVDESS: %78.47) sergilemektedir. Bu durum, kaynak kısıtı olan sistemlerde hibrit mimarilerin, yüksek hesaplama maliyetli Transformer tabanlı modellere göre daha verimli bir alternatif olduğunu göstermektedir.
Özet (Çeviri)
Speech emotion recognition (SER) is a challenging research area with increasing importance across a wide range of applications, from human-machine interaction to biomedical applications such as mental health monitoring. The main objective of this thesis is to improve the success of speech emotion recognition and compare model efficiency by considering four different deep learning architectures (Proposed Hybrid CNN+RNN, Vanilla Transformer, PANNs-CNN14, and Wav2Vec 2.0) representing different approaches in the literature. RAVDESS datasets recorded in a studio environment and CREMA-D datasets containing noisy/natural environment conditions were used to measure the success and generalization ability of the models. For methodological consistency, all models were developed on the PyTorch library, and data enrichment techniques were applied to address data imbalance. The Mel-Spectrogram (image-based) approach was adopted for CNN, RNN, and PANNs models in the feature extraction phase; End-to-end learning was performed for the Wav2Vec 2.0 model using raw sound waves. Experimental results revealed the superiority of transfer learning-based models. The Wav2Vec 2.0 model, which processes raw sound waves, achieved the highest success rate with an accuracy rate of 90.62% in the RAVDESS dataset and 75.42% in the CREMA-D dataset. On the other hand, the hybrid CNN+RNN architecture proposed in this study, despite having only 380,000 parameters, exhibited a performance approaching that of PANNs (80 million) and Wav2Vec (90 million) models, which are approximately 200 times larger (RAVDESS: 78.47%). This shows that hybrid architectures are a more efficient alternative to high-computational-cost Transformer-based models in resourceconstrained systems.
Benzer Tezler
- Fog computing-based real-time emotion recognition using physiological signals
Fizyolojik sinyaller ile sis hesaplama tabanlı gerçek zamanlı duygu tanıma
ÖMÜR FATMANUR ERZURUMLUOĞLU
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÖKHAN İNCE
- Deep learning based three dimensional face expression recognition using geometry images from three dimensional face models
Üç boyutlu yüz modellerinden elde edilen geometri görüntüleri kullanılan derin öğrenme tabanlı üç boyutlu yüz ifadelerini tanıma
NEŞE GÜNEŞ
Yüksek Lisans
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. ULUĞ BAYAZIT
- Advanced techniques and comprehensive analysis in speech emotion recognition using deep neural networks
Derin sinir ağları kullanarak konuşma duygu tanıma üzerine gelişmiş teknikler ve kapsamlı analiz
AHMET KEMAL YETKİN
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HATİCE KÖSE
- Sprechakt und unterrichtssprache (erne semantish-pragmalinguistische und methodisch-didaktishe Untersuchung)
Sözeylem ve ders dili (anlambilim ve edimdilbilimsel bağlamda metodik didaktik bir inceleme)
HASAN SEBÜKTEKİN
Doktora
Almanca
1994
Alman Dili ve EdebiyatıGazi ÜniversitesiYabancı Diller Eğitimi Ana Bilim Dalı
PROF. DR. ZEKİ CEMİL ARDA
- Ses analizinde akustik parametrelerin tespiti ve anksiyete bozukluğunun akustik parametrelerle ilişkisinin araştırılması
The detection of acoustic parameters in the voice analysis and the investigation of relationship with acoustic parameters of anxiety disorders
TURGUT ÖZSEVEN
Doktora
Türkçe
2017
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKarabük ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. MUHARREM DÜĞENCİ