Geri Dön

Konuşma duygusu tanımada derin öğrenme tabanlı modellerin karşılaştırmalı analizi

Comparative analysis of deep learning-based models in speech emotion recognition

  1. Tez No: 1016099
  2. Yazar: SEÇKİN YILDIZ
  3. Danışmanlar: DR. ÖĞR. ÜYESİ EMRE ÖLMEZ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Mühendislik Bilimleri, Computer Engineering and Computer Science and Control, Science and Technology, Engineering Sciences
  6. Anahtar Kelimeler: Derin öğrenme, Makine öğrenmesi, Yapay zeka, İnsan-yapay zeka etkileşimi, Deep learning, Machine learning, Artificial intelligence, Human-artificial intelligence interaction
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: İzmir Bakırçay Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Biyomedikal Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Biyomedikal Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Konuşma duygu tanıma (KDT), insan-makine etkileşiminden, ruh sağlığı takibi gibi biyomedikal uygulama alanlarına kadar geniş bir yelpazede artan bir öneme sahip, zorlu bir araştırma alanıdır. Bu tez çalışmasının temel amacı, konuşma duygusu tanıma başarısını artırmak ve model verimliliğini kıyaslamak amacıyla, literatürdeki farklı yaklaşımları temsil eden dört farklı derin öğrenme mimarisini (Önerilen Hibrit ESA+ÖSA, Temel Transformer, PANNs-CNN14 ve Wav2Vec 2.0) karşılaştırmaktır. Çalışmada modellerin başarısını ve genelleme yeteneğini ölçmek için stüdyo ortamında kaydedilen RAVDESS ve gürültülü/doğal ortam koşullarını barındıran CREMA-D veri setleri kullanılmıştır. Metodolojik tutarlılık adına tüm modeller PyTorch kütüphanesi üzerinde geliştirilmiş, veri setlerinde sınıflar arası veri dengesizliğini gidermek için veri arttırma (augmentation) teknikleri uygulanmıştır. Özellik çıkarımı aşamasında ESA, ÖSA ve PANNs modelleri için Mel-Spektrogram (görüntü tabanlı) yaklaşımı benimsenirken Wav2Vec 2.0 modeli için ham ses dalgaları (raw waveform) kullanılarak uçtan uca öğrenme gerçekleştirilmektedir. Deneysel sonuçlar, transfer öğrenme tabanlı modellerin üstünlüğünü ortaya koymaktadır. Ham ses dalgalarını işleyen Wav2Vec 2.0 modeli, RAVDESS veri setinde %90.62, CREMA-D veri setinde ise %75.42 doğruluk oranıyla en yüksek başarıyı elde etmektedir. Öte yandan, bu çalışmada önerilen hibrit ESA+ ÖSA mimarisi, sadece 380 bin parametreye sahip olmasına rağmen, kendisinden yaklaşık 200 kat daha büyük olan PANNs (80 Milyon) ve Wav2Vec (90 Milyon) modellerine yaklaşan bir performans (RAVDESS: %78.47) sergilemektedir. Bu durum, kaynak kısıtı olan sistemlerde hibrit mimarilerin, yüksek hesaplama maliyetli Transformer tabanlı modellere göre daha verimli bir alternatif olduğunu göstermektedir.

Özet (Çeviri)

Speech emotion recognition (SER) is a challenging research area with increasing importance across a wide range of applications, from human-machine interaction to biomedical applications such as mental health monitoring. The main objective of this thesis is to improve the success of speech emotion recognition and compare model efficiency by considering four different deep learning architectures (Proposed Hybrid CNN+RNN, Vanilla Transformer, PANNs-CNN14, and Wav2Vec 2.0) representing different approaches in the literature. RAVDESS datasets recorded in a studio environment and CREMA-D datasets containing noisy/natural environment conditions were used to measure the success and generalization ability of the models. For methodological consistency, all models were developed on the PyTorch library, and data enrichment techniques were applied to address data imbalance. The Mel-Spectrogram (image-based) approach was adopted for CNN, RNN, and PANNs models in the feature extraction phase; End-to-end learning was performed for the Wav2Vec 2.0 model using raw sound waves. Experimental results revealed the superiority of transfer learning-based models. The Wav2Vec 2.0 model, which processes raw sound waves, achieved the highest success rate with an accuracy rate of 90.62% in the RAVDESS dataset and 75.42% in the CREMA-D dataset. On the other hand, the hybrid CNN+RNN architecture proposed in this study, despite having only 380,000 parameters, exhibited a performance approaching that of PANNs (80 million) and Wav2Vec (90 million) models, which are approximately 200 times larger (RAVDESS: 78.47%). This shows that hybrid architectures are a more efficient alternative to high-computational-cost Transformer-based models in resource￾constrained systems.

Benzer Tezler

  1. Fog computing-based real-time emotion recognition using physiological signals

    Fizyolojik sinyaller ile sis hesaplama tabanlı gerçek zamanlı duygu tanıma

    ÖMÜR FATMANUR ERZURUMLUOĞLU

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. GÖKHAN İNCE

  2. Deep learning based three dimensional face expression recognition using geometry images from three dimensional face models

    Üç boyutlu yüz modellerinden elde edilen geometri görüntüleri kullanılan derin öğrenme tabanlı üç boyutlu yüz ifadelerini tanıma

    NEŞE GÜNEŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ULUĞ BAYAZIT

  3. Advanced techniques and comprehensive analysis in speech emotion recognition using deep neural networks

    Derin sinir ağları kullanarak konuşma duygu tanıma üzerine gelişmiş teknikler ve kapsamlı analiz

    AHMET KEMAL YETKİN

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. HATİCE KÖSE

  4. Sprechakt und unterrichtssprache (erne semantish-pragmalinguistische und methodisch-didaktishe Untersuchung)

    Sözeylem ve ders dili (anlambilim ve edimdilbilimsel bağlamda metodik didaktik bir inceleme)

    HASAN SEBÜKTEKİN

    Doktora

    Almanca

    Almanca

    1994

    Alman Dili ve EdebiyatıGazi Üniversitesi

    Yabancı Diller Eğitimi Ana Bilim Dalı

    PROF. DR. ZEKİ CEMİL ARDA

  5. Ses analizinde akustik parametrelerin tespiti ve anksiyete bozukluğunun akustik parametrelerle ilişkisinin araştırılması

    The detection of acoustic parameters in the voice analysis and the investigation of relationship with acoustic parameters of anxiety disorders

    TURGUT ÖZSEVEN

    Doktora

    Türkçe

    Türkçe

    2017

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKarabük Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. MUHARREM DÜĞENCİ