Geri Dön

Konuşma temelli duygu tanıma sürecinde derin öğrenme yaklaşımlarının kullanımı

The use of deep learning approaches in the speech-based emotion recognition process

  1. Tez No: 989306
  2. Yazar: NESLİHAN GÜNDOĞAN
  3. Danışmanlar: DR. ÖĞR. ÜYESİ BUKET İŞLER
  4. Tez Türü: Yüksek Lisans
  5. Konular: Mühendislik Bilimleri, Engineering Sciences
  6. Anahtar Kelimeler: Duygu tanıma, Emotion recognition
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: İstanbul Topkapı Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Yapay Zeka Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Günümüzde insan–makine etkileşiminin doğallığını ve verimliliğini artırma ihtiyacı, duygu temelli yapay zekâ uygulamalarının önemini her geçen gün artırmaktadır. Özellikle sesli arayüzler, çağrı merkezi otomasyonları, akıllı asistanlar ve eğitim teknolojileri gibi alanlarda, konuşma sinyalleri üzerinden duyguların otomatik olarak tanınması kritik bir gereksinim hâline gelmiştir. Bu bağlamda, konuşma temelli duygu tanıma sistemlerinin geliştirilmesi, mühendislik ve bilişim disiplinlerinde güncel ve öncelikli bir araştırma alanı olarak öne çıkmaktadır. Bununla birlikte, literatürde farklı derin öğrenme mimarilerinin konuşma verileri üzerinde sistematik olarak karşılaştırıldığı ve entegre edildiği çalışmalara sınırlı ölçüde rastlanmaktadır. Bu tez çalışması, söz konusu boşluğu gidermek ve sınıflandırma başarımını artırmaya yönelik yeni bir hibrit yaklaşım önermek amacıyla gerçekleştirilmiştir. Çalışmada, farklı duygusal durumları temsil eden etiketli ses verileri içeren RAVDESS (Ryerson Audio-Visual Database of Emotional Speech and Song) veri kümesi kullanılmıştır. Ses sinyallerinden Mel Frekans Kepstral Katsayıları (MFCC) yöntemi ile özellik çıkarımı yapılmış ve bu özellikler üç farklı derin öğrenme mimarisi ile işlenmiştir. İlk olarak CNN, ardından DNN mimarileri eğitilmiş; sırasıyla %76 ve %74 ortalama F1 skoru elde edilmiştir. Son aşamada, her iki modelin ara katman temsilleri birleştirilerek MFCCFusionNet adlı hibrit bir sınıflayıcı tasarlanmış ve %83 ortalama F1 doğruluk oranına ulaşılmıştır. Bu yaklaşım klasik transfer öğrenmesinden farklı olarak, özellik düzeyinde temsil transferi esasına dayanmaktadır. Elde edilen sonuçlar, konuşma temelli duygu tanıma sistemlerinde derin öğrenmeye dayalı hibrit yapıların performansı anlamlı şekilde iyileştirebileceğini göstermektedir.

Özet (Çeviri)

The growing need to enhance the naturalness and efficiency of human–machine interaction has significantly increased the importance of emotion-based artificial intelligence applications. In particular, the automatic recognition of emotions from speech signals has become a critical requirement in domains such as voice interfaces, call centre automation, intelligent assistants, and educational technologies. Accordingly, the development of speech-based emotion recognition systems has emerged as a contemporary and prioritised research field within engineering and computer science disciplines. However, the existing literature reveals a limited number of studies that systematically compare and integrate different deep learning architectures on speech data. This thesis was undertaken to address this gap and to propose a novel hybrid approach aimed at improving classification performance. In this study, the RAVDESS (Ryerson Audio-Visual Database of Emotional Speech and Song) dataset was employed, which contains labelled audio recordings representing various emotional states. Features were extracted from the speech signals using the Mel-Frequency Cepstral Coefficients (MFCC) method and processed through three different deep learning architectures. First, a CNN model was trained, achieving 76% classification accuracy, followed by a DNN model that yielded 74% accuracy. In the final phase, the intermediate representations obtained from both models were combined to construct a hybrid classifier, named MFCCFusionNet, which achieved the highest performance with 83% accuracy. Unlike conventional transfer learning, this approach is based on feature-level representation transfer, where internal representations learned by separate models are reused in a subsequent architecture. The findings demonstrate that hybrid deep learning structures can significantly enhance the performance of speech-based emotion recognition systems.

Benzer Tezler

  1. Design and development of audio-emotional serious games for audiology therapy

    Odyoloji terapisi için işitsel-duygusal ciddi oyunlar tasarlama ve geliştirme

    EGE VERİM

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Oyun ve Etkileşim Teknolojileri Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. HATİCE KÖSE

  2. Duygu okuryazarlığını geliştirmeye yönelik yaratıcı drama temelli bir model önerisi

    A creative drama-based model proposal for the development of emotional literacy

    MUAMMER KARTAL

    Doktora

    Türkçe

    Türkçe

    2025

    Eğitim ve ÖğretimGazi Üniversitesi

    Türkçe ve Sosyal Bilimler Eğitimi Ana Bilim Dalı

    PROF. DR. BAŞAK UYSAL

  3. The sounds of political actions in the streets of Istanbul

    İstanbul sokaklarında politik eylem sesleri

    EMİNE ŞİRİN ÖZGÜN

    Doktora

    İngilizce

    İngilizce

    2012

    Siyasal Bilimlerİstanbul Teknik Üniversitesi

    Müzik Ana Bilim Dalı

    PROF. Ş. ŞEHVAR BEŞİROĞLU

    DOÇ. DR. ROBERT REİGLE

  4. Televizyon üzerinden dindar/mütedeyyin kadınları anlamak: Dindar kadınların televizyonu alımlama ve kullanım biçimleri

    Understanding religious/pious women through television: Religious women's reception and usage of television

    ERGEN DEVRİM KARAGÖZ

    Doktora

    Türkçe

    Türkçe

    2022

    İletişim BilimleriGalatasaray Üniversitesi

    Radyo Televizyon ve Sinema Ana Bilim Dalı

    DOÇ. DR. ÖZLEM DANACI YÜCE

  5. Human presence detection in emergency situations using deep learning based audio-visual systems

    Derin öğrenme tabanlı işitsel-görsel sistemler ile tehlike durumunda insan tespiti

    İZLEN GENECİ

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilişsel Bilim Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. BANU GÜNEL KILIÇ

    PROF. DR. HÜSEYİN CEM BOZŞAHİN