Konuşma temelli duygu tanıma sürecinde derin öğrenme yaklaşımlarının kullanımı
The use of deep learning approaches in the speech-based emotion recognition process
- Tez No: 989306
- Danışmanlar: DR. ÖĞR. ÜYESİ BUKET İŞLER
- Tez Türü: Yüksek Lisans
- Konular: Mühendislik Bilimleri, Engineering Sciences
- Anahtar Kelimeler: Duygu tanıma, Emotion recognition
- Yıl: 2025
- Dil: Türkçe
- Üniversite: İstanbul Topkapı Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Yapay Zeka Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Günümüzde insan–makine etkileşiminin doğallığını ve verimliliğini artırma ihtiyacı, duygu temelli yapay zekâ uygulamalarının önemini her geçen gün artırmaktadır. Özellikle sesli arayüzler, çağrı merkezi otomasyonları, akıllı asistanlar ve eğitim teknolojileri gibi alanlarda, konuşma sinyalleri üzerinden duyguların otomatik olarak tanınması kritik bir gereksinim hâline gelmiştir. Bu bağlamda, konuşma temelli duygu tanıma sistemlerinin geliştirilmesi, mühendislik ve bilişim disiplinlerinde güncel ve öncelikli bir araştırma alanı olarak öne çıkmaktadır. Bununla birlikte, literatürde farklı derin öğrenme mimarilerinin konuşma verileri üzerinde sistematik olarak karşılaştırıldığı ve entegre edildiği çalışmalara sınırlı ölçüde rastlanmaktadır. Bu tez çalışması, söz konusu boşluğu gidermek ve sınıflandırma başarımını artırmaya yönelik yeni bir hibrit yaklaşım önermek amacıyla gerçekleştirilmiştir. Çalışmada, farklı duygusal durumları temsil eden etiketli ses verileri içeren RAVDESS (Ryerson Audio-Visual Database of Emotional Speech and Song) veri kümesi kullanılmıştır. Ses sinyallerinden Mel Frekans Kepstral Katsayıları (MFCC) yöntemi ile özellik çıkarımı yapılmış ve bu özellikler üç farklı derin öğrenme mimarisi ile işlenmiştir. İlk olarak CNN, ardından DNN mimarileri eğitilmiş; sırasıyla %76 ve %74 ortalama F1 skoru elde edilmiştir. Son aşamada, her iki modelin ara katman temsilleri birleştirilerek MFCCFusionNet adlı hibrit bir sınıflayıcı tasarlanmış ve %83 ortalama F1 doğruluk oranına ulaşılmıştır. Bu yaklaşım klasik transfer öğrenmesinden farklı olarak, özellik düzeyinde temsil transferi esasına dayanmaktadır. Elde edilen sonuçlar, konuşma temelli duygu tanıma sistemlerinde derin öğrenmeye dayalı hibrit yapıların performansı anlamlı şekilde iyileştirebileceğini göstermektedir.
Özet (Çeviri)
The growing need to enhance the naturalness and efficiency of human–machine interaction has significantly increased the importance of emotion-based artificial intelligence applications. In particular, the automatic recognition of emotions from speech signals has become a critical requirement in domains such as voice interfaces, call centre automation, intelligent assistants, and educational technologies. Accordingly, the development of speech-based emotion recognition systems has emerged as a contemporary and prioritised research field within engineering and computer science disciplines. However, the existing literature reveals a limited number of studies that systematically compare and integrate different deep learning architectures on speech data. This thesis was undertaken to address this gap and to propose a novel hybrid approach aimed at improving classification performance. In this study, the RAVDESS (Ryerson Audio-Visual Database of Emotional Speech and Song) dataset was employed, which contains labelled audio recordings representing various emotional states. Features were extracted from the speech signals using the Mel-Frequency Cepstral Coefficients (MFCC) method and processed through three different deep learning architectures. First, a CNN model was trained, achieving 76% classification accuracy, followed by a DNN model that yielded 74% accuracy. In the final phase, the intermediate representations obtained from both models were combined to construct a hybrid classifier, named MFCCFusionNet, which achieved the highest performance with 83% accuracy. Unlike conventional transfer learning, this approach is based on feature-level representation transfer, where internal representations learned by separate models are reused in a subsequent architecture. The findings demonstrate that hybrid deep learning structures can significantly enhance the performance of speech-based emotion recognition systems.
Benzer Tezler
- Design and development of audio-emotional serious games for audiology therapy
Odyoloji terapisi için işitsel-duygusal ciddi oyunlar tasarlama ve geliştirme
EGE VERİM
Yüksek Lisans
İngilizce
2023
Bilim ve Teknolojiİstanbul Teknik ÜniversitesiOyun ve Etkileşim Teknolojileri Ana Bilim Dalı (disiplinlerarası)
PROF. DR. HATİCE KÖSE
- Duygu okuryazarlığını geliştirmeye yönelik yaratıcı drama temelli bir model önerisi
A creative drama-based model proposal for the development of emotional literacy
MUAMMER KARTAL
Doktora
Türkçe
2025
Eğitim ve ÖğretimGazi ÜniversitesiTürkçe ve Sosyal Bilimler Eğitimi Ana Bilim Dalı
PROF. DR. BAŞAK UYSAL
- The sounds of political actions in the streets of Istanbul
İstanbul sokaklarında politik eylem sesleri
EMİNE ŞİRİN ÖZGÜN
Doktora
İngilizce
2012
Siyasal Bilimlerİstanbul Teknik ÜniversitesiMüzik Ana Bilim Dalı
PROF. Ş. ŞEHVAR BEŞİROĞLU
DOÇ. DR. ROBERT REİGLE
- Televizyon üzerinden dindar/mütedeyyin kadınları anlamak: Dindar kadınların televizyonu alımlama ve kullanım biçimleri
Understanding religious/pious women through television: Religious women's reception and usage of television
ERGEN DEVRİM KARAGÖZ
Doktora
Türkçe
2022
İletişim BilimleriGalatasaray ÜniversitesiRadyo Televizyon ve Sinema Ana Bilim Dalı
DOÇ. DR. ÖZLEM DANACI YÜCE
- Human presence detection in emergency situations using deep learning based audio-visual systems
Derin öğrenme tabanlı işitsel-görsel sistemler ile tehlike durumunda insan tespiti
İZLEN GENECİ
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilişsel Bilim Ana Bilim Dalı (disiplinlerarası)
PROF. DR. BANU GÜNEL KILIÇ
PROF. DR. HÜSEYİN CEM BOZŞAHİN