Derin öğrenme yöntemleri kullanılarak görme engelliler için akıllı gözlükler ile gerçek zamanlı duygu tanıma
Real-time emotion recognition with smart glasses for the visually impaired using deep learning methods
- Tez No: 1019695
- Danışmanlar: DOÇ. DR. NURSEL YALÇIN
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Derin öğrenme, Duygu tanıma, Giyilebilir teknoloji, Yüz ifadelerinden duyguları anlama, Deep learning, Emotion recognition, Wearable technology, Emotion recognition ability
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Gazi Üniversitesi
- Enstitü: Bilişim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Bilimleri Ana Bilim Dalı (disiplinlerarası)
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Yedi temel yüz ifadesi, cinsiyet, yaş veya kültür fark etmeksizin bireyin psikolojik durumunu yansıtan evrensel göstergelerdir. İnsan görsel sistemi bu ifadeleri sezgisel olarak çözümlese de bilgisayarlı görü alanında duygusal durumların dinamik ve kontrolsüz ortam koşullarında otomatik olarak tanınması hâlâ önemli bir araştırma sorunudur. Bu doktora tezi, yüz ifadelerine dayalı duygu tanıma süreçlerine yönelik teorik ve uygulamalı bir çerçeve oluşturmayı; elde edilen bulguları ise görme yetersizliği bulunan bireylerin sosyal etkileşim kapasitelerini desteklemeye yönelik akıllı, giyilebilir bir sistem prototipine dönüştürmeyi amaçlamaktadır. Çalışmanın ilk aşamasında, 2019 yılından günümüze yayınlanan literatür PRISMA protokolü doğrultusunda sistematik olarak taranmış; mevcut veri setleri, model mimarileri ve gerçek zamanlı dağıtım stratejileri karşılaştırmalı olarak analiz edilmiştir. Elde edilen bulgular, veri seti bileşimi ve sınıf dağılımının model genelleme başarısı üzerinde belirleyici rol oynadığını ortaya koymuştur. Bu doğrultuda, sınıf dengesizliklerini gidermek ve veri çeşitliliğini artırmak amacıyla gelişmiş ön işleme ve artırma protokolleriyle FER24_CK+ adlı hibrit veri seti yapılandırılmıştır. Teknik katkı kapsamında, kaynak kısıtlı ortamlara yönelik EfficientNetB7 tabanlı bir Evrişimli Sinir Ağı (ESA) mimarisi ve dikkat mekanizmaları bütünleştirilmiş CBAM-4CNN modeli geliştirilmiştir. Hibrit yaklaşımlar kapsamında önerilen EmoFormer-CBAM (ViT-CBAM) mimarisi, yerel ve bağlamsal özelliklerin eş zamanlı öğrenilmesi prensibiyle, yeni derlenen CleanFER25_RAF_CK veri setinde %98, heterojen yapıdaki AffectNet veri setinde ise yaklaşık %72 test doğruluğu elde ederek çapraz veri seti genelleme yeteneğini kanıtlamıştır. Gerçek zamanlı dağıtım aşamasında modeller Torch Script formatına dönüştürülerek; video akışı, yüz tespiti, mesafe duyarlı çıkarım ve işitsel geri bildirim adımlarını içeren uçtan uca bir kenar işleme (edge-processing) hattına entegre edilmiştir. Teknik saha doğrulaması, doğal iç mekân ortamlarında yaş, cinsiyet ve yüz morfolojisi açısından çeşitlendirilmiş genişletilmiş bir katılımcı grubuyla gerçekleştirilmiştir. Deney protokolü, katılımcı ile kamera arasındaki mesafe değişkenine göre beş temel gruba (0,0–0,5 m; 0,5–1,5 m; 1,5–2,0 m; 2,0–2,5 m; 2,5 m ve üzeri) ayrılmış olup, 0,0–3,0 metre aralığında yedi temel duygu üzerinden hesaplanan gerçek zamanlı genel sistem doğruluğu %88 olarak elde edilmiştir. Duygu bazlı analizler; öfke (%97), mutluluk (%96) ve şaşkınlık (%92) kategorilerinde yüksek kararlılık gösterirken, mesafe artışıyla birlikte doğrulukta belirgin bir düşüş yaşanmaması önerilen mimarinin öznitelik çıkarımındaki dayanıklılığını ortaya koymuştur. İğrenme duygusundaki sınırlı performans (%69) ise metodolojik ve veri kaynaklı bir zorluk olarak değerlendirilmiş, otomatik duygu tanıma literatüründe bilinen sınıf dengesizliği ve istemli ifade üretim güçlüğüyle ilişkili bir sınırlılık olarak yorumlanmıştır. Algoritmik ve donanım fizibilitesi tamamlanmış olup; görme yetersizliği bulunan son kullanıcılarla yapılacak kullanılabilirlik değerlendirmesi, Gazi Üniversitesi Etik Kurulu onayı (Karar No: 2024-1319) çerçevesinde planlanmış bir gelecek çalışma olarak konumlandırılmıştır. Bu çalışma, derin öğrenme tabanlı duygu tanıma literatürüne veri seti iyileştirme, hibrit mimari optimizasyonu ve gömülü sistem entegrasyonu boyutlarında katkı sunarken; yardımcı teknolojiler geliştirme süreçlerinde insan merkezli tasarım ilkelerinin ve gerçek dünya doğrulamasının zorunluluğunu vurgulamaktadır.
Özet (Çeviri)
Seven basic facial expressions are universal indicators reflecting an individual's psychological state, regardless of gender, age, or culture. While the human visual system intuitively interprets these expressions, the automatic recognition of emotional states in dynamic and uncontrolled environmental conditions remains a significant research challenge in the field of computer vision. This doctoral dissertation aims to establish a theoretical and applied framework for emotion recognition processes based on facial expressions and to transform the findings into a prototype of a smart, wearable system to support the social interaction capacity of individuals with visual impairments. In the first phase of the study, the literature published from 2019 to the present was systematically reviewed according to the PRISMA protocol; existing datasets, model architectures, and real-time deployment strategies were analyzed comparatively. The findings revealed that dataset composition and class distribution play a decisive role in the success of model generalization. Accordingly, a hybrid dataset called FER24_CK+ was structured with advanced preprocessing and enhancement protocols to address class imbalances and increase data diversity. In terms of technical contribution, an EfficientNetB7-based CNN architecture and a CBAM-4CNN model with integrated attention mechanisms were developed for resource-constrained environments. Within the scope of hybrid approaches, the proposed EmoFormer-CBAM (ViT-CBAM) architecture, based on the principle of simultaneous learning of local and contextual features, demonstrated its cross-dataset generalization capability by achieving 98% test accuracy on the newly compiled CleanFER25_RAF_CK dataset and approximately 72% on the heterogeneous AffectNet dataset. During the real-time deployment phase, the models were converted to Torch Script format and integrated into an end-to-end edge-processing pipeline including video streaming, face detection, distance-sensitive inference, and auditory feedback steps. Technical field validation was performed in natural indoor environments with an expanded participant group diversified in terms of age, gender, and facial morphology. The experimental protocol was divided into five basic groups (0.0–0.5 m; 0.5–1.5 m; 1.5–2.0 m; 2.0–2.5 m; 2.5 m and above) according to the distance variable between the participant and the camera, and the real-time overall system accuracy calculated based on seven basic emotions in the 0.0–3.0 meter range was obtained as 88%. Emotion-based analyses showed high stability in the categories of anger (97%), happiness (96%), and surprise (92%), while the absence of a significant decrease in accuracy with increasing distance revealed the robustness of the proposed architecture in feature extraction. The limited performance in the emotion of disgust (69%) was considered a methodological and data-related challenge, interpreted as a limitation related to class imbalance and difficulty in generating voluntary expressions, known in the automatic emotion recognition literature. Algorithmic and hardware feasibility studies have been completed; The usability assessment to be conducted with visually impaired end-users is positioned as a future study planned within the framework of Gazi University Ethics Committee approval (Decision No: 2024-1319). This study contributes to the deep learning-based emotion recognition literature in terms of dataset improvement, hybrid architecture optimization, and embedded system integration; while emphasizing the necessity of human-centered design principles and real-world validation in the development processes of assistive technologies.
Benzer Tezler
- Knowledge-based visual question answering
Bilgi tabanlı görsel soru cevaplama
ZİŞAN YALÇINKAYA
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ANIL BAŞ
- Effect of expanding bounding box annotations on small object detection performance in aerial imagery
Sınırlayıcı kutu etiketlerinin büyütülmesinin havadan çekilen görüntülerde küçük nesne tespiti performansına etkisi
MUSTAFA UĞUR
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Yapay zeka tabanlı bara diferansiyel koruma sistemi
Artificial intelligence based busbar differential protection system
EMRE ÖZDEMİR
Yüksek Lisans
Türkçe
2025
Elektrik ve Elektronik MühendisliğiSakarya ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. YILMAZ UYAROĞLU
- Derin öğrenme yöntemleri ile dokunsal parke yüzeyi tespiti
Tactile paving surface detection with deep learning methods
ABDULSAMET AKTAŞ
Yüksek Lisans
Türkçe
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ÖNDER DEMİR
DR. ÖĞR. ÜYESİ BUKET DOĞAN
- Kuantum hesaplama modellerinin derin öğrenme kullanılarak otomatik üretimi
Automated generation of quantum computing models using deep learning
NİYAZİ FURKAN BAR
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFırat ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET KARAKÖSE