Hibrit derin öğrenme modelleri ile videodan işaret dili tanıma
Recognition of sign language videos using hybrid deep learning models
- Tez No: 980450
- Danışmanlar: PROF. DR. SIRMA YAVUZ
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Görüntü işleme-bilgisayarlı, Yapay zeka ve makine öğrenmesi dersi, İnsan bilgisayar etkileşimi, İnsan-yapay zeka etkileşimi, İşaret dili, Image processing-computer assisted, Artificial intelligence and machine learning course, Human computer interaction, Human-artificial intelligence interaction, Sign language
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
İşaret Dili Tanıma (İDT), işitme engelli bireylerin iletişim engellerini kaldırmaya yönelik kritik bir araştırma alanı olup, işaretçi farklılıkları, hareket karmaşıklığı ve hesaplama verimliliği gibi önemli zorluklar barındırmaktadır. Bu tez, bu zorlukları ele almak üzere iki yenilikçi hibrit derin öğrenme mimarisi sunmaktadır. İlk olarak, transfer öğrenmesi ile bağlamsal özellikleri birleştiren DeepEMA modeli geliştirilmiştir. Bu modelin temel katkısı, farklı özellik kaynaklarının (EfficientNet-B7 ve CRNN) güvenilirliğini dinamik olarak öğrenen ve birleştiren özgün bir Hiyerarşik Dikkat Mekanizması önermesidir. Mimari, BosphorusSign22k veri seti üzerinde geliştirilip eğitilmiş, ardından modelin genelleme yeteneğini test etmek amacıyla farklı dillerdeki veri setlerinde yalnızca RGB video verisiyle dahi yüksek başarımlar elde edilmiştir. Model, BosphorusSign22k-Genel (174 sınıf) veri setinde %96,84; LSA64'te %99,84 ve INCLUDE-50'de %98,41 doğruluk ile hibrit dikkat yaklaşımlarının potansiyelini ortaya koymuştur. Tezin ikinci aşamasında, İDT sistemlerinin pratik uygulanabilirliği için kritik olan işaretçi-bağımsız genelleme problemine odaklanılmıştır. Bu amaçla, Durum Uzay Modeli (SSM) tabanlı MambaVision mimarisi temel alınmıştır. Bu tez, ilgili mimarinin İDT alanındaki etkinliğini sistematik olarak inceleyen öncü çalışmalardan biridir. Modelin genelleme yeteneğini artırmak için, RGB video verileri ile MediaPipe iskelet verilerini sinerjik olarak birleştiren çok modlu bir yapı tasarlanmıştır. Bu iki farklı veri modalitesini entegre etmek için FiLM mimarisinden yola çıkarak geliştirilen ve bilgi kaybını en aza indiren yenilikçi bir Uyarlanabilir Geçitli Füzyon Katmanı (AG-FiCL) önerilmiştir. Önerilen çok modlu model (Mamba AG-FiCL), işaretçi-bağımsız test protokolleri altında BosphorusSign22-Genel veri setinde %97,05; BosphorusSign22k'da (744 sınıf) %93,21; AUTSL'de %85,54 ve LSA64'te %99,69 gibi, literatürdeki en iyi sonuçlara yaklaşan veya bu sonuçları aşan, rekabetçi performanslar sergilemiştir. Detaylı hata analizi, modelin sadece görsel desenleri ezberlemek yerine, işaretler arasında anlamsal ve morfolojik ilişkiler kurarak öğrendiğini göstermiştir. Bu çalışma, Mamba mimarisinin kelime düzeyinde İDT alanındaki potansiyelini kanıtlamış ve önerdiği yenilikçi füzyon mekanizmasıyla alana önemli bir katkı sunarak gelecekteki araştırmalar için sağlam bir temel oluşturmuştur.
Özet (Çeviri)
Sign Language Recognition (SLR) is a critical research area focused on overcoming communication barriers for the hearing-impaired. This field presents significant challenges, including signer variations, complex motion, and computational efficiency. This thesis presents two innovative hybrid deep learning architectures designed to address these challenges. First, the DeepEMA model combines transfer learning with contextual features. Its primary contribution is a novel Hierarchical Attention Mechanism that dynamically assesses and integrates the reliability of diverse feature sources (EfficientNet-B7 and CRNN). Trained on the BosphorusSign22k dataset, the architecture demonstrated strong generalization by achieving high performance on datasets from different languages using only RGB video data. The model validated the effectiveness of hybrid attention approaches, achieving accuracies of 96.84% on BosphorusSign22k-General (174 classes), 99.84% on LSA64, and 98.41% on INCLUDE-50. The second phase of this research addresses signer-independent generalization, a critical factor for the practical application of SLR systems. For this, the State Space Model (SSM) based MambaVision architecture is adopted. This thesis is one of the pioneering studies that systematically investigates the effectiveness of this architecture in the SLR field. To enhance generalization, a multi-modal structure was designed to synergistically combine RGB video with MediaPipe skeleton data. To fuse these distinct data modalities with minimal information loss, we propose an innovative Adaptive Gated Fusion Layer (AG-FiCL), inspired by the FiLM architecture. The resulting multi-modal model, Mamba AG-FiCL, demonstrated competitive performance under signer-independent test protocols, achieving results that approach or surpass state-of-the-art benchmarks: 97.05% on BosphorusSign22-General, 93.21% on BosphorusSign22k (744 classes), 85.54% on AUTSL, and 99.69% on LSA64. A detailed error analysis revealed that the model learns by establishing semantic and morphological relationships between signs, rather than merely memorizing visual patterns. This study validates the potential of the Mamba architecture for word-level SLR and contributes a novel fusion mechanism to the field, establishing a solid foundation for future research.
Benzer Tezler
- İşaret dili tanımada derin öğrenme ile istatistiksel yöntemlerin karşılaştırılması
Comparison of deep learning and statistical methods in sign language recognition
CANER DOĞAN
- Facial expression analysis foran online usability evaluation platform
Çevrimiçi kullanılabilirlik değerlendirme platformu için yüz ifadesi analizi
ALİ AZMOUDEH
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Derin öğrenme ile cerrahi video anlama
Surgical video understanding with deep learning
ABDISHAKOUR ABDILLAHI AWALE ABDISHAKOUR ABDILLAHI AWALE
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilişim Sistemleri Ana Bilim Dalı
DR. ÖĞR. ÜYESİ DUYGU SARIKAYA
- Deep unfolding for clutter removal in ground penetrating radar
Yere nüfuz eden radarda kargaşa gidermek için derin katman açma
SAMET ÖZGÜL
Yüksek Lisans
İngilizce
2023
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesiİletişim Sistemleri Ana Bilim Dalı
PROF. DR. IŞIN ERER
- Hibrit derin öğrenme modelleri ile hisse senedi fiyat tahmini
Stock price prediction with hybrid deep learning models
KÜBRA KARADAĞ