Geri Dön

Hibrit derin öğrenme modelleri ile videodan işaret dili tanıma

Recognition of sign language videos using hybrid deep learning models

  1. Tez No: 980450
  2. Yazar: ESMA YENİSARI
  3. Danışmanlar: PROF. DR. SIRMA YAVUZ
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Görüntü işleme-bilgisayarlı, Yapay zeka ve makine öğrenmesi dersi, İnsan bilgisayar etkileşimi, İnsan-yapay zeka etkileşimi, İşaret dili, Image processing-computer assisted, Artificial intelligence and machine learning course, Human computer interaction, Human-artificial intelligence interaction, Sign language
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Yıldız Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

İşaret Dili Tanıma (İDT), işitme engelli bireylerin iletişim engellerini kaldırmaya yönelik kritik bir araştırma alanı olup, işaretçi farklılıkları, hareket karmaşıklığı ve hesaplama verimliliği gibi önemli zorluklar barındırmaktadır. Bu tez, bu zorlukları ele almak üzere iki yenilikçi hibrit derin öğrenme mimarisi sunmaktadır. İlk olarak, transfer öğrenmesi ile bağlamsal özellikleri birleştiren DeepEMA modeli geliştirilmiştir. Bu modelin temel katkısı, farklı özellik kaynaklarının (EfficientNet-B7 ve CRNN) güvenilirliğini dinamik olarak öğrenen ve birleştiren özgün bir Hiyerarşik Dikkat Mekanizması önermesidir. Mimari, BosphorusSign22k veri seti üzerinde geliştirilip eğitilmiş, ardından modelin genelleme yeteneğini test etmek amacıyla farklı dillerdeki veri setlerinde yalnızca RGB video verisiyle dahi yüksek başarımlar elde edilmiştir. Model, BosphorusSign22k-Genel (174 sınıf) veri setinde %96,84; LSA64'te %99,84 ve INCLUDE-50'de %98,41 doğruluk ile hibrit dikkat yaklaşımlarının potansiyelini ortaya koymuştur. Tezin ikinci aşamasında, İDT sistemlerinin pratik uygulanabilirliği için kritik olan işaretçi-bağımsız genelleme problemine odaklanılmıştır. Bu amaçla, Durum Uzay Modeli (SSM) tabanlı MambaVision mimarisi temel alınmıştır. Bu tez, ilgili mimarinin İDT alanındaki etkinliğini sistematik olarak inceleyen öncü çalışmalardan biridir. Modelin genelleme yeteneğini artırmak için, RGB video verileri ile MediaPipe iskelet verilerini sinerjik olarak birleştiren çok modlu bir yapı tasarlanmıştır. Bu iki farklı veri modalitesini entegre etmek için FiLM mimarisinden yola çıkarak geliştirilen ve bilgi kaybını en aza indiren yenilikçi bir Uyarlanabilir Geçitli Füzyon Katmanı (AG-FiCL) önerilmiştir. Önerilen çok modlu model (Mamba AG-FiCL), işaretçi-bağımsız test protokolleri altında BosphorusSign22-Genel veri setinde %97,05; BosphorusSign22k'da (744 sınıf) %93,21; AUTSL'de %85,54 ve LSA64'te %99,69 gibi, literatürdeki en iyi sonuçlara yaklaşan veya bu sonuçları aşan, rekabetçi performanslar sergilemiştir. Detaylı hata analizi, modelin sadece görsel desenleri ezberlemek yerine, işaretler arasında anlamsal ve morfolojik ilişkiler kurarak öğrendiğini göstermiştir. Bu çalışma, Mamba mimarisinin kelime düzeyinde İDT alanındaki potansiyelini kanıtlamış ve önerdiği yenilikçi füzyon mekanizmasıyla alana önemli bir katkı sunarak gelecekteki araştırmalar için sağlam bir temel oluşturmuştur.

Özet (Çeviri)

Sign Language Recognition (SLR) is a critical research area focused on overcoming communication barriers for the hearing-impaired. This field presents significant challenges, including signer variations, complex motion, and computational efficiency. This thesis presents two innovative hybrid deep learning architectures designed to address these challenges. First, the DeepEMA model combines transfer learning with contextual features. Its primary contribution is a novel Hierarchical Attention Mechanism that dynamically assesses and integrates the reliability of diverse feature sources (EfficientNet-B7 and CRNN). Trained on the BosphorusSign22k dataset, the architecture demonstrated strong generalization by achieving high performance on datasets from different languages using only RGB video data. The model validated the effectiveness of hybrid attention approaches, achieving accuracies of 96.84% on BosphorusSign22k-General (174 classes), 99.84% on LSA64, and 98.41% on INCLUDE-50. The second phase of this research addresses signer-independent generalization, a critical factor for the practical application of SLR systems. For this, the State Space Model (SSM) based MambaVision architecture is adopted. This thesis is one of the pioneering studies that systematically investigates the effectiveness of this architecture in the SLR field. To enhance generalization, a multi-modal structure was designed to synergistically combine RGB video with MediaPipe skeleton data. To fuse these distinct data modalities with minimal information loss, we propose an innovative Adaptive Gated Fusion Layer (AG-FiCL), inspired by the FiLM architecture. The resulting multi-modal model, Mamba AG-FiCL, demonstrated competitive performance under signer-independent test protocols, achieving results that approach or surpass state-of-the-art benchmarks: 97.05% on BosphorusSign22-General, 93.21% on BosphorusSign22k (744 classes), 85.54% on AUTSL, and 99.69% on LSA64. A detailed error analysis revealed that the model learns by establishing semantic and morphological relationships between signs, rather than merely memorizing visual patterns. This study validates the potential of the Mamba architecture for word-level SLR and contributes a novel fusion mechanism to the field, establishing a solid foundation for future research.

Benzer Tezler

  1. İşaret dili tanımada derin öğrenme ile istatistiksel yöntemlerin karşılaştırılması

    Comparison of deep learning and statistical methods in sign language recognition

    CANER DOĞAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    İstatistikAnkara Üniversitesi

    İstatistik Ana Bilim Dalı

    DOÇ. DR. LEVENT ÖZBEK

  2. Facial expression analysis foran online usability evaluation platform

    Çevrimiçi kullanılabilirlik değerlendirme platformu için yüz ifadesi analizi

    ALİ AZMOUDEH

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. HAZIM KEMAL EKENEL

  3. Derin öğrenme ile cerrahi video anlama

    Surgical video understanding with deep learning

    ABDISHAKOUR ABDILLAHI AWALE ABDISHAKOUR ABDILLAHI AWALE

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Bilişim Sistemleri Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ DUYGU SARIKAYA

  4. Deep unfolding for clutter removal in ground penetrating radar

    Yere nüfuz eden radarda kargaşa gidermek için derin katman açma

    SAMET ÖZGÜL

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    İletişim Sistemleri Ana Bilim Dalı

    PROF. DR. IŞIN ERER

  5. Hibrit derin öğrenme modelleri ile hisse senedi fiyat tahmini

    Stock price prediction with hybrid deep learning models

    KÜBRA KARADAĞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    EkonometriTrakya Üniversitesi

    Ekonometri Ana Bilim Dalı

    PROF. DR. NURCAN METİN