Geri Dön

Multimodal deep learning approaches for educational video analysis and summarization

Eğitim videolarının analizi ve özetlenmesi için çok modlu derin öğrenme yaklaşımları

  1. Tez No: 991557
  2. Yazar: İBRAHİM EREKMEN
  3. Danışmanlar: DOÇ. DR. ŞEVKET GÜMÜŞTEKİN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: İzmir Yüksek Teknoloji Enstitüsü
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Eğitimsel video içeriğindeki hızlı büyüme eğitime erişimi kolaylaştırmakta, ancak videoların doğrusal ve zaman alıcı doğası nedeniyle çeşitli zorluklar teşkil etmektedir. Bu tez, video analizi ve özetleme için üç farklı çok modlu derin öğrenme yaklaşımı aracılığıyla bu zorlukları ele almaktadır. İlk çalışma, video kesiti önem tahminine yönelik denetimli öğrenme yöntemlerini incelemektedir. Kullback-Leibler ıraksama kaybı ile Etiket Dağılımı Öğrenimi kullanılarak eğitilmiş, sıralı çapraz dikkat füzyonlu metin tabanlı çok modlu bir transformer mimarisi öneriyoruz. EDUVSUM veri kümesi üzerinde yapılan değerlendirme, kesit önem puanlarını tahmin etmede güçlü bir performans göstermektedir. İkinci çalışma, görsel ve metinsel modaliteler arasındaki karşılıklılığı kullanarak, öz-denetimli karşılaştırmalı öğrenme yoluyla etiketleme darboğazını ele almaktadır. Manuel insan etiketli video veri kümeleri gerektirmeden kesit önemini öğrenen bir derin öğrenme çerçevesi geliştirdik. Model, her bir modalite için ayrı Transformer kodlayıcılar kullanmakta, ardından çift yönlü çapraz dikkat füzyonu uygulamakta ve yardımcı düzenleyicilerle birleştirilmiş simetrik karşılaştırmalı kayıp fonksiyonu kullanılarak eğitilmektedir. Bu yaklaşım, EDUVSUM veri kümesinde gelecek vaat eden sonuçlar elde ederek, eğitimsel video özetleme için etiketleme gerektirmeyen öğrenmenin uygulanabilirliğini kanıtlamaktadır. Üçüncü çalışma, kapsamlı ve uçtan uca pratik bir eğitim videosu analiz aracı sunmaktadır. Sistem, metin çıkarma, içerik analizi, çok modlu segmentasyon ve görsel içerik tespiti olmak üzere dört aşamalı bir süreç uygulamaktadır. Sistem, tarayıcı tabanlı bir arayüzle kullanıma sunulmuş olup, gerçek dünya eğitim videosu analizinde pratik uygulanabilirliğini göstermiştir. Bu katkılar; derin öğrenme ve çok modlu füzyon yöntemlerinin entegrasyonunun, pasif video izlemeyi aktif ve yapılandırılmış öğrenme deneyimlerine dönüştürebileceğini ortaya koymaktadır. Bu tezde önerilen metodolojiler, mimariler ve değerlendirme çerçeveleri, eğitimsel video özetleme çalışmaları için temel oluşturmaktadır.

Özet (Çeviri)

The rapid growth in educational video content facilitates access to education but poses challenges due to its linear, time-consuming nature. This thesis addresses these challenges through three multimodal deep learning approaches for video analysis and summarization. The first study investigates supervised learning methods for video segment importance prediction. We propose a text-anchored multimodal transformer architecture with sequential cross-attention fusion, trained using Label Distribution Learning with Kullback-Leibler divergence loss. Evaluation on the EDUVSUM dataset demonstrates strong performance in predicting segment importance scores. The second study addresses the annotation bottleneck through self-supervised contrastive learning by exploiting the correspondence between visual and textual modalities. We develop a deep learning framework that learns segment importance without manual human-labeled video datasets. The model employs separate Transformer encoders for each modality, followed by bidirectional cross-attention fusion and trained using symmetric contrastive loss combined with auxiliary regularizers. This approach achieves promising results on the EDUVSUM dataset demonstrating the viability of annotation-free learning for educational video summarization. The third study presents a comprehensive end-to-end practical educational video analysis tool. The system implements a four-stage pipeline consisting of transcript extraction, content analysis, multimodal segmentation, and visual content detection. The system was deployed with a browser-based interface, demonstrating practical feasibility for real-world educational video analysis. These contributions establish that the integration of deep learning and multimodal fusion methods can transform passive video viewing into active, structured learning experiences. Collectively, the methodologies, architectures, and evaluation frameworks proposed in this thesis provide a foundation for educational video summarization.

Benzer Tezler

  1. Beden dilinden elde edilen mekânsal-zamansal veriler kullanılarak yapay zekâ ile duygu tespiti

    Emotion detection using artificial intelligence with spatiotemporal data obtained from body language

    ABDULHALIK OĞUZ

    Doktora

    Türkçe

    Türkçe

    2024

    Elektrik ve Elektronik MühendisliğiBatman Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. ÖMER FARUK ERTUĞRUL

  2. Mimarlıkta malzeme eğitimine yapay zekâ entegrasyonu üzerine bir araştırma

    A study on integration of artificial intelligence into material education in architecture

    PEYAM BAŞER

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Mimarlıkİstanbul Teknik Üniversitesi

    Mimarlık Ana Bilim Dalı

    PROF. DR. SEDEN ACUN ÖZGÜNLER

    DR. ÖĞR. ÜYESİ MİNE TOPÇUBAŞI

  3. Derin öğrenme yöntemleri kullanılarak çok modlu duygu analizi

    Multimodal sentiment analysis using deep learning methods

    AYŞE TEKİN

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolErzincan Binali Yıldırım Üniversitesi

    Yapay Zeka ve Robotik Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ MEHMET KÜRŞAT ÖKSÜZ

  4. Dejeneratif omurga hastalıklarının sınıflandırılması için docker konteynerleri tabanlı multimodal derin öğrenme yaklaşımları

    Docker-based multimodal deep learning approaches for the classification of degenerative spinal diseases

    HASAN YİĞİT

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Mühendislik BilimleriMuğla Sıtkı Koçman Üniversitesi

    Yapay Zeka Ana Bilim Dalı

    DOÇ. DR. İBRAHİM ÖNDER YENİÇERİ

  5. Hybrid deep learning architectures for early detection and continuous monitoring of parkinson's disease using multimodal sensor data

    Çok modlu sensör verileri kullanılarak parkinson hastalığının erken tespiti ve sürekli izlenmesi için hibrit derin öğrenme mimarileri

    MARWAH MUWAFAQ KADHIM AL-MOZANI

    Doktora

    İngilizce

    İngilizce

    2026

    Elektrik ve Elektronik MühendisliğiKarabük Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. HÜSEYİN DEMİREL