Multimodal deep learning approaches for educational video analysis and summarization
Eğitim videolarının analizi ve özetlenmesi için çok modlu derin öğrenme yaklaşımları
- Tez No: 991557
- Danışmanlar: DOÇ. DR. ŞEVKET GÜMÜŞTEKİN
- Tez Türü: Yüksek Lisans
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İzmir Yüksek Teknoloji Enstitüsü
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Eğitimsel video içeriğindeki hızlı büyüme eğitime erişimi kolaylaştırmakta, ancak videoların doğrusal ve zaman alıcı doğası nedeniyle çeşitli zorluklar teşkil etmektedir. Bu tez, video analizi ve özetleme için üç farklı çok modlu derin öğrenme yaklaşımı aracılığıyla bu zorlukları ele almaktadır. İlk çalışma, video kesiti önem tahminine yönelik denetimli öğrenme yöntemlerini incelemektedir. Kullback-Leibler ıraksama kaybı ile Etiket Dağılımı Öğrenimi kullanılarak eğitilmiş, sıralı çapraz dikkat füzyonlu metin tabanlı çok modlu bir transformer mimarisi öneriyoruz. EDUVSUM veri kümesi üzerinde yapılan değerlendirme, kesit önem puanlarını tahmin etmede güçlü bir performans göstermektedir. İkinci çalışma, görsel ve metinsel modaliteler arasındaki karşılıklılığı kullanarak, öz-denetimli karşılaştırmalı öğrenme yoluyla etiketleme darboğazını ele almaktadır. Manuel insan etiketli video veri kümeleri gerektirmeden kesit önemini öğrenen bir derin öğrenme çerçevesi geliştirdik. Model, her bir modalite için ayrı Transformer kodlayıcılar kullanmakta, ardından çift yönlü çapraz dikkat füzyonu uygulamakta ve yardımcı düzenleyicilerle birleştirilmiş simetrik karşılaştırmalı kayıp fonksiyonu kullanılarak eğitilmektedir. Bu yaklaşım, EDUVSUM veri kümesinde gelecek vaat eden sonuçlar elde ederek, eğitimsel video özetleme için etiketleme gerektirmeyen öğrenmenin uygulanabilirliğini kanıtlamaktadır. Üçüncü çalışma, kapsamlı ve uçtan uca pratik bir eğitim videosu analiz aracı sunmaktadır. Sistem, metin çıkarma, içerik analizi, çok modlu segmentasyon ve görsel içerik tespiti olmak üzere dört aşamalı bir süreç uygulamaktadır. Sistem, tarayıcı tabanlı bir arayüzle kullanıma sunulmuş olup, gerçek dünya eğitim videosu analizinde pratik uygulanabilirliğini göstermiştir. Bu katkılar; derin öğrenme ve çok modlu füzyon yöntemlerinin entegrasyonunun, pasif video izlemeyi aktif ve yapılandırılmış öğrenme deneyimlerine dönüştürebileceğini ortaya koymaktadır. Bu tezde önerilen metodolojiler, mimariler ve değerlendirme çerçeveleri, eğitimsel video özetleme çalışmaları için temel oluşturmaktadır.
Özet (Çeviri)
The rapid growth in educational video content facilitates access to education but poses challenges due to its linear, time-consuming nature. This thesis addresses these challenges through three multimodal deep learning approaches for video analysis and summarization. The first study investigates supervised learning methods for video segment importance prediction. We propose a text-anchored multimodal transformer architecture with sequential cross-attention fusion, trained using Label Distribution Learning with Kullback-Leibler divergence loss. Evaluation on the EDUVSUM dataset demonstrates strong performance in predicting segment importance scores. The second study addresses the annotation bottleneck through self-supervised contrastive learning by exploiting the correspondence between visual and textual modalities. We develop a deep learning framework that learns segment importance without manual human-labeled video datasets. The model employs separate Transformer encoders for each modality, followed by bidirectional cross-attention fusion and trained using symmetric contrastive loss combined with auxiliary regularizers. This approach achieves promising results on the EDUVSUM dataset demonstrating the viability of annotation-free learning for educational video summarization. The third study presents a comprehensive end-to-end practical educational video analysis tool. The system implements a four-stage pipeline consisting of transcript extraction, content analysis, multimodal segmentation, and visual content detection. The system was deployed with a browser-based interface, demonstrating practical feasibility for real-world educational video analysis. These contributions establish that the integration of deep learning and multimodal fusion methods can transform passive video viewing into active, structured learning experiences. Collectively, the methodologies, architectures, and evaluation frameworks proposed in this thesis provide a foundation for educational video summarization.
Benzer Tezler
- Beden dilinden elde edilen mekânsal-zamansal veriler kullanılarak yapay zekâ ile duygu tespiti
Emotion detection using artificial intelligence with spatiotemporal data obtained from body language
ABDULHALIK OĞUZ
Doktora
Türkçe
2024
Elektrik ve Elektronik MühendisliğiBatman ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. ÖMER FARUK ERTUĞRUL
- Mimarlıkta malzeme eğitimine yapay zekâ entegrasyonu üzerine bir araştırma
A study on integration of artificial intelligence into material education in architecture
PEYAM BAŞER
Yüksek Lisans
Türkçe
2025
Mimarlıkİstanbul Teknik ÜniversitesiMimarlık Ana Bilim Dalı
PROF. DR. SEDEN ACUN ÖZGÜNLER
DR. ÖĞR. ÜYESİ MİNE TOPÇUBAŞI
- Derin öğrenme yöntemleri kullanılarak çok modlu duygu analizi
Multimodal sentiment analysis using deep learning methods
AYŞE TEKİN
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolErzincan Binali Yıldırım ÜniversitesiYapay Zeka ve Robotik Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MEHMET KÜRŞAT ÖKSÜZ
- Dejeneratif omurga hastalıklarının sınıflandırılması için docker konteynerleri tabanlı multimodal derin öğrenme yaklaşımları
Docker-based multimodal deep learning approaches for the classification of degenerative spinal diseases
HASAN YİĞİT
Yüksek Lisans
Türkçe
2025
Mühendislik BilimleriMuğla Sıtkı Koçman ÜniversitesiYapay Zeka Ana Bilim Dalı
DOÇ. DR. İBRAHİM ÖNDER YENİÇERİ
- Hybrid deep learning architectures for early detection and continuous monitoring of parkinson's disease using multimodal sensor data
Çok modlu sensör verileri kullanılarak parkinson hastalığının erken tespiti ve sürekli izlenmesi için hibrit derin öğrenme mimarileri
MARWAH MUWAFAQ KADHIM AL-MOZANI
Doktora
İngilizce
2026
Elektrik ve Elektronik MühendisliğiKarabük ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. HÜSEYİN DEMİREL