Geri Dön

Transformer-based vision-language frameworks: A cross-domain study from video captioning to medical report generation

Transformatör tabanlı görsel-dil çerçeveleri: Video altyazılamadan tıbbi rapor üretimine disiplinlerarası bir çalışma

  1. Tez No: 988643
  2. Yazar: BENGÜ FETİLER
  3. Danışmanlar: DOÇ. DR. VOLKAN KILIÇ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Elektrik ve Elektronik Mühendisliği, Computer Engineering and Computer Science and Control, Electrical and Electronics Engineering
  6. Anahtar Kelimeler: Sayısal görüntü işleme, Digital image processing
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İzmir Katip Çelebi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Elektrik ve Elektronik Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Görsel-dil modellemede kaydedilen gelişmeler, video altyazılama ve tıbbi rapor üretimi alanlarında önemli ilerlemeler sağlamış; modellerin görsel içeriği yorumlama ve bağlamsal olarak tutarlı doğal dil çıktıları oluşturma yeteneğini güçlendirmiştir. Ancak, uzun menzilli zamansal bağımlılıkların modellenmesi, ince ayrıntılı semantik bilgilerin yakalanması ve çoklu modlu verilerin etkili biçimde bütünleştirilmesi gibi zorluklar halen devam etmektedir. Bu tez, hem genel amaçlı çoklu ortam uygulamalarında hem de tıbbi görüntüleme gibi alan-özel görevlerde karşılaşılan bu sorunlara, görsel-dil anlayışını geliştiren bir dizi derin öğrenme temelli yöntem sunarak çözüm getirmektedir. Tezin ilk katkısı, konvolüsyonel ve transformatör tabanlı kodlayıcıları çoklu modlu dikkat mekanizmaları ile birleştiren gelişmiş bir video altyazılama mimarisidir. Bu yapı, video dizilerinden hiyerarşik uzamsal–zamansal özellikler çıkarmak ve bunları dilsel temsillerle hizalamak üzere tasarlanmıştır. Önerilen model, hareket dinamiklerini, sahne geçişlerini ve anlamsal ipuçlarını etkili biçimde yakalayarak bağlama uygun ve zamansal açıdan tutarlı açıklamalar üretebilmektedir. Standart veri kümeleri üzerinde yapılan kapsamlı deneyler, modelin çoklu değerlendirme ölçütlerine göre mevcut yöntemlere kıyasla belirgin iyileşme sağladığını göstermektedir. Tezin ikinci katkısı ise radyolojik görüntülerden tıbbi rapor üretimine odaklanmaktadır; bu alan doğruluk, yorumlanabilirlik ve klinik geçerlilik açısından yüksek hassasiyet gerektirmektedir. Bu kapsamda, tıbbi raporlardaki uzun metin üretimi sorununu ele almak amacıyla bellek destekli bir CLIP-rehberli transformatör çerçevesi önerilmiştir. Model, tıbbi görüntü kodlayıcılarından elde edilen görsel özellikleri yapısal dilsel bilgilerle bütünleştirerek tanıya duyarlı, tutarlı ve klinik açıdan uygun raporlar üretebilmektedir. Anatomik bölgeler ile metinsel açıklamalar arasındaki ilişkiyi güçlendirmek için özel bir hizalama modülü geliştirilmiştir. Kamusal veri kümeleri üzerinde yapılan değerlendirmeler, modelin hem doğal dil kalitesi hem de klinik doğruluk açısından temel yaklaşımları geride bıraktığını ortaya koymaktadır. Her iki alan için gerçekleştirilen kapsamlı deneyler, bileşen çıkarma analizleri ve karşılaştırmalı değerlendirmeler, önerilen yöntemlerin semantik anlama ve zamansal akıl yürütme gerektiren görevlerde belirgin performans kazanımları sağladığını göstermektedir. Bu katkılar, görsel-dil modelleme araştırmalarına güçlü bir temel sunmakta ve çoklu ortam analizi ile bilgisayar destekli klinik karar destek sistemlerinde gerçek dünya uygulamaları için önemli bir potansiyel taşımaktadır.

Özet (Çeviri)

Recent advances in visual–language modeling have transformed the fields of video captioning and medical report generation by enabling models to jointly interpret visual content and generate coherent natural language descriptions. Despite this progress, several challenges remain, including the need to model long-range temporal dependencies, capture fine-grained semantic details, and effectively integrate multimodal information in both general-purpose multimedia tasks and domain-specific medical applications. This thesis addresses these challenges by proposing a set of unified and specialized deep learning frameworks that advance the state-of-the-art in visual–language understanding. The first contribution of the thesis introduces an enhanced video captioning architecture that combines convolutional and transformer-based encoders with multimodal attention mechanisms. This framework is designed to extract hierarchical spatial–temporal features from video sequences and align them with linguistic representations. The proposed model effectively captures motion dynamics, scene transitions, and semantic cues that are critical for generating contextually rich and temporally consistent video descriptions. Extensive experiments on benchmark datasets demonstrate that the model achieves substantial improvements over existing methods across multiple evaluation metrics. The second major contribution focuses on medical report generation from radiological images, a domain where accuracy, interpretability, and clinical relevance are of paramount importance. Transformer architecture is proposed to address the long-sequence generation challenge inherent in medical reporting. The model incorporates visual features obtained from medical imaging encoders and integrates them with structured linguistic priors to generate coherent, diagnosis-aware radiology reports. To better capture clinical terminology and disease-specific patterns, a specialized alignment module is introduced to strengthen the correspondence between anatomical regions and textual descriptions. Evaluations on publicly available datasets show that the proposed framework consistently outperforms baseline architectures in terms of both natural language quality and clinical correctness. Across both domains, the thesis introduces comprehensive experimental analyses, ablation studies, and comparative evaluations that highlight the effectiveness of the proposed methods. The results demonstrate that integrating structured memory mechanisms, multimodal attention, and hierarchical visual encoding significantly improves model performance in tasks requiring both semantic understanding and temporal reasoning. These contributions provide a robust foundation for future research in visual–language modeling and offer promising pathways for real-world applications in multimedia analysis and computer-aided clinical decision-support.

Benzer Tezler

  1. Toplam kalite yönetimi, kalite güvencesi sistemleri ve Türkiye'deki uygulamaları

    Total quality management, quality assurance systems and their applications in Turkey

    AHMET BEŞKESE

    Yüksek Lisans

    Türkçe

    Türkçe

    1995

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. ATAÇ SOYSAL

  2. Knowledge-based visual question answering

    Bilgi tabanlı görsel soru cevaplama

    ZİŞAN YALÇINKAYA

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ANIL BAŞ

  3. “Dijital ınfluencer”Miquela Sousa'yı“Takiplemek”: Sosyal medyada kadın beden temsili üzerine düşünmek

    “Following”the“Digital influencer”Miquela Sousa: Reflecting on female body representation on social media

    GÜLCAN UYSAL

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    İletişim Bilimleriİstanbul Üniversitesi

    Kadın Çalışmaları Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. NİLÜFER TİMİSİ NALÇAOĞLU

  4. Multimodal medical visual question answering: Knowledge spaces and semantic segmentation for improved and explainable AI

    Çok-kipli tıbbi görsel soru cevaplama: Bilgi uzayları ve anlamsal bölütleme ile gelişmiş ve açıklanabilir yapay zekâ

    ZİYA ATA YAZICI

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. HAZIM KEMAL EKENEL

  5. Beyin tümörü sınıflandırması için optimize edilmiş hibrit modeller ve yenilikçi diferansiyel dikkat mimarilerinin geliştirilmesi

    Development of optimized hybrid models and innovative differential attention architectures for brain tumor classification

    MUHAMMED ÇELİK

    Doktora

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolTokat Gaziosmanpaşa Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ÖZKAN İNİK