Geri Dön

Efficient visual question answering via matryoshka representation learning based adaptive granularity selection

Matruşka temsil öğrenimi tabanlı adaptif ayrıntı düzeyi seçimi yoluyla verimli görsel soru yanıtlama

  1. Tez No: 1003808
  2. Yazar: MUHAMMED CİHAT ÜNAL
  3. Danışmanlar: PROF. DR. NAZLI İKİZLER CİNBİŞ, DR. BERKAN DEMİREL
  4. Tez Türü: Yüksek Lisans
  5. Konular: Mühendislik Bilimleri, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Engineering Sciences, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2024
  8. Dil: İngilizce
  9. Üniversite: Hacettepe Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Çok Modlu Büyük Dil Modelleri (MLLM'ler), bilgisayarlı görü ve doğal dil işleme görevlerinde yüksek performans sergilese de, yüksek çözünürlüklü görüntüleri işlerken oluşan aşırı uzunluktaki görsel yapıtaşı dizileri nedeniyle darboğazlar yaşamaktadır. AVG-LLaVA gibi adaptif yöntemler bu sorunu hafifletmeyi amaçlasa da, bu gibi yöntemler çoklukla kaba ölçekli çıkarım sırasında kritik bilgi kaybına yol açabilen basit havuzlama işlemlerine dayanmaktadır. Bu tezde yaptığımız çalışma, havuzlama tabanlı yöntemleri bilgi açısından zenginleştirilmiş temsillerle değiştirmek amacıyla, Matruşka Temsil Öğrenimi tabanlı bir model olan MRL-LLaVA'yı sunmaktadır. Önerilen yaklaşım iki temel bileşenden oluşmaktadır: (a) Gömme boyutları boyunca iç içe geçmiş temsiller üretmek üzere bir MRL katmanı ile bir CLIP modeline ince ayar yapılması ve (b) bu işlem sonucunda elde edilen MRL-CLIP modelinin AVG-LLaVA mimarisine entegre edilmesi. Üç farklı Görsel soru yanıtlama veri kümesi (GQA, ChartQA ve DocVQA) üzerindeki değerlendirmeler, MRL-LLaVA modelinin cevap verme süresini %43,6'ya kadar azalttığını; aynı zamanda belge anlama (DocVQA'da +%7,60) ve sahne muhakemesi (GQA'da +%3,97) görevlerinde önemli kazanımlar sağladığını göstermektedir. Yönlendirme analizi, temel modelin sabit yapılandırmalara odaklandığı senaryoların aksine, yaklaşımımızın görev gereksinimlerine göre değişen dinamik davranışlar sergilediğini ortaya koymaktadır. Bu esneklik, modelin farklı görsel soru cevaplama görevlerinde gereken görsel ayrıntı düzeyini daha adaptif bir şekilde seçmesine olanak tanımaktadır. Elde edilen sonuçlar, Matruşka tabanlı iç içe geçmiş temsillerin havuzlama işlemlerine kıyasla daha zengin görsel ayrıntı düzeyleri sunduğunu ve çok modlu büyük dil modelleri için verimlilik-performans dengesini iyileştirdiğini göstermektedir.

Özet (Çeviri)

Multimodal Large Language Models (MLLMs) achieve strong performance on vision-language tasks but suffer from computational bottlenecks when processing high-resolution images due to excessive visual token sequences. While adaptive granularity methods like AVG-LLaVA attempt to mitigate this, they rely on simple pooling operations that may lose critical information during coarse-grained extraction. This thesis presents MRL-LLaVA, a novel framework that integrates Matryoshka Representation Learning (MRL) to replace pooling-based extraction with hierarchical, information-enriched representations. Our approach involves two key components: (a) fine-tuning a pretrained CLIP visual encoder with an MRL layer to produce nested representations across embedding dimensions, and (b) integrating this MRL-CLIP encoder into AVG-LLaVA to create MRL-LLaVA. Evaluating across three VQA benchmarks (GQA, ChartQA, and DocVQA), MRL-LLaVA achieves substantial gains on document understanding (+7.60% on DocVQA) and scene reasoning (+3.97% on GQA) while reducing inference latency up to 43.6%. Routing analysis reveals that our approach may enable more adaptive granularity selection on certain VQA tasks, demonstrating diverse routing behavior where the baseline concentrates on fixed configurations. These results validate that Matryoshka-based nested representations provide richer visual granularities than pooling operations, offering improved efficiency-performance trade-offs for MLLMs.

Benzer Tezler

  1. Knowledge-based visual question answering

    Bilgi tabanlı görsel soru cevaplama

    ZİŞAN YALÇINKAYA

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ANIL BAŞ

  2. Optimizing artistic process: Exploring efficient environment creation workflows in gaming industry

    Sanatsal sürecin optimizasyonu: Oyun endüstrisinde verimli çevre oluşturma süreçlerinin incelenmesi

    EMRAH ÖZÇİÇEK

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Oyun ve Etkileşim Teknolojileri Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. LEMAN FİGEN GÜL

  3. Kimya tanı testinin görsellik, üç aşamalı, tek ve sıralı seçenek özellikleriyle öğrencilerin sınav kaygısı arasındaki ilişkinin incelenmesi

    Investigating the relation between visuality, three-stage, single choice and sequential choice characteristics of the science diagnostic test and students' exam anxiety

    MELTEM ŞEKER

    Yüksek Lisans

    Türkçe

    Türkçe

    2017

    Eğitim ve ÖğretimDokuz Eylül Üniversitesi

    İlköğretim Ana Bilim Dalı

    DOÇ. DR. SUAT TÜRKOGUZ

  4. The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching

    Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi

    ÖZLEM YAZAR

    Yüksek Lisans

    İngilizce

    İngilizce

    2004

    Eğitim ve ÖğretimGazi Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    YRD. DOÇ. DR. PAŞA TEVFİK CEPHE

  5. Mimari tasarım sürecinin erken aşamasında kullanılacak artırılmış gerçeklik uygulamalarının geliştirilmesi için bir yöntem önerisi

    A new approach for development of a mobile augmented reality application to be used in the early phases of the architectural design process

    MAHMUT ÇAĞDAŞ DURMAZOĞLU

    Doktora

    Türkçe

    Türkçe

    2023

    Mimarlıkİstanbul Teknik Üniversitesi

    Bilişim Ana Bilim Dalı

    PROF. DR. LEMAN FİGEN GÜL