Efficient visual question answering via matryoshka representation learning based adaptive granularity selection
Matruşka temsil öğrenimi tabanlı adaptif ayrıntı düzeyi seçimi yoluyla verimli görsel soru yanıtlama
- Tez No: 1003808
- Danışmanlar: PROF. DR. NAZLI İKİZLER CİNBİŞ, DR. BERKAN DEMİREL
- Tez Türü: Yüksek Lisans
- Konular: Mühendislik Bilimleri, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Engineering Sciences, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2024
- Dil: İngilizce
- Üniversite: Hacettepe Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Çok Modlu Büyük Dil Modelleri (MLLM'ler), bilgisayarlı görü ve doğal dil işleme görevlerinde yüksek performans sergilese de, yüksek çözünürlüklü görüntüleri işlerken oluşan aşırı uzunluktaki görsel yapıtaşı dizileri nedeniyle darboğazlar yaşamaktadır. AVG-LLaVA gibi adaptif yöntemler bu sorunu hafifletmeyi amaçlasa da, bu gibi yöntemler çoklukla kaba ölçekli çıkarım sırasında kritik bilgi kaybına yol açabilen basit havuzlama işlemlerine dayanmaktadır. Bu tezde yaptığımız çalışma, havuzlama tabanlı yöntemleri bilgi açısından zenginleştirilmiş temsillerle değiştirmek amacıyla, Matruşka Temsil Öğrenimi tabanlı bir model olan MRL-LLaVA'yı sunmaktadır. Önerilen yaklaşım iki temel bileşenden oluşmaktadır: (a) Gömme boyutları boyunca iç içe geçmiş temsiller üretmek üzere bir MRL katmanı ile bir CLIP modeline ince ayar yapılması ve (b) bu işlem sonucunda elde edilen MRL-CLIP modelinin AVG-LLaVA mimarisine entegre edilmesi. Üç farklı Görsel soru yanıtlama veri kümesi (GQA, ChartQA ve DocVQA) üzerindeki değerlendirmeler, MRL-LLaVA modelinin cevap verme süresini %43,6'ya kadar azalttığını; aynı zamanda belge anlama (DocVQA'da +%7,60) ve sahne muhakemesi (GQA'da +%3,97) görevlerinde önemli kazanımlar sağladığını göstermektedir. Yönlendirme analizi, temel modelin sabit yapılandırmalara odaklandığı senaryoların aksine, yaklaşımımızın görev gereksinimlerine göre değişen dinamik davranışlar sergilediğini ortaya koymaktadır. Bu esneklik, modelin farklı görsel soru cevaplama görevlerinde gereken görsel ayrıntı düzeyini daha adaptif bir şekilde seçmesine olanak tanımaktadır. Elde edilen sonuçlar, Matruşka tabanlı iç içe geçmiş temsillerin havuzlama işlemlerine kıyasla daha zengin görsel ayrıntı düzeyleri sunduğunu ve çok modlu büyük dil modelleri için verimlilik-performans dengesini iyileştirdiğini göstermektedir.
Özet (Çeviri)
Multimodal Large Language Models (MLLMs) achieve strong performance on vision-language tasks but suffer from computational bottlenecks when processing high-resolution images due to excessive visual token sequences. While adaptive granularity methods like AVG-LLaVA attempt to mitigate this, they rely on simple pooling operations that may lose critical information during coarse-grained extraction. This thesis presents MRL-LLaVA, a novel framework that integrates Matryoshka Representation Learning (MRL) to replace pooling-based extraction with hierarchical, information-enriched representations. Our approach involves two key components: (a) fine-tuning a pretrained CLIP visual encoder with an MRL layer to produce nested representations across embedding dimensions, and (b) integrating this MRL-CLIP encoder into AVG-LLaVA to create MRL-LLaVA. Evaluating across three VQA benchmarks (GQA, ChartQA, and DocVQA), MRL-LLaVA achieves substantial gains on document understanding (+7.60% on DocVQA) and scene reasoning (+3.97% on GQA) while reducing inference latency up to 43.6%. Routing analysis reveals that our approach may enable more adaptive granularity selection on certain VQA tasks, demonstrating diverse routing behavior where the baseline concentrates on fixed configurations. These results validate that Matryoshka-based nested representations provide richer visual granularities than pooling operations, offering improved efficiency-performance trade-offs for MLLMs.
Benzer Tezler
- Knowledge-based visual question answering
Bilgi tabanlı görsel soru cevaplama
ZİŞAN YALÇINKAYA
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ANIL BAŞ
- Optimizing artistic process: Exploring efficient environment creation workflows in gaming industry
Sanatsal sürecin optimizasyonu: Oyun endüstrisinde verimli çevre oluşturma süreçlerinin incelenmesi
EMRAH ÖZÇİÇEK
Yüksek Lisans
İngilizce
2024
Bilim ve Teknolojiİstanbul Teknik ÜniversitesiOyun ve Etkileşim Teknolojileri Ana Bilim Dalı (disiplinlerarası)
PROF. DR. LEMAN FİGEN GÜL
- Kimya tanı testinin görsellik, üç aşamalı, tek ve sıralı seçenek özellikleriyle öğrencilerin sınav kaygısı arasındaki ilişkinin incelenmesi
Investigating the relation between visuality, three-stage, single choice and sequential choice characteristics of the science diagnostic test and students' exam anxiety
MELTEM ŞEKER
Yüksek Lisans
Türkçe
2017
Eğitim ve ÖğretimDokuz Eylül Üniversitesiİlköğretim Ana Bilim Dalı
DOÇ. DR. SUAT TÜRKOGUZ
- The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching
Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi
ÖZLEM YAZAR
Yüksek Lisans
İngilizce
2004
Eğitim ve ÖğretimGazi Üniversitesiİngiliz Dili Eğitimi Ana Bilim Dalı
YRD. DOÇ. DR. PAŞA TEVFİK CEPHE
- Mimari tasarım sürecinin erken aşamasında kullanılacak artırılmış gerçeklik uygulamalarının geliştirilmesi için bir yöntem önerisi
A new approach for development of a mobile augmented reality application to be used in the early phases of the architectural design process
MAHMUT ÇAĞDAŞ DURMAZOĞLU
Doktora
Türkçe
2023
Mimarlıkİstanbul Teknik ÜniversitesiBilişim Ana Bilim Dalı
PROF. DR. LEMAN FİGEN GÜL