Improving vision LLM performance on standardized test questions
Görsel dil modellerinin üniversite sınavı performansının geliştirilmesi
- Tez No: 974946
- Danışmanlar: DOÇ. DR. ŞEYDA ERTEKİN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışmada, açık kaynaklı görsel dil modellerinin, daha önce herhangi bir kıyaslama standardının bulunmadığı bir alan olan karmaşık ve çok-modlu Türk lise sınavı sorularında kapalı sistemlere rakip olabilecek şekilde eğitilebileceği gösterilmektedir. Bu tez, Görsel Dil Modelleri'nin (GDM) Türk lise müfredatı üzerindeki performansını değerlendirmek için ilk standartlaştırılmış kıyaslamayı sunmaktadır. Çok-modlu akıl yürütmeyi kapsamlı bir şekilde test etmek amacıyla tasarlanmış, 309 konudan eşit olarak örneklenmiş, elle derlenmiş 1.854 adet beş seçenekli Yükseköğretim Kurumları Sınavı (YKS) sorusundan oluşan bir veri seti takdim edilmektedir. Hem açık kaynaklı hem de kapalı GDM'ler değerlendirilerek başlangıç performans seviyeleri belirlenmiş ve en iyi kapalı model (Gemini 2.5 Flash, %84,68) ile en güçlü açık kaynaklı model (Qwen-2.5VL-32B, %62,46) arasında 23 puanlık bir doğruluk farkı ortaya konmuştur. Bu farkı kapatmak amacıyla, gelişmiş modellerden (Gemini 2.0, Gemini 2.5) elde edilen çözümlerle ve karmaşık sorular için video destekli yönlendirme ile zenginleştirilmiş, toplam 161,4 milyon jetondan oluşan üç büyük ölçekli çok-modlu eğitim veri seti (D, M, L) derlenmiştir. Optimize edilmiş QMSA (Soru–Üstveri–Çözüm–Cevap) sözdizimi kullanılarak Qwen-2.5VL-32B modeline ince ayar yapılmış ve %25,82'lik göreceli bir iyileşme ile %78,59 doğruluk oranına ulaşılmıştır. Bu sonuç, kapalı model performansıyla aradaki farkı %7,9'a düşürmüştür. Bu çalışmanın üç temel katkısı bulunmaktadır: (1) GDM'lerin Türkçe akademik değerlendirmesi için kamuya açık bir kıyaslama, (2) rekabetçi açık kaynak performansı sağlayan yüksek kaliteli ve alana özgü bir eğitim veri seti ve (3) veri merkezli ince ayarın, açık kaynak ile kapalı modeller arasındaki performans farkını önemli ölçüde kapatabildiğinin deneysel olarak gösterilmesi. Ayrıca, mekânsal akıl yürütme ve alana özgü diyagram yorumlama gibi temel zorlukların altı çizilmekte ve hedeflenmiş eğitim sonrası süreçler, araç destekli akıl yürütme ve sentetik veri üretimi, gelecek vaat eden araştırma yönleri olarak önerilmektedir.
Özet (Çeviri)
In our research, we show that open-source vision-language models can be trained to rival proprietary systems on complex, multimodal Turkish high-school exam questions — a domain where no benchmark previously existed. This thesis introduces the first standardized benchmark for evaluating Vision Language Models (VLMs) on the Turkish high-school curriculum. We present a manually curated dataset of 1,854 five-choice Yükseköğretim Kurumları Sınavı (YKS) questions, evenly sampled from 309 topics, designed to comprehensively test multimodal reasoning over complex, exam-style problems. We establish performance baselines by evaluating both open-source and proprietary VLMs, revealing a 23-point accuracy gap between the best proprietary model (Gemini 2.5 Flash, 84.68%) and the strongest open-source model (Qwen-2.5VL-32B, 62.46%). To close this gap, we curated three large-scale multimodal training datasets (D, M, L) totaling 161.4 million tokens, augmented with solutions from advanced models (Gemini 2.0, Gemini 2.5) and video-assisted prompting for complex questions. Using our optimized QMSA (Question–Metadata–Solution–Answer) syntax, we fine-tuned Qwen-2.5VL-32B, achieving 78.59\% accuracy — a 25.82% relative improvement — narrowing the gap to proprietary performance to 7.9%. This work delivers three contributions: (1) a publicly available benchmark for Turkish academic evaluation of VLMs, (2) a high-quality, domain-specific training dataset enabling competitive open-source performance, and (3) an empirical demonstration that data-centric fine-tuning can substantially close the open–proprietary performance gap. We also outline key challenges, such as spatial reasoning and domain-specific diagram interpretation, and propose targeted post-training, tool-assisted reasoning, and synthetic data generation as promising future directions.
Benzer Tezler
- Exploring the capabilities of large language models in visual question answering: A new approach using question-driven image captions as prompts
Büyük dil modellerinin görsel soru yanıtlama yeteneklerinin keşfedilmesi: Soru odaklı görüntü altyazılarını istem olarak kullanan yeni bir yaklaşım
ÖVGÜ ÖZDEMİR
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiModelleme ve Simülasyon Ana Bilim Dalı
DOÇ. DR. ERDEM AKAGÜNDÜZ
- Improving the state estimation accuracy of real-time vision based multiple target tracking algorithms with unequal dimension interactive multiple model estimator
Eşit olmayan boyutlu etkileşimli çoklu model kestirim yöntemi ile gerçek zamanlı görüntü tabanlı çoklu hedef takip algoritmalarının durum tahmini hassasiyetinin iyileştirilmesi
YAĞIZ KURT
Yüksek Lisans
İngilizce
2023
Havacılık ve Uzay MühendisliğiOrta Doğu Teknik ÜniversitesiHavacılık ve Uzay Mühendisliği Ana Bilim Dalı
DOÇ. DR. HALİL ERSİN SÖKEN
- Developing learning algorithms for enhancing industrial machine vision systems and improving task accuracy of robotic manipulators
Endüstriyel yapay görme sistemlerini iyileştirmek ve robotik manipülatörlerin görev doğruluğunu artırmak için öğrenme algoritmalarının geliştirilmesi
DIYAR KHALIS BILAL
Doktora
İngilizce
2021
Mekatronik MühendisliğiSabancı ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
PROF. DR. MUSTAFA ÜNEL
- Towards improving the robustness and generalizability of camera-based bird's eye view segmentation models
Kuş bakışı görünüm segmentasyon modellerinin sağlamlığını ve genelleme yeteneğini geliştirme
MERVE RABİA BAĞCI
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ FATMA GÜNEY
- Improving edge detection using intersection consistency
Kesişimlerin tutarlılığı kullanılarak kenar bulmayı iyileştirme
SERDAR ÇİFTÇİ
Yüksek Lisans
İngilizce
2011
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Bölümü
PROF. DR. FATOŞ TÜNAY YARMAN VURAL
YRD. DOÇ. DR. SİNAN KALKAN