Geri Dön

Improving vision LLM performance on standardized test questions

Görsel dil modellerinin üniversite sınavı performansının geliştirilmesi

  1. Tez No: 974946
  2. Yazar: ŞEFİK EGEMEN SERT
  3. Danışmanlar: DOÇ. DR. ŞEYDA ERTEKİN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Orta Doğu Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışmada, açık kaynaklı görsel dil modellerinin, daha önce herhangi bir kıyaslama standardının bulunmadığı bir alan olan karmaşık ve çok-modlu Türk lise sınavı sorularında kapalı sistemlere rakip olabilecek şekilde eğitilebileceği gösterilmektedir. Bu tez, Görsel Dil Modelleri'nin (GDM) Türk lise müfredatı üzerindeki performansını değerlendirmek için ilk standartlaştırılmış kıyaslamayı sunmaktadır. Çok-modlu akıl yürütmeyi kapsamlı bir şekilde test etmek amacıyla tasarlanmış, 309 konudan eşit olarak örneklenmiş, elle derlenmiş 1.854 adet beş seçenekli Yükseköğretim Kurumları Sınavı (YKS) sorusundan oluşan bir veri seti takdim edilmektedir. Hem açık kaynaklı hem de kapalı GDM'ler değerlendirilerek başlangıç performans seviyeleri belirlenmiş ve en iyi kapalı model (Gemini 2.5 Flash, %84,68) ile en güçlü açık kaynaklı model (Qwen-2.5VL-32B, %62,46) arasında 23 puanlık bir doğruluk farkı ortaya konmuştur. Bu farkı kapatmak amacıyla, gelişmiş modellerden (Gemini 2.0, Gemini 2.5) elde edilen çözümlerle ve karmaşık sorular için video destekli yönlendirme ile zenginleştirilmiş, toplam 161,4 milyon jetondan oluşan üç büyük ölçekli çok-modlu eğitim veri seti (D, M, L) derlenmiştir. Optimize edilmiş QMSA (Soru–Üstveri–Çözüm–Cevap) sözdizimi kullanılarak Qwen-2.5VL-32B modeline ince ayar yapılmış ve %25,82'lik göreceli bir iyileşme ile %78,59 doğruluk oranına ulaşılmıştır. Bu sonuç, kapalı model performansıyla aradaki farkı %7,9'a düşürmüştür. Bu çalışmanın üç temel katkısı bulunmaktadır: (1) GDM'lerin Türkçe akademik değerlendirmesi için kamuya açık bir kıyaslama, (2) rekabetçi açık kaynak performansı sağlayan yüksek kaliteli ve alana özgü bir eğitim veri seti ve (3) veri merkezli ince ayarın, açık kaynak ile kapalı modeller arasındaki performans farkını önemli ölçüde kapatabildiğinin deneysel olarak gösterilmesi. Ayrıca, mekânsal akıl yürütme ve alana özgü diyagram yorumlama gibi temel zorlukların altı çizilmekte ve hedeflenmiş eğitim sonrası süreçler, araç destekli akıl yürütme ve sentetik veri üretimi, gelecek vaat eden araştırma yönleri olarak önerilmektedir.

Özet (Çeviri)

In our research, we show that open-source vision-language models can be trained to rival proprietary systems on complex, multimodal Turkish high-school exam questions — a domain where no benchmark previously existed. This thesis introduces the first standardized benchmark for evaluating Vision Language Models (VLMs) on the Turkish high-school curriculum. We present a manually curated dataset of 1,854 five-choice Yükseköğretim Kurumları Sınavı (YKS) questions, evenly sampled from 309 topics, designed to comprehensively test multimodal reasoning over complex, exam-style problems. We establish performance baselines by evaluating both open-source and proprietary VLMs, revealing a 23-point accuracy gap between the best proprietary model (Gemini 2.5 Flash, 84.68%) and the strongest open-source model (Qwen-2.5VL-32B, 62.46%). To close this gap, we curated three large-scale multimodal training datasets (D, M, L) totaling 161.4 million tokens, augmented with solutions from advanced models (Gemini 2.0, Gemini 2.5) and video-assisted prompting for complex questions. Using our optimized QMSA (Question–Metadata–Solution–Answer) syntax, we fine-tuned Qwen-2.5VL-32B, achieving 78.59\% accuracy — a 25.82% relative improvement — narrowing the gap to proprietary performance to 7.9%. This work delivers three contributions: (1) a publicly available benchmark for Turkish academic evaluation of VLMs, (2) a high-quality, domain-specific training dataset enabling competitive open-source performance, and (3) an empirical demonstration that data-centric fine-tuning can substantially close the open–proprietary performance gap. We also outline key challenges, such as spatial reasoning and domain-specific diagram interpretation, and propose targeted post-training, tool-assisted reasoning, and synthetic data generation as promising future directions.

Benzer Tezler

  1. Exploring the capabilities of large language models in visual question answering: A new approach using question-driven image captions as prompts

    Büyük dil modellerinin görsel soru yanıtlama yeteneklerinin keşfedilmesi: Soru odaklı görüntü altyazılarını istem olarak kullanan yeni bir yaklaşım

    ÖVGÜ ÖZDEMİR

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Modelleme ve Simülasyon Ana Bilim Dalı

    DOÇ. DR. ERDEM AKAGÜNDÜZ

  2. Improving the state estimation accuracy of real-time vision based multiple target tracking algorithms with unequal dimension interactive multiple model estimator

    Eşit olmayan boyutlu etkileşimli çoklu model kestirim yöntemi ile gerçek zamanlı görüntü tabanlı çoklu hedef takip algoritmalarının durum tahmini hassasiyetinin iyileştirilmesi

    YAĞIZ KURT

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Havacılık ve Uzay MühendisliğiOrta Doğu Teknik Üniversitesi

    Havacılık ve Uzay Mühendisliği Ana Bilim Dalı

    DOÇ. DR. HALİL ERSİN SÖKEN

  3. Developing learning algorithms for enhancing industrial machine vision systems and improving task accuracy of robotic manipulators

    Endüstriyel yapay görme sistemlerini iyileştirmek ve robotik manipülatörlerin görev doğruluğunu artırmak için öğrenme algoritmalarının geliştirilmesi

    DIYAR KHALIS BILAL

    Doktora

    İngilizce

    İngilizce

    2021

    Mekatronik MühendisliğiSabancı Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    PROF. DR. MUSTAFA ÜNEL

  4. Towards improving the robustness and generalizability of camera-based bird's eye view segmentation models

    Kuş bakışı görünüm segmentasyon modellerinin sağlamlığını ve genelleme yeteneğini geliştirme

    MERVE RABİA BAĞCI

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ FATMA GÜNEY

  5. Improving edge detection using intersection consistency

    Kesişimlerin tutarlılığı kullanılarak kenar bulmayı iyileştirme

    SERDAR ÇİFTÇİ

    Yüksek Lisans

    İngilizce

    İngilizce

    2011

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Bölümü

    PROF. DR. FATOŞ TÜNAY YARMAN VURAL

    YRD. DOÇ. DR. SİNAN KALKAN