Görsel dil modellerinin görüntü sınıflandırmadaki performanslarının karşılaştırılması
Performance comparison of vision-language models in image classification
- Tez No: 983266
- Danışmanlar: DOÇ. DR. MEHMET ERKAN YÜKSEL
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Burdur Mehmet Akif Ersoy Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Görsel Dil Modelleri (Vision-Language Models, VLMs), görsel ve metinsel modaliteleri bütünleştirerek görüntü sınıflandırmasında yeni bir paradigma ortaya koymaktadır. Multimodal görevlerde yüksek başarı elde eden bu modellerin, yalnızca görsel sınıflandırma bağlamındaki etkinlikleri ise yeterince incelenmemiştir. Bu tez çalışmasında, güncel sekiz VLM'nin — GPT-4o, GPT-4o-mini, Gemini-flash-1.5-8b, LLaMA-3.2-90B-vision-instruct, Grok-2-vision-1212, Qwen2.5-vl-7b-instruct, Claude-3.5-sonnet ve Pixtral-large-2411 — dört farklı veri kümesi üzerinde kapsamlı ve metrik odaklı karşılaştırmalı bir analizi sunulmaktadır. Deneyler, CIFAR-10, ImageNet, COCO ve alana özgü New Plant Diseases veri kümeleri kullanılarak; sıfır örnekli ve az örnekli senaryolarda doğruluk, kesinlik, duyarlılık, F1-skoru ve sağlamlık ölçütleri üzerinden gerçekleştirilmiştir. Elde edilen nicel bulgular, GPT-4o'nun tüm temel metriklerde sürekli olarak en yüksek performansı sergilediğini (örneğin CIFAR-10 üzerinde doğruluk: 0,91; F1-skoru: 0,91) ve Pixtral-large-2411 gibi görece daha hafif modelleri (doğruluk: 0,13; F1-skoru: 0,13) belirgin şekilde geride bıraktığını göstermektedir. ImageNet ve COCO veri kümelerindeki yüksek başarıların, büyük olasılıkla eğitim öncesi veri örtüşmesinden kaynaklandığı düşünülürken; New Plant Diseases veri setinde gözlenen kayda değer performans düşüşü, domain adaptasyonu zorluklarını ortaya koymaktadır. Bu bulgular, gerçek dünya görüntü sınıflandırma uygulamalarına yönelik VLM'lerin geliştirilmesinde sağlam, parametre verimli ve domain adaptasyonuna duyarlı ince ayar stratejilerine olan ihtiyacı vurgulamaktadır.
Özet (Çeviri)
Vision-Language Models (VLMs) have introduced a new paradigm in image classification by integrating visual and textual modalities. Although these models achieve remarkable success in multimodal tasks, their effectiveness in purely visual classification has remained relatively underexplored. This thesis conducts a comprehensive, metric-driven comparative analysis of eight state-of-the-art VLMs—GPT-4o, GPT-4o-mini, Gemini-flash-1.5-8b, LLaMA-3.2-90B-vision-instruct, Grok-2-vision-1212, Qwen2.5-vl-7b-instruct, Claude-3.5-sonnet, and Pixtral-large-2411—across four datasets: CIFAR-10, ImageNet, COCO, and a domain-specific New Plant Diseases dataset. Model performance was systematically evaluated in zero-shot and few-shot settings using accuracy, precision, recall, F1-score, and robustness as primary metrics. The results demonstrate that GPT-4o consistently achieves the highest performance across standard benchmarks (e.g., accuracy: 0.91; F1-score: 0.91 on CIFAR-10), substantially outperforming lighter models such as Pixtral-large-2411 (accuracy: 0.13; F1-score: 0.13). While the near-optimal results observed on ImageNet and COCO are likely attributable to pre-training data overlap, the marked performance degradation on the New Plant Diseases dataset highlights persistent domain adaptation challenges. Overall, these findings underscore the necessity of robust, parameter-efficient, and domain-adaptive fine-tuning strategies to improve the applicability of VLMs in real-world image classification tasks.
Benzer Tezler
- Facial expression analysis foran online usability evaluation platform
Çevrimiçi kullanılabilirlik değerlendirme platformu için yüz ifadesi analizi
ALİ AZMOUDEH
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Görüntü sınıflandırmada yineleyen derin ağ ve görü dönüştürücü modellerinin karşılaştırılması
Comparison of recurrent deep network and vision transformer models in image classification
OĞUZHAN BUBO
Yüksek Lisans
Türkçe
2023
Elektrik ve Elektronik MühendisliğiSakarya ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ BURHAN BARAKLI
- Exploring the capabilities of large language models in visual question answering: A new approach using question-driven image captions as prompts
Büyük dil modellerinin görsel soru yanıtlama yeteneklerinin keşfedilmesi: Soru odaklı görüntü altyazılarını istem olarak kullanan yeni bir yaklaşım
ÖVGÜ ÖZDEMİR
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiModelleme ve Simülasyon Ana Bilim Dalı
DOÇ. DR. ERDEM AKAGÜNDÜZ
- Vcompact vision–language models for low-resource Turkish image captioning: Projection-based fusion strategies
Düşük kaynaklı Türkçe görüntü açıklama için kompakt görsel–dil modellerinde projeksiyon tabanlı füzyon stratejileri
ULVİ DEMİRSOY
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGalatasaray ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ UZAY ÇETİN
- Tıbbi görevler için çok modlu büyük dil modellerinin performansının iyileştirilmesi
Enhancing the performance of multimodal large language models for medical tasks
MUHAMMED ONUR ULU
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. GÖKHAN BİLGİN