Geri Dön

Görsel dil modellerinin görüntü sınıflandırmadaki performanslarının karşılaştırılması

Performance comparison of vision-language models in image classification

  1. Tez No: 983266
  2. Yazar: DOĞUKAN ÖZEREN
  3. Danışmanlar: DOÇ. DR. MEHMET ERKAN YÜKSEL
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Burdur Mehmet Akif Ersoy Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Görsel Dil Modelleri (Vision-Language Models, VLMs), görsel ve metinsel modaliteleri bütünleştirerek görüntü sınıflandırmasında yeni bir paradigma ortaya koymaktadır. Multimodal görevlerde yüksek başarı elde eden bu modellerin, yalnızca görsel sınıflandırma bağlamındaki etkinlikleri ise yeterince incelenmemiştir. Bu tez çalışmasında, güncel sekiz VLM'nin — GPT-4o, GPT-4o-mini, Gemini-flash-1.5-8b, LLaMA-3.2-90B-vision-instruct, Grok-2-vision-1212, Qwen2.5-vl-7b-instruct, Claude-3.5-sonnet ve Pixtral-large-2411 — dört farklı veri kümesi üzerinde kapsamlı ve metrik odaklı karşılaştırmalı bir analizi sunulmaktadır. Deneyler, CIFAR-10, ImageNet, COCO ve alana özgü New Plant Diseases veri kümeleri kullanılarak; sıfır örnekli ve az örnekli senaryolarda doğruluk, kesinlik, duyarlılık, F1-skoru ve sağlamlık ölçütleri üzerinden gerçekleştirilmiştir. Elde edilen nicel bulgular, GPT-4o'nun tüm temel metriklerde sürekli olarak en yüksek performansı sergilediğini (örneğin CIFAR-10 üzerinde doğruluk: 0,91; F1-skoru: 0,91) ve Pixtral-large-2411 gibi görece daha hafif modelleri (doğruluk: 0,13; F1-skoru: 0,13) belirgin şekilde geride bıraktığını göstermektedir. ImageNet ve COCO veri kümelerindeki yüksek başarıların, büyük olasılıkla eğitim öncesi veri örtüşmesinden kaynaklandığı düşünülürken; New Plant Diseases veri setinde gözlenen kayda değer performans düşüşü, domain adaptasyonu zorluklarını ortaya koymaktadır. Bu bulgular, gerçek dünya görüntü sınıflandırma uygulamalarına yönelik VLM'lerin geliştirilmesinde sağlam, parametre verimli ve domain adaptasyonuna duyarlı ince ayar stratejilerine olan ihtiyacı vurgulamaktadır.

Özet (Çeviri)

Vision-Language Models (VLMs) have introduced a new paradigm in image classification by integrating visual and textual modalities. Although these models achieve remarkable success in multimodal tasks, their effectiveness in purely visual classification has remained relatively underexplored. This thesis conducts a comprehensive, metric-driven comparative analysis of eight state-of-the-art VLMs—GPT-4o, GPT-4o-mini, Gemini-flash-1.5-8b, LLaMA-3.2-90B-vision-instruct, Grok-2-vision-1212, Qwen2.5-vl-7b-instruct, Claude-3.5-sonnet, and Pixtral-large-2411—across four datasets: CIFAR-10, ImageNet, COCO, and a domain-specific New Plant Diseases dataset. Model performance was systematically evaluated in zero-shot and few-shot settings using accuracy, precision, recall, F1-score, and robustness as primary metrics. The results demonstrate that GPT-4o consistently achieves the highest performance across standard benchmarks (e.g., accuracy: 0.91; F1-score: 0.91 on CIFAR-10), substantially outperforming lighter models such as Pixtral-large-2411 (accuracy: 0.13; F1-score: 0.13). While the near-optimal results observed on ImageNet and COCO are likely attributable to pre-training data overlap, the marked performance degradation on the New Plant Diseases dataset highlights persistent domain adaptation challenges. Overall, these findings underscore the necessity of robust, parameter-efficient, and domain-adaptive fine-tuning strategies to improve the applicability of VLMs in real-world image classification tasks.

Benzer Tezler

  1. Facial expression analysis foran online usability evaluation platform

    Çevrimiçi kullanılabilirlik değerlendirme platformu için yüz ifadesi analizi

    ALİ AZMOUDEH

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. HAZIM KEMAL EKENEL

  2. Görüntü sınıflandırmada yineleyen derin ağ ve görü dönüştürücü modellerinin karşılaştırılması

    Comparison of recurrent deep network and vision transformer models in image classification

    OĞUZHAN BUBO

    Yüksek Lisans

    Türkçe

    Türkçe

    2023

    Elektrik ve Elektronik MühendisliğiSakarya Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ BURHAN BARAKLI

  3. Exploring the capabilities of large language models in visual question answering: A new approach using question-driven image captions as prompts

    Büyük dil modellerinin görsel soru yanıtlama yeteneklerinin keşfedilmesi: Soru odaklı görüntü altyazılarını istem olarak kullanan yeni bir yaklaşım

    ÖVGÜ ÖZDEMİR

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Modelleme ve Simülasyon Ana Bilim Dalı

    DOÇ. DR. ERDEM AKAGÜNDÜZ

  4. Vcompact vision–language models for low-resource Turkish image captioning: Projection-based fusion strategies

    Düşük kaynaklı Türkçe görüntü açıklama için kompakt görsel–dil modellerinde projeksiyon tabanlı füzyon stratejileri

    ULVİ DEMİRSOY

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGalatasaray Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ UZAY ÇETİN

  5. Tıbbi görevler için çok modlu büyük dil modellerinin performansının iyileştirilmesi

    Enhancing the performance of multimodal large language models for medical tasks

    MUHAMMED ONUR ULU

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. GÖKHAN BİLGİN