Görsel soru cevaplama görevinde transformatör tabanlı önceden eğitilmiş modellerin tıbbi veri setleri üzerindeki performanslarının karşılaştırılması ve analizi
Comparison and analysis of the performance of transformer-based pre-trained models on medical datasets in a visual question answering
- Tez No: 993560
- Danışmanlar: DR. ÖĞR. ÜYESİ NİDA GÖKÇE NARİN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Patoloji, Computer Engineering and Computer Science and Control, Pathology
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Muğla Sıtkı Koçman Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Yapay Zeka Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Görsel Soru Cevaplama (GSC), yapay zeka çalışmalarında bilgisayarlı görü ve doğal dil işlemeyi birleştiren çok modlu bir görsel-dil modeli görevidir. GSC üzerinde, tıbbi verilerle yapılan çalışmalar ve tıbbın gerektirdiği uzmanlıktan dolayı Tıbbi Görsel Soru Cevaplama (Med-GSC) alt alanı ortaya çıkmıştır. Med-GSC uygulamaları, klinik karar destek sistemleri için büyük potansiyel taşımaktadır. Bu tez çalışması, genel amaçlı görevlerde yüksek başarı gösteren çeşitli transformatör tabanlı önceden eğitilmiş görüntü-dil modellerinin, farklı tıbbi uzmanlık alanlarına ait görüntüler üzerindeki genellenebilirlik kapasitelerini ve performanslarını incelemeyi amaçlamaktadır. Çalışma kapsamında; radyoloji odaklı VQA-RAD, patoloji odaklı PathVQA ve gastroenteroloji alanında bu görev için güncel bir veri kümesi olan Kvasir-VQA kullanılarak modellerin farklı klinik senaryolardaki başarısı test edilmiştir. Model olarak, görüntü-dil modellerinde yüksek performansa ve farklı mimarilere sahip BLIP, BLIP-2 ve Florence-2 modelleri seçilmiştir. Seçilen bu modeller, belirlenen tıbbi veri setleri üzerinde ince ayar (fine-tuning) işlemine tabi tutularak; radyolojik, patolojik ve endoskopik görüntüler üzerinden sorulan sorulara verdikleri yanıtların doğruluğu, değerlendirme metrikleri ve kayıp (loss) grafikleri bazlı karşılaştırmalı analizlerle değerlendirilmiştir. Elde edilen deneysel sonuçlar; modellerin tıbbi alana uyumu, GSC yetenekleri ve farklı tıbbi alanlar arasındaki performans çeşitliliklerini ortaya koymaktadır. Çalışmada, Kvasir-VQA üzerinde kendi ağırlıkları ile eğitilen BLIP ve Florence-2 modelleri, görsel soruları cevaplamada sırasıyla %79.67 ve %84.00 tam eşleşme doğruluğu ile en iyi performansı göstermiştir. Elde edilen sonuçlar, bu transformatör tabanlı mimarilerin Med-GSC alanında kullanımına dair somut çıkarımlar sunmakta ve farklı tıbbi görüntülere uyum sağlayabilen en etkili model yapılarının belirlenmesine katkı sağlamaktadır.
Özet (Çeviri)
Visual Question Answering (VQA) is a multimodal visual-language model task that combines computer vision and natural language processing in artificial intelligence studies. Due to the expertise required by medical data and the nature of medical studies, a subfield called Medical Visual Question Answering (Med-VQA) has emerged within VQA. Med-VQA applications hold great potential for clinical decision support systems. This thesis aims to examine the generalizability capabilities and performance of various transformer-based pre-trained image-language models that demonstrate high success in general-purpose tasks, across images from different medical specialties. The study uses radiology-focused VQA-RAD, pathology-focused PathVQA, and Kvasir-VQA, a current dataset for this task in gastroenterology, to test the success of the models in different clinical scenarios. BLIP, BLIP-2, and Florence-2 models, which have high performance and different architectures in image-language models, were selected. These selected models were subjected to fine-tuning on the determined medical datasets; The accuracy of the responses given by the models to questions posed over radiological, pathological, and endoscopic images was evaluated through comparative analyses based on evaluation metrics and loss graphs. The experimental results reveal the models' fit to the medical field, their GSC capabilities, and the variations in performance across different medical fields. In this study, the BLIP and Florence-2 models, trained on Kvasir-VQA with their own weights, showed the best performance in answering visual questions with 79.67% and 84.00% perfect match accuracy, respectively. These results offer concrete implications for the use of these transformer-based architectures in the Med-GSC field and contribute to identifying the most effective model structures that can adapt to different medical images.
Benzer Tezler
- Tıbbi görevler için çok modlu büyük dil modellerinin performansının iyileştirilmesi
Enhancing the performance of multimodal large language models for medical tasks
MUHAMMED ONUR ULU
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. GÖKHAN BİLGİN
- Exploring the capabilities of large language models in visual question answering: A new approach using question-driven image captions as prompts
Büyük dil modellerinin görsel soru yanıtlama yeteneklerinin keşfedilmesi: Soru odaklı görüntü altyazılarını istem olarak kullanan yeni bir yaklaşım
ÖVGÜ ÖZDEMİR
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiModelleme ve Simülasyon Ana Bilim Dalı
DOÇ. DR. ERDEM AKAGÜNDÜZ
- Görsel soru cevaplama probleminde bağlamsal vektörlerin performans analizi
Performance analysis of contextual vectors in visual question answering problem
ÖZLEM HAKDAĞLI
Yüksek Lisans
Türkçe
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBursa Uludağ ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. METİN BİLGİN
- Knowledge-based visual question answering
Bilgi tabanlı görsel soru cevaplama
ZİŞAN YALÇINKAYA
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ANIL BAŞ
- Multimodal medical visual question answering: Knowledge spaces and semantic segmentation for improved and explainable AI
Çok-kipli tıbbi görsel soru cevaplama: Bilgi uzayları ve anlamsal bölütleme ile gelişmiş ve açıklanabilir yapay zekâ
ZİYA ATA YAZICI
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL