Çok modlu tıbbi veriler ile görme-dil tabanlı açıklanabilir karar destek sistemi
Explainable vision-language-based clinical decision support system using multimodal medical data
- Tez No: 1019592
- Danışmanlar: DR. ÖĞR. ÜYESİ FATMA ZEHRA SOLAK
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Bilgisayarla görme, Derin öğrenme, Karar destek sistemleri, Tıbbi görüntüleme, Computer vision, Deep learning, Decision support systems, Medical imaging
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Konya Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez çalışmasında, deri lezyonlarının görme-dil modelleri ile sınıflandırılması ve model kararlarının klinik açıdan daha yorumlanabilir hale getirilmesi amaçlanmıştır. Bu amaçla Kavram ve Kanıt Güdümlü Görme-Dil Modeli, CEG-VLM, yaklaşımı önerilmiştir. Çalışmada temel veri kaynağı olarak dermoskopik görüntüler, klinik görüntüler, tanı etiketleri ve 7 Noktalı Kontrol Listesi'ne dayalı dermoskopik kavram etiketleri içeren DERM7pt veri seti kullanılmıştır. Deneysel süreçte OpenAI CLIP, BioMedCLIP, DermLIP ve WhyLesionCLIP omurgaları aynı veri ayrımları, görev tanımları ve değerlendirme ölçütleriyle karşılaştırılmıştır. İlk aşamada modeller görev-özel eğitim yapılmadan Pure VLM düzeyinde değerlendirilmiş, ikinci aşamada ise aynı omurgalar önerilen CEG-VLM yapısı altında incelenmiştir. CEG-VLM, Pure VLM'nin görüntü-metin benzerliği mantığını korurken rezidüel görüntü uyarlama, dermatolojik kanıt promptları, 7 kriter kavram dalı, kanıta dayalı ağırlıklandırma ve adaptif dermoskopik-klinik görüntü füzyonunu bütünleşik bir yapı altında birleştirmektedir. Çalışmada ikili iyi huylu-kötü huylu sınıflandırma ve MEL, NEV, SK, BCC sınıflarından oluşan dört sınıflı tanı sınıflandırması olmak üzere iki görev ele alınmıştır. İkili görevde en güçlü ve dengeli performans DermLIP + CEG-VLM modeli ile elde edilmiş; bu model test kümesinde 0,8449 doğruluk, 0,8509 dengeli doğruluk, 0,8343 makro-F1, 0,9242 AUC ve 0,8699 kötü huylu duyarlılığı değerlerine ulaşmıştır. Dört sınıflı görevde ise genel metriklerde WhyLesionCLIP + CEG-VLM modeli öne çıkmış ve 0,7812 doğruluk, 0,7417 dengeli doğruluk, 0,6647 makro-F1, 0,9227 makro AUC ve 0,7417 makro duyarlılık üretmiştir. Açıklanabilirlik analizi; sınıf ve dermatolojik kanıt prompt katkıları, 7 kriter kavram çıktıları ve bölge kapatma tabanlı prompt ilişkili önem haritaları üzerinden gerçekleştirilmiştir. Ayrıca 7 kriter kavram çıktılarının uzman etiketleriyle uyumunu nicel olarak değerlendirmek amacıyla risk düzeyinde kavram uyum analizi uygulanmıştır. Bu analizde CEG-VLM, Pure VLM kavram prompt yoklama tabanına göre ikili görevde kavram uyum skorunu 0,4974'ten 0,6492'ye, dört sınıflı görevde ise 0,5696'dan 0,6894'e yükseltmiştir. Bulgular, CEG-VLM yaklaşımının deri lezyonu sınıflandırmasında performansı artırabildiğini ve karar sürecini dermatolojik kanıtlar, 7 kriter risk kavramları ve görsel önem bölgeleri üzerinden daha yorumlanabilir hale getirebildiğini göstermektedir. Bu yönüyle çalışma, dermatolojik görüntü analizinde performans ve açıklanabilirliği birlikte ele alan bütünleşik bir görme-dil modeli adaptasyon çerçevesi sunmaktadır.
Özet (Çeviri)
This thesis aims to classify skin lesions using vision-language models and to make model decisions more clinically interpretable. For this purpose, a Concept and Evidence-Guided Vision-Language Model, CEG-VLM, is proposed. The DERM7pt dataset was used as the primary data source, including dermoscopic images, clinical images, diagnosis labels, and dermoscopic concept annotations based on the 7-Point Checklist. In the experimental process, four vision-language model backbones, namely OpenAI CLIP, BioMedCLIP, DermLIP, and WhyLesionCLIP, were compared using the same data splits, task definitions, and evaluation metrics. In the first stage, the models were evaluated at the Pure VLM level without task-specific training. In the second stage, the same backbones were examined within the proposed CEG-VLM framework. CEG-VLM preserves the image-text similarity mechanism of Pure VLM while integrating residual image adaptation, dermatological evidence prompts, a 7-point concept branch, evidence-based weighting, and adaptive dermoscopic-clinical image fusion within a unified structure. Two diagnostic tasks were addressed in this study: binary benign-malignant classification and four-class diagnosis classification consisting of MEL, NEV, SK, and BCC classes. In the binary task, the strongest and most balanced performance was achieved by DermLIP + CEG-VLM, which obtained 0.8449 accuracy, 0.8509 balanced accuracy, 0.8343 macro-F1, 0.9242 AUC, and 0.8699 malignant sensitivity on the test set. In the four-class task, WhyLesionCLIP + CEG-VLM stood out in terms of overall metrics, achieving 0.7812 accuracy, 0.7417 balanced accuracy, 0.6647 macro-F1, 0.9227 macro AUC, and 0.7417 macro sensitivity. Explainability analysis was conducted through class and dermatological evidence prompt contributions, 7-point concept outputs, and occlusion-based prompt relevance maps. In addition, a risk-level concept alignment analysis was performed to quantitatively evaluate the agreement between the 7-point concept outputs and expert annotations. In this analysis, CEG-VLM increased the concept alignment score from 0.4974 to 0.6492 in the binary task and from 0.5696 to 0.6894 in the four-class task compared with the Pure VLM concept prompt probing baseline. The findings show that the CEG-VLM approach can improve skin lesion classification performance and make the decision-making process more interpretable through dermatological evidence, 7-point risk concepts, and visually relevant image regions. In this respect, this study presents an integrated vision-language model adaptation framework that jointly addresses performance and explainability in dermatological image analysis.
Benzer Tezler
- Multimodal medical visual question answering: Knowledge spaces and semantic segmentation for improved and explainable AI
Çok-kipli tıbbi görsel soru cevaplama: Bilgi uzayları ve anlamsal bölütleme ile gelişmiş ve açıklanabilir yapay zekâ
ZİYA ATA YAZICI
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Explainable medical ai systems for visual and speech based medical diagnosis
Görsel ve konuşma tabanlı tıbbi teşhis için açıklanabilir tıbbi yapay zeka sistemleri
ŞEVVAL İLHAN
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGebze Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. YUSUF SİNAN AKGÜL
- Machine-learning approaches for neurological disorder diagnosis from genomic and neuroimaging data
Genomik ve nörogörüntüleme verilerinden nörolojik bozukluk teşhisi için makine öğrenmesi yaklaşımları
İSMAİL BİLGEN
Doktora
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. BEHÇET UĞUR TÖREYİN
- A conceptual approach for design and development of serious games in maritime domain
Denizcilik alanında eğitici oyun dizaynı ve geliştirilmesi için konseptsel bir yaklaşım
SÜLEYMAN CİHAN GÜRBÜZ
Doktora
İngilizce
2024
Denizcilikİstanbul Teknik ÜniversitesiDeniz Ulaştırma İşletme Mühendisliği Ana Bilim Dalı
PROF. METİN ÇELİK
- Image compression based on centipede model
Kırkayak modeline dayalı görüntü sıkıştırma
BİNNUR KURT
Yüksek Lisans
İngilizce
1997
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
DOÇ. DR. MUHİTTİN GÖKMEN