Görüntü dönüştürücü mimarileri kullanarak açıklanabilirlik temelli akciğer kanser tespiti ve otomatik tomografi rapor üretimi
Explainability-based lung cancer detection and automatic tomography report generation using vision transformer architectures
- Tez No: 1024856
- Danışmanlar: DOÇ. DR. ÖZAL YILDIRIM
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Fırat Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Yazılım Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Akciğer kanseri, GLOBOCAN 2022 verilerine göre yılda yaklaşık 2,5 milyon yeni olgu ve 1,8 milyon ölüme neden olarak hem görülme sıklığı hem de kansere bağlı ölümler açısından dünyada ilk sırada yer almaktadır. Tanı sürecinde lezyonların tespiti ve biyopsi kararları büyük ölçüde toraks Bilgisayarlı Tomografi (Computed Tomography, CT) görüntüleri ile bunlara eşlik eden radyoloji raporlarının değerlendirilmesine dayanmaktadır. Bununla birlikte, CT görüntülerinin manuel değerlendirilmesi zaman ve deneyim gerektirmekte; gözlemciler arası yorum farklılıkları, artan klinik iş yükü ve küçük ya da belirsiz lezyonların gözden kaçırılabilmesi gibi önemli sınırlılıklar içermektedir. Bu sınırlılıkların giderilmesi amacıyla son yıllarda derin öğrenme tabanlı bilgisayar destekli tanı sistemleri geliştirilmiştir. Ancak mevcut yaklaşımların büyük bölümü tek kesit analiziyle sınırlı kalmakta, açıklanabilirlik performansını niceliksel olarak doğrulamamakta ve yalnızca tek dilde radyoloji raporu üretimine odaklanmaktadır. Bu tezde, toraks CT görüntülerinden hasta düzeyinde akciğer kanseri sınıflandırmasını Türkçe ve İngilizce radyoloji raporu üretimiyle tek bir uçtan uca açıklanabilir mimaride bütünleştiren yeni bir çerçeve önerilmektedir. Önerilen yaklaşımda, çoklu kesitli Görüntü Dönüştürücü (Vision Transformer, ViT) tabanlı bir kodlayıcıdan elde edilen temsil uzayı, Öğrenilebilir Sorgu Tabanlı Dikkat Havuzlaması (Learnable Query Attention Pooling, LQAP) mekanizması ile hasta düzeyinde birleştirilmekte ve bu temsil, çapraz dikkat (cross-attention) ile koşullandırılmış GPT-2 tabanlı bir kod çözücü aracılığıyla yapılandırılmış radyoloji raporlarına dönüştürülmektedir. Modelin eğitim ve doğrulama süreçleri, Küçük Hücreli Akciğer Kanseri (Small Cell Lung Cancer, SCLC), Küçük Hücreli Dışı Akciğer Kanseri (Non-Small Cell Lung Cancer, NSCLC) ve normal olguları içeren bu tez kapsamında derlenmiş LungCA adlı veri seti üzerinde yürütülmüştür. Test kümesinde önerilen çerçeve, Türkçe senaryoda \%97,40 doğruluk ve \%97,35 makro F1, İngilizce senaryoda \%94,81 doğruluk ve \%94,70 makro F1 değerlerine ulaşmıştır. Üretilen Grad-CAM ısı haritaları, uzman sınır kutularıyla 0,45 ortalama IoU ve \%85,5 Pointing Game doğruluğu düzeyinde hizalanmış; güncel çok kipli büyük dil modellerine karşı özellikle SCLC alt tip ayrımında belirgin üstünlük sağlanmıştır. Elde edilen sonuçlar doğrultusunda önerilen çerçeve, yüksek tanısal başarımı, niceliksel olarak doğrulanmış açıklanabilirliği ve çift dilli otomatik raporlamayı tek bir uçtan uca mimaride birleştiren güvenilir bir klinik karar destek aracı olarak öne çıkmakta ve radyoloji iş akışını hızlandırabilecek güçlü bir klinik kullanım potansiyeli taşımaktadır.
Özet (Çeviri)
According to GLOBOCAN 2022 data, lung cancer ranks first globally in terms of both incidence and cancer-related deaths, causing approximately 2.5 million new cases and 1.8 million deaths annually. In the diagnostic process, the detection of lesions and biopsy decisions largely rely on the evaluation of thoracic Computed Tomography (CT) images and their accompanying radiology reports. However, the manual evaluation of CT images requires time and experience; it involves significant limitations such as inter-observer interpretation differences, an increasing clinical workload, and the possibility of overlooking small or ambiguous lesions. In order to overcome these limitations, deep learning-based computer-aided diagnosis systems have been developed in recent years. Nevertheless, the majority of existing approaches are limited to single-slice analysis, fail to quantitatively validate explainability performance, and focus solely on generating radiology reports in a single language. In this thesis, a novel framework is proposed that integrates patient-level lung cancer classification from thoracic CT images with Turkish and English radiology report generation in a single end-to-end explainable architecture. In the proposed approach, the representation space obtained from a multi-slice Vision Transformer (ViT)-based encoder is aggregated at the patient level using a Learnable Query Attention Pooling (LQAP) mechanism, and this representation is transformed into structured radiology reports via a GPT-2-based decoder conditioned by cross-attention. The training and validation processes of the model were conducted on the LungCA dataset, compiled within the scope of this thesis, which includes Small Cell Lung Cancer (SCLC), Non-Small Cell Lung Cancer (NSCLC), and normal cases. On the test set, the proposed framework achieved 97.40\% accuracy and 97.35\% macro F1 in the Turkish scenario, and 94.81\% accuracy and 94.70\% macro F1 in the English scenario. The generated Grad-CAM heatmaps aligned with expert bounding boxes at a level of 0.45 mean IoU and 85.5\% Pointing Game accuracy; a distinct superiority was achieved against state-of-the-art multimodal large language models, particularly in SCLC sub-type discrimination. Based on the obtained results, the proposed framework stands out as a reliable clinical decision support tool that combines high diagnostic performance, quantitatively validated explainability, and bilingual automated reporting in a single end-to-end architecture, and it carries a strong clinical use potential that can accelerate the radiology workflow.
Benzer Tezler
- Multimodal medical visual question answering: Knowledge spaces and semantic segmentation for improved and explainable AI
Çok-kipli tıbbi görsel soru cevaplama: Bilgi uzayları ve anlamsal bölütleme ile gelişmiş ve açıklanabilir yapay zekâ
ZİYA ATA YAZICI
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Yerel görünüm ve derin modeller kullanarak hibrit bir yüz tanıma yaklaşımı
A hybrid face recognition approach using local appearance and deep models
MERT ARI
Yüksek Lisans
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Quantum image dataset transform (QIDT)
Başlık çevirisi yok
ZORKAN ERKAN
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Topkapı ÜniversitesiYazılım Mühendisliği Ana Bilim Dalı
DOÇ. DR. CEVAT RAHEBİ
- Transfer learning based super resolution of aerial images and the effects of the super resolution on object detection
Öğrenme transferi temelli hava aracı görüntülerinin süper çözünürlüğü ve süper çözünürlüğün nesne tespitine etkileri
ASLAN AHMET HAYKIR
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. İLKAY ÖKSÜZ
- 8.5 GHz FMCW radarı kullanarak araç, insan ve dron üzerinden oluşturulan menzil doppler haritalarının uzamsal boyutlarda sınıflandırılması
Spatial classification of range doppler maps generated from vehicles, humans and drones using 8.5 GHz FMCW radar
ALKIN ÖZKURTOĞLU
Yüksek Lisans
Türkçe
2025
Savunma ve Savunma TeknolojileriBaşkent ÜniversitesiSavunma Teknolojileri ve Sistemleri Ana Bilim Dalı
DR. ÖĞR. ÜYESİ MEHMET DİKMEN