A novel energy-efficient attention-based transformer model for medical images
Tıbbi görüntüler için enerji verimli yeni bir dikkat tabanlı transformer modeli
- Tez No: 1005706
- Danışmanlar: DOÇ. DR. MURAT GEZER
- Tez Türü: Doktora
- Konular: Bilim ve Teknoloji, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Science and Technology, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İstanbul Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Enformatik Ana Bilim Dalı
- Bilim Dalı: Enformatik Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Derin öğrenme, tıbbi görüntü analizinde otomatik tarama, tanı ve karar destek sistemlerini mümkün kılarak birçok görüntüleme yönteminde temel bir araç haline gelmiştir. Bununla birlikte, özellikle Vision Transformer (ViT) tabanlı son teknoloji modeller yüksek hesaplama maliyetine sahiptir ve bu durum, tıbbi yapay zekâ sistemlerinin enerji tüketimi, donanım gereksinimleri ve çevresel etkileri hakkında kaygılara yol açmaktadır. Bu tez, bu kaygıları ele almak üzere, Yeşil AI ilkeleriyle uyumlu olacak şekilde tasarlanan hafif ve enerji açısından duyarlı bir dönüştürücü tabanlı tıbbi görüntü sınıflandırma modeli önermektedir.- Önerilen mimari, TensorQuadtree tabanlı yama çıkarma aşamasını Global Quadtree Attention (GQA) katmanı ile birleştirmektedir. Sabit çözünürlüklü yamalar kullanmak yerine, TensorQuadtree girdi görüntülerini uyarlamalı olarak değişken boyutlu bloklara ayırır; yapısal olarak karmaşık veya klinik açıdan önemli bölgelere daha fazla, homojen bölgelere ise daha az token atar. Bu token'lar, toplam token sayısını ve işlem miktarını düşük tutarken uzun menzilli bağlamsal ilişkileri koruyan kompakt bir küresel dikkat bloğundan geçirilir. Model, MedMNIST koleksiyonundan seçilen dört temsil edici 2B veri kümesi—BreastMNIST, PneumoniaMNIST, DermaMNIST ve BloodMNIST—üzerinde değerlendirilmiştir. Bu veri kümeleri ikili ve çok sınıflı görevleri, gri seviye ve RGB görüntüleri ile dengeli ve dengesiz sınıf dağılımlarını bir arada sunmaktadır. Deneyler, quadtree bölme ölçütü, temel yama boyutu, odak (focal) kaybı hiperparametreleri ve quadtree eşik değerinin tahmin başarımı ile hesaplama verimliliği arasındaki dengeye etkisini incelemektedir. Dört veri kümesi genelinde önerilen TensorQuadtree + GQA modeli, PneumoniaMNIST için 0.846 doğruluk ve 0.917 AUROC; BloodMNIST için 0.967 doğruluk ve 0.998 makro-AUROC değerleri elde ederek yüksek duyarlılığı korurken klinik açıdan anlamlı doğruluk, AUROC ve F1 skorlarına ulaşmaktadır. Hesaplamalı açıdan bakıldığında, mimari son yapılandırmada yalnızca 0.158 milyon parametre ve görüntü başına 0.091 GOP gerektiren son derece kompakt bir yapıya sahiptir; bu değerler, 117.26 milyon parametre ve 12.90 GOP gerektiren MedViTv2-L taban çizgisine kıyasla belirgin ölçüde düşüktür. Gecikme süresi, işleme hızı ve tepe GPU bellek kullanımı da modelin kısıtlı kaynaklara sahip ortamlara uygun olduğunu, buna karşın rekabetçi tahmin performansını koruduğunu göstermektedir. Sonuçlar, uyarlamalı quadtree tabanlı tokenleştirme ile küresel dikkatin birlikte kullanılmasının, tanısal performans ile hesaplama ayak izi arasında etkili bir denge sağlayabildiğini ve daha sürdürülebilir tıbbi görüntü analizi için somut bir katkı sunduğunu ortaya koymaktadır.
Özet (Çeviri)
Deep learning has become a central tool in medical image analysis, enabling automated screening, diagnosis, and decision support across a wide range of imaging modalities. However, many state-of-the-art models—particularly Vision Transformers (ViTs)—are computationally intensive, which raises concerns about energy consumption, hardware requirements, and the environmental footprint of medical AI systems. This thesis addresses these concerns by proposing a lightweight, energy-aware transformer model for medical image classification that is explicitly designed in line with Green AI principles. The proposed architecture combines a TensorQuadtree-based patch extraction stage with a Global Quadtree Attention (GQA) layer. Instead of processing all image regions at a fixed resolution, the TensorQuadtree adaptively partitions input images into variable-sized blocks, assigning more tokens to structurally complex or clinically informative regions and fewer tokens to homogeneous areas. These tokens are then processed by a compact transformer block with global attention, allowing the model to retain long-range contextual reasoning while keeping the total number of tokens and operations low. The model is evaluated on four representative 2D datasets from the MedMNIST collection—BreastMNIST, PneumoniaMNIST, DermaMNIST, and BloodMNIST—which together cover binary and multi-class tasks, grayscale and RGB images, and both balanced and imbalanced class distributions. Experiments investigate the impact of quadtree split criteria, base patch size, focal loss hyperparameters, and quadtree threshold settings on the trade-off between predictive performance and computational efficiency. Across all datasets, the proposed TensorQuadtree + GQA model achieves clinically meaningful accuracy, AUROC, and F1 scores—for example, an accuracy of 0.846 and AUROC of 0.917 on PneumoniaMNIST, and an accuracy of 0.967 with macro-AUROC of 0.998 on BloodMNIST—while maintaining strong sensitivity for disease-positive cases. From a computational standpoint, the architecture is extremely compact, requiring only 0.158 million parameters and 0.091 GOPs per image in its final configuration, compared with 117.26 million parameters and 12.90 GOPs for a MedViTv2-L baseline. Latency, throughput, and peak GPU memory usage further indicate that the model is well suited to resource-constrained environments while preserving competitive predictive performance. Overall, the results show that adaptive, quadtree-based tokenization combined with global attention can deliver an effective balance between diagnostic performance and computational footprint, contributing to more sustainable medical image analysis.
Benzer Tezler
- Nickel and cobalt boride based high-capacity electrodes: production, characterization and supercapacitor performance
Nikel ve kobalt borür esaslı yüksek kapasiteli elektrotlar: üretimi, karakterizasyonu ve süperkapasitör performansı
MEHTAP ARSLAN KABA
Doktora
İngilizce
2026
Metalurji Mühendisliğiİstanbul Teknik ÜniversitesiMetalurji ve Malzeme Mühendisliği Ana Bilim Dalı
PROF. DR. GÜLDEM KARTAL ŞİRELİ
- Moleküler baskılı floresannanoparçacıkların sentezlenmesi ve sensörsistemlerinde kullanımlarının incelenmesi
Synthesis of molecularly imprintedfluorescent nanoparticles and their use insensor systems
CEREN KAYMAZ KUŞÇUOĞLU
Yüksek Lisans
Türkçe
2020
Polimer Bilim ve TeknolojisiHacettepe ÜniversitesiPolimer Bilim ve Teknolojisi Ana Bilim Dalı
DOÇ. DR. MURAT BARSBAY
- Beyin tümörü segmentasyonu için yeni bir üç boyutlu U-Net tabanlı derin öğrenme mimarisi
A novel three-dimensional U-Net based deep learning architecture for brain tumor segmentation
AYŞE BAŞTUĞ KOÇ
Doktora
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. DEVRİM AKGÜN
- Experimental physical modeling of hydrodynamics of a fixed owc with development of analytical and numerical models
Sabit salınımlı su sütunu dalga enerji dönüştürücü hidrodinamiğinin deneysel analitik ve nümerik olarak modellenmesi
ANIL ÇELİK
Doktora
İngilizce
2019
İnşaat Mühendisliğiİstanbul Teknik ÜniversitesiKıyı Bilimleri Mühendisliği Ana Bilim Dalı
PROF. DR. ABDÜSSELAM ALTUNKAYNAK
- Elektrik enerji sistemlerinde güç kalitesi
Power quality in electrical energy systems
ALİ GEMİCİ
Yüksek Lisans
Türkçe
1995
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiPROF.DR. NESRİN TARKAN