Fusion of RGB and thermal image pairs for object and face liveness detection
Nesne ve yüz canlılığı tespiti için RGB ve termal görüntü çiftlerinin birleştirilmesi
- Tez No: 997275
- Danışmanlar: PROF. DR. TAYFUN AKGÜL
- Tez Türü: Yüksek Lisans
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Telekomünikasyon Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bilgisayarlı görü ve yapay zekâ tabanlı algılama sistemleri, son yıllarda hem akademik araştırmalar hem de endüstriyel uygulamalar açısından büyük bir ivme kazanmıştır. Otonom sürüş sistemleri, akıllı gözetleme altyapıları, biyometrik kimlik doğrulama çözümleri, sınır güvenliği, askeri uygulamalar ve arama-kurtarma operasyonları gibi pek çok kritik alanda kullanılan bu sistemlerden, farklı çevresel ve operasyonel koşullar altında güvenilir ve tutarlı bir performans sergilemeleri beklenmektedir. Ancak gerçek dünya ortamları, değişken ve yetersiz aydınlatma koşulları, karanlık ortamlar, sert gölgeler, duman, sis veya yağmur gibi atmosferik etkiler, karmaşık sahne yapıları ve kısmi engeller gibi çok sayıda zorluğu bir arada barındırmaktadır. Bu durum, tek bir algılama yöntemine dayanan geleneksel bilgisayarlı görü sistemlerinin performansını ciddi biçimde sınırlandırmakta ve bu sistemlerin gerçek dünya senaryolarında güvenilirliğini azaltmaktadır. Görünür spektrum kameralar, yüksek çözünürlük, zengin renk ve doku bilgileri sayesinde nesne algılama, sınıflandırma ve yüz tespiti gibi görevlerde yüksek doğruluk sağlayabilmektedir. Bununla birlikte, RGB tabanlı algılama sistemlerinin başarımı büyük ölçüde ortam aydınlatmasına bağlıdır. Düşük ışık, gece koşulları veya yoğun gölgelerin bulunduğu sahnelerde RGB görüntülerdeki görsel bilgi ciddi biçimde bozulmakta; kontrast kaybı, gürültü artışı ve detay eksikliği gibi sorunlar ortaya çıkmaktadır. Bu durum, derin öğrenme tabanlı modellerin bile algılama performansında belirgin düşüşlere yol açabilmektedir. Termal kameralar ise ortam ışığından bağımsız olarak nesnelerin yaydığı kızılötesi radyasyonu algılayabildiğinden, karanlık veya görsel olarak zorlayıcı koşullarda daha kararlı bir algılama sunmaktadır. Bununla birlikte, termal görüntüler sensör teknolojilerinin doğası gereği genellikle düşük çözünürlüklüdür ve nesnelerin geometrik yapısını ve sınır detaylarını yeterince temsil edememektedir. Bu nedenle yalnızca termal görüntülere dayalı sistemler, hassas konumlandırma ve ayrıntılı şekil bilgisi gerektiren görevlerde sınırlı performans sergilemektedir. RGB ve termal görüntüleme kiplerinin bu tamamlayıcı özellikleri, iki kipin birlikte kullanıldığı çok kipli (multimodal) algılama sistemlerini güçlü bir alternatif hâline getirmektedir. Ancak RGB-T sistemlerin başarımı, yalnızca iki farklı sensörün birlikte kullanılmasına değil, bu sensörlerden elde edilen bilgilerin nasıl birleştirildiğine de doğrudan bağlıdır. Literatürde erken seviye, orta seviye ve geç seviye füzyon yaklaşımları gibi pek çok farklı strateji önerilmiş olsa da, bu yöntemlerin önemli bir bölümü karmaşık ağ mimarileri, çok dallı yapılar ve yüksek hesaplama maliyeti gerektiren öğrenmeye dayalı füzyon mekanizmalarına dayanmaktadır. Bu durum, sistemlerin gerçek zamanlı uygulamalarda kullanılmasını zorlaştırmakta ve füzyon sürecinin yorumlanabilirliğini azaltmaktadır. Bu tez çalışmasında, RGB ve termal görüntülerin birlikte kullanıldığı, sade ancak etkili bir görsel algılama çerçevesi geliştirilmiştir. Çoklu sensör sistemlerinde sıkça karşılaşılan zamanlama ve senkronizasyon problemlerini ortadan kaldırmak amacıyla, tüm veriler eşzamanlı RGB ve termal görüntü elde edebilen hibrit bir kamera sistemi kullanılarak toplanmıştır. Bu yaklaşım sayesinde zaman uyumsuzluğundan kaynaklanan belirsizlikler büyük ölçüde azaltılmıştır. Bununla birlikte, RGB ve termal sensörler arasındaki optik yapı, görüş açısı ve çözünürlük farklılıkları, füzyon öncesinde hassas geometrik hizalama gerektirmektedir. Bu nedenle nesne algılama senaryolarında stereo kamera kalibrasyonu uygulanmış; kamera iç ve dış parametreleri tahmin edilerek görüntü rektifikasyonu gerçekleştirilmiş ve iki görüntüleme türü arasında piksel seviyesinde geometrik tutarlılık sağlanmıştır. Tezin temel katkısı RGB görüntülerden elde edilen kenar bilgisinin, hizalanmış termal görüntülerle doğrusal ağırlıklı bir füzyon denklemi kullanılarak birleştirilmesidir. RGB görüntülerden çıkarılan kenar bilgisi, sahnedeki nesnelerin geometrik yapısını, sınırlarını ve yapısal sürekliliğini yüksek doğrulukla temsil ederken; termal görüntüler, aydınlatmadan bağımsız ısı dağılımı bilgisi sunmaktadır. Bu iki bilginin tek bir hibrit görüntü içerisinde birleştirilmesi, hem yapısal hem de termal ipuçlarını aynı anda içeren zengin bir temsil ortaya koymaktadır. Önerilen yaklaşımla oluşturulan görüntüler, karmaşık öğrenmeye dayalı füzyon ağlarına ihtiyaç duymadan, doğrudan standart YOLO tabanlı algılama modellerine giriş olarak kullanılabilmektedir. Bu durum, hem hesaplama maliyetini düşürmekte hem de füzyon sürecinin şeffaf ve yorumlanabilir olmasını sağlamaktadır. Deneysel değerlendirmeleri desteklemek amacıyla bu tez kapsamında iki özgün RGB-T veri kümesi toplanmıştır. ARISTO veri kümesi, hem iç hem de dış mekânları kapsayan gerçek RGB-T nesne algılama veri kümesidir. Veri kümesi, farklı sahne tipleri, mesafeler ve çevresel koşullar altında toplanmış görüntüler içermektedir. İç mekân sahnelerinde 23, dış mekân sahnelerinde ise 16 olmak üzere geniş bir nesne sınıfı çeşitliliği sunmaktadır. Bildiğimiz kadarıyla, ARISTO veri kümesi, literatürde kamuya açık az sayıdaki iç mekân RGB-T veri kümelerinden biri olmasının yanı sıra, dış mekânlarda da yüksek sınıf çeşitliliği sunmasıyla dikkat çekmektedir. İkinci veri kümesi olan ARISTOF ise yüz canlılık tespiti amacıyla özel olarak toplanmış olup, canlı ve sahte yüz örneklerinden oluşmaktadır. Bu veri kümesi, statik sunum saldırılarına karşı RGB-T tabanlı yaklaşımların davranışını ayrıntılı biçimde incelemek üzere toplanmıştır. Gizlilik ve kişisel veri koruma mevzuatları gereği ARISTOF veri kümesi yalnızca bu tez kapsamında deneysel amaçlarla kullanılmıştır. Gerçek RGB-T veri kümelerinin sınırlı ölçeği, derin öğrenme tabanlı modellerin genellenebilirliğini kısıtlayan önemli bir faktördür. Bu nedenle tez kapsamında sentetik termal veri üretimi ayrıntılı biçimde ele alınmıştır. Büyük ölçekli COCO RGB veri kümesi kullanılarak iki farklı sentetik termal üretim stratejisi uygulanmıştır. İlk stratejide, RGB görüntülerden SSI-Depth yöntemi ile tahmin edilen derinlik haritaları termal benzeri temsiller olarak değerlendirilmiştir. Bu yaklaşım, sahne geometrisini koruyarak nesne sınırlarının belirginleşmesini sağlamaktadır. İkinci stratejide ise, GAN tabanlı RGB'den termale görüntü dönüşüm modelleri kullanılarak görsel olarak daha gerçekçi ve termal karakteristiği güçlü sentetik görüntüler üretilmiştir. Her iki yöntemle elde edilen sentetik termal görüntüler, RGB'den çıkarılan kenar bilgisi ile aynı füzyon stratejisi kullanılarak birleştirilmiş ve büyük ölçekli hibrit eRGB-T veri kümeleri oluşturulmuştur. Nesne algılama deneyleri, YOLOv8 modeli kullanılarak hem gerçek hem de sentetik veri kümeleri üzerinde kapsamlı biçimde gerçekleştirilmiştir. Deneysel sonuçlar, termal görüntülerle eğitilen modellerin yapısal detay eksikliği nedeniyle düşük doğruluk ve geri çağırım değerleri sergilediğini açıkça ortaya koymaktadır. RGB tabanlı modeller yüksek doğruluk sağlamakla birlikte, özellikle düşük ışık ve zor aydınlatma koşullarında kararlılık kaybı yaşamaktadır. Önerilen kenar çıkarımlı RGB-T füzyon temsili ise, termal girdilere kıyasla belirgin performans artışı sağlamış ve birçok senaryoda RGB modellerle karşılaştırılabilir mAP@50 değerlerine ulaşmıştır. Sentetik veri üzerinde ön-eğitim yapılıp gerçek ARISTO-eRGB-T verisi ile ince ayar uygulanan modellerin, özellikle dış mekân sahnelerinde daha yüksek doğruluk ve daha güçlü genelleme yeteneği sergilediği gözlemlenmiştir. LLVIP ve FLIR veri kümeleri üzerinde gerçekleştirilen çapraz veri kümesi deneyleri, önerilen yaklaşımın farklı sensör yapılandırmalarına ve veri dağılımlarına başarıyla genellenebildiğini göstermiştir. Tezin ikinci aşamasında, önerilen füzyon yaklaşımının genellenebilirliği yüz canlılık tespiti problemi üzerinden ayrıntılı biçimde değerlendirilmiştir. ARISTOF veri kümesi üzerinde gerçekleştirilen deneylerde, sadece termal görüntü içeren girdilerde sahte yüzlerin büyük ölçüde algılanamadığı; füzyonlu girdilerde ise RGB'den elde edilen yapısal bilginin yüz algılama ve canlılık ayrımı performansını anlamlı biçimde artırdığı gözlemlenmiştir. YOLOv8-Face modeli kullanılarak gerçekleştirilen iki sınıflı canlı/sahte deneylerde, yüksek hassasiyet, geri çağırım ve mAP değerleri elde edilmiş; ayrıca bağımsız test verileri üzerinde de güçlü bir genelleme performansı sergilenmiştir. Bu bulgular, önerilen füzyon temsilinin yalnızca genel nesne algılama değil, biyometrik güvenlik gibi daha hassas uygulamalarda da etkili olduğunu ortaya koymaktadır. Sonuç olarak bu tez çalışması, RGB'den elde edilen yapısal kenar bilgisinin termal görüntülerle birleştirilmesinin hem nesne algılama hem de yüz canlılık tespiti görevlerinde pratik, etkili ve hesaplama açısından verimli bir füzyon stratejisi sunduğunu göstermektedir. Geliştirilen veri kümeleri, önerilen yöntem ve kapsamlı deneysel analizler, RGB-T çok kipli algılama alanında gelecekte yapılacak akademik ve endüstriyel çalışmalar için güçlü ve sağlam bir temel oluşturmaktadır.
Özet (Çeviri)
Reliable visual perception is essential for intelligent systems operating in real-world environments. This is particularly important in applications such as surveillance, autonomous systems, and biometric analysis. In practice, these systems often face challenging conditions, including low illumination, nighttime operation, adverse weather, and cluttered backgrounds. Under such conditions, system performance strongly depends on the sensing modality. This dependency becomes even more critical in real deployments. Visible-spectrum cameras remain the most commonly used sensors in computer vision. Their widespread use is mainly due to their high spatial resolution and rich texture information. However, RGB-based detection methods are sensitive to illumination changes and often experience performance drops in low-light or nighttime scenarios. Thermal cameras, on the other hand, capture infrared radiation emitted by objects and operate largely independently of ambient lighting. This allows them to function reliably in darkness and harsh environments. However, thermal images usually have lower spatial resolution and less structural detail than RGB images. As a result, they may struggle in tasks that require sharp object boundaries or fine geometric features. Because RGB and thermal modalities have complementary strengths, combining them is a natural choice for multimodal perception systems. RGB images provide structural detail, while thermal images offer robustness to lighting conditions. When used together, they can produce more reliable visual representations. However, effective performance depends not only on having both modalities, but also on how well they are aligned and fused. In this thesis, robust multimodal perception is addressed through the joint use of RGB and thermal imaging for object detection and face liveness detection. To prevent synchronization and temporal alignment problems that commonly occur in multi-sensor systems, data are collected using a hybrid RGB-T camera that captures paired RGB and thermal images simultaneously. Although the acquisition is synchronized, geometric differences between the sensors still exist. Therefore, stereo camera calibration and image rectification are performed to achieve pixel-level alignment before fusion. The main contribution of this thesis is a simple and effective edge-enhanced RGB-T fusion representation. In this approach, structural edge information extracted from RGB images is combined with geometrically aligned thermal images using a weighted linear fusion method. Instead of using complex fusion networks or separate modality-specific branches, the method integrates structural and thermal information into a single hybrid image. This fused image can be directly used by standard YOLO-based detection models, allowing efficient training, lower computational cost, and improved interpretability. To enable comprehensive evaluation, two RGB-T datasets are developed. The ARISTO dataset is a real-world RGB-T object detection dataset that includes paired RGB and thermal images collected in both indoor and outdoor environments, covering a diverse set of object categories. To the best of our knowledge, ARISTO is one of the few publicly available indoor RGB-T datasets and also among the RGB-T datasets that contain a relatively large number of outdoor object classes. In addition, a dedicated RGB-T face liveness detection dataset, named ARISTOF, is collected under controlled conditions and includes both live and spoof face samples. Due to privacy considerations, ARISTOF is used only for experimental evaluation within this study. Because real RGB-T datasets are limited in size, this thesis also explores synthetic thermal image generation using large-scale RGB data. Two approaches are considered: depth-based thermal generation using shift-and-scale invariant depth estimation, and GAN-based RGB-to-thermal image translation. The generated synthetic thermal images are fused with RGB-derived edge information using the same fusion strategy. This enables large-scale training and consistent evaluation across both real and synthetic data. Object detection experiments are conducted using the YOLOv8 model on real and synthetic hybrid datasets. The results show that thermal-only detection is limited by insufficient structural detail, while RGB-only detection remains sensitive to difficult lighting conditions. The proposed edge-enhanced RGB-T fusion improves detection performance compared to thermal-only inputs and achieves results close to RGB-only models, while maintaining the robustness of thermal information. In addition, fine-tuning models pretrained on synthetic data with real RGB-T samples further improves performance, especially in outdoor environments. Cross-dataset evaluations on the LLVIP and FLIR benchmarks also demonstrate the generalization ability of the proposed method. The fusion framework is further evaluated for face liveness detection using the ARISTOF dataset. The same edge-enhanced RGB-T representation is adapted for close-range facial analysis. The results show that the fused representation improves face detectability compared to thermal-only inputs and enables reliable discrimination between live and spoof faces. High precision, recall, and mAP values on validation and test sets confirm the effectiveness and generalization capability of the method. In conclusion, this thesis demonstrates that integrating RGB-derived structural edge information with thermal imagery provides a practical and efficient fusion strategy for multimodal vision tasks. The proposed framework improves both object detection and face liveness detection under challenging conditions. In addition, the developed datasets and experimental results contribute useful resources and insights for future research in RGB-T multimodal perception.
Benzer Tezler
- Termal ve RGB görüntülerde farklı görüntü füzyonu tekniklerinin performans analizi
Performance analysis of different image fusion techniques in thermal and RGB images
BÜŞRA ÇELİK
Yüksek Lisans
Türkçe
2026
Elektrik ve Elektronik MühendisliğiGazi ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. FIRAT HARDALAÇ
- Uzaktan algılama ve coğrafi bilgi sistemi kullanımı ile potansiyel termal su alanlarının araştırılması: Kaz dağları ve çevresi örneği
Investigation of potential thermal water areas by using remote sensing and geographical information system: Exploration of Kaz mountains and environment
ABDURRAHMAN YASİN OKUR
Yüksek Lisans
Türkçe
2017
Jeodezi ve Fotogrametriİstanbul Teknik ÜniversitesiGeomatik Mühendisliği Ana Bilim Dalı
PROF. DR. HİLAL GONCA COŞKUN
- Multimodal yüz görüntülerinde gerçek zamanlı görüntü çakıştırma yöntemlerinin karşılaştırmalı analizi
A comparative analysis of real-time image registration methods in multimodal facial images
MEHMET OKUMUŞ
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolErciyes ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ TAYYİP ÖZCAN
- Sensör füzyonuna dayalı derin öğrenme yöntemleri ile nesne tanıma başarısının artırılması
Increasing object detection success with deep learning methods based on sensor fusion
AHMET ÖZCAN
Doktora
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMilli Savunma ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ÖMER ÇETİN
- Derin öğrenme ile termal görüntülerden askeri nesne tespiti
Military object detection from thermal images using deep learning
YUSUF BAYAV
Yüksek Lisans
Türkçe
2025
Elektrik ve Elektronik MühendisliğiMilli Savunma ÜniversitesiAskeri Elektronik Sistemler Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ONUR BATTAL