Content Aware State Space Model for Remote Sensing Image Captioning
Uzaktan Algılama Görüntüleri için İçerik Duyarlı Durum-UzayıModelleri ile Görüntü Altyazılanması
- Tez No: 1003263
- Danışmanlar: PROF. DR. NAZLI İKİZLER CİNBİŞ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Hacettepe Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Bilimleri Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Uzaktan algılama görüntü altyazılama, hava görüntülerinin ayrıntılı metinsel tanımlarını oluşturmayı amaçlamakta ve geniş coğrafi sahnelerin semantik olarak yorumlanmasını kolaylaştırmaktadır. Karmaşık uzamsal yapılar ve nesnelerin çeşitli ve dengesiz dağılımı nedeniyle bu problem oldukça zorlayıcıdır. Bu tezde, Bölge-Uyarlamalı öznitelik zenginleştirme modülünü Mamba tabanlı dizi modelleme mimarisiyle birleştiren içerik-duyarlı bir görsel kodlama çerçevesi sunulmaktadır. Görsel öznitelikler, önceden eğitilmiş bir CLIP görüntü kodlayıcısı kullanılarak çıkarılmakta ve küresel sahne bağlamı ile yerel uzamsal içeriğe göre öz-dikkat ve evrişim işlemlerini uyarlamalı şekilde harmanlayan Bölge-Uyarlamalı Karıştırıcı ile zenginleştirilmektedir. Zenginleştirilen görsel belirteçler, uzun menzilli bağımlılıkları doğrusal karmaşıklıkla modellemek üzere bir GMamba kodlayıcısı tarafından işlenmektedir. Alan uyumunu daha da artırmak için, büyük ölçekli hava görüntüleri üzerinde önceden eğitilmiş uzaktan algılamaya özgü bir görsel kodlayıcı olan RSCLIP, alternatif bir omurga olarak sisteme dahil edilmiştir. Kıyaslama veri kümeleri üzerinde gerçekleştirilen deneysel değerlendirmeler, RSCLIP kodlayıcısıyla donatılmış önerilen RACap modelinin değerlendirme ölçütlerinin büyük çoğunluğunda en ileri düzeyde başarımı elde ettiğini ve mevcut Mamba tabanlı ile dönüştürücü tabanlı yöntemleri hem sözcüksel doğruluk hem de genel betimleme kalitesi açısından aştığını göstermektedir. Bu bulgular, içerik odaklı görüntü iyileştirmenin alan uyarlamalı görsel kodlama ile birleştirilmesinin etkinliğini vurgulayarak, uzaktan algılama görüntülerine altyazılama için ölçeklenebilir ve verimli bir çözüm sağladığını ortaya koymaktadır.
Özet (Çeviri)
Remote sensing image captioning aims to generate detailed textual descriptions of aerial images, enabling semantic understanding of large-scale geographic environments. This task remains challenging due to complex spatial layouts, scale variations, and the uneven distribution of objects across scenes. In this thesis, a content-aware visual encoding framework is proposed to address these challenges by integrating region-adaptive visual refinement with Mamba-based sequence modeling. Visual features are first extracted using a pretrained CLIP encoder and then refined through a Region-Adaptive Captioning, which dynamically combines self-attention and convolution based on global context and local spatial complexity. This design enables selective processing of informative regions while reducing redundant computation over homogeneous areas. The refined visual tokens are subsequently processed by a Genetic Mamba (GMamba) encoder, which models long-range dependencies with linear computational complexity. To further improve domain alignment, a remote sensing-specific visual encoder, RSCLIP, is incorporated as an alternative backbone to enhance visual-semantic consistency in aerial imagery. Experimental results on multiple benchmark datasets demonstrate that the proposed RACap framework achieves strong performance across standard evaluation metrics and outperforms existing Mamba-based and transformer-based approaches on most datasets. The improvements are particularly evident in lexical accuracy and overall caption quality. These findings highlight the effectiveness of combining content-aware visual refinement with domain-adaptive visual encoding, providing a scalable and efficient solution for remote sensing image captioning.
Benzer Tezler
- Traffic and mobility aware delay modeling for software-defined networks (SDN)
Yazılım tanımlı ağlar için trafik ve hareket duyarlı gecikme modeli
MÜGE ÖZÇEVİK
Doktora
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. BERK CANBERK
- Kent otellerinin güncel tasarım kriterleri
Current design criterias of city hotels
ELİF AKÇAKAYA
Yüksek Lisans
Türkçe
2014
Mimarlıkİstanbul Teknik ÜniversitesiMimarlık Ana Bilim Dalı
YRD. DOÇ. DR. HÜLYA ARI
- Automotive radar interference mitigation with next generation sequence models
Yeni nesil dizi modelleri ile otomotiv radarlarında girişim giderme
ELİF ÖZTÜRK KOÇ
Yüksek Lisans
İngilizce
2026
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
PROF. DR. IŞIN ERER
- A context-aware model for stochastic planning in environments with hidden states
Saklı durumları olan ortamlarda stokastik planlamaiçin bağlam-farkındalığı olan model
ÖMER EKMEKCİ
Doktora
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. FARUK POLAT
- Context-aware Markov decision processes
İçerikten-haber Markov karar süreçleri
ÖMER EKMEKCİ
Yüksek Lisans
İngilizce
2014
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Bölümü
PROF. DR. FARUK POLAT