Geri Dön

Content Aware State Space Model for Remote Sensing Image Captioning

Uzaktan Algılama Görüntüleri için İçerik Duyarlı Durum-UzayıModelleri ile Görüntü Altyazılanması

  1. Tez No: 1003263
  2. Yazar: MELİKE AKDAĞ
  3. Danışmanlar: PROF. DR. NAZLI İKİZLER CİNBİŞ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Hacettepe Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Bilimleri Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Uzaktan algılama görüntü altyazılama, hava görüntülerinin ayrıntılı metinsel tanımlarını oluşturmayı amaçlamakta ve geniş coğrafi sahnelerin semantik olarak yorumlanmasını kolaylaştırmaktadır. Karmaşık uzamsal yapılar ve nesnelerin çeşitli ve dengesiz dağılımı nedeniyle bu problem oldukça zorlayıcıdır. Bu tezde, Bölge-Uyarlamalı öznitelik zenginleştirme modülünü Mamba tabanlı dizi modelleme mimarisiyle birleştiren içerik-duyarlı bir görsel kodlama çerçevesi sunulmaktadır. Görsel öznitelikler, önceden eğitilmiş bir CLIP görüntü kodlayıcısı kullanılarak çıkarılmakta ve küresel sahne bağlamı ile yerel uzamsal içeriğe göre öz-dikkat ve evrişim işlemlerini uyarlamalı şekilde harmanlayan Bölge-Uyarlamalı Karıştırıcı ile zenginleştirilmektedir. Zenginleştirilen görsel belirteçler, uzun menzilli bağımlılıkları doğrusal karmaşıklıkla modellemek üzere bir GMamba kodlayıcısı tarafından işlenmektedir. Alan uyumunu daha da artırmak için, büyük ölçekli hava görüntüleri üzerinde önceden eğitilmiş uzaktan algılamaya özgü bir görsel kodlayıcı olan RSCLIP, alternatif bir omurga olarak sisteme dahil edilmiştir. Kıyaslama veri kümeleri üzerinde gerçekleştirilen deneysel değerlendirmeler, RSCLIP kodlayıcısıyla donatılmış önerilen RACap modelinin değerlendirme ölçütlerinin büyük çoğunluğunda en ileri düzeyde başarımı elde ettiğini ve mevcut Mamba tabanlı ile dönüştürücü tabanlı yöntemleri hem sözcüksel doğruluk hem de genel betimleme kalitesi açısından aştığını göstermektedir. Bu bulgular, içerik odaklı görüntü iyileştirmenin alan uyarlamalı görsel kodlama ile birleştirilmesinin etkinliğini vurgulayarak, uzaktan algılama görüntülerine altyazılama için ölçeklenebilir ve verimli bir çözüm sağladığını ortaya koymaktadır.

Özet (Çeviri)

Remote sensing image captioning aims to generate detailed textual descriptions of aerial images, enabling semantic understanding of large-scale geographic environments. This task remains challenging due to complex spatial layouts, scale variations, and the uneven distribution of objects across scenes. In this thesis, a content-aware visual encoding framework is proposed to address these challenges by integrating region-adaptive visual refinement with Mamba-based sequence modeling. Visual features are first extracted using a pretrained CLIP encoder and then refined through a Region-Adaptive Captioning, which dynamically combines self-attention and convolution based on global context and local spatial complexity. This design enables selective processing of informative regions while reducing redundant computation over homogeneous areas. The refined visual tokens are subsequently processed by a Genetic Mamba (GMamba) encoder, which models long-range dependencies with linear computational complexity. To further improve domain alignment, a remote sensing-specific visual encoder, RSCLIP, is incorporated as an alternative backbone to enhance visual-semantic consistency in aerial imagery. Experimental results on multiple benchmark datasets demonstrate that the proposed RACap framework achieves strong performance across standard evaluation metrics and outperforms existing Mamba-based and transformer-based approaches on most datasets. The improvements are particularly evident in lexical accuracy and overall caption quality. These findings highlight the effectiveness of combining content-aware visual refinement with domain-adaptive visual encoding, providing a scalable and efficient solution for remote sensing image captioning.

Benzer Tezler

  1. Traffic and mobility aware delay modeling for software-defined networks (SDN)

    Yazılım tanımlı ağlar için trafik ve hareket duyarlı gecikme modeli

    MÜGE ÖZÇEVİK

    Doktora

    İngilizce

    İngilizce

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. BERK CANBERK

  2. Kent otellerinin güncel tasarım kriterleri

    Current design criterias of city hotels

    ELİF AKÇAKAYA

    Yüksek Lisans

    Türkçe

    Türkçe

    2014

    Mimarlıkİstanbul Teknik Üniversitesi

    Mimarlık Ana Bilim Dalı

    YRD. DOÇ. DR. HÜLYA ARI

  3. Automotive radar interference mitigation with next generation sequence models

    Yeni nesil dizi modelleri ile otomotiv radarlarında girişim giderme

    ELİF ÖZTÜRK KOÇ

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    PROF. DR. IŞIN ERER

  4. A context-aware model for stochastic planning in environments with hidden states

    Saklı durumları olan ortamlarda stokastik planlamaiçin bağlam-farkındalığı olan model

    ÖMER EKMEKCİ

    Doktora

    İngilizce

    İngilizce

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. FARUK POLAT

  5. Context-aware Markov decision processes

    İçerikten-haber Markov karar süreçleri

    ÖMER EKMEKCİ

    Yüksek Lisans

    İngilizce

    İngilizce

    2014

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Bölümü

    PROF. DR. FARUK POLAT