Contextual object detection via image inpainting
Resim doldurma ile bağlamsal nesne tanıma
- Tez No: 982035
- Danışmanlar: PROF. DR. SELİM AKSOY
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İhsan Doğramacı Bilkent Üniversitesi
- Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Uydu görüntülerinde nesne tespiti, şehirlerin gözlemlenmesi, afet yönetimi ve askeri gözetim gibi uygulamalarla bilgisayarla görü alanında kritik bir yer almaktadır. Ancak, mevcut yaklaşımlarda genellikle karışık arka planlar gibi nedenlerden dolayı nesnelerin temsil edici özelliklerinin yeterli olmaması gibi zorluklarla karşılaşılmaktadır. Bu çalışmada, Resim Doldurma ile Bağlamsal Nesne Tanıma modelimizi sunmaktayız. Bu yeni yaklaşımımızda resim doldurma modelinin dönüştürücüler kısmındaki öğrenilmiş parametrelerini kullanarak resimlerdeki genel bağlamı elde etmekteyiz. Geliştirdiğimiz füzyon modelimizi kullanarak elde ettiğimiz resimlerdeki bağlamlar ile nesne tanıma modelindeki karşılık gelen öznitelik piramit ağındaki nesneleri temsil eden verileri harmanlamaktayız. Böylelikle bağlam piramit ağı olarak adlandırdığımız tümleşim çıktılarımızı öznitelik piramit ağındaki ilgili katmanların yerine geçirerek daha iyi bir şekilde nesneler için konum ve etiket tespiti yapabilmekteyiz. Deneylerimiz DOTA ve HRSC2016 veri kümelerinde yapılmıştır. Modelimiz, yapılan deneylerde, literatürde en yüksek ortalama kesinlik (mAP) sonuçlarından birini veren OrientedRCNN modelini DOTA sınama veri kümesinde aynı ön işlem ve son işlem yöntemlerini kullanarak tek ölçekli resimlerde 0.67% ve çok ölçekli resimlerde ise 0.60% üstünlük göstermektedir. Modelimiz HRSC2016 veri kümesinde ise 90.57% mAP değeri elde ederek Oriented-RCNN'i 0.27% lik bir farkla geçmiş olup en yüksek değerlerden birini elde etmiştir. Bu bağlamda modelimiz, gelecekteki uydu görüntülerinde nesne tespiti uygulamaları için yeni bir yaklaşım sunmakta olup, nesnelerin daha doğru bir şekilde konumlandırılması ve tanımlanmasına öncülük etmektedir.
Özet (Çeviri)
Object detection in aerial imagery is a critical task in computer vision with applications in urban monitoring, disaster management, and military surveillance. Current approaches often encounter challenges, such as a lack of representative features of objects with cluttered backgrounds. To address these challenges, we introduce Contextual Object Detection via Image Inpainting (CODI), a novel approach that extract the representative features of the image's semantic context derived from the transformer units of the inpainting model, and our proposed fusion module learns how to inject these contextual features with the representative features of the objects obtained from the related Feature Pyramid Network (FPN) of the object detection model. The outputs, which we called Contextual Pyramid Network (CPN), of the fusion model are used to replace the original FPN layers for better localization and labeling accuracy over the objects. Our experiments were conducted on DOTA and HRSC2016 datasets. Our model achieved promising results on mAP by prevailing over Oriented RCNN, which is one of the best-performing models on the DOTA dataset. Specifically, by applying the same pre-processing and post-processing, CODI achieved an improvement of 0.67% in mean average precision (mAP) at single-scale and 0.6% at multi-scale over the Oriented RCNN on the test set. On the HRSC2016 dataset, CODI achieved an impressive mAP of 90.57%, outperforming Oriented RCNN by 0.27 percentage points. This result places CODI among the top-performing models using a ResNet-50 backbone. In that sense, our approach provides a foundation for future applications, paving the way for more precise object localization and identification in remote sensing.
Benzer Tezler
- Unified approaches to efficient and robust image retrieval through fusion restoration, and compression
Füzyon, sıkıştırma ve restorasyon yoluyla verimli ve dayanıklı görsel getirim için birleşik yaklaşımlar
ENİS TEPER
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ YUSUF HÜSEYİN ŞAHİN
- Automatic detection of compound structures by joint selection of region groups from multiple hierarchical segmentations
Bileşik yapıların çoklu sıradüzensel bölütlemelerden bölge gruplarının ortaklaşa seçilmesiyle otomatik sezimi
HÜSEYİN GÖKHAN AKÇAY
Doktora
İngilizce
2016
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. SELİM AKSOY
- Bilgisayarlı görü destekli kentsel koruma: Siirt tarihi kent merkezi üzerine bir değerlendirme
Computer vision-supported urban conservation: An evaluation on siirt historical city center
SALİH DÜNDAR
Yüksek Lisans
Türkçe
2026
Şehircilik ve Bölge PlanlamaSiirt ÜniversitesiŞehir ve Bölge Planlama Ana Bilim Dalı
DOÇ. DR. ARZU ALTUNTAŞ
- Termal görüntüler için geliştirilmiş derin öğrenme tabanlı nesne tespit yöntemi
A deep learning – based object detection method developed for thermal images
SERGEN ERBAY
Yüksek Lisans
Türkçe
2026
Savunma ve Savunma TeknolojileriSakarya Uygulamalı Bilimler ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. ALİ FURKAN KAMANLI
- Deep learning–based automatic segmentation and 3d reconstruction in warhead performance testing
Harp başlığı performans testlerinde derin öğrenme tabanlı otomatik bölütleme ve 3b yeniden inşa
UĞUR CAN KARACA
Yüksek Lisans
Türkçe
2025
Makine MühendisliğiTobb Ekonomi ve Teknoloji ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ TOYGAR AKGÜN