Improved mambabda framework for robust building damage assessment across disaster domains
Farklı afet türlerinde bina hasar değerlendirmesi için geliştirilmiş mambabda çerçevesi
- Tez No: 1013187
- Danışmanlar: PROF. DR. HAZIM KEMAL EKENEL
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Bilgisayarla görme, Evrişimli sinir ağları, Sayısal görüntü işleme, Uzaktan algılama, Yapay sinir ağları, Computer vision, Convolutional neural networks, Digital image processing, Remote sensing, Artificial neural networks
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Afet sonrası hızlı ve güvenilir olarak hasar değerlendirmesi yapmak; acil müdahale planlaması veya kayıp / ekonomik zarar tahminleri yapılması açısından önemli bir gereksinimdir. Bu bağlamda, bina hasar değerlendirmesi (building damage assessment, BDA), yerleşim yerlerini etkileyen büyük ölçekli afetlerden sonra, bina konumlarını bularak ve bu binalardaki hasar seviyelerini sınıflandırarak bina düzeyindeki etkiyi doğru bir şekilde tahmin etmeyi amaçlayan, kritik öneme sahip bir görevdir. Temelde bir lokalizasyon ve değişim tespiti işlemidir. Otomatikleştirilmiş bir BDA sistemi, genel olarak afet öncesi ve sonrası olmak üzere aynı bölgeyi kapsayan iki görseli girdi alıp, çıktıda ise bina lokalizasyon haritası ve hasar sınıflandırma haritası üretir. Bu sayede hızlıca elde edilen bu çıktılar hangi bölgede yüksek hangi bölgede düşük hasar olduğuna yönelik görsel ve nicel bir bilgi sağlamakta ve yetkililerin aksiyon almasını kolaylaştırmaktadır. Derin öğrenme yöntemlerinde son yıllarda yaşanmakta olan hızlı gelişmeler, bilgisayarlı görü ve değişim tespiti temelli işlemleri de olumlu etkilemiş ve bu görevlerde elde edilen başarı oranları artmıştır. Yakın zamana kadar bu alanlardaki işlemler için yoğun bir şekilde kullanılmakta olan evrişimli sinir ağları (convolutional neural network, CNN), bu alanda neredeyse yegane hakimiyet sahibiydi. CNN'ler, yüksek hızı ve görsellerde yerel seviyede tanıma kapasitesi sayesinde oldukça başarılı ve popüler bir konumdaydı, fakat uzun mesafe bağıntılar kurma bakımından zayıflıkları vardı. Bu aşamada devreye Transformer tabanlı mimariler girdi. Bu yapılar, bir dizi veya görseldeki uzun menzilli bağlantıların çok daha başarılı bir şekilde tanınabilmesine olanak sağlamaktadır. Ancak Transformer modellerinin, öz-dikkat (self-attention) mekanizmasından dolayı dizi uzunluğuna bağlı olarak karesel zaman karmaşıklığına sahip olma dezavantajı vardır. Bu sorunu etkili bir şekilde çözmek için 2023 yılında Mamba modeli önerilmiş ve VMamba ile bilgisayarlı görü alanına entegre edilmiştir. Mamba temelli mimariler, CNN ve Transformer tabanlı mimarilerin güçlü özelliklerini bir araya getirmekte ve hem kısa hem uzun mesafeli tanıma kapasitesi yüksek ve doğrusal zaman karmaşıklığında çalışabilen mimariler olarak öne çıkmaktadır. ChangeMamba ve onun BDA için özelleştirilmiş mimarisi MambaBDA ise alanında güncel üst düzey bir yöntem olarak değerlendirilmektedir. Derin öğrenme ve BDA alanlarındaki tüm bu gelişmelere rağmen, görevin doğası gereği karşılaşılmaya devam edilen bazı zorluklar mevcuttur. İlk olarak, mevcut veri kümelerinin çoğunluğunda sınıf dağılım dengesizliği bulunmakta, özellikle“hasarsız”sınıfının diğer hasar sınıflarına kıyasla çok daha fazla örnek sayısına sahip olduğu görülmektedir. İkinci olarak, arka plan dağınıklığı, ışıklandırma çeşitliliği ve gölgeler gibi değişkenler, bina tespitini ve afet öncesi ve sonrası görseller arasında net bir hasar kaynaklı değişim tespitini güçleştirmektedir. Son olarak, bu alanda sağlanan çoğu veri kümesinde çakıştırılmış (afet öncesi ve sonrası aralarında hizalanmış) görseller kullanılıyor olsa da piksel kaymaları ve hizalama bozuklukları bulunabilmektedir. Bu tez çalışması kapsamında önerilen modüler iyileştirmelerin hem alan içi hem de veri kümeleri arası (görülmemiş veriler üzerinde) testlerde MambaBDA modelinin performansında bir artış sağlayıp sağlamayacağı araştırılmıştır. MambaBDA, temelde bir ikiz kodlayıcı (siamese encoders) ve bu kodlayıcılara bağlanan iki ayrı çözücüden (decoder) oluşan bir mimaridir. Kodlayıcı, görsel durum uzayı (visual state space, VSS) bloklarından oluşmakta ve girdiyi buna göre modellemektedir. Çözücülerden ilki, bina lokalizasyonu ile görevli olan anlamsal (semantic) çözücüdür ve bu çözücü bloğunun çıktısı bina lokalizasyon haritasıdır. Bu çözücü içindeki temel birim de kodlayıcı ile benzer şekilde VSS bloklarıdır. İkinci çözücü ise değişim (change) çözücüsü olarak adlandırılmaktadır ve bu çözücü bloğunun çıktısı hasar sınıflandırma haritasıdır. Bu çözücüde temel VSS bloklarına ek olarak uzay-zaman durum uzayı (spatio-temporal state space, STSS) blokları bulunmakta ve bunlar ile verinin yeniden sıralanması ve düzenlenmesi sağlanmaktadır. Bütün kodlayıcı ve çözücüler kendi içlerinde dört aşamadan oluşmaktadır, bu sayede çok seviyeli öznitelik üretimi ve bu öznitelikler üzerinde işlemler yapılabilmekte ve modelin performansı artırılmaktadır. Referans alınan model üzerinde şu üç temel geliştirme uygulanmış ve bunların detaylı testleri yapılarak referans model ile karşılaştırmalı sonuçları incelenmiştir: (i)~sınıf dengesizliği problemini hafifletmek için fokal kayıp (focal loss) kullanılması, (ii)~ilgisiz bağlamı bastırarak doğru parçalara odaklanma sağlamak için dikkat kapıları (attention gate, AG) kullanılması, ve (iii)~girdilerdeki küçük hiza bozukluklarının dinamik olarak telafi edilebilmesi için özel ve hafif bir hizalama modülü (alignment module) entegre edilmesi. Bütün bu geliştirmeler tamamen modüler olarak tasarlandığından tekli veya birbirlerinin kombinasyonları halinde detaylı testlerin yapılmasına ve farklı mimariler üzerinde de uygulanabilmesine olanak sağlamaktadır. Uygulanan bu modüler geliştirmeler aşağıdaki gibi açıklanabilir: (1) Fokal Loss Adaptasyonu: Sınıf dengesizliği sebebiyle modelin en fazla veriye sahip sınıfa yönelme eğilimini azaltmak için kullanılmıştır. Fokal loss, kolay örneklerin katkısını azaltıp zor örnekleri ağırlıklandırarak modelin azınlık sınıflar üzerindeki sınıflandırma doğruluk oranını artırmaya yönelik çalışmaktadır. Bu yöntem sınıflandırma ile ilgili olduğundan yalnızca değişim çözücüsü yani hasar bloğunda uygulanmıştır ve temel modelde kullanılmakta olan çapraz entropi kaybına eklenerek birlikte bir kullanım sağlanmıştır. Bu geliştirme, deneylerde FOCAL ismi ile geçmektedir. (2) Attention Gate (AG) Entegrasyonu: Kodlayıcı - çözücü arasındaki atlamalı bağlantılar, pek çok zaman alakasız bilgi taşıması yapmaktadır. Modelin, görsel üzerinde hedefe yönelik alanlara odaklanmasını ve daha kesin ve doğru tahminlerde bulunmasını sağlamak için, hafif AG modülleri entegre edilmiştir. AG modülleri bir nevi yumuşak maskeleme katmanı olarak çalışmakta ve bilginin kısmi geçişine izin vermektedir. Entegrasyonda, küçük grup boyutlarında daha etkili olması için grup normalizasyonu (group normalization) tercih edilmiştir. Bu yöntem, iki varyant olarak ele alınmıştır: AGB olarak ifade edilen varyant sadece bina bloğunda, AGBD olarak ifade edilen varyant ise hem bina hem de hasar bloklarında AG modülleri bulundurur. Her ikisi için de AG modülleri, çözücülerdeki aşamalar arası geçiş noktalarında konumlandırılmıştır. (3) Hizalama Modülü: Özel olarak tasarlanmış hizalama modülü, afet öncesi ve sonrası girdileri arasındaki olası hizalama problemi kaynaklı kayıpları azaltmaya yönelik bir modüldür. Sığ bir CNN ağı olan bu modül, üç adet 3 x 3 boyutlarında evrişim katmanından oluşmakta ve ReLU aktivasyon fonksiyonundan yararlanmaktadır. Girdi olarak aldığı afet öncesi ve sonrası özniteliklerini, iki boyutlu bir akış (kayıklık) haritası çıkarmakta kullanır, daha sonra bu kayıklık haritası kullanılarak afet öncesi öznitelikleri, afet sonrası özniteliklerine hizalanır. Bu geliştirme, deneylerde ALIGN ismiyle ele alınmıştır. Bahsi geçen geliştirmeler, farklı veri kümelerinde ve farklı test düzenlemeleri ile detaylıca test edilmiştir. Deneylerde dört adet veri kümesi kullanılmıştır, bu veri kümelerinde“hasarsız”,“hafif hasar”,“ağır hasar”ve“yıkılmış”olmak üzere dört adet hasar sınıfı mevcuttur. İlk veri kümesi xBD, aralarında en büyük ölçekli ve çeşitli veri örnekleri bulunduran veri kümesidir. Diğer veri kümeleri Pakistan Flooding, Turkey Earthquake ve Hurricane Ida isimli veri kümeleridir. Deneyler; alan içi (in-domain) ve veri kümeleri arası (cross-dataset) olarak ikiye ayrılmıştır. Alan içi testlerinde xBD, Pakistan Flooding ve Turkey Earthquake veri kümelerinde eğitilen modeller, aynı veri kümelerinin test bölümlerinde test edilmiştir. Veri kümeleri arası testlerde ise xBD ve Pakistan Flooding üzerinde eğitilen modeller, diğer veri kümeleri üzerinde test edilmiş, böylece modellerin benzeri görülmemiş verileri üzerindeki performansı ve genelleme kabiliyetlerinin ölçülmesi hedeflenmiştir. Her bir deneyde referans model, yukarıda bahsi geçen tekli geliştirmeler, ve bu geliştirmelerin ikili \& üçlü kombinasyonları test edilmiştir. Değerlendirme metrikleri olarak; bina konumlandırma $F_1^{loc}$, hasar sınıflandırma $F_1^{clf}$ ve ağırlıklı toplam skor $F_1^{oa}=0.3F_1^{loc}+0.7F_1^{clf}$ raporlanmıştır. Alan içi deneylerde, xBD üzerindeki testlerde en yüksek başarıya sahip FOCAL+ALIGN+AGB kombinasyon modeli %79.16 toplam skor elde ederek referans temel modelin %1.04 puan üzerine çıkmıştır. Pakistan Flooding veri kümesinde FOCAL+AGB %81.33 skor ile referans modelin %0.82 üzerindedir. Nispeten daha küçük ölçeği ve hizalama bozuklukları sebebiyle daha zor bir veri kümesi olan Turkey Earthquake üzerinde ise en başarılı model varyantı %53.20 toplam skor ile AGB olmuş ve referans modelin %5.02 puan üzerine çıkmayı başarmıştır. Bu sonuçlar, kazanımların sınırlı da olsa istikrarlı olduğunu ve geliştirmelerin potansiyale sahip olduğunu göstermektedir. Veri kümeleri arası deneylerde kazanımlar daha net bir şekilde görülebilmektedir. xBD veri kümesinde eğitilen modellerin Pakistan Flooding alanına transferinde, referans model %29.56 toplam puan alırken, FOCAL+AGB modeli %56.60 toplam skora ulaşarak %27.04 puanlık gelişme sağlamıştır. xBD ile eğitilen modellerin Hurricane Ida testlerinde %5.86 (ALIGN+AGB modeli), Turkey Earthquake testlerinde ise %1.88 puan gelişme (FOCAL+AGB modeli) sağlanmıştır. Pakistan Flooding üzerinde eğitilen modellerin ise; xBD testlerinde %9.54 (FOCAL+ALIGN+AGB modeli), Hurricane Ida testlerinde %3.00 (FOCAL+ALIGN+AGB modeli), Turkey Earthquake testlerinde %1.08 puanlık yükseliş (FOCAL+ALIGN+AGBD modeli) görülmüştür. Veri kümeleri arası deneyler halihazırda modeli zorlayacak deneyler iken, ilaveten zorlu veriler içeren Turkey Earthquake gibi veri kümelerinde küçük de olsa gelişim gözlenmesi ve xBD ve Pakistan Flooding gibi daha dengeli veri kümelerinde ise çok daha dikkate değer artışların gözlenmesi önerilen geliştirmelerin özellikle farklı alanlara genelleştirme kabiliyetinin yüksek olduğunu ortaya koymaktadır. Geliştirme özelinde incelendiğinde ise, FOCAL geliştirmesinin beklendiği gibi, çoğu deneyde zor sınıfların sınıflandırma puanlarını dengelediği ve genel sınıflandırma skorlarında artışı sağladığı görülmektedir. AGB geliştirmesi de pek çok deneyde istikrarlı bir şekilde hem lokalizasyon hem de sınıflandırma skorlarında artış sağlamaktadır. Bunu, maskeleme sistemi ile arka plan karmaşıklığını azaltıp bina sınırlarına odaklanmayı sağlayarak ve karmaşık arka planlarda bile hasar değerlendirmesini kolaylaştırarak başarmaktadır. ALIGN geliştirmesi ise daha limitli alanlarda olsa da yer yer gelişme sağlamakta ve özellikle fokal loss ve attention gate geliştirmeleri ile birlikte iken daha güçlü olmaktadır. Sonuç olarak bu tez çalışması, temel mimari yapıyı değiştirmeden modelin performansını artırmayı sağlayacak üç geliştirme önerisinde bulunmuş ve modelin hesaplama karmaşıklığını önemli ölçüde artırmadan performansının ve özellikle alanlar arası değişikliğe karşı direncinin kayda değer ölçüde yükseltilebileceğini göstermektedir. Ayrıca ilgili mimari ve geliştirmelerin dört farklı veri kümesinde detaylı testleri ve analizlerini yaparak literatür katkısında bulunmaktadır.
Özet (Çeviri)
Rapid and reliable post-disaster damage assessment is a crucial requirement for emergency response and loss estimation. In this sense, building damage assessment (BDA) is a key task that aims to produce accurate estimates of building level impact after large-scale disasters that affect land and settlements, localizing the buildings and categorizing the damage levels. An automated BDA system typically accepts two inputs, a pre-disaster image and a post-disaster image of a specific region, and outputs a building localization map and a damage classification map for this region. With the developments in deep learning and change detection fields, following Convolutional Neural Network (CNN) and Transformer-based architectures, current state of the art shifted towards Mamba-based models. ChangeMamba architecture's MambaBDA network is specifically designed for BDA task and is considered among the best performing models. Regardless of the developments in the field, some crucial challenges remain due to the nature of the BDA task. First, most available datasets suffer from class imbalance. Second, background clutter and effects such as lighting and shadow variance can cause both localization and classification errors. Lastly, there can be some misregistration issues and pixel shifts between the pre-disaster and post-disaster images, further confusing the model. To address these issues, this thesis builds upon MambaBDA as the baseline model. MambaBDA fundamentally consists of siamese encoders and two decoders. The semantic decoder is responsible for creating the building localization map, and the change decoder is responsible for creating the damage classification map. All encoders and decoders are composed of four stages to enable utilizing multi-level features. Considering the aforementioned challenges, this thesis proposes three lightweight and modular enhancements that can further improve the already high-performing baseline. The proposed enhancements are explained as follows: (1) Adopting Focal Loss: In most cases, the damage distribution in datasets is heavily skewed towards“no damage”class, or in some cases the other classes can also face imbalance problem. Focal loss aims to address this by down-weighting the easy majority classes and increasing the impact of minority class samples. Since this is about the classification part only, focal loss is applied only on the damage classification head and it is combined with the cross-entropy loss that is already being used in the baseline. This enhancement will be referred to as FOCAL. (2) Attention Gate (AG) Integration: The skip connections between the encoders and decoders often carry irrelevant information. In order to retain only the relevant information, and make the model focus on the targeted regions, lightweight AG modules are integrated. AGs work fundamentally as soft masking gates and enable the model to make more accurate predictions. This enhancement is examined as two variants: AGB, where only the building head contains AGs, and AGBD where both the building and damage heads contain AGs. In both, the AG modules are placed between the four stages of the decoder. (3) Custom Alignment Module: The alignment module aims to dynamically compensate possible misalignments between the pre-disaster and post-disaster images. It is a shallow convolutional network that consists of three 3 x 3 convolution layers and ReLU activation function in-between. It works by predicting a pixel shift flow map, and warping the pre-disaster features according to post-disaster features. The enhancements are tested in detail on four datasets: xBD, Pakistan Flooding, Turkey Earthquake, and Hurricane Ida. The damage data in the datasets consist of four classes:“no damage”,“minor damage”,“major damage”, and“destroyed”. The experiments are structured in two categories: in-domain, in which the models are tested on the test split of the same dataset, and cross-dataset, in which the models are tested on different datasets from the ones they are trained on, which serves as unseen domain evaluation. In all experiments, the evaluated models include the baseline, the individual enhancements, and combinations of the three enhancements. For the evaluation metrics, building localization $F_1^{loc}$, damage classification $F_1^{clf}$, and overall score $F_1^{oa} = 0.3F_1^{loc} + 0.7F_1^{clf}$ are reported. The experiment results show that the proposed enhancements provide consistent benefits, with the largest improvements noticeable in unseen domain tests. In in-domain tests, the proposed modules increase the baseline's overall score by 0.82% to 5.02%. In cross-dataset tests, the proposed modules are able to increase the scores by up to 27.04%, which indicates strongly improved generalization across disasters. A detailed examination of the localization and class-specific scores show that: focal loss primarily improves the classification scores of minority and hard classes; attention gates are able to improve both the localization and classification scores in most experiments; and the alignment module also contributes in some cases, and is especially more beneficial when combined with focal loss and attention gate enhancements. In conclusion, this thesis provides low-overhead modular enhancements that can improve the performance and robustness of a state-of-the-art BDA model, especially under domain shift scenarios.
Benzer Tezler
- Improved measurement of residual strength in the in situ wedge shear test
Başlık çevirisi yok
TURGUT AYBAK
- Improved synthesis of computer generated digital amplitude holograms
Bilgisayarla geliştirilmiş sayısal genlik hologramlarının üretilmesi
MEHMET HALUK GÜVEN
Doktora
İngilizce
1991
Fizik ve Fizik MühendisliğiOrta Doğu Teknik ÜniversitesiFizik Bölümü
PROF.DR. RAMAZAN AYDIN
- Improved transmitting boundaries by the use of the residual variable method
Artık değişken metodu kullanılarak geliştirilmiş sınır koşulları
KAĞAN TUNCAY
Yüksek Lisans
İngilizce
1993
Kimya MühendisliğiOrta Doğu Teknik ÜniversitesiMühendislik Bilimleri Ana Bilim Dalı
PROF. DR. NURİ AKKAŞ
- Improved oil recovery using alkaline solutions in limestone medium
Kireçtaşı ortamında alkali çözeltilerde geliştirilmiş petrol kurtarımı
ULAŞ TÜRKSOY
Yüksek Lisans
İngilizce
1997
Petrol ve Doğal Gaz MühendisliğiOrta Doğu Teknik ÜniversitesiPetrol ve Doğal Gaz Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. SUAT BAĞCI
- Improved semi analytical method for sensitivity analysis of plates and shells
Plak ve kabukların duyarlılık analizi için geliştirilmiş yarı analitik metod
YUNUS EMRE APAYDIN
Yüksek Lisans
İngilizce
1997
Makine MühendisliğiUludağ ÜniversitesiMakine Mühendisliği Ana Bilim Dalı
PROF. DR. SUHA ORAL