Stereo görüntülerinde derin öğrenme temelli derinlik tahmini algoritmalarının karşılaştırılması ve iyileştirilmesi
Comparison and improvement of deep learning based depth estimation algorithms in stereo images
- Tez No: 1005994
- Danışmanlar: DR. ÖĞR. ÜYESİ ZAHRA ELMI
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Bilim ve mühendislik uygulamaları, Yazılım mühendisliği, Science and engineering practices, Software engineering
- Yıl: 2026
- Dil: Türkçe
- Üniversite: İstanbul Sabahattin Zaim Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Stereo eşleştirme temelli derinlik tahmini, farklı kamera açılarından elde edilen eşleşmiş görüntülerden üç boyutlu bilgi çıkaran bilgisayarla görmenin temel problemlerinden birisidir. Bu çalışma, özellik çıkarma kabiliyetlerini ve derinlik tahmini performansını iyileştirmek için RAFT-Stereo modeline ConvNeXt mimarisinin entegre edildiği geliştirilmiş bir stereo eşleştirme yaklaşımı sunmaktadır. Önerilen yöntem, RAFT-Stereo modelinde yer alan mevcut ResNet tabanlı özellik çıkarma yöntemini, stereo eşleştirme görevlerine uyarlanmış ImageNet ön-eğitimli ağırlıkları kullanan ConvNeXt-Tiny ve ConvNeXt-Small yöntemlerle değiştirmektedir. Önerilen model SceneFlow veri setinde eğitilmiş ve ETH3D veri setinde değerlendirilmiştir. Performans değerlendirmesi, farklı derinlik aralıklarında (yakın, orta ve uzak mesafeler) uç nokta hatası, hatalı piksel oranı ve D1 hatası gibi standart metrikler kullanılarak gerçekleştirilmiştir. Bunlarla birlikte, modelin hesaplama verimliliği saniyedeki kare sayısı ve çalışma süresi metrikleri ile değerlendirilmiştir. Deneysel sonuçlar, ConvNeXt entegre edilmiş modelin, dokusuz bölgeler ve tekrarlayan desenler içeren karmaşık görüntülerde derinlik tahmini sürecinde daha iyi sonuçlar elde ettiğini göstermiştir. Bu çalışma, modern CNN mimarilerinin stereo derinlik tahmini algoritmalarını iyileştirme sürecinde etkinliğini göstererek stereo eşleştirmenin geliştirilmesine katkıda bulunmaktadır. Bulgular, ConvNeXt gibi gelişmiş özellik çıkarım yöntemlerinden yararlanmanın, hesaplama karmaşıklığını arttırmadan mevcut stereo derinlik tahmini modellerinin performansını arttırabileceğini göstermektedir.
Özet (Çeviri)
Stereo matching-based depth estimation is one of the fundamental problems in computer vision that extracts three-dimensional information from paired images obtained from different camera angles. This study presents an improved stereo matching approach where ConvNeXt architecture is integrated into the RAFT-Stereo model to enhance feature extraction capabilities and depth estimation performance. The proposed method replaces the existing ResNet-based feature extraction method in RAFT-Stereo model with ConvNeXt-Tiny and ConvNeXt-Small methods using ImageNet pre-trained weights adapted to stereo matching tasks. The proposed model was trained on the SceneFlow dataset and evaluated on the ETH3D dataset. Performance evaluation was conducted using standard metrics such as End-Point Error, Bad-pixel ratio, and D1-all error across different depth ranges (near, medium and far distances). Additionally, the computational efficiency of the model was evaluated using frames per second and runtime metrics. Experimental results demonstrated that the ConvNeXt-integrated model achieved better results in depth estimation process on complex images containing textureless regions and repetitive patterns. This work contributes to the advancement of stereo matching by demonstrating the effectiveness of modern CNN architectures in improving stereo depth estimation algorithms. The findings indicate that leveraging advanced feature extraction methods like ConvNeXt can enhance the performance of existing stereo depth estimation models without increasing computational complexity.
Benzer Tezler
- Monodepth-based object detection and depth sensing for autonomous vehicle vision systems
Monodepth tabanlı otonom araç görüş sistemleri için nesne tespiti ve derinlik algılama
EMRE ÇETİN
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ GÖKHAN SEÇİNTİ
- A deep learning approach to surface reconstruction for surgical navigation during laparoscopic, endoscopic or robotic surgery
Laparoskopik, endoskopik ve robotik cerrahide navigasyon (yön bulma) amacıyla derin öğrenme yaklaşımıyla organ yüzeyi oluşturma
AMIN ZABARDAST
Yüksek Lisans
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiSağlık Bilişimi Ana Bilim Dalı
PROF. DR. ÜNAL ERKAN MUMCUOĞLU
- Evaluation of stereo matching algorithms for digital surface model generation from high-resolution satellite imagery
Yüksek çözünürlüklü uydu görüntülerinden dijital yüzey modeli üretimi için stereo eşleme algoritmalarinin değerlendirilmesi
YAZGI NUR SAYIN
Yüksek Lisans
İngilizce
2025
Jeodezi ve FotogrametriHacettepe ÜniversitesiGeomatik Mühendisliği Ana Bilim Dalı
PROF. DR. ALİ ÖZGÜN OK
- Ai-based visual odometry implementation on an embedded system
Yapay zeka tabanlı görsel odometrinin gömülü bir sistemde gerçeklemesi
OĞUZHAN BÜYÜKSOLAK
Yüksek Lisans
İngilizce
2023
Savunma ve Savunma Teknolojileriİstanbul Teknik ÜniversitesiSavunma Teknolojileri Ana Bilim Dalı
PROF. DR. ECE OLCAY GÜNEŞ
- Storefront logo recognition and stereo vision based distance estimation
Mağaza logosu tanıma ve stereo görüntü tabanlı mesafe kestirimi
MEHMET BİBERCİ
Yüksek Lisans
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. ULUĞ BAYAZIT