Geri Dön

Multimodal sensor fusion for detecting and classifying robot manipulation failures

Robot manipülasyon hatalarını tespit ve sınıflandırma için çoklu sensör füzyonu

  1. Tez No: 986633
  2. Yazar: ARDA İNCEOĞLU
  3. Danışmanlar: PROF. DR. SANEM SARIEL UZER, DOÇ. DR. EREN ERDAL AKSOY
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Görsel algılama, Otonom robotlar, Yapay zeka, Visual perception, Autonomous robots, Artificial intelligence
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: İstanbul Teknik Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Robotlar, yapılandırılmış endüstriyel ortamlardan çıkıp, evler ve hastaneler gibi karmaşık ve dinamik günlük yaşam alanlarına giderek daha fazla entegre olmaktadır. Ancak bu yeni ortamlar, insan etkileşimleri ve dağınık nesne düzenlemeleri gibi belirsizlikler içermektedir. Bu belirsizlikler, robotların manipülasyon eylemlerinin beklenmedik, istenmeyen veya güvensiz sonuçlara yol açmasına neden olabilir. Bu nedenle, robotların insanlar ile beraber otonom ve güvenli bir şekilde çalışabilmeleri için olası kazaları önleyecek ve görevlerin yürütülmesi sırasında oluşan başarısızlıkları fark edecek izleme ve hata tespit sistemlerine ihtiyaç duyulmaktadır. Bu tez, robotların ortamla ve nesnelerle etkileşim görevlerinde ortaya çıkan hataların tespiti ve sınıflandırılması için çoklu sensör verilerinin birleştirilmesine odaklanan kapsamlı bir çalışmayı sunmaktadır. Robotlar, RGB-D kameralar, mikrofonlar ve kuvvet-tork sensörleri gibi çeşitli sensörlerle donatılmıştır. Tezde özellikle görsel ve işitsel modalitelerin tamamlayıcı doğasına odaklanılmıştır. Görsel sensörler, nesnelerin konumu ve sahne yapısı gibi mekansal ilişkileri yakalarken; işitsel sensörler, özellikle robotun uzuvlarının hareketi esnasında görüş alanını kapattığı (occlusion) durumlarda veya görüş alanı dışındaki alanlarda meydana gelen çarpışma, düşme gibi kritik olayları tespit ederek görsel verinin eksiklerini tamamlamaktadır. Farklı tipteki sensörlerden gelen verilerin tümleştirilmesi, algılamayı ve kontrolü önemli ölçüde iyileştirebilir; ancak bu süreç bir dizi zorluğu beraberinde getirmektedir. Bu zorluklar arasında sensör kalibrasyonu, senkronizasyon, veri temsili, gürültü ve belirsizlik, veri ilişkilendirme ve hesaplama karmaşıklığı bulunmaktadır. Tezin temel amacı, robot manipülasyon başarısızlıklarını tespit etmek ve sınıflandırmak için çoklu sensör verilerini tümleştiren yeni bir yaklaşım sunmaktır. Bu amaçla, sensör işleme ve tümleştirme zorluklarını ele alan iki ana mimari önerilmiştir: FINO-Net (Convolutional Neural Network tabanlı) ve MAVI (Transformer tabanlı). Her iki mimari de RGB, derinlik ve ses verilerini işleyerek başarısızlıkları tespit etmek ve sınıflandırmak için tasarlanmıştır. Hata tespitinin kritik önemine rağmen, literatürdeki mevcut veri kümeleri bu ihtiyacı karşılamada yetersiz kalmaktadır. Son yıllarda özellikle robot becerisi öğrenme (skill learning) görevleri için büyük ölçekli manipülasyon veri kümeleri toplama çabaları artsa da bu çabalar neredeyse tamamen başarılı eylemlere odaklanmıştır. Manipülasyon sırasında ortaya çıkan hatalar bu veri kümelerinde göz ardı edilmiştir. Hata sezme odaklı veri kümeleri ise kısıtlı sayıda örnek içermekte veya tekil sensör kipine odaklanmaktadır. Bu tezde ilk olarak robot manipülasyon başarısızlıklarını içeren çoklu sensör verilerini içeren FAILURE veri kümesi tanıtılmıştır. Bu veri kümesi, derinlik kamerası, mikrofon ile donatılmış bir baxter robotundan elde edilen sensör ve durum verilerini içermektedir. Veri kümesi, beş temel manipülasyon eylemini (itme, alma-yerleştirme, dökme, kabın içine yerleştirme ve üstüne koyma) kapsamaktadır. Her eylem, başarılı ve başarısız denemeleri içerecek şekilde ROS bag formatında senkronize bir şekilde kaydedilmiştir. FAILURE veri kümesi, ikili etiketler (başarı/başarısızlık), başarısızlık türleri (çarpışma, ıskalama, taşırma, dökme ve devirme) ve başarısızlığın hangi karede gerçekleştiğini belirten zaman damgaları ile zengin bir şekilde etiketlenmiştir. FINO-Net, çoklu sensör verilerini işlemek için evrişimli sinir ağları (CNN) ve ConvLSTM katmanlarını kullanan bir mimaridir. RGB ve derinlik görüntüleri erken tümleştirme ile işlenirken, ses verileri MFCC (Mel Frekans Kepstral Katsayıları) temsilleri kullanılarak ayrı bir dalda işlenir. Görsel ve işitsel özellikler, geç tümleştirme stratejisiyle birleştirilir ve tam bağlı katmanlara beslenir. FINO-Net, gerçek zamanlı işleme gereksinimlerini karşılamak için en iyilenmiştir ve manipülasyonun farklı aşamalarından örneklenen karelerle çalışabilir. Deneysel sonuçlar, FINO-Net'in başarısızlık tespiti ve sınıflandırmasında yüksek doğruluk sağladığını göstermektedir. Özellikle, çoklu sensör verilerinin birleştirilmesi, tek bir sensör kullanımına kıyasla daha iyi bir başarım göstermiştir. Tezin ikinci ana katkısı olan MAVI mimarisi, FINO-Net'in deterministik füzyon yaklaşımının ötesine geçerek, dönüştürücü tabanlı (transformer-based), uzamsal-zamansal ve belirsizliği dikkate alan (uncertainty-aware) bir model sunmaktadır. Bunun için Vision Transformer (ViT) yaklaşımını temel alır. Görsel verideki (RGB ve derinlik) uzamsal-zamansal bağımlılıkları yakalamak için ViT modelini adapte eder. Benzer şekilde ses verilerini (MFCC) de 2 boyutlu bir görüntü gibi ele alarak dönüştürücü blokları ile işler. Gerçek dünya senaryolarında, sensör verilerinin güvenilirliği çevresel faktörlere (örneğin, yetersiz aydınlatma nedeniyle görsel verinin bozulması veya arka plan gürültüsü nedeniyle işitsel verinin kirlenmesi) bağlı olarak anlık değişebilir. MAVI, her bir modaliteden (RGB, derinlik, ses) gelen tahminlerin yanı sıra, bu tahminlerin veri kaynaklı belirsizlik seviyelerini (aleatoric uncertainties) de hesaplar. Önerilen olasılıksal füzyon mekanizması, bu belirsizlik tahminlerini kullanarak sensör katkılarını dinamik bir şekilde ağırlıklandırır. Bu sayede, gürültülü veya bozuk bir sensörden gelen verinin etkisi otomatik olarak azaltılır ve modelin değişen sensör koşulları altındaki gürbüzlüğü artırılır. Her iki mimari de FAILURE veri kümesi üzerinde kapsamlı bir şekilde analiz edilmiştir. FINO-Net ile hata tespitinde 0.8656 F1-skoru ve hata sınıflandırılmasında 0.7959 F1-skoru elde edilmiştir. MAVI ile bu sonuçlar iyileştirilerek hata tespitinde 0.8705 F1-skoru, hata sınıflandırılmasında 0.8221 F1-skoru elde edilmiştir. Aleatorik belirsizlik modellemesi kullanan MAVI-RGBDA-Ale modelinin, bu mekanizmayı kullanmayan standart deterministik modele kıyasla somut bir başarı artışı gösterdiği gözlenmiştir. MAVI-RGBDA-Ale mimarisinin elde ettiği bu yüksek başarım (0.8705 F1-skoru), çoklu sensör füzyonunun önemini göstermektedir. Model, tüm modaliteleri (RGB, derinlik ve ses) birleştirdiğinde, hem en iyi tekil modalite (örn., MAVI-RGB-Ale, F1-skoru: 0.7459) hem de kısmi füzyon (örn., MAVI-RGBD-Ale, F1-skoru: 0.8244) sonuçlarını geride bırakmıştır. Tezde sunulan FAILURE veri kümesi sınırlı sayıda manipülasyon eylemlerini içermektedir. Gelecek çalışmalarda, daha fazla sensör modalitesinin (örneğin, dokunsal veriler) eklenmesi ve eylem, robot ve test ortamı sayısının arttırılarak modelin genelleme performansının iyileştirilmesi önerilmektedir. Bu tez, robotik manipülasyon alanında çoklu sensör verilerinin birleştirilmesi ile hata tespiti ve sınıflandırılması için yeni bir bakış açısı sunmaktadır. FAILURE veri kümesi, topluluk için açık bir kaynak olarak hizmet vermekte ve gelecekteki araştırmalara temel oluşturmaktadır. FINO-Net ve MAVI modellerinden elde edilen başarılı sonuçlar bu modellerin, endüstriyel ve ev içi robotik uygulamarında güvenilir ve gerçek zamanlı izleme sistemlerinin geliştirilmesi için umut verici olduklarını göstermektedir. Sonuç olarak, bu tez, çoklu sensör verilerinin robotik manipülasyon başarısızlıklarını tespit etmek ve sınıflandırmak için nasıl etkili bir şekilde kullanılabileceğini göstermektedir. Sunulan mimariler ve veri kümesi, gelecekteki araştırmalar için önemli bir adım teşkil etmektedir.

Özet (Çeviri)

As robots increasingly operate in unstructured daily environments alongside humans, ensuring safe manipulation and robust execution monitoring becomes critical for preventing accidents and maintaining reliable task execution. Effective failure detection in such complex scenarios requires integrating data from diverse sensors (e.g., RGB-D cameras, microphones, proprioceptive sensors). However, integrating sensory data from different sources introduces issues such as data representation, noise, spatio-temporal alignment, and computational complexity. This thesis addresses the challenges of detecting and classifying failures in robot manipulation tasks by leveraging multimodal sensor fusion. First, this thesis introduces the FAILURE dataset, a comprehensive benchmark for robot failure detection in manipulation tasks. Building on this, this study proposes two novel architectures, FINO-Net and MAVI, that enable robust failure detection and classification. Despite the importance of failure detection in robot manipulation, existing datasets rarely provide multimodal sensor data with detailed failure annotations. The FAILURE dataset, a key contribution, includes synchronized multimodal sensor data and annotations for success/failure outcomes and failure types (e.g., collision, spill). It supports diverse manipulation tasks such as pushing and pouring, providing a benchmark for future research. FINO-Net is a Convolutional Neural Network (CNN) based architecture that combines RGB, depth, and audio data for detection and classification of robot manipulation failures. It employs early fusion for visual modalities (RGB and depth) and late fusion for combining visual and auditory features. The architecture includes modality-specific branches: a visual branch with Convolutional-LSTM (ConvLSTM) layers for spatio-temporal processing and an auditory branch for audio feature extraction. Experiments on the FAILURE dataset, a comprehensive multimodal robot manipulation dataset, demonstrate FINO-Net's effectiveness, achieving high F1 scores (0.8656 for detection, 0.7959 for classification) by leveraging complementary sensor data. MAVI builds on insights from FINO-Net by adopting a transformer-based architecture that incorporates spatio-temporal and uncertainty modeling. It processes RGB, depth, and audio data separately using transformer blocks and fuses them through uncertainty-aware attention layers. The fusion mechanism dynamically weights modality contributions based on prediction uncertainties. MAVI outperforms FINO-Net on the FAILURE dataset, achieving improved F1 scores (0.8705 for detection and 0.8221 for classification) by leveraging multi-sensor data and aleatoric uncertainty modeling. Limitations include computational demands and the need for further generalization across tasks. Future work could extend evaluation to multiple robots, diverse environments, and a broader range of manipulation tasks to improve generalizability. Despite these limitations, this research advances robot perception by offering robust architectures for real-time failure detection and classification, enhancing robot autonomy in complex environments.

Benzer Tezler

  1. Identification of object manipulation anomalies for service robots

    Servis robotları için nesne etkileşim anomalilerinin tanısı

    DOĞAN ALTAN

    Doktora

    İngilizce

    İngilizce

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. SANEM SARIEL UZER

  2. Hand gesture recognition for Turkish sign language using electromyography for human-robot interaction

    İnsan-robot etkileşimi için elektromyografi kullanarak Türk işaret dili için el hareketi tanıma

    MUSTAFA SEDDIQI

    Yüksek Lisans

    İngilizce

    İngilizce

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. HATİCE KÖSE

  3. Multimodal sensing for manipulation failure detection

    Etkileşim hatası sezme için çok kipli algılama

    ARDA İNCEOĞLU

    Yüksek Lisans

    İngilizce

    İngilizce

    2018

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. SANEM SARIEL

  4. Sensör füzyonuna dayalı derin öğrenme yöntemleri ile nesne tanıma başarısının artırılması

    Increasing object detection success with deep learning methods based on sensor fusion

    AHMET ÖZCAN

    Doktora

    Türkçe

    Türkçe

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMilli Savunma Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ÖMER ÇETİN

  5. Fire detection algorithms using multimodal signal and image analysis

    Çokkipli işaret ve imge çözümleme tabanlı yangın tespit algoritmaları

    BEHÇET UĞUR TÖREYİN

    Doktora

    İngilizce

    İngilizce

    2009

    Elektrik ve Elektronik Mühendisliğiİhsan Doğramacı Bilkent Üniversitesi

    Elektrik ve Elektronik Mühendisliği Bölümü

    PROF. DR. A. ENİS ÇETİN