Temizlik robotlarında olaya dayalı reaktif planlama ve kapsama için hiyerarşik pekiştirmeli öğrenme
Hierarchical reinforcement learning for event-driven reactive planning and coverage in cleaning robots
- Tez No: 1016029
- Danışmanlar: DR. ÖĞR. ÜYESİ ALPASLAN BURAK İNNER
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Kocaeli Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez çalışmasında, temizlik robotlarının bilinmeyen ortamlarda tam kapsama görevini sürdürürken çevrimiçi ve stokastik olarak ortaya çıkan yüksek öncelikli kirlilik olaylarına zamanında ve etkin biçimde müdahale edebilmesi amaçlanmıştır. Bu kapsamda, Kapsama Yol Planlaması (Coverage Path Planning, CPP) probleminin dinamik bir genişletmesi olarak ele alınan Reaktif Temizlik için Olaya Dayalı Yeniden Planlama (Event-Driven Replanning for Reactive Cleaning, EDR-RC) problemi tanımlanmış; çok amaçlı ve durağan olmayan karar verme yapısına çözüm getirmek üzere Hiyerarşik Pekiştirmeli Öğrenme (Hierarchical Reinforcement Learning, HRL) tabanlı iki seviyeli bir yaklaşım geliştirilmiştir. Önerilen yaklaşımda karar verme süreci iki seviyeli olarak modellenmiştir. Üst seviyede yer alan yönetici politika, kapsama ilerlemesi ile tespit edilen kirlilik hedeflerinin durumunu birlikte değerlendirerek her T adımda bir yürütülecek alt politikayı seçmiştir. Alt seviyede ise bilinmeyen haritada kapsama oranını artırmaya odaklanan kapsama politikası ve seçilen kirlilik hedefine çarpışmadan ulaşmayı amaçlayan hedefe yönelim politikası tanımlanmıştır. Ortam, kısmi gözlemlenebilir Markov karar süreci (Partially Observable Markov Decision Process, POMDP) olarak modellenmiş; çok ölçekli robot merkezli harita temsilleri ve LiDAR gözlemleri ile kirlilik üretimi, algılanması ve temizlenmesi süreçleri simülasyon düzeyinde yapılandırılmıştır. Yönetici ödülü, kapsama artışı ile temizlenen kirlilik sayısını ortak bir ölçeğe getirecek biçimde tasarlanmış ve görev ya da hedef değişimi cezalarıyla kararlılık teşvik edilmiştir. Eğitim akışı aşamalı olarak yürütülmüş; alt seviye politikalar sürekli eylem uzayında (kapsama için Soft Actor-Critic (SAC), hedefe yönelim için Twin Delayed Deep Deterministic Policy Gradient (TD3)) eğitildikten sonra, yönetici politika ayrık eylem uzayı üzerinde Deep Q-Network (DQN) ile eğitilmiştir. Yöntem, kural tabanlı açgözlü (greedy) sezgisel yönetici ve olay farkındalığı olmayan salt kapsama yaklaşımı ile karşılaştırılmıştır. Elde edilen sonuçlar, önerilen HRL yaklaşımının kirlilik temizleme oranında %98,2 seviyesine ulaştığını ve kapsama başarımını yüksek düzeyde koruduğunu (%94,1 ± %5,3) göstermiştir. Buna karşılık, daha bütüncül görev başarımının yol uzunluğu (226,9 m) ve tepki gecikmesi (96 adım) gibi ölçütlerde maliyet oluşturduğu gözlenmiştir. Sezgisel yaklaşım düşük tepki gecikmesi sağlasa da kapsama performansında düşüş ve yüksek değişkenlik sergilemiştir (%62,9 ± %37,1). Salt kapsama yaklaşımı ise yüksek kapsama oranına (%98,5 ± %1,2) ulaşmasına karşın kirlilik temizleme performansı tanım gereği %0,0 olarak kalmıştır. Sonuçlar, EDR-RC probleminde kapsama ve kirlilik temizleme hedeflerinin birlikte optimize edilmesinin gerekli olduğunu ve HRL tabanlı zaman ölçekli karar yapısının bu dengeyi kurabildiğini ortaya koymuştur.
Özet (Çeviri)
This thesis addresses event-driven replanning for reactive cleaning (EDR-RC), a dynamic extension of coverage path planning in which a cleaning robot must maintain global area coverage while reacting to stochastically emerging, high-priority trash events. To tackle the resulting multi-objective and non-stationary decision-making problem, a two-level hierarchical deep reinforcement learning (HRL) framework is developed. The proposed system decomposes the task into a high-level manager and two low-level worker policies. The manager periodically selects which skill to execute for the next T steps based on the global coverage progress and the set of detected trash targets. At the low level, a coverage policy improves exploration and coverage in unknown maps, while a goal-conditioned navigation policy drives the robot to a selected trash location without collisions. The environment is modeled as a partially observable Markov decision process (POMDP) with multi-scale egocentric map observations, LiDAR sensing, and simulated trash generation, detection, and cleaning dynamics. A unified managerial reward is designed to balance coverage gains and cleaning outcomes by normalizing them onto a common scale, while penalizing excessive mode/target switching to promote stability. Training follows a staged pipeline: the coverage worker is trained with SAC, the navigation worker with TD3, and the manager with DQN due to its discrete action space. The framework is evaluated in simulation against a rule-based greedy manager and a pure coverage baseline without event awareness. Results indicate that the proposed HRL approach achieves a cleaning rate of 98.2% while preserving high coverage performance (94.1% ± 5.3%). This holistic performance comes with costs in operational efficiency, reflected by increased path length (226.9 m) and response delay (96 steps). The heuristic baseline yields fast reactions but suffers from low and highly variable coverage (62.9% ± 37.1%), whereas the pure coverage baseline reaches high coverage (98.5% ± 1.2%) but attains 0.0% cleaning by definition. Overall, the findings demonstrate that jointly optimizing coverage and event-driven cleaning is essential for EDR-RC, and that time-scale-separated HRL provides an effective mechanism for balancing these competing objectives.
Benzer Tezler
- Güneş panellerinin kirliliği sonucu temizlik robotlarına yönelik bölgesel yönlendirme sistemi
Regional guidance system for cleaning robots due to solar panel contamination
EMİN CANTEZ
Yüksek Lisans
Türkçe
2025
Mühendislik BilimleriBursa Teknik ÜniversitesiAkıllı Sistemler Mühendisliği Ana Bilim Dalı
DOÇ. DR. ÖMER FARUK EFE
DOÇ. DR. GÖKAY BAYRAK
- Path planning algorithm development for unmanned aerial and ground vehicles
İnsansız hava ve kara araçlarında yol planlama algoritması geliştirme
GİRAY UZUN
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiKontrol ve Otomasyon Mühendisliği Ana Bilim Dalı
PROF. DR. O.SETA BOGOSYAN
- Otonom mobil robotlarda doğruluk ve hız odaklı lokalizasyon algoritmalarının geliştirilmesi, uygulaması ve karşılaştırmalı analizi
Development, implementation, and comparative analysis of accuracy and speed-oriented localization algorithms in autonomous mobile robots
OZAN VAHİT ALTINPINAR
Doktora
Türkçe
2025
Mekatronik Mühendisliğiİstanbul Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
PROF. DR. VOLKAN SEZER
- Bir iç mekân robotunun tasarımının ve gezinge planlamasının derin öğrenme yöntemleriyle optimizasyonu
Optimization of the design and of the trajectory planning of an indoor robot with deep learning methods
DENİZ SAKARYA
Yüksek Lisans
Türkçe
2025
Mekatronik Mühendisliğiİskenderun Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
PROF. DR. BEŞİR DANDIL
- İç mekanlarda otonom bir şekilde hareket edebilen bir mobil robotun tasarım, imalat ve kontrolü
Design and control of an indoor autonomous mobile robot
SUAT KARAKAYA
Doktora
Türkçe
2019
Mekatronik MühendisliğiKocaeli ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
PROF. DR. HASAN OCAK