Robust and adaptive deep reinforcement learning
Gürbüz ve uyarlanabilir derin pekiştirmeli öğrenme
- Tez No: 991140
- Danışmanlar: DOÇ. DR. EMRE UĞUR, PROF. DR. ERHAN ÖZTOP
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Yapay zeka, Artificial intelligence
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Boğaziçi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez, karmaşık, Markov olmayan ve durağan olmayan ortamlarda gürbüz ve uyarlanabilir pekiştirmeli öğrenme tabanlı etmenler geliştirme zorluğunu ele almaktadır. Koşullu Sinirsel Süreçler ile Gözetimsiz Meta-Sınama (UMCNP), sınama zamanında ödül sinyalleri eksik olduğunda bilinmeyen dinamikler altında az örnekli uyarlamayı hedeflemektedir. UMCNP, kendi ürettiği gezingeler aracılığıyla etkin örneklemli uyarlama sağlamak için bir model öğrenir. Çift yönlü İlerleyen Sinir Ağları ile Epizodik Getiri İlerlemesi (ERP-BPNN), otonom görev geçişi için yeni bir içsel motivasyon sinyali (ERP) ile morfolojik olarak farklı etmenler arasında yetenek aktarımını sağlayan çift yönlü ilerleyen sinir ağlarını birleştirerek insan esinli bir çoklu görev pekiştirmeli öğrenme çatısı sağlar. Yayınım Politikaları için Durum Geri Çatma (SRDP), bir durum geri çatma yitimini yayınım politikası öğrenme sürecine dahil ederek çevrimdışı pekiştirmeli öğrenmede dağılım dışı durumlara genelleme yapma zorluğunun üstesinden gelir. Durağan Olmayan Çevrimdışı Pekiştirmeli Öğrenmede Öngörü (FORL), koşullu yayınım modellerini olasılıksal örneksiz zaman dizisi temel modelleri ile birleştirerek zorlu durağan olmayan durumları ele alır. Bu çatı, ani, saklı gözlem sapmalarını proaktif olarak öngörür ve düzeltir. Sürekli kontrol, çevrimdışı pekiştirmeli öğrenme deneyleri ve robotik görevler üzerindeki deneysel değerlendirmeler, bu yöntemlerin etkinliğini doğrulamaktadır. Çıkarımlarımız, meta sınama örneklem etkinliğinde önemli iyileşmeler, getiri ilerlemesi kullanılarak eğitilen çift yönlü yetenek aktarımı yoluyla daha hızlı yakınsama, dağılım dışı durumlara üstün genelleme ve gözlem işlevindeki ani, Markov olmayan kaymalara karşı gürbüz başarı göstermektedir.
Özet (Çeviri)
This thesis addresses the challenge of developing robust and adaptive reinforcement learning (RL) agents that operate in complex, non-Markovian, and non-stationary environments. Unsupervised Meta-Testing with Conditional Neural Processes (UMCNP) addresses few-shot adaptation under unknown dynamics when reward signals are missing at test time. UMCNP learns a dynamics model to enable sample-efficient adaptation through self-generated trajectories. Episodic Return Progress with Bidirectional Progressive Neural Networks (ERP-BPNN) presents a human-inspired framework for multi-task learning by integrating a novel intrinsic motivation signal (ERP) for autonomous task switching with a bidirectional progressive neural network architecture, thereby facilitating effective skill transfer among morphologically different agents. State Reconstruction for Diffusion Policies (SRDP) confronts the challenge of generalization to out-of-distribution states in offline RL by incorporating a state reconstruction loss into the diffusion policy learning process. Forecasting in Non-stationary Offline RL (FORL) mitigates non-trivial non-stationarities by unifying conditional diffusion models with probabilistic zero-shot time-series foundation models. This framework proactively forecasts and corrects for abrupt, hidden observation offsets. Empirical evaluations across a range of continuous control, offline RL benchmarks, and robotics tasks confirm the efficacy of these methods. Our results demonstrate significant improvements in meta-testing sample efficiency, faster convergence via bidirectional skill transfer with return progress, superior generalization to out-of-distribution states, and robust performance against abrupt, non-Markovian shifts in the observation function.
Benzer Tezler
- Balancing mixed adversarial perturbations: Towards robust reinforcement learning
Karma çekişmeli bozulmaları dengeleme: Gürbüz pekiştirmeli öğrenmeye doğru
MUSTAFA ERDEM
Doktora
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. NAZIM KEMAL ÜRE
- Makine öğrenmesi yöntemleri ile hibrit ve kompozit ZA-27 alaşımlarının aşınma davranışlarının karşılaştırmalı analizi
Comparative analysis of wear behavior of hybrid and composite ZA-27 alloys using machine learning methods
SENA NUR ADIYAMAN
Yüksek Lisans
Türkçe
2024
Endüstri ve Endüstri MühendisliğiSakarya ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÜLTEKİN ÇAĞIL
- Türkiye enerji piyasasının makine öğrenmesi uygulamasıyla düşük-karbon salımına geçişte ajan temelli modellenmesi
Turkish energy market agent-based modeling for low-carbon transition with machine learning application
BURAK GÖKÇE
Doktora
Türkçe
2026
Enerjiİstanbul Teknik ÜniversitesiEnerji Bilimi ve Teknolojileri Ana Bilim Dalı
PROF. DR. GÜLGÜN KAYAKUTLU
- Makine öğrenmesi tabanlı iç ortam sıcaklık kontrolü için bir simülatör yazılımı tasarımı
Design of a simulator software for machine learning-based indoor temperature control
AYDIN BOSTANCI
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. DEVRİM AKGÜN
- Otonom dronlar için bir akıllı navigasyon ve engellerden kaçınma sistemi
An intelligent navigation and obstacles avoidance system for autonomous drones
MUZZAMIL ALI HASSAN MAHMOUD
Yüksek Lisans
Türkçe
2025
Elektrik ve Elektronik MühendisliğiBursa Uludağ ÜniversitesiDevreler ve Sistemler Ana Bilim Dalı
PROF. DR. ERSEN YILMAZ