Geri Dön

Robust and adaptive deep reinforcement learning

Gürbüz ve uyarlanabilir derin pekiştirmeli öğrenme

  1. Tez No: 991140
  2. Yazar: SUZAN ECE ADA
  3. Danışmanlar: DOÇ. DR. EMRE UĞUR, PROF. DR. ERHAN ÖZTOP
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Yapay zeka, Artificial intelligence
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Boğaziçi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez, karmaşık, Markov olmayan ve durağan olmayan ortamlarda gürbüz ve uyarlanabilir pekiştirmeli öğrenme tabanlı etmenler geliştirme zorluğunu ele almaktadır. Koşullu Sinirsel Süreçler ile Gözetimsiz Meta-Sınama (UMCNP), sınama zamanında ödül sinyalleri eksik olduğunda bilinmeyen dinamikler altında az örnekli uyarlamayı hedeflemektedir. UMCNP, kendi ürettiği gezingeler aracılığıyla etkin örneklemli uyarlama sağlamak için bir model öğrenir. Çift yönlü İlerleyen Sinir Ağları ile Epizodik Getiri İlerlemesi (ERP-BPNN), otonom görev geçişi için yeni bir içsel motivasyon sinyali (ERP) ile morfolojik olarak farklı etmenler arasında yetenek aktarımını sağlayan çift yönlü ilerleyen sinir ağlarını birleştirerek insan esinli bir çoklu görev pekiştirmeli öğrenme çatısı sağlar. Yayınım Politikaları için Durum Geri Çatma (SRDP), bir durum geri çatma yitimini yayınım politikası öğrenme sürecine dahil ederek çevrimdışı pekiştirmeli öğrenmede dağılım dışı durumlara genelleme yapma zorluğunun üstesinden gelir. Durağan Olmayan Çevrimdışı Pekiştirmeli Öğrenmede Öngörü (FORL), koşullu yayınım modellerini olasılıksal örneksiz zaman dizisi temel modelleri ile birleştirerek zorlu durağan olmayan durumları ele alır. Bu çatı, ani, saklı gözlem sapmalarını proaktif olarak öngörür ve düzeltir. Sürekli kontrol, çevrimdışı pekiştirmeli öğrenme deneyleri ve robotik görevler üzerindeki deneysel değerlendirmeler, bu yöntemlerin etkinliğini doğrulamaktadır. Çıkarımlarımız, meta sınama örneklem etkinliğinde önemli iyileşmeler, getiri ilerlemesi kullanılarak eğitilen çift yönlü yetenek aktarımı yoluyla daha hızlı yakınsama, dağılım dışı durumlara üstün genelleme ve gözlem işlevindeki ani, Markov olmayan kaymalara karşı gürbüz başarı göstermektedir.

Özet (Çeviri)

This thesis addresses the challenge of developing robust and adaptive reinforcement learning (RL) agents that operate in complex, non-Markovian, and non-stationary environments. Unsupervised Meta-Testing with Conditional Neural Processes (UMCNP) addresses few-shot adaptation under unknown dynamics when reward signals are missing at test time. UMCNP learns a dynamics model to enable sample-efficient adaptation through self-generated trajectories. Episodic Return Progress with Bidirectional Progressive Neural Networks (ERP-BPNN) presents a human-inspired framework for multi-task learning by integrating a novel intrinsic motivation signal (ERP) for autonomous task switching with a bidirectional progressive neural network architecture, thereby facilitating effective skill transfer among morphologically different agents. State Reconstruction for Diffusion Policies (SRDP) confronts the challenge of generalization to out-of-distribution states in offline RL by incorporating a state reconstruction loss into the diffusion policy learning process. Forecasting in Non-stationary Offline RL (FORL) mitigates non-trivial non-stationarities by unifying conditional diffusion models with probabilistic zero-shot time-series foundation models. This framework proactively forecasts and corrects for abrupt, hidden observation offsets. Empirical evaluations across a range of continuous control, offline RL benchmarks, and robotics tasks confirm the efficacy of these methods. Our results demonstrate significant improvements in meta-testing sample efficiency, faster convergence via bidirectional skill transfer with return progress, superior generalization to out-of-distribution states, and robust performance against abrupt, non-Markovian shifts in the observation function.

Benzer Tezler

  1. Balancing mixed adversarial perturbations: Towards robust reinforcement learning

    Karma çekişmeli bozulmaları dengeleme: Gürbüz pekiştirmeli öğrenmeye doğru

    MUSTAFA ERDEM

    Doktora

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. NAZIM KEMAL ÜRE

  2. Makine öğrenmesi yöntemleri ile hibrit ve kompozit ZA-27 alaşımlarının aşınma davranışlarının karşılaştırmalı analizi

    Comparative analysis of wear behavior of hybrid and composite ZA-27 alloys using machine learning methods

    SENA NUR ADIYAMAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Endüstri ve Endüstri MühendisliğiSakarya Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. GÜLTEKİN ÇAĞIL

  3. Türkiye enerji piyasasının makine öğrenmesi uygulamasıyla düşük-karbon salımına geçişte ajan temelli modellenmesi

    Turkish energy market agent-based modeling for low-carbon transition with machine learning application

    BURAK GÖKÇE

    Doktora

    Türkçe

    Türkçe

    2026

    Enerjiİstanbul Teknik Üniversitesi

    Enerji Bilimi ve Teknolojileri Ana Bilim Dalı

    PROF. DR. GÜLGÜN KAYAKUTLU

  4. Makine öğrenmesi tabanlı iç ortam sıcaklık kontrolü için bir simülatör yazılımı tasarımı

    Design of a simulator software for machine learning-based indoor temperature control

    AYDIN BOSTANCI

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. DEVRİM AKGÜN

  5. Otonom dronlar için bir akıllı navigasyon ve engellerden kaçınma sistemi

    An intelligent navigation and obstacles avoidance system for autonomous drones

    MUZZAMIL ALI HASSAN MAHMOUD

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Elektrik ve Elektronik MühendisliğiBursa Uludağ Üniversitesi

    Devreler ve Sistemler Ana Bilim Dalı

    PROF. DR. ERSEN YILMAZ