Geri Dön

Imagining alternative actions for improved sample efficiency during policy learning

Politika öğrenimi sırasında artırılmış örnek verimliliği için alternatif eylemlerin hayal edilmesi

  1. Tez No: 882893
  2. Yazar: MUHAMMET HATİPOĞLU
  3. Danışmanlar: DOÇ. DR. EMRE UĞUR
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2024
  8. Dil: İngilizce
  9. Üniversite: Boğaziçi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez, yerel olarak öğrenilen yaklaşık bir dünya modeline dayalı alternatif eylemlerin hayal edilmesini içeren yeni bir mekanizma aracılığıyla pekiştirmeli öğrenmede örnek verimliliğini artırmayı araştırmaktadır. Bu yaklaşım, sürekli Cart Pole, Hopper ve Walker2d gibi çeşitli simüle edilmiş ortamlarda uygulanmış ve politika ağ mimarisinde Koşullu Sinir Süreçleri (CNP) ve Çok Katmanlı Perseptronların (MLP) kullanılmasının potansiyel faydalarını incelemekle kalmayıp, hipotetik ödüllere ve hipotetik durum-eylem değer yaklaşımlarına dayanan iki farklı yeni hedefin kullanımını da araştır-maktadır. Bulgularımız, CNP'lerin test edilen ortamlarda öğrenmeyi geliştirmediğini gösterirken, alternatif eylem hayal etme mekanizmasının, MLP'ler ve öğrenilmiş dünya modelleri ile uygulandığında performansı artırma potansiyeline sahip olduğunu ortaya koymuştur. Özellikle bu mekanizma, keşfi etkili bir şekilde yönlendirerek, iki deneyde potansiyel olarak daha hızlı yakınsama ve ortalama bölüm getirilerinde iyileşmeye yol açmıştır. Bununla birlikte, bu mekanizmanın etkinliği farklı deney ortamları arasında değişiklik göstermiş ve Walker2d ortamında daha az belirgin olmuştur. Çalışma ayrıca, mükemmel dünya modeli kullanıldığı takdirde önerilen yöntemin sub-optimal politikalara yakınsaması riskini deneysel olarak ortaya koymuştur.

Özet (Çeviri)

This study explores enhancing sample efficiency in reinforcement learning by a novel mechanism that involves the imagination of alternative actions based on a learned local approximate world model. Two different novel objectives for imagined actions that are based on hypothetical rewards and hypothetical state-action value approximations are also implemented. The potential benefits of using Conditional Neural Processes (CNP) as the policy network architecture are also investigated in comparative analyses. The proposed method is tested in several simulated environments, including Continuous Cart Pole, Hopper, and Walker2d. Our findings reveal that while CNPs do not improve learning in the tested environments, the alternative action imagination mechanism shows promise for improving performance when implemented with MLPs and learned world models. In particular, this mechanism effectively guided exploration, leading to potentially faster convergence and improved average episode returns in two experiments. However, its effectiveness varied across different setups and was less pronounced in the Walker2d environment. The study also highlighted the risks of over-optimization when using perfect world models, emphasizing the benefits of learned models in maintaining effective exploration and preventing premature convergence to sub-optimal policies.

Benzer Tezler

  1. Kobaylarda splenik ototransplantasyon ve postsplenektomi sepsisi

    Başlık çevirisi yok

    S.ÇAĞATAY ÇİFTER

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    1987

    Genel CerrahiGazi Üniversitesi

    Genel Cerrahi Ana Bilim Dalı

  2. Çocuklarda vezikoüreteral reflü değerlendirilmesinde radyonüklid yöntemler

    Başlık çevirisi yok

    AHMET YASER MÜSLÜMANOĞLU

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    1987

    Çocuk Sağlığı ve Hastalıklarıİstanbul Üniversitesi

    Üroloji Ana Bilim Dalı

  3. İki boyutludan üç boyutlu görüntüye

    Başlık çevirisi yok

    GÜRSOY BACAKSIZ