Geri Dön

Experience replay strategies for improving performance of deep off-policy actor-critic reinforcement learning algorithms

Derin politika dışı aktör-kritik pekiştirmeli öğrenme algoritmalarının performansını artırmak için deneyim tekrarı stratejileri

  1. Tez No: 955161
  2. Yazar: MEHMET EFE LORASDAĞI
  3. Danışmanlar: PROF. DR. SÜLEYMAN SERDAR KOZAT
  4. Tez Türü: Yüksek Lisans
  5. Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: İhsan Doğramacı Bilkent Üniversitesi
  10. Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Sürekli kontrol altında derin deterministik politika gradyan algoritmalarında, kritik öğrenimini hızlandırmak amacıyla kullanılan deneyim tekrar stratejilerinin, aktör tarafında dengesizliğe yol açtığını gözlemliyoruz. Öncelikli Deneyim Tekrarı gibi geleneksel yöntemler, hem aktör hem de kritik ağlarını güncellemek için aynı geçiş verilerini kullanır. Ancak bu ortak veri yaklaşımı, yüksek zamansal fark hatasına sahip geçişlerin, kritiğin değer fonksiyonunu öğrenmesi için faydalı olsa da, aktör açısından politikadan sapmış eylemleri temsil edebileceğini ve bu durumun yanıltıcı gradyanlar ile politikanın bozulmasına neden olabileceğini göz ardı etmektedir. Bu sorunu çözmek için Ayrıştırılmış Öncelikli Deneyim Tekrarı adını verdiğimiz yeni bir metot öneriyoruz. Bu yöntem, aktör ve kritik için geçiş örneklemeyi açıkça birbirinden ayırarak, her birinin farklı öğrenme hedeflerine hizmet etmektedir. Kritik tarafında, geleneksel önceliklendirme şemasını kullanarak, yüksek zamansal fark hatasına sahip geçişleri seçer ve değer fonksiyonunun verimli bir şekilde öğrenilmesini destekler. Aktör için ise, Ayrıştırılmış Öncelikli Deneyim Tekrarı yeni bir örnekleme stratejisi getirir. Bu strateji, bellekteki eylemler ile mevcut politikanın önerdiği eylemler arasındaki Kullback–Leibler uzaklığını minimize ederek, daha çok politika içi geçişleri seçer. Ayrıştırılmış Öncelikli Deneyim Tekrarı'nı, güncel en iyi yöntemlerden biri olan Twin Delayed Deep Deterministic Policy Gradient algoritması ile entegre ediyor ve OpenAI Gym ile MuJoCo'nun altı standart sürekli kontrol problemlerinde değerlendiriyoruz. Sonuçlar, Ayrıştırılmış Öncelikli Deneyim Tekrarı'nın öğrenmeyi sürekli olarak hızlandırdığını ve hem klasik hem de öncelikli deneyim tekrar yöntemlerine kıyasla daha yüksek performansa ulaştığını göstermektedir. Daha da önemlisi, Ayrıştırılmış Öncelikli Deneyim Tekrarı, Öncelikli Deneyim Tekrarı'nın başarısız olduğu görevlerde dahi öğrenme stabilitesini koruyarak güçlü politikalarla sonuçlanmaktadır. Yaptığımız ayrıntılı analizler, bu dayanıklılığın ana sebebinin örnekleme ayrıştırması olduğunu doğrulamakta ve Ayrıştırılmış Öncelikli Deneyim Tekrarı'nın sağladığı faydaların, hesaplama açısından ucuz bir optimizasyon ile elde edilebildiğini ortaya koymaktadır. Bu da Ayrıştırılmış Öncelikli Deneyim Tekrarı'nı politika dışı öğrenmeyi geliştirmek için pratik ve etkili bir çözüm haline getirmektedir.

Özet (Çeviri)

We investigate an important conflict in deep deterministic policy gradient algorithms where experience replay strategies designed to accelerate critic learning can destabilize the actor. Conventional methods, including Prioritized Experience Replay, sample a single batch of transitions to update both networks. This shared data approach ignores the fact that transitions with high temporal difference error, while beneficial for the critic's value function estimation, may correspond to off-policy actions that can introduce misleading gradients and degrade the actor's policy. To resolve this, we introduce Decoupled Prioritized Experience Replay, a novel framework that explicitly separates the transition sampling for the actor and critic to serve their distinct learning objectives. For the critic, it employs a conventional prioritization scheme, sampling transitions with high temporal difference error to promote efficient learning of the value function. For the actor, however, Decoupled Prioritized Experience Replay introduces a new sampling strategy. It selects batches that are more on-policy by minimizing the Kullback–Leibler divergence between the actions stored in the buffer and those proposed by the current policy. We integrate Decoupled Prioritized Experience Replay with the state-of-the-art Twin Delayed Deep Deterministic policy gradient algorithm and conduct an evaluation on six standard continuous control benchmarks from OpenAI Gym and MuJoCo. The results show that Decoupled Prioritized Experience Replay consistently accelerates learning and achieves superior final performance compared to both vanilla and prioritized replay. More critically, Decoupled Prioritized Experience Replay maintains learning stability and converges to strong policies in tasks where standard prioritized replay failed to learn. Further ablation studies indicate that the decoupling mechanism is an important factor in this robustness and that the benefits of Decoupled Prioritized Experience Replay are achievable with a computationally inexpensive search, making it a practically effective solution for improving off-policy learning.

Benzer Tezler

  1. Eksternal etmoidektomiler

    Başlık çevirisi yok

    ERCÜMENT AKMAN

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    1987

    Kulak Burun ve BoğazGazi Üniversitesi

    Kulak Burun Boğaz Ana Bilim Dalı

    PROF.DR. NECMETTİN AKYILDIZ

  2. Gazi tipi eksternal fiksatörlerle yapılan uygulamalarda kırık hattındaki kompresyonun biyomekanik olarak“strain gage”lerle tayini

    Başlık çevirisi yok

    HÜSEYİN ŞENGÜL

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    1987

    Ortopedi ve TravmatolojiGazi Üniversitesi

    Ortopedi ve Travmatoloji Ana Bilim Dalı

    PROF. DR. ORHAN ASLANOĞLU

  3. Çekirdeksiz kuru üzümde uygulanan politikanın Ege Bölgesinde üretim ve üretici açısından sonuçlarının değerlendirilmesi

    Başlık çevirisi yok

    GÜVEN ÖZERİN

    Doktora

    Türkçe

    Türkçe

    1986

    ZiraatEge Üniversitesi

    Tarım Ekonomisi Ana Bilim Dalı

    PROF. DR. METİN TALİM

  4. Ameliyat öncesi hastaların ameliyata ilişkin duyguları, düşünceleri ve bilgi istekleri

    The Pre-operative patiensts feelings throughts and information requirements concerning their surgical operations

    KADRİYE BULDUKOĞLU

    Yüksek Lisans

    Türkçe

    Türkçe

    1987

    HemşirelikCumhuriyet Üniversitesi

    Hemşirelik Ana Bilim Dalı

    YRD. DOÇ. DR. MELİHA ATALAY

  5. Türkiye'de son 30 yıl içinde karma yem üretimi ve teknolojisi alanındaki gelişmeler

    Başlık çevirisi yok

    RECEP ÇÖPTEN

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    ZiraatEge Üniversitesi

    Zootekni Ana Bilim Dalı

    PROF. DR. MUSTAFA ERGÜL