Prioritized experience deep deterministic policy gradient method for dynamic systems
Dinamik sistemler için öncelikli deneyimli derin deterministik politika gradyan yöntemi
- Tez No: 566186
- Danışmanlar: DOÇ. DR. AHMET ONAT
- Tez Türü: Yüksek Lisans
- Konular: Mekatronik Mühendisliği, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Mechatronics Engineering, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2019
- Dil: İngilizce
- Üniversite: Sabancı Üniversitesi
- Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Mekatronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışmada, pekiştirmeli öğrenme yoluyla dinamik sistemlerin kontrolünü öğrenme problemi ele alınmıştır. Dinamik sistemlerin kontrolünün öğrenmesi hususunda iki önemli problem vardır: ilintili örnek uzay ve çok boyutluluğun laneti: İlk problem, öğrenmek için kullanılan ardışık örneklerin, birbiriyle ilintili olmasından dolayı dinamik sistem kontrolünü öğrenmek için yeterli zengin veri setini sunamaması anlamına gelmektedir. İkinci problemse, büyük sayıda durum boyutuna sahip dinamik sistemler için durum uzayını niceliklerine ayırarak betimleme yaparak öğrenmek, öğrenilmesi gereken durum sayısını çok artıracağı için, öğrenmenin imkansız veyahut çok zor hale gelmesi anlamına gelir. Son zamanlarda, bu iki problem, güncel olan en iyi çalışma olan Derin Deterministik Politika Gradyan (DDPG) yoluyla çözülmeye çalışılmıştır. Bu çalışmada, Derin Deterministik Politika Gradyan yönteminin örnekleme yöntemini daha verimli bir yol olarak, Öncelikli Deneyimli Derin Deterministik Politika Gradyanı yöntemi öne sürülmüştür. Bu yöntem Derin Deterministik Politika Gradyanı yöntemine, Öncelikli Deneyim Tekrarı (Prioritized Experience Replay) yöntemindeki örnekleme yönteminin entegrasyonu olarak düşünülebilir. Bu yöntem ile, öğrenmenin her deneyimden eşit derece olmasının yerine, hatalı olan deneyimleri tekrar tekrar örnekleyerek, daha verimli öğrenmenin sağlanması amaçlanmıştır. Öncelikli Deneyimli Derin Deterministik Politika Gradyanı (PE-DDPG) yöntemi öne sürülmüş olup, bu yöntem OpenAI Gym aracındaki Ters Sarkaç problemi üzerinde test edilmiştir. Sonuçlar göstermektedir ki, önerilen yöntem öğrenme zamanını kısaltmış ve öğrenme sırasındaki varyansı da düşürerek daha kararlı bir öğrenme süreci sağlamıştır.
Özet (Çeviri)
In this thesis, the problem of learning to control a dynamic system through reinforcement learning is taken up. There are two important problems in learning to control dynamic systems under this framework: correlated sample space and curse of dimensionality: The first problem means that samples sequentially taken from the plant are correlated, and fail to provide a rich data set to learn from. The second problem means that plants with a large state dimension are untractable if states are quantized for the learning algorithm. Recently, these problems have been attacked by state-of-the-art algorithm called Deep Deterministic Policy Gradient method (DDPG). In this thesis, we propose a new algorithm Prioritized Experience DDPG (PE-DDPG) that improves the sample efficiency of DDPG, through a Prioritized Experience Replay mechanism integrated into the original DDPG. It allows the agent experience some samples more frequently depending on their novelty. PE-DDPG algorithm is tested on OpenAI Gym's Inverted Pendulum task. The results of experiment show that the proposed algorithm can reduce training time and it has lower variance which implies more stable learning process.
Benzer Tezler
- Kalkınmada öncelikli yörelerde görev yapan vali-kaymakam il ve ilçe Milli Eğitim Gençlik ve Spor Müdürlerinin ilköğretim yönetiminde karşılaştıkları güçlükler
Başlık çevirisi yok
MUSTAFA YALÇINKAYA
Yüksek Lisans
Türkçe
1987
Eğitim ve ÖğretimGazi ÜniversitesiEğitim Yönetimi Ana Bilim Dalı
DOÇ. DR. AYŞEGÜL ATAMAN
- İlçe Milli Eğitim Gençlik ve Spor Müdürlüklerinin görevlerini gerçekleştirme düzeyi (Ankara ili örneği)
Başlık çevirisi yok
Ş.ŞULE ERÇETİN(AÇIKALIN)
- Ağaçlandırmalarda çok ölçütlü karar verme
Multicriteria decision making in afforestation
AHMET TÜRKER
Doktora
Türkçe
1986
Ormancılık ve Orman Mühendisliğiİstanbul ÜniversitesiOrman Mühendisliği Ana Bilim Dalı
DOÇ. DR. UÇKUN GERAY
- Two class finite capacity queueing systems with switching server
Başlık çevirisi yok
YİĞİT BALLIGİL
Yüksek Lisans
İngilizce
1990
Endüstri ve Endüstri MühendisliğiBoğaziçi ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. ALİ RIZA KAYLAN