Reinforcement learning control for autorotation of a simple point-mass helicopter model
Basitleştirilmiş bir nokta-kütle helikopter modeli otorotasyonu için takviyeli öğrenme kontrolü
- Tez No: 520901
- Danışmanlar: DR. ÖĞR. ÜYESİ ALİ TÜRKER KUTAY
- Tez Türü: Yüksek Lisans
- Konular: Havacılık ve Uzay Mühendisliği, Aeronautical Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2018
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Havacılık ve Uzay Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Havacılık ve Uzay Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışma, basitleştirilmiş bir nokta-kütle helikopterin otorotasyonda güdümü problemine bir eyleyici-eleştirici takviyeli öğrenme metodu uygulamasını sunmaktadır. Otorotasyonda bir OH-58A helikopterinin nokta-kütle matematiksel modeli oluşturulmuştur. Bir takviyeli öğrenme elemanı, modelden bağımsız bir eyleyici-eleştirici algoritma tarafından, çok çekirdekli bir işlemci üzerinde paralel şekilde eğitilmiştir. Öğrenmenin amacı, yere değme noktasında, sıfır değerine çok yakın yatay ve dikey kinetik enerjiye ulaşmak olarak tanımlanmıştır. Öğrenme evreleri esnasında her bir ayrık zaman adımında takviyeli öğrenme elemanı bir çoğul-şartlı ödül fonksiyonuna bağlı olarak ödüllendirilmekte veya cezalandırılmaktadır. Ödül fonksiyonu yere değme noktasında yatay ve dikey hızlarının karelerinin ağırlıklandırılmış toplamının negatifini vermektedir. Takviyeli öğrenme elemanı eyleyici ve eleştirici olarak iki yapay sinir ağı fonksiyon kestirimcisinden oluşmaktadır. Eleştirici, bir durum değişkeni setinin değerini tahmin etmektedir. Eyleyici çıktıları, bir Gauss dağılımının orta noktasını temsil etmektedir. Bu dağılımlardan örneklenen reel sayılar, durum değişkeni setine karşılık gelen aksiyonları ifade etmektedir. Her iki yapay sinir ağının parametrelerinin güncellenmesi, öğrenme evreleri esnasında toplanan kısmi türevlerden hesaplanmakta ve öğrenme evresi sonunda bir defa gerçekleştirilmektedir. Optimizasyon için RMSProp algoritması kullanılmıştır. Takviyeli öğrenme elemanı tarafından elde edilen sonuçlar, uygulanan metodun birçok başlangıç koşulu için nokta-kütle helikopterin otorotasyonda minimum kinetik enerji ile yere değmesini sağlamakta başarılı olduğunu göstermektedir. Takviyeli öğrenme elemanı tarafından uygulanan kontroller, bir insan pilotun helikopter otorotasyonu esnasında uyguladığı kontrollere benzerlik göstermektedir.
Özet (Çeviri)
This study presents an application of an actor-critic reinforcement learning method to a simple point-mass model helicopter guidance problem during autorotation. A point-mass model of an OH-58A helicopter in autorotation was built. A reinforcement learning agent was trained by a model-free asynchronous actor-critic algorithm, where training episodes were parallelized on a multi-core CPU. Objective of the training was defined as achieving near-zero horizontal and vertical kinetic energies at the instant of touchdown. During each training episode, the agent was presented a reward at each discrete time-step according to a multi-conditional reward function. Reward function was programmed to output the negative of a weighted sum of squared vertical and horizontal velocities at touchdown. The agent consists of two separate neural network function approximators, namely the actor and the critic. The critic approximates the value of a set of states. The actor generates a set of actions given a set of states, sampled from a Gaussian distribution with mean values as output set of the actor network. Updates to the parameters of both networks were calculated from accumulated gradients during each episode and applied once per episode to improve training stability. RMSProp algorithm was used for optimization. Results achieved by the agent indicates that the method is successful at guiding the point-mass helicopter to the ground with minimal kinetic energy for most initial conditions. Controls generated by the reinforcement learning agent were found to be similar to a helicopter pilot's technique.
Benzer Tezler
- Reinforcement learning based coaxial multicopter control for electrical vertical take off and landing
Pekiştirmeli öğrenme temelli elektrikli dikey kalkış ve iniş için eksendeş çoklu döner kanat kontrolü
MUHAMMED ALİ KUL
Yüksek Lisans
İngilizce
2025
Havacılık ve Uzay MühendisliğiYıldız Teknik ÜniversitesiAviyonik Mühendisliği Ana Bilim Dalı
PROF. DR. UFUK SAKARYA
- A reinforcement learning approach for control flow error detection in automated software testing
Yazılım otomatık testlerıne pekıştırmelı öğrenme yaklaşımı uygulayarak akış hatalarını yakalama
ENGİN DURMAZ
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MUSTAFA BORAHAN TÜMER
- Explorations on inverse reinforcement learning for the analysis of motor control and cognitive decision making mechanisms of the brain
Motor kontrol ve beynin bilişsel karar verme mekanizmalarını analiz etmek üzere tersine pekiştirmeli öğrenme ile keşifler
EMİR ARDİTİ
Yüksek Lisans
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÖzyeğin ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
PROF. DR. ERHAN ÖZTOP
DR. ÖĞR. ÜYESİ REYHAN AYDOĞAN
DOÇ. DR. EMRE UĞUR
- Deep reinforcement learning off-policy algorithms for robotic manipulator control
Robotik manipülatör kontrolü için derin takviyeli öğrenme politikasız algoritmaları
ALTUN RZAYEV
Yüksek Lisans
İngilizce
2021
Mekatronik MühendisliğiBahçeşehir ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. VAHID TAVAKOL AGHAEI
- Novel deep reinforcement learning algorithms for continuous control
Sürekli kontrol için yeni derin pekiştirmeli öğrenme algoritmaları
BATURAY SAĞLAM
Yüksek Lisans
İngilizce
2023
Elektrik ve Elektronik Mühendisliğiİhsan Doğramacı Bilkent ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
PROF. SÜLEYMAN SERDAR KOZAT