Dinamik ödül tabanlı çok ajanlı pekiştirmeli öğrenme ile TR-VTOL iha kontrolü
Multi-agent reinforcement learning based control of TR-VTOL
- Tez No: 1002723
- Danışmanlar: PROF. DR. AYDIN YEŞİLDİREK
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Uçak Mühendisliği, Havacılık ve Uzay Mühendisliği, Computer Engineering and Computer Science and Control, Aeronautical Engineering, Aeronautical Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Mekatronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Mekatronik Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Tilt-rotor dikey kalkış ve iniş yapabilen insansız hava araçları (TR-VTOL İHA), döner kanat ve sabit kanat yapılarını birleştiren hibrit platformlardır. Ancak sistemdeki değişkenlerin birbirini doğrudan etkilemesi, doğrusal olmayan kuvvetler ve geçiş anlarında değişkenlik gösteren dinamikleri nedeniyle kontrol açısından önemli zorluklar barındırmaktadır. Değişken rüzgâr koşulları, belirsiz bozucu etkiler, farklı çevresel ve aerodinamik koşullar PID veya lineerleştirilmiş model tabanlı kontrol yöntemlerinin kararlı bir performans sağlamasını zorlaştırmaktadır. Bu nedenle, belirsizliklerle başa çıkabilen ve karmaşık dinamikleri öğrenerek uyum sağlayabilen modern kontrol yaklaşımlarına ihtiyaç duyulmaktadır. Bu tez kapsamında, söz konusu karmaşık dinamiklerle başa çıkabilmek amacıyla modern kontrol yaklaşımlarından biri olan pekiştirmeli öğrenme (RL) tabanlı bir kontrol mimarisi geliştirilmiştir. Soft Aktör-Eleştirmen (SAC), Deep Deterministic Policy Gradient (DDPG), Twin-Delayed DDPG (TD3) ve Proximal Policy Optimization (PPO) algoritmaları hem tek ajanlı hem çok ajanlı yapılarda karşılaştırılmıştır. Literatürde kullanılan yaygın ödül yaklaşımlarından farklı olarak, sistemin sönüm oranı ve doğal frekans parametrelerini kullanan model tabanlı dinamik bir ödül fonksiyonu önerilmiştir. Bu yaklaşım, öğrenme sürecini fiziksel sistem davranışı üzerinden yönlendirerek geçici rejim performansını iyileştirmeyi hedeflemektedir. Geliştirilen ödül fonksiyonu ve RL algoritmalarının tek ve çok ajanlı yapıları öğrenme performansı ve yakınsama süresi üzerindeki etkileri karşılaştırılmıştır. Sonuçlar tablo ve grafiklerle sunulmuştur. Önerilen ödül fonksiyonu kullanıldığında eğitim süresi 2506 s'den 306 s'ye (%88) düşmüş ve ortalama ödül değeri –0.25'ten –0.10'a (%60) iyileşmiştir. Algoritma karşılaştırmaları incelendiğinde, çok ajanlı mimaride SAC, 306 s/–0.10 sonucu ile en dengeli çözüm olmuştur. PPO –0.067 ortalama ödüle ulaşmış ancak 1437 s eğitim süresiyle SAC'ten yaklaşık %370 daha uzun sürede öğrenmiştir. DDPG ve TD3 ise sırasıyla 2469 s/–0.71 ve 3235 s/–2.2 sonuçlarıyla hem süre hem performans açısından SAC'in gerisinde kalmıştır. Tek ajanlı mimaride SAC, TD3 ve PPO algoritmalarında ortalama ödül değerleri sırasıyla –188.15, –25.6 ve –93.38 olarak gerçekleşmiştir. Tek ajanlı DDPG 429 s/–0.096 sonucu üretmiş olsa da, çok ajanlı SAC'e kıyasla %40 daha uzun eğitim süresi gerektirmiştir.
Özet (Çeviri)
Tilt-rotor Vertical Take-Off Landing unmanned aerial vehicles (TR-VTOL UAVs) are hybrid platforms that combine rotary-wing and fixed-wing configurations. However, strong coupling among system variables, nonlinear aerodynamic forces, dynamically varying characteristics during transition phases create significant control challenges. Variable wind conditions, uncertain disturbances, changing environmental and aerodynamic effects make it difficult for PID or linearized model-based control methods to maintain stable performance. Therefore, advanced control approaches capable of handling uncertainties and learning complex dynamics are required. In this thesis, a reinforcement learning (RL)-based control architecture is developed to address these challenges. Soft Actor-Critic (SAC), Deep Deterministic Policy Gradient (DDPG), Twin-Delayed DDPG (TD3) and Proximal Policy Optimization (PPO) algorithms are compared in both single-agent and multi-agent configurations. Unlike conventional reward formulations in the literature, a model-based dynamic reward function incorporating the system's damping ratio and natural frequency parameters is proposed. This approach guides the learning process through the physical behavior of the system and aims to improve transient response performance. The effects of the proposed reward function and the single-agent versus multi-agent structures on learning performance and convergence time are analyzed and presented in tables and figures. When the proposed reward function is used, training time decreases from 2506 s to 306 s (88%), and the average reward improves from –0.25 to –0.10 (60%). In the multi-agent architecture, SAC provides the most balanced solution with 306 s training time and –0.10 average reward. PPO achieves –0.067 but requires 1437 s of training, approximately 370% longer than SAC. DDPG and TD3 yield 2469 s/–0.71 and 3235 s/–2.2, respectively, remaining behind SAC in both training duration and performance. In the single-agent architecture, average rewards for SAC, TD3, and PPO are –188.15, –25.6, and –93.38, respectively. Although single-agent DDPG achieves 429 s/–0.096, it still requires 40% longer training time than multi-agent SAC.
Benzer Tezler
- Deep reinforcement learning for stackelberg dynamic pricing: from dp benchmarks to multi-agent competition
Stackelberg dinamik fiyatlandırma için derin pekiştirmeli öğrenme: DP referanslarından çok ajanlı rekabete
FURKAN ORAL
Yüksek Lisans
İngilizce
2026
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiVeri Mühendisliği ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)
DR. ÖĞR. ÜYESİ MEHMET YASİN ULUKUŞ
- Wind-optimized route planning with deep reinforcement learning
Derin pekiştirmeli öğrenme ile rüzgar optimizasyonlu rota planlaması
MELİH SAFA CENGİZ
Yüksek Lisans
İngilizce
2025
Uçak Mühendisliğiİstanbul Teknik ÜniversitesiUçak ve Uzay Mühendisliği Ana Bilim Dalı
DOÇ. DR. BARIŞ BAŞPINAR
- Deep reinforcement learning approach in control of Stewart platform- simulation and control
Stewart platformunun kontrolünde derin pekistirmeli öğrenme yaklaşımıc- simülasyon ve kontrol
HADI YADAVARI
Doktora
İngilizce
2023
Mekatronik Mühendisliğiİstanbul Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. SERHAT İKİZOĞLU
DR. ÖĞR. ÜYESİ VAHİT BARIŞ TAVAKOL
- Makı̇ne öğrenmesı̇ ı̇le sürü robotları ı̇çı̇n savaş stratejı̇sı̇ modelı̇
A q-learning based approach for simple and multi-agent systems
ÜMİT ULUSOY
Yüksek Lisans
Türkçe
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. MEHMET SERDAR GÜZEL
- İHA destekli ağlarda kapsama ve alan kullanımı verimliliği için öğrenmeye dayalı dinamik konumlandırma
Learning-based dynamic positioning for coverage and area utilization efficiency in UAV-assisted networks
ERDİ KAYA
Doktora
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. YILMAZ AR
DR. ÖĞR. ÜYESİ ELİF HAYTAOĞLU