Inverse reinforcement learning for mean-field games with averagereward
Ortalama ödül kriteri altında ortalama alan oyunları için ters pekiştirmeli öğrenme
- Tez No: 1025824
- Danışmanlar: DOÇ. DR. NACİ SALDI
- Tez Türü: Yüksek Lisans
- Konular: Matematik, Mathematics
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İhsan Doğramacı Bilkent Üniversitesi
- Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Matematik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Ayrık zamanlı, sonsuz ufuklu ve ortalama ödül kriterine sahip ortalama alan oyunları (mean-field games, MFG) için ters pekiştirmeli öğrenme (inverse reinforcement learning, IRL) problemini inceliyoruz. Uzman gösterimlerinin, bilinmeyen bir ödül fonksiyonu altında durağan bir ortalama alan dengesinden geldiğini varsayıyoruz. Amaç, gözlemlenen davranışı maksimum nedensel entropi ilkesiyle açıklayan bir politikayı geri kazanmaktır. Ters problemi, uzman ortalama alan terimi ve uzun dönem özellik beklentileriyle tutarlılığı zorunlu kılarak formüle ediyor; iki farklı ödül sınıfını aynı popülasyon düzeyindeki formülasyon içinde ele alıyoruz. Sonlu boyutlu doğrusal ödüller için, açık bir log-partition amacına sahip konveks bir dual reformülasyon elde ediyor ve sabit adım büyüklüklü gradyan inişini gerekçelendiren düzgünlük ve eğrilik özelliklerini kanıtlıyoruz. Sonsuz boyutlu yeniden üreten çekirdek Hilbert uzayı (reproducing kernel Hilbert space, RKHS) ödülleri için, iç maksimizasyonu sağlayan politikanın bir soft Bellman denklemiyle karakterize edildiği bir Lagrange gevşetmesi geliştiriyoruz. Buradaki temel zorluk, indirim faktöründen kaynaklanan bir büzülmenin bulunmamasıdır. Bu zorluğu, soft Bellman operatörü için katı bir büzülme sağlayan minorizasyon-temelli alt-stokastik bir çekirdek tanıtarak aşıyoruz. Log-olabilirlik skor fonksiyonunun Fréchet türevlenebilirliğini ve Lipschitz düzgünlüğünü kuruyor; böylece yakınsama garantilerine sahip bir gradyan çıkışı algoritması elde ediyoruz. Doğrusal ödül yapısı için iki malware-spread MFG örneği ve RKHS-temelli bir tüketici-tercihi modeli olmak üzere üç sayısal örnek, geri kazanılan politikaların uzman davranışıyla yakından örtüştüğünü göstermektedir.
Özet (Çeviri)
We study inverse reinforcement learning for discrete-time, infinite-horizon mean-field games (MFGs) under an average-reward criterion. Expert demonstrations are assumed to arise from a stationary mean-field equilibrium under an unknown reward function, and the goal is to recover a policy that explains the observed behaviour via the maximum causal entropy principle. We formulate the inverse problem by enforcing consistency with the expert mean-field term and long-run feature expectations, while treating two reward classes within the same population-level formulation. For finite-dimensional linear rewards, we derive a convex dual reformulation with an explicit log-partition objective, and prove smoothness and curvature properties that justify constant-step-size gradient descent. For infinite-dimensional RKHS rewards, we develop a Lagrangian relaxation whose inner-maximising policy is characterised by a soft Bellman equation. The main obstacle is the absence of a discount-factor contraction. We resolve this by introducing a minorisation-based sub-stochastic kernel, which yields a strict contraction for the soft Bellman operator. We establish Frechet differentiability and Lipschitz smoothness of the log-likelihood score function, leading to a gradient ascent algorithm with convergence guarantees. Three numerical examples, two malware-spread MFGs for the linear reward setting and an RKHS-based consumer-choice model, show that the recovered policies closely match expert behaviour.
Benzer Tezler
- Gemi yapılarında gerilme yığılması öngörülerinin kaba ağ yapısı ve makine öğrenmesi ile gerçekleştirilmesi
The forecasting of stress concentration in ship buildings by using rough mesh structure and machine learning method
BURÇİN ATEŞ
Yüksek Lisans
Türkçe
2020
Gemi Mühendisliğiİstanbul Teknik ÜniversitesiGemi ve Deniz Teknolojisi Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SERDAR AYTEKİN KÖROĞLU
- Yapay sinir ağlarında öğrenme algoritmalarının analizi
Analysis of learning algorithms in neural networks
SEVİNÇ BAKLAVACI
Yüksek Lisans
Türkçe
1994
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiDOÇ.DR. LEYLA GÖREN
- Self-collision aware reaching and pose control in large workspaces using deep reinforcement learning
Büyük çalışma alanlarında derin pekiştirmeli öğrenme tabanlı kendi kendine çarpışma farkındalığına sahip erişim ve poz kontrolü
TUMUÇİN BAL
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ BARIŞ AKGÜN
- Tracking control methodologies for a quadrotor UAV
Dört rotorlu bir İHA için yol takibi kontrol yöntemleri
BORA BAYRAKTAROĞLU
Yüksek Lisans
İngilizce
2017
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiKontrol ve Otomasyon Mühendisliği Ana Bilim Dalı
PROF. DR. MÜJDE GÜZELKAYA
- Explorations on inverse reinforcement learning for the analysis of motor control and cognitive decision making mechanisms of the brain
Motor kontrol ve beynin bilişsel karar verme mekanizmalarını analiz etmek üzere tersine pekiştirmeli öğrenme ile keşifler
EMİR ARDİTİ
Yüksek Lisans
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÖzyeğin ÜniversitesiBilgisayar Bilimleri Ana Bilim Dalı
PROF. DR. ERHAN ÖZTOP
DR. ÖĞR. ÜYESİ REYHAN AYDOĞAN
DOÇ. DR. EMRE UĞUR