When one bit suffices: Decentralized learning from welfare maximization to optimal equilibrium selection
Tek bitlik geri bildirimle merkeziyetsiz öğrenme: Refah maksimizasyonundan optimal denge seçimine
- Tez No: 1022180
- Danışmanlar: DR. ÖĞR. ÜYESİ MUHAMMED ÖMER SAYIN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Elektrik ve Elektronik Mühendisliği, Computer Engineering and Computer Science and Control, Electrical and Electronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İhsan Doğramacı Bilkent Üniversitesi
- Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Merkeziyetsiz çok etmenli sistemler; kablosuz iletişim, akıllı ulaşım, nesnelerin interneti ağları, robotik ve siber-fiziksel sistemler gibi alanlarda giderek daha merkezi bir rol oynamaktadır. Bu ortamlarda otonom etmenler sınırlı yerel bilgi kullanarak eşgüdüm sağlamak zorundadır; ancak kararları, amaçları veya öğrenilen modelleri hakkında ayrıntılı bilgi paylaşmaları, bant genişliği kısıtları, güvenilmez iletişim veya gizlilik kaygıları nedeniyle pratik olmayabilir. Bunun sonucunda merkeziyetsiz öğrenme dinamikleri, sistem düzeyi sosyal refah açısından zayıf performans gösterebilir. Bu sorunu ele almak için, merkeziyetsiz öğrenmeyi refah açısından etkin davranışa yönlendiren asgari bir anlamsal geri bildirim mekanizması geliştiriyoruz. Her turda her etmen, hoşnutluk ya da hoşnutsuzluk olarak yorumlanan ve asgari bant genişliği kullanılarak iletilebilen rastgeleleştirilmiş ikili bir sinyal gönderir. Davranışını ise yerel gözlemleriyle birlikte bu asgari sinyalleri kullanarak günceller. Etmenlerin oyunun tamamını bilmesi gerekmez. Ayrıca getiri, eylem, politika, model veya değer kestirimlerini doğrudan paylaşmaları da gerekmez. Amaç, hedeflenen bir sistem düzeyi sosyal refah ölçütünü, uygun sonuçlar ya da denge kısıtlı bir küme üzerinde optimize etmektir. İlk olarak, sonlu normal biçimli oyunların geniş kapsamlı sınıflarını inceliyor ve önerilen dinamiklerin sosyal refahı maksimize eden ortak eylemleri açık sonlu-zaman garantileriyle öğrenebildiğini gösteriyoruz. Ardından, analizi Markov oyunları olarak da bilinen stokastik oyunlara genişletiyor ve sosyal refah açısından optimal yaklaşık denge seçimi için sonlu-zaman garantileri elde ediyoruz. Refah maksimizasyonu ile denge seçimini birleştirmek için, tamamen bireysel çıkara dayalı davranış ile tam iş birliği arasında geçiş sağlayan etmene özgü tolerans parametreleri tanıtıyoruz. Son olarak, mekanizmanın dinamik iletişim ağları altındaki dayanıklılığını inceliyor ve ek bilgi paylaşımının değişen bağlantılılığı nasıl telafi edebileceğini karakterize ediyoruz. Bu ortamlar genelinde analiz sonucunda, ilgili refah kıyasına göre ölçülen ve keşif kaynaklı bir ek terim içeren açık sonlu-zaman logaritmik pişmanlık garantileri elde ediyoruz. Birlikte ele alındığında bu sonuçlar, asgari anlamsal geri bildirimin, çoğu zaman tur başına etmen başına yalnızca bir bitin, ciddi bilgi ve iletişim kısıtları altında bile merkeziyetsiz öğrenmeyi sistem düzeyi sosyal refah amaçlarıyla etkili biçimde hizalayabileceğini göstermektedir.
Özet (Çeviri)
Decentralized multi-agent systems are increasingly central to wireless communication, intelligent transportation, Internet of Things (IoT) networks, robotics, and cyber-physical systems. In these settings, autonomous agents must coordinate using limited local information, while exchanging detailed information about their decisions, objectives, or learned models may be impractical due to bandwidth limitations, unreliable communication, or privacy concerns. As a result, decentralized learning dynamics can perform poorly from a system-level welfare perspective. To address this issue, we develop a minimal semantic feedback mechanism for steering decentralized learning toward welfare-efficient behavior. In each round, every agent transmits only a randomized binary signal, interpreted as content or discontent, which can be communicated with minimal bandwidth, and updates its behavior using local observations together with these minimal signals. The agents need not know the full game, nor do they need to exchange payoffs, actions, policies, models, or value estimates directly. The objective is to optimize a target system-level welfare criterion, either over feasible outcomes or over an equilibrium-constrained set. We first study broad classes of finite normal-form games and show that the proposed dynamics can learn welfare-maximizing joint actions with explicit finite-time guarantees. We then extend the analysis to stochastic games, also known as Markov games, and establish finite-time guarantees for welfare-optimal approximate-equilibrium selection. To unify welfare maximization and equilibrium selection, we introduce agent-specific tolerance parameters that interpolate between fully self-interested behavior and full cooperation. Finally, we examine the resilience of the mechanism under dynamic communication networks and characterize how additional information exchange can compensate for changing connectivity. Across these settings, the analysis yields explicit finite-time logarithmic regret guarantees with an exploration-induced offset term, measured with respect to the relevant welfare benchmark. Together, the results show that minimal semantic feedback—often only one bit per agent per round—can effectively align decentralized learning with system-level welfare objectives even under severe informational and communication constraints.
Benzer Tezler
- Sabancı Center Akbank Kulesi için bir sistem analizi
The System analysis for Akbank Tower of Sabancı Center
OSMAN SALICI
Yüksek Lisans
Türkçe
1997
İnşaat Mühendisliğiİstanbul Teknik ÜniversitesiYapı Ana Bilim Dalı
PROF. DR. ERDOĞAN UZGİDER
- Ağaç yapısının lempel-zıv veri sıkıştırma algoritmasına uyarlanması
Application of tree structure to lempel-zıv data compression algorithm
TOLGA ULUS
- Türkçe yazım denetleyen editör
Turkish spelling checker editor
K.MESUT YARIMBIYIKLI
Yüksek Lisans
Türkçe
1992
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiDOÇ. DR. TAKUHİ NADİA ERDOĞAN
- İki parçalı rezistif ve kondüktif şeritlerden düzlemsel dalgaların kırınımı
Plane-wave diffractıon by two-part resistive and conductıve strıps
ORHAN BIÇAKÇI
Yüksek Lisans
Türkçe
1993
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiDOÇ.DR. EREN ERDOĞAN