A unified sequence modeling framework for ımperfect-ınformation trick-taking card games
Eksik bilgili el alma kart oyunlarına yönelik bütünleşik bir sekans modelleme çerçevesi
- Tez No: 1018047
- Danışmanlar: PROF. DR. FERDA NUR ALPASLAN
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Yapay Zeka Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tezde, transformer tabanlı dizi modellemenin, kısmi gözlemlenebilirlik altında el alma tabanlı kart oyunları için uygulanabilir ve yeniden kullanılabilir bir pekiştirmeli öğrenme çerçevesi sunup sunamayacağı araştırılmıştır. Bu amacı gerçekleştirmek için DTCard adlı birleşik bir çerçeve geliştirilmiş ve üç el alma tabanlı kart oyunu olan Hearts, Whist ve Spades üzerinde değerlendirilmiştir. Önerilen yaklaşım, yalnızca geleneksel değer tabanlı pekiştirmeli öğrenmeye dayanmak yerine, Decision Transformer mimarisi aracılığıyla karar verme sürecini getiriye koşullandırılmış bir dizi tahmin problemi olarak yeniden formüle etmektedir. Çerçeve üç aşamalı bir yapı halinde düzenlenmiştir. İlk aşamada, rastgele ve kural tabanlı temel ajanlar kullanılarak benzetim yoluyla çevrimdışı veri kümeleri üretilmiştir. İkinci aşamada, toplanan yörüngeler üzerinde çevrimdışı olarak bir Decision Transformer eğitilmiştir. Üçüncü aşamada ise önceden eğitilmiş model, statik veri kümesinin sınırlarının ötesinde performans artışı sağlamak amacıyla kontrollü bir Selective Expert Iteration süreci ile rafine edilmiştir. Ayrıca, yasallık kısıtları eğitim sırasında katı maskelemeden kaçınılan, ancak çıkarım sırasında deterministik yasal hamle filtrelemesi ile güvenli davranışı garanti eden bir tasarım ile ele alınmıştır. Deneysel sonuçlar, önerilen çerçevenin her üç oyunda da rekabetçi politikalar öğrendiğini ve dört oyunculu düzende sürekli olarak denge seviyesinin üzerinde performans gösterdiğini ortaya koymuştur. Rafine edilmiş DT+SEI varyantı çoğu deney ortamında ek performans artışı sağlamış, en belirgin iyileşme Hearts oyununda gözlenmiştir. Ek analizler, modelin filtreleme öncesi yasadışı hamle oranlarının oldukça düşük olduğunu ve bunun yasallığa duyarlı davranışın büyük ölçüde yörünge verilerinden öğrenilebildiğini gösterdiğini ortaya koymuştur. Genel olarak bulgular, transformer tabanlı çevrimdışı pekiştirmeli öğrenmenin, eksik bilgili el alma tabanlı kart oyunları için uygulanabilir ve yeniden kullanılabilir bir çerçeve sunabileceğini göstermektedir.
Özet (Çeviri)
This thesis investigates whether transformer-based sequence modeling can serve as a practical and reusable reinforcement learning framework for trick-taking card games under partial observability. To address this problem, a unified framework named DTCard is developed and evaluated on three trick-taking games: Hearts, Whist, and Spades. Instead of relying on conventional value-based reinforcement learning alone, the proposed approach reformulates decision making as a return-conditioned sequence prediction problem through the use of Decision Transformers. The framework is organized as a three-phase pipeline. First, offline datasets are generated through simulated gameplay using random and rule-based baseline agents. Second, a Decision Transformer is trained offline on the collected trajectories. Third, the pretrained model is refined through a controlled Selective Expert Iteration stage in order to improve performance beyond the limitations of the static dataset. In addition, legality constraints are handled through a design that avoids strict train-time masking while ensuring safe inference through deterministic legal action filtering. Experimental results show that the proposed framework learns competitive policies across all three games and consistently performs above the parity level in a four-player setting. The refined Decision Transformer+Selective Expert Iteration variant further improves performance in most settings, with the strongest gains observed in Hearts. Additional analysis shows that the model achieves very low pre-filter illegal move rates, indicating that legality-sensitive behavior can largely be learned from trajectory data. Overall, the findings demonstrate that transformer-based offline reinforcement learning can provide a viable and reusable framework for imperfect-information trick-taking card games.
Benzer Tezler
- Development of a web-based job-shop scheduling system in CIM environment
Bilgisayar tümleşik üretim ortamında ağ-tabanlı atölye çizelgeleme sistemi geliştirilmesi
MURAT KAAN AKALP
Yüksek Lisans
İngilizce
2002
Makine MühendisliğiOrta Doğu Teknik ÜniversitesiMakine Mühendisliği Ana Bilim Dalı
PROF. DR. S. ENGİN KILIÇ
- Transformer-based vision-language frameworks: A cross-domain study from video captioning to medical report generation
Transformatör tabanlı görsel-dil çerçeveleri: Video altyazılamadan tıbbi rapor üretimine disiplinlerarası bir çalışma
BENGÜ FETİLER
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİzmir Katip Çelebi ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. VOLKAN KILIÇ
- Comicverse: Expanding the frontiers of ai in comic books with holistic understanding
Comicverse: Bütünsel anlayışla çizgi romanlarda yapay zekanın sınırlarını genişletmek
GÜRKAN SOYKAN
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. DR. DENİZ YURET
PROF. DR. TEVFİK METİN SEZGİN
- Grafiksel modüler uzaylarda bazı yeni yaklaşımlar
Some novel approaches in graphical modular spaces
ELİF ÖZBAY AZAP
Yüksek Lisans
Türkçe
2025
MatematikSakarya ÜniversitesiMatematik Ana Bilim Dalı
PROF. DR. MAHPEYKER ÖZTÜRK
- Toplu taşıma hatlarının optimizasyonu için bir model önerisi: Sivas örneği
A model proposal for the optimization of public transportation lines: The case of Sivas
İSMAİL ÖZÇELİK
Yüksek Lisans
Türkçe
2026
Ulaşımİstanbul Teknik Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
DOÇ. DR. HÜSEYİN ONUR TEZCAN