Geri Dön

A unified sequence modeling framework for ımperfect-ınformation trick-taking card games

Eksik bilgili el alma kart oyunlarına yönelik bütünleşik bir sekans modelleme çerçevesi

  1. Tez No: 1018047
  2. Yazar: BUĞRA KAAN DEMİRDÖVER
  3. Danışmanlar: PROF. DR. FERDA NUR ALPASLAN
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Orta Doğu Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Yapay Zeka Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tezde, transformer tabanlı dizi modellemenin, kısmi gözlemlenebilirlik altında el alma tabanlı kart oyunları için uygulanabilir ve yeniden kullanılabilir bir pekiştirmeli öğrenme çerçevesi sunup sunamayacağı araştırılmıştır. Bu amacı gerçekleştirmek için DTCard adlı birleşik bir çerçeve geliştirilmiş ve üç el alma tabanlı kart oyunu olan Hearts, Whist ve Spades üzerinde değerlendirilmiştir. Önerilen yaklaşım, yalnızca geleneksel değer tabanlı pekiştirmeli öğrenmeye dayanmak yerine, Decision Transformer mimarisi aracılığıyla karar verme sürecini getiriye koşullandırılmış bir dizi tahmin problemi olarak yeniden formüle etmektedir. Çerçeve üç aşamalı bir yapı halinde düzenlenmiştir. İlk aşamada, rastgele ve kural tabanlı temel ajanlar kullanılarak benzetim yoluyla çevrimdışı veri kümeleri üretilmiştir. İkinci aşamada, toplanan yörüngeler üzerinde çevrimdışı olarak bir Decision Transformer eğitilmiştir. Üçüncü aşamada ise önceden eğitilmiş model, statik veri kümesinin sınırlarının ötesinde performans artışı sağlamak amacıyla kontrollü bir Selective Expert Iteration süreci ile rafine edilmiştir. Ayrıca, yasallık kısıtları eğitim sırasında katı maskelemeden kaçınılan, ancak çıkarım sırasında deterministik yasal hamle filtrelemesi ile güvenli davranışı garanti eden bir tasarım ile ele alınmıştır. Deneysel sonuçlar, önerilen çerçevenin her üç oyunda da rekabetçi politikalar öğrendiğini ve dört oyunculu düzende sürekli olarak denge seviyesinin üzerinde performans gösterdiğini ortaya koymuştur. Rafine edilmiş DT+SEI varyantı çoğu deney ortamında ek performans artışı sağlamış, en belirgin iyileşme Hearts oyununda gözlenmiştir. Ek analizler, modelin filtreleme öncesi yasadışı hamle oranlarının oldukça düşük olduğunu ve bunun yasallığa duyarlı davranışın büyük ölçüde yörünge verilerinden öğrenilebildiğini gösterdiğini ortaya koymuştur. Genel olarak bulgular, transformer tabanlı çevrimdışı pekiştirmeli öğrenmenin, eksik bilgili el alma tabanlı kart oyunları için uygulanabilir ve yeniden kullanılabilir bir çerçeve sunabileceğini göstermektedir.

Özet (Çeviri)

This thesis investigates whether transformer-based sequence modeling can serve as a practical and reusable reinforcement learning framework for trick-taking card games under partial observability. To address this problem, a unified framework named DTCard is developed and evaluated on three trick-taking games: Hearts, Whist, and Spades. Instead of relying on conventional value-based reinforcement learning alone, the proposed approach reformulates decision making as a return-conditioned sequence prediction problem through the use of Decision Transformers. The framework is organized as a three-phase pipeline. First, offline datasets are generated through simulated gameplay using random and rule-based baseline agents. Second, a Decision Transformer is trained offline on the collected trajectories. Third, the pretrained model is refined through a controlled Selective Expert Iteration stage in order to improve performance beyond the limitations of the static dataset. In addition, legality constraints are handled through a design that avoids strict train-time masking while ensuring safe inference through deterministic legal action filtering. Experimental results show that the proposed framework learns competitive policies across all three games and consistently performs above the parity level in a four-player setting. The refined Decision Transformer+Selective Expert Iteration variant further improves performance in most settings, with the strongest gains observed in Hearts. Additional analysis shows that the model achieves very low pre-filter illegal move rates, indicating that legality-sensitive behavior can largely be learned from trajectory data. Overall, the findings demonstrate that transformer-based offline reinforcement learning can provide a viable and reusable framework for imperfect-information trick-taking card games.

Benzer Tezler

  1. Development of a web-based job-shop scheduling system in CIM environment

    Bilgisayar tümleşik üretim ortamında ağ-tabanlı atölye çizelgeleme sistemi geliştirilmesi

    MURAT KAAN AKALP

    Yüksek Lisans

    İngilizce

    İngilizce

    2002

    Makine MühendisliğiOrta Doğu Teknik Üniversitesi

    Makine Mühendisliği Ana Bilim Dalı

    PROF. DR. S. ENGİN KILIÇ

  2. Transformer-based vision-language frameworks: A cross-domain study from video captioning to medical report generation

    Transformatör tabanlı görsel-dil çerçeveleri: Video altyazılamadan tıbbi rapor üretimine disiplinlerarası bir çalışma

    BENGÜ FETİLER

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİzmir Katip Çelebi Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. VOLKAN KILIÇ

  3. Comicverse: Expanding the frontiers of ai in comic books with holistic understanding

    Comicverse: Bütünsel anlayışla çizgi romanlarda yapay zekanın sınırlarını genişletmek

    GÜRKAN SOYKAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    PROF. DR. DENİZ YURET

    PROF. DR. TEVFİK METİN SEZGİN

  4. Grafiksel modüler uzaylarda bazı yeni yaklaşımlar

    Some novel approaches in graphical modular spaces

    ELİF ÖZBAY AZAP

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    MatematikSakarya Üniversitesi

    Matematik Ana Bilim Dalı

    PROF. DR. MAHPEYKER ÖZTÜRK

  5. Toplu taşıma hatlarının optimizasyonu için bir model önerisi: Sivas örneği

    A model proposal for the optimization of public transportation lines: The case of Sivas

    İSMAİL ÖZÇELİK

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Ulaşımİstanbul Teknik Üniversitesi

    İnşaat Mühendisliği Ana Bilim Dalı

    DOÇ. DR. HÜSEYİN ONUR TEZCAN