Satrançta Deep Blue'nun Garry Kasparov'u, Go'da AlphaGo'nun Lee Sedol'u devirdiği, poker botlarının yıllardır profesyonelleri alt ettiği bir dönemdeyiz. Ancak, Stratego gibi klasik ve karmaşık bir oyun, yapay zekayı bir türlü alt edememişti. Hatta DeepMind gibi devasa bütçelere sahip kurumlar bile, bu oyunda en iyi insan oyuncuları sürekli yenebilen bir makine geliştirmekte zorlanıyordu.
Şimdi ise Carnegie Mellon, MIT, New York Üniversitesi ve Stanford Üniversitesi'nden bir araştırma ekibi bu başarıyı yakaladı. Ataraxos adını verdikleri yapay zeka, şüphesiz tüm zamanların en iyi Stratego oyuncusu olarak kabul edilen Pim Niemeijer'i 15'e 1 gibi ezici bir skorla mağlup etti; karşılaşmada ayrıca dört beraberlik de yaşandı. Bu başarıya ulaşmak için ise yalnızca 16 adet GPU ve birkaç bin dolarlık bir eğitim bütçesi yeterli oldu.
Gizli Orduların Savaşı
Stratego oyununda her oyuncu, mareşalden spye kadar çeşitli askeri rütbeleri temsil eden 40'ar adet taşa sahip olur. Ayrıca bombalar ve bir de bayrak bulunur. Oyuncunun amacı, rakibinin bayrağını ele geçirmektir. Rakibinizin taşlarının nerede olduğunu bilirsiniz, ancak ne olduğunu bilmezsiniz. Taşların kimlikleri, yalnızca iki taş çarpıştığında ortaya çıkar. Çarpışmada daha zayıf olan taş oyundan çıkar ve kazananın kimliği belli olur. Bu durum, Stratego'yu, bilgisayarların yıllar önce çözdüğü poker gibi, eksik bilgiyle oynanan bir oyun haline getiriyor. NYU'dan araştırmacı ve çalışmanın ortak yazarlarından Eugene Vinitsky, "Stratego'nun süper ayırt edici bir yanı var, o da çok uzun bir zaman ölçeğinde ortaya çıkan muazzam miktarda gizli bilgi içermesi," diyor.
Pokerin bazı türlerinde gizli bilgi oldukça azdır. Texas Hold'em'de, "yalnızca iki gizli kartınız olur," diyor MIT'den bilgisayar bilimcisi ve bir diğer ortak yazar Gabriele Farina. Bu da makinenin tümünü hesaplayabileceği 1.326 olası elde kalmasını sağlar. "Stratego'da ise tahtadaki 40 taş her türlü düzende olabilir," diye ekliyor Farina. Bu, 1 sekstilyondan fazla olası dizilim anlamına geliyor. Bir de oyunun süresi var.
"Satrançta oyun genellikle 40 hamle sürer, ancak Stratego'da bir oyun kolaylıkla 2.000 hamleye ulaşabilir," diyor Farina. Buna ek olarak, Stratego bir blöf oyunudur. Bazen rakibinizi korkutmak için zayıf bir taşı, bir mareşalmiş gibi hareket ettirirsiniz. Oyuncular çok sık blöf yaptığında, tehditleri anlamsızlaşır; hiç blöf yapmadıklarında ise tahmin edilebilir hale gelirler. Ekip, bu dengeyi kurma zorluğunun, 2022'de tanıtılan DeepMind'ın DeepNash'ı gibi önceki yapay zekaları şaşırttığını açıklıyor.
Tahmin Etmeyi Öğrenmek
DeepNash gibi, Ataraxos da kendisiyle oynayarak öğrendi; toplamda 163 milyon oyun oynadı. Bu kendi kendine oyun seanslarında, galibiyete götüren hamleler pekiştirildi ve gelecekteki maçlarda daha sık oynandı, kayıplara yol açan hamleler ise daha az oynandı. Bu, aynı basit eğitim fikriydi. Fark, Ataraxos'un her oyundan sonra ne kadar ayarlama yaptığıydı, çünkü gizli bilgi, kendi kendine oyun öğrenme algoritmalarının döngüye girmesine neden olabiliyor. Ekip, bu durumu, eğitimin başlarında büyük ve cesur strateji değişiklikleri yaparak, sonraları ise küçük ve dikkatli değişiklikler yaparak ele aldı.
Daha da büyük yenilik, DeepNash'ta hiç olmayan bir şeydi: her hamleden önce ileriye dönük düşünmek. AlphaGo gibi yapay zekalar, hareket etmeden hemen önce bir arama yaparak genel stratejilerini geliştirir. DeepMind, Stratego'da bunu çalıştıramadı çünkü arama uzayı çok büyüktü ve denemeye değip değmeyeceği sorusunu açık bıraktı.
"Bu, başardığımız şeylerden biri," diyor Farina. Çözüm, rakibin hareket şekillerine dayanarak rakibin gizli taşlarını tahmin etmek için eğitilmiş bir inanç modeli olan ikinci bir sinir ağıydı. Bu şekilde, her olası dizilimi tekrarlamak yerine, Ataraxos makul olanları örnekliyor, her birinde aday hamleleri oynuyor ve sonuçlarına göre seçim yapıyor.
Ve bu, oyun tarzında kendini gösteriyor.
Sakin ve Telaşsız
Ataraxos ismi, Antik Yunanca'da bir sakinlik durumunu ifade eden kelimeden geliyor. "Bu, sakin ve telaşsız birini ifade eder," diye açıklıyor Farina. Yapay zekanın yapısının ve insan duygularının yokluğunun, "bir insanın aklını kaçıracağı durumlarda bile" dürtüsel tepki vermemesini sağladığını öne sürüyor. Bir insan önemli bir dezavantajdan kurtulmak için büyük riskler alabilirken, Ataraxos oyuna yavaş ve metodik bir şekilde geri dönecektir.
Geliştirdiği strateji ayrıca karşılaştığı sorunlara dikkat çekmekten kaçınır. Ataraxos, rakibinin zayıf bir nokta olduğundan şüphelenmek için hiçbir neden görmediğini tahmin ettiğinde, tahtanın her iki tarafını da görebilen biri için felaket gibi görünse bile o noktayı görmezden gelir.
"İnsanlar için, bir sırrı bildiğinizi bildiğinizde, o sırrı bilme gerçeğini göz ardı ederek karar vermek çok zordur," diyor Farina. "Makinalar için ise kolay." Ekip, bunun, makinelerin yalnızca blöf yaparken yapacağı hamleleri yapmasına ve bu hamleleri insanlardan çok daha iyi takip etmesine yol açtığını söylüyor. Vinitsky, "Botun, zafer olasılığı yüzde ikiden geriye doğru, çok, çok rahat bir şekilde 'blöf' yaparak döndüğünü izliyorduk," diye ekliyor.
Ataraxos'un bu mucizevi geri dönüşlerini gerçekleştirdiği insan oyuncu Niemeijer, dört dünya şampiyonluğu ve 600 haftadan fazla süreyle dünyanın en iyi oyuncusu unvanına sahip.
Karşılaşma
Üç hafta boyunca Niemeijer, Ataraxos'a karşı 20 çevrimiçi oyun oynadı ve her galibiyeti için 100 dolar kazandı. Yapay zekanın ona uyum sağlamayacağını biliyordu, bu da ona zayıf noktaları avlamak için zaman tanıyordu. Sadece bir kez kazanabildi.
Araştırmacılar, bu kaybın gerçek bir kusur olmadığını iddia ediyor. Stratego'yu iyi oynamak, taşların düzenini rastgeleleştirmeyi gerektirir, bu nedenle şans her zaman bir rol oynar. "Mükemmel bir strateji bile bazen kaybedecektir," diyor Farina.
İnsan şampiyonu şanslıydı, ancak bu karşılıklı oldu. "Bazen biz de şanslıydık," diye itiraf ediyor Vinitsky.
2025 Stratego Dünya Şampiyonası'nda Ataraxos'a meydan okuyan katılımcılar daha da kötü bir performans sergiledi. Yapay zeka, 40 oyunun 38'ini kazandı. Bu süreçte, insanların oyun oynama şeklini de değiştirdi. Farina, "Sanırım bu bot biraz metagamı biraz eğip büktü," diyor.
Oyuncular, örneğin, bayrağını nadiren oynanan bir düzen olan sadece iki bomba ile bir köşeye saklamasına şaşırdılar.
Ancak Ataraxos'un en iyi numarası, tartışmasız fiyat etiketiydi.
Ödenen Bedel
DeepNash, Google'ın özel çiplerinden 1.024 tanesi üzerinde iki ila üç ay boyunca eğitildi; Ataraxos ekibi, 2025 fiyatlarıyla bu maliyetin 3 ila 4,5 milyon dolar olacağını tahmin ediyor. Buna karşılık Ataraxos, bir hafta boyunca 16 GPU'ya, ayrıca inanç modelini eğitmek için dört gün boyunca ek dört GPU'ya ihtiyaç duydu.
Farina ve baş yazar Samuel Sokota, bu verimliliği, grafik kartlarında saniyede milyonlarca hamle çalıştıran bir simülatör yazarak elde etti. Farina, "Akademideki ölçeğimizde, tüm GPU alanına erişimimiz yok," diyor.
Algoritma ayrıca çok daha hızlı öğrendi; DeepNash'tan yaklaşık 34 kat daha az oyun oynadı ve yine de çok daha güçlü bir sonuç elde etti.
Ataraxos mimarisi, diğer oyunları öğrenmede de işe yaradı. Aynı yaklaşım, Stratego'nun daha hızlı ve sekiz taşlı bir varyantı olan Barrage Stratego'da üç dünya şampiyonunu yenerek, işbirliğine dayalı kart oyunu Hanabi'de ustalaştı ve Çin kart oyunu dou dizhu'nun en iyi botlarını yendi. Ancak ekip, tahta veya kart oyunlarından çok daha karmaşık senaryolara odaklanıyor.
Tahtanın Ötesinde
Tahta oyunlarının sabit kuralları ve net galipleri varken, müzakereler, finansal piyasalar veya askeri çatışmalar gibi gerçek dünya sorunları genellikle böyle değildir. Ancak Ataraxos ekibi, bu boşluğun göründüğünden daha küçük olduğunu savunuyor, çünkü herhangi bir gerçek sorunu ele almak, onun basitleştirilmiş bir modelini inşa etmekle başlar.
Vinitsky, "Savaş oyunları insanların yaygın olarak yaptığı bir şeydir," diyor. "Buradan türetilen teknikleri ileriye doğru oynamak ve güçlü bir rakibin yaptıklarınıza nasıl tepki verebileceğini görmek için kullanabilirsiniz."
Farina ve meslektaşları şimdi yapay zekalarını daha anlaşılır hale getirmeye ilgi duyuyor, çünkü Ataraxos mevcut haliyle neden hamleler yaptığını açıklayamıyor. Farina, "Güçlü ama aynı zamanda yorumlanabilir ve açıklanabilir stratejiler üreten makineler üzerinde çalışıyoruz. Sanırım henüz tam olarak orada değiliz," diyor.