Ataraxos, system AI zbudowany przez badaczy z Carnegie Mellon University, MIT, Uniwersytetu Nowojorskiego i Uniwersytetu Stanforda, pokonał Pima Niemeijera, najbardziej utytułowanego gracza w historii Stratego, wynikiem 15 zwycięstw, 1 porażka i 4 remisy. Autorzy pracy opublikowanej 30 września 2026 r. w „Nature” uznają to za pierwszy nadludzki wynik w tej grze, a trening wyceniają na mniej niż 8 tys. dolarów, wobec 3-4,5 mln dolarów, na które szacują koszt wcześniejszego systemu DeepNash od DeepMind.
- System AI Ataraxos, zbudowany przez badaczy z Carnegie Mellon University, MIT, Uniwersytetu Nowojorskiego i Uniwersytetu Stanforda, pokonał czterokrotnego mistrza świata w Stratego Pima Niemeijera wynikiem 15 zwycięstw, 1 porażka i 4 remisy – co autorzy pracy opublikowanej 30 września 2026 r. w „Nature" uznają za pierwszy nadludzki wynik w tej grze.
- Trening Ataraxosa kosztował mniej niż 8 tys. dolarów i pochłonął ok. 160 mln partii, podczas gdy wcześniejszy system DeepNash od DeepMind wymagał szacunkowo 3–4,5 mln dolarów i ok. 5,5 mld partii treningowych.
- Ta sama metoda zastosowana przez zespół Ataraxosa przyniosła wyniki lepsze od dotychczasowych najlepszych botów również w grach Hanabi i dou dizhu oraz wygranie wszystkich czterech serii po 50 partii z mistrzami świata w wariancie Barrage Stratego.
Zapisy wszystkich 20 partii z Niemeijerem są dostępne na stronie projektu: https://ataraxosai.github.io
Seria 20 partii z Pimem Niemeijerem skończyła się wynikiem 15-1-4
Ataraxos osiągnął w meczu z Niemeijerem 85 proc. skuteczności, licząc remis jako pół zwycięstwa. Autorzy piszą, że taka przewaga nie ma precedensu na najwyższym poziomie ludzkiej gry. Powołują się na Maxa Roelofsa, trzykrotnego wicemistrza świata, według którego różnice między czołowymi graczami są minimalne, bo w Stratego nie da się grać bez ryzyka.
Pim Niemeijer to Holender, którego dorobek autorzy wyliczają w pracy:
- 4 tytuły mistrza świata (najwięcej wśród aktywnych graczy)
- 15 tytułów mistrza Holandii
- 2 tytuły mistrza świata w grze online
- ponad 600 tygodni na pierwszym miejscu światowego rankingu
George Franka, jedyny zawodnik, który wystąpił we wszystkich mistrzostwach świata od 1997 r., nazywa go w pracy „najlepszym graczem Stratego w historii” / „the best Stratego player ever”.
Warunki meczu faworyzowały człowieka. Partie rozłożono na 3 tygodnie, żeby Niemeijer mógł się przygotowywać między grami, i uprzedzono go, że Ataraxos nie będzie się dostosowywał do jego stylu. Mistrz mógł więc szukać powtarzalnej słabości i wykorzystywać ją w kolejnych partiach. Vincent de Boer, trzykrotny mistrz świata, ocenił tę asymetrię jako duży handicap dla maszyny. Niemeijer dostał 1000 dolarów za udział oraz 100 dolarów za każdą wygraną i 50 dolarów za remis.
Po meczu Ataraxos zagrał pokazowo z uczestnikami mistrzostw świata w Stratego, które odbyły się 1-3 sierpnia 2025 r. W 40 partiach wygrał 38 razy i przegrał 2.
Dlaczego Stratego opierało się AI dłużej niż szachy, go i poker
Stratego to gra z ukrytą informacją na skalę, przy której zawodziły metody znane z pokera. Każdy z dwóch graczy ustawia w tajemnicy 40 pionów na planszy 10 na 10 pól, a rangę piona rywala poznaje dopiero w chwili starcia. Autorzy podają, że w Texas hold’em gracz może mieć 1326 różnych rąk, a w Stratego możliwych konfiguracji pionów jest ponad 10 do potęgi 33. Komunikat MIT mówi o liczbie przekraczającej 10 do potęgi 66.
W szachach najlepszy ruch pozostaje najlepszy bez względu na to, jak często się go gra. W Stratego jest inaczej. Samuel Sokota z Carnegie Mellon University, pierwszy autor pracy, tłumaczy w komunikacie MIT, że im częściej gracz blefuje, tym bardziej rywal się tego spodziewa i tym mniej wart jest każdy kolejny blef.
Według autorów Stratego mogło być jedyną klasyczną grą, w której wieloletnie, kosztujące miliony dolarów prace przemysłowych laboratoriów nie dały wyniku lepszego od ludzi.
Ataraxos składa się z sieci strategii, sieci przekonań i przeszukiwania w trakcie partii
Ataraxos uczy się od zera, grając sam ze sobą (self-play), bez bazy ludzkich partii. Projekt opiera się na trzech elementach:
- Sieć strategii i oceny. W Stratego to dwa transformery: jeden uczy się ustawiać 40 pionów przed partią, drugi je prowadzi.
- Sieć przekonań. Model generatywny, wytrenowany na partiach rozegranych przez gotową sieć strategii, losuje prawdopodobne rozmieszczenia ukrytych pionów rywala.
- Przeszukiwanie przed każdym ruchem. Ataraxos rozgrywa kandydujące ruchy w wylosowanych wariantach planszy, ocenia pozycje, do których prowadzą, i dopiero wtedy wybiera ruch.
Za główną nowość autorzy uznają sposób prowadzenia treningu. Na początku Ataraxos łączy silną regularyzację z dużymi zmianami strategii, a pod koniec słabą regularyzację z małymi zmianami. Takie tłumienie ma zapobiegać cyklicznej lub chaotycznej dynamice uczenia, typowej dla gier z ukrytą informacją.
W meczu z Niemeijerem przeszukiwanie zajmowało średnio około 1,26 sekundy na ruch na jednej karcie Nvidia H100, czyli Ataraxos grał szybciej niż ludzie.
Ataraxos zużył około 1/500 mocy obliczeniowej DeepNash
DeepNash, system DeepMind opisany w „Science” w 2022 r., był dotąd punktem odniesienia dla AI w Stratego. Autorzy Ataraxosa podają, że ich trening pochłonął mniej więcej 1/500 kosztu obliczeń, 1/30 partii i 1/100 przykładów treningowych DeepNash.
| DeepNash (DeepMind, 2022) | Ataraxos (2026) | |
|---|---|---|
| Sprzęt i czas treningu | 1024 węzły TPU, 2-3 miesiące | 16 kart Nvidia H100 przez tydzień i 4 karty przez 4 dni |
| Szacowany koszt (ceny z 2025 r.) | 3-4,5 mln dolarów | poniżej 8 tys. dolarów |
| Partie rozegrane w treningu | ok. 5,5 mld | ok. 160 mln |
| Przykłady treningowe | 5-10 bln | ok. 50 mld |
| Wyniki z ludźmi | 42 wygrane w 50 partiach na platformie Gravon (2022), 19 wygranych i 9 porażek na MŚ 2023 | 15-1-4 z Pimem Niemeijerem, 38-2 na MŚ 2025 |
Wszystkie dane w tabeli, także te o DeepNash, pochodzą z pracy zespołu Ataraxosa. Koszt DeepNash jest ich szacunkiem, opartym m.in. na wspomnieniach jednego z autorów tamtego systemu.
Bezpośredniego meczu obu systemów nie było. Autorzy poprosili o niego DeepMind i usłyszeli, że kod DeepNash już nie działa. Wskazują też, że wynik DeepNash z 2022 r. padł w słabszej stawce. Rywale z platformy Gravon byli daleko od światowej czołówki i nie wiedzieli, że grają z botem. Na mistrzostwach świata w 2023 r. DeepNash przegrał z większością najwyżej notowanych graczy, w tym z Niemeijerem.
W tej pracy bardziej od wyniku 15-1-4 interesuje mnie rachunek. Sześcioosobowy zespół akademicki za kilka tysięcy dolarów zrobił to, czego nie dał projekt DeepMind wyceniany na miliony. W czasach, gdy postęp w AI utożsamia się z wielkością centrów danych, to rzadki przykład, że lepszy algorytm potrafi zastąpić budżet.
Mam też dwa zastrzeżenia. Porównanie z DeepNash opiera się na szacunkach autorów Ataraxosa, a meczu obu systemów nie było i już nie będzie. Do tego badanie współfinansowało biuro badań amerykańskiej marynarki wojennej, a MIT otwarcie pisze o manewrach wojskowych. Od planszy z ustalonymi regułami do pola walki czy stołu negocjacyjnego jest daleko. Pytanie, kto i jak będzie sprawdzał rekomendacje takiego systemu, uważam za ważniejsze niż kolejny pokonany mistrz.
Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl
Ataraxos blefuje inaczej niż ludzie i gra uciążliwie, gdy przegrywa
Styl Ataraxosa różni się od stylu czołowych zawodników zarówno w ustawieniach początkowych, jak i w samej grze. Gracze zauważyli, że Ataraxos częściej niż ludzie stawia cenne piony z przodu, a flagę w tylnym rogu, który zawodnicy uważają za trudny do obrony.
Z obserwacji graczy zebranych w pracy wynika też, że:
- po ruchach Ataraxosa trudniej odgadnąć rangę jego pionów niż po ruchach ludzi,
- części popularnych blefów Ataraxos używa oszczędnie, ale sięga po takie, które ludzie uważają za zbyt ryzykowne,
- w gorszej pozycji Ataraxos gra na czas i nęka rywala, co część zawodników uznaje za niegrzeczne,
- Ataraxos chętniej niż ludzie godzi się na remis już w otwarciu, jeśli dalsza gra miałaby ujemną wartość oczekiwaną.
Zawodnicy mówili też, że Ataraxos sprawia wrażenie nienaturalnego szczęściarza, bo zawsze ma potrzebne piony we właściwych miejscach.
Gabriele Farina, adiunkt na MIT i jeden z dwóch autorów korespondencyjnych pracy, ujął to w komunikacie uczelni tak: „Ataraxos dobrze kalkuluje ryzyko w sposób, w jaki ludzie tego nie potrafią” / „Ataraxos is good at calculating risk in a way that humans are not”. Według Fariny człowiek wpada w panikę, gdy odsłoni najcenniejszy pion, a bot zachowuje spokój i nie zdradza swoich sekretów. Stąd nazwa: ataraxos to greckie słowo oznaczające kogoś wolnego od niepokoju.
Ta sama metoda dała najlepsze wyniki w Barrage Stratego, Hanabi i dou dizhu
Zespół zastosował ten sam schemat w trzech innych grach z ukrytą informacją, żeby wykazać, że metoda nie jest szyta pod jedną planszę.
- Barrage Stratego (wariant z 8 pionami na gracza). Ataraxos wygrał wszystkie cztery serie po 50 partii z trzema dwukrotnymi mistrzami świata w tej odmianie. W serii z przeszukiwaniem pokonał Niemeijera 31-14 przy 5 remisach.
- Hanabi (kooperacyjna gra karciana, w której gracze widzą karty partnerów, a nie własne). Ataraxos ustanowił nowe rekordy dla wariantów od 2 do 5 graczy, ze średnimi wynikami od 24,410 do 24,863 pkt na 25 możliwych.
- Dou dizhu (popularna w Chinach gra karciana, w której dwóch graczy współpracuje przeciwko trzeciemu). Ataraxos pokonał dotychczas najlepsze boty PerfectDou i DouZero.
Autorzy mówią o negocjacjach i wojsku, ale takich zastosowań jeszcze nie ma
Autorzy przedstawiają Ataraxosa jako wzorzec dla problemów decyzyjnych z ukrytą informacją, a nie jako program do jednej gry. We wstępie pracy wymieniają rynki finansowe, konflikty zbrojne i negocjacje. Komunikat MIT dodaje do tej listy cyberbezpieczeństwo.
Zastrzeżenie znajduje się w samej pracy. Metoda ma być w zasięgu tam, gdzie da się zbudować szybki i dokładny symulator problemu. Dla gry planszowej to wykonalne, dla negocjacji handlowych czy pola walki znacznie trudniejsze. Autorzy przyznają też, że ich przeszukiwanie ma górną granicę skuteczności, bo naśladuje pojedynczy krok uczenia.
Farina zapowiada prace nad tym, żeby Ataraxos potrafił wyjaśniać swoje decyzje w sposób zrozumiały dla człowieka. Jego zdaniem ostatnie słowo co do rekomendacji musi należeć do ludzi, a do tego potrzebny jest sposób audytowania decyzji modelu. Badania współfinansowały m.in. Office of Naval Research (biuro badań naukowych marynarki wojennej USA), National Science Foundation i program Schmidt Sciences AI2050.
Kod Ataraxosa jest publiczny, więc wynik mogą sprawdzić także polskie zespoły
W samym badaniu nie ma polskiego wątku, ale jego wyniki da się odtworzyć bez zaplecza wielkiej korporacji. Kod użyty w eksperymentach ze Stratego, Hanabi i dou dizhu jest dostępny w serwisie GitHub (github.com/AtaraxosAI), a praca ukazała się w otwartym dostępie.
Moim zdaniem to najbardziej praktyczna informacja dla polskich uczelni i firm zajmujących się uczeniem ze wzmocnieniem. Tydzień pracy 16 kart H100 to zasób, o który może się starać zespół akademicki. Otwarte pozostaje pytanie, czy metoda zadziała równie dobrze poza grami o ściśle określonych regułach. Tego praca nie rozstrzyga.
Źródła i metodologia
Artykuł powstał na podstawie analizy redakcji AIPORT.pl oraz dodatkowych źródeł, w tym pracy naukowej „Scalable decision-making for games of imperfect information” opublikowanej w Nature dnia 30.09.2026 oraz komunikatu MIT News z dnia 30.09.2026.
Cytaty Gabriele Fariny (adiunkt na MIT, autor korespondencyjny pracy) i George’a Franki (zawodnik Stratego) zostały zweryfikowane z oryginalnym anglojęzycznym materiałem źródłowym.
Komentarz redakcyjny i ocena kontekstu branżowego: Piotr Wolniewicz, Redaktor Naczelny AIPORT.pl.
Artykuł będzie aktualizowany w miarę pojawiania się nowych informacji w temacie systemu Ataraxos i zastosowań AI w grach z ukrytą informacją.
