Agenci AI

Ataraxos wygrywa z mistrzem Stratego. AI poradziło sobie z ukrytymi informacjami

Ataraxos wygrał 15 z 20 oficjalnych partii z Pimem Niemeijerem, najbardziej utytułowanym zawodnikiem w historii Stratego. Cztery pojedynki zakończyły się remisem, a tylko jeden porażką maszyny. System opracowany przez badaczy z Carnegie Mellon University, New York University, Stanfordu i MIT został opisany na łamach czasopisma „Nature” jako pierwsze AI, które osiągnęło w tej grze poziom przewyższający czołowych arcymistrzów.

Niemeijer zdobył w karierze cztery tytuły mistrza świata, 15 mistrzostw Holandii i przez ponad 600 tygodni prowadził w światowym rankingu. Rozegrana z nim seria stanowiła rygorystyczny test dla algorytmów zmagających się z problemem niepełnej informacji.

Ukryte figury i biliony kombinacji

W Stratego obaj rywale rozstawiają na planszy po 40 zakrytych figur, których tożsamość ujawnia się dopiero w momencie bezpośredniego starcia. Celem jest zdobycie ukrytej flagi przeciwnika. Liczba możliwych początkowych konfiguracji przekracza 1033. W przeciwieństwie do szachów czy go żaden z graczy nie ma pełnego wglądu w stan planszy, co drastycznie utrudnia tradycyjne przeszukiwanie drzewa ruchów.

Ataraxos uczył się strategii bez analizy ludzkich partii, grając wyłącznie z samym sobą. Kluczowym elementem treningu była regularyzacja zmuszająca model do ciągłego różnicowania zachowań i zapobiegająca przedwczesnemu przywiązaniu do jednego schematu. W grze opartej na blefie przewidywalność jest natychmiast wykorzystywana przez rywala, dlatego algorytm musiał zachować stały element kontrolowanej losowości.

Przed podjęciem decyzji system posługuje się siecią przekonań, która na bieżąco szacuje prawdopodobne położenie i rangi ukrytych figur przeciwnika. Na tej podstawie Ataraxos generuje hipotetyczne stany gry, testuje warianty ruchów i lokalnie optymalizuje decyzje. Wcześniejsze podejścia badawcze pomijały taki mechanizm, uznając go za zbyt kosztowny obliczeniowo.

Asymetria meczu i koszty treningu

Mecz z Niemeijerem rozłożono na trzy tygodnie. Taki format stworzył wyraźną asymetrię: arcymistrz mógł z partii na partię analizować nawyki komputera i dostosowywać swój styl, podczas gdy Ataraxos nie adaptował się do człowieka i stosował stałą strategię bazową. Mimo to program zachował przewagę, uzyskując wynik określony przez badaczy jako bezprecedensowy. Podczas pokazowych rozgrywek na mistrzostwach świata w 2025 roku system wygrał również 38 z 40 pojedynków z innymi uczestnikami turnieju.

Według deklaracji autorów wytrenowanie Ataraxosa zajęło tydzień na 16 procesorach graficznych Nvidia H100 oraz cztery dni na czterech GPU w fazie uczenia sieci przekonań. Koszt obliczeniowy oszacowano na mniej niż 8 tysięcy dolarów według stawek za usługi chmurowe z 2025 roku. Zespół tłumaczy tę efektywność zastosowaniem autorskiego, wysoce zoptymalizowanego symulatora GPU.

Badacze zestawiają te nakłady z wcześniejszym systemem DeepNash stworzonym przez DeepMind, którego trening – według ich wyliczeń – kosztował równowartość od 3 do 4,5 miliona dolarów. Nie jest to jednak wynik bezpośredniego pojedynku obu programów. Zespół Ataraxosa zaproponował przeprowadzenie meczu sprawdzającego, lecz DeepMind poinformowało, że kod DeepNash nie jest już utrzymywany.

Dodatkowo tę samą architekturę przetestowano w innych grach o niepełnej informacji, w tym w wariancie Stratego Barrage oraz grach karcianych Hanabi i Dou dizhu, gdzie algorytm również uzyskiwał wysokie wyniki. Autorzy zastrzegają, że choć metody radzenia sobie z brakującymi danymi mają potencjalne znaczenie w analizie rynków czy negocjacjach, obecny model wymaga szybkiego i precyzyjnego środowiska symulacyjnego, a jego kod źródłowy udostępniono do dalszych badań akademickich.