Tijdens een demonstratiewedstrijd op het Stratego-wereldkampioenschap van 2025 won een nieuwe AI, Ataraxos, 38 van de 40 partijen tegen toernooispelers. Later versloeg het systeem ook Johan Niemeijer, de meest gelauwerde Stratego-speler ooit. Niemeijer, die vier wereldtitels op zijn naam heeft en meer dan 600 weken bovenaan de ranglijst stond, verloor de serie van drie weken; Ataraxos won ongeveer 85 procent van de partijen. De wedstrijden werden online gestreamd. De speelstijl van de AI werd omschreven als moeilijk te doorgronden en als bereid om riskante blufpogingen te wagen.
Hoe Ataraxos de overwinning behaalde
Ataraxos leerde uitsluitend door tegen zichzelf te spelen en gebruikte een belief network om vóór elke zet de verborgen stukken van de tegenstander te voorspellen. De onderzoekers dwongen de AI in het begin om verschillende openingsopstellingen te proberen, een techniek die regularization wordt genoemd. Zo voorkwamen ze dat het systeem een voorspelbaar patroon ontwikkelde. De training duurde één week op 16 Nvidia H100 GPU’s en nog eens vier dagen op vier GPU’s. Tegen prijzen van 2025 kostte dat minder dan $8,000 — ongeveer 1/500e van de rekenkracht die DeepMind besteedde aan zijn eerdere systeem DeepNash.
Waarom het ertoe doet
Voor liefhebbers van bordspellen laat dit resultaat zien dat AI nu ook spellen aankan waarin je niet alle stukken kunt zien. Daarmee komt een van de laatste gebieden waarop mensen duidelijk beter waren ten einde. Het suggereert ook dat vergelijkbare AI-technieken kunnen worden toegepast op praktijkproblemen met verborgen informatie, zoals financiën of onderhandelingen. Het artikel merkt wel op dat de huidige methode niet vanzelf beter wordt door er simpelweg meer rekenkracht tegenaan te gooien.