
IA vence o maior campeão de Stratego da história gastando pouco
Sistema batizado Ataraxos, criado por pesquisadores do MIT, Carnegie Mellon, Stanford e NYU, derrotou o holandês Pim Niemeijer por 15 vitórias a 1, com 4 empates, treinando em apenas 16 GPUs por uma semana.
Por Elias Brandão · Analista de IA e ética
O que é o Stratego, afinal
Para quem não cresceu com o tabuleiro embaixo do braço: Stratego é um jogo de estratégia em que cada jogador posiciona 40 peças militares viradas para baixo, escondidas do adversário. Diferente do xadrez, ninguém sabe a patente das peças do oponente até o momento do confronto — é um jogo de informação oculta, o que historicamente o tornava um osso duro de roer para a inteligência artificial, bem mais difícil de modelar do que xadrez ou Go.
Esse obstáculo acaba de cair. Um sistema batizado Ataraxos, desenvolvido por pesquisadores do MIT, da Carnegie Mellon, de Stanford e da NYU, derrotou Pim Niemeijer, descrito como o jogador mais condecorado da história do Stratego, em uma série de 20 partidas: 15 vitórias, 1 derrota e 4 empates. O resultado foi publicado na revista científica Nature.
Chute calculado: uma rede para adivinhar o que está escondido
Em bom português, o truque do Ataraxos foi separar duas tarefas que antes ficavam amontoadas em um único cérebro artificial. Uma rede neural cuida da decisão de jogo propriamente dita — que peça mover, para onde. A segunda rede neural tem um único trabalho: estimar, com base no padrão de jogadas do adversário, qual é a identidade mais provável de cada peça escondida no tabuleiro. É como jogar pôquer prestando atenção nos "tells" do adversário, só que de forma sistemática e estatística.
Essa combinação de autojogo (self-play) por aprendizado por reforço com planejamento em tempo de decisão foi o que permitiu ao sistema lidar com a quantidade monstruosa de informação oculta do Stratego — algo que modelos anteriores não conseguiam fazer de forma competitiva.
Por que isso importa: o orçamento
O mais chamativo não é só vencer, é o preço da vitória. O treinamento do Ataraxos rodou em 16 GPUs Nvidia H100 por uma semana, com custo estimado abaixo de 8 mil dólares. Para efeito de comparação, o DeepNash, sistema anterior desenvolvido para o mesmo jogo, teve custo de treinamento estimado entre 3 e 4,5 milhões de dólares — uma diferença de centenas de vezes em poder computacional.
A mesma receita, segundo os pesquisadores, também produziu um sistema sobre-humano para o Barrage Stratego (variante do jogo) e resultados de ponta em outros jogos de informação oculta, como Hanabi e dou dizhu. Fica em aberto se essa arquitetura mais barata vai se tornar o novo padrão para resolver outros problemas de decisão sob incerteza, fora dos tabuleiros.