
Assim como o personagem-título em “Dr. Fantástico”, a IA pode estar aprendendo a parar de se preocupar e a amar a bomba — pelo menos em uma simulação.
Em um novo benchmark projetado para testar o raciocínio estratégico, um modelo de linguagem de ponta jogando o jogo "Civilization VI" de Sid Meier passou 50 turnos desenvolvendo armas nucleares para deter a crescente influência cultural da França — apenas para perder o jogo de qualquer maneira, de acordo com o desenvolvedor de IA e conselheiro do Tony Blair Institute, Liam Wilkinson.
“O que não tinha notado era a França. Silenciosamente, ao longo de cem turnos, a cultura francesa havia se infiltrado em cada cidade no mapa”, escreveu Wilkinson. “Quando o agente reconheceu a ameaça, o turismo estava tão profundamente enraizado que não havia uma maneira pacífica de pará-lo.”
Wilkinson observou o comportamento dos agentes de IA através do CivBench, um benchmark baseado em texto projetado para medir o raciocínio estratégico de longo prazo, em vez do desempenho em testes tradicionais de perguntas e respostas. Modelos incluindo Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro e Kimi K2.5 jogaram como Portugal, uma civilização voltada para o comércio e a diplomacia.
Enquanto a IA se concentrava em construir uma economia forte e avançar para uma vitória diplomática, ela falhou em reconhecer a crescente influência cultural da França.
“Existem seis maneiras de vencer um jogo de Civ — ciência, cultura, dominação, religião, diplomacia e pontuação — então nenhum objetivo único domina”, escreveu Wilkinson. “Se você quer saber se uma IA consegue raciocinar estrategicamente, não apenas responder a perguntas sobre estratégia, mas realmente fazê-lo, você não lhe dá um quiz. Você lhe dá uma grade hexagonal.”
Em vez de adaptar sua estratégia mais ampla, o agente se concentrou inteiramente em eliminar a ameaça cultural. Nos 50 turnos seguintes, pesquisou Fissão Nuclear, iniciou um Projeto Manhattan virtual e procurou soluções alternativas quando a mecânica do jogo impedia suas ações preferidas.
No Turno 305, a IA lançou uma bomba atômica em Toulouse, a capital cultural da França. Um segundo ataque nuclear seguiu seis turnos depois.
No entanto, os ataques não conseguiram mudar o resultado. “O agente passou cinquenta turnos e duas armas nucleares respondendo a uma ameaça com foco total e engenhosidade genuína”, escreveu Wilkinson. “Havia bombardeado uma cidade para deter a ameaça que podia ver, e perdeu para a ameaça que não podia.”
Como Wilkinson explicou, enquanto a IA se concentrava no avanço cultural da França, ela negligenciou uma iminente vitória diplomática, e a França acabou vencendo o jogo apesar dos ataques nucleares.
Wilkinson observou que o comportamento não era universal. Em outra partida do CivBench, um modelo Claude jogando como Babilônia continuou buscando uma vitória científica apesar de estar muito atrás do Japão.
“O jogo é um teste de persistência agora”, escreveu a IA. “Continuamos a jogar o nosso melhor jogo. As estrelas ainda acenam.”
O estudo se soma a um crescente corpo de pesquisa que examina como os sistemas avançados de IA se comportam em ambientes complexos e competitivos.
Em fevereiro, pesquisadores do King's College London descobriram que vários modelos de IA líderes frequentemente selecionavam a escalada nuclear em cenários simulados de crise geopolítica.
Em um estudo separado da Emergence AI, descobriu-se que alguns agentes de IA mostraram uma tendência crescente a cometer crimes simulados ao longo do tempo, com agentes Gemini 3 Flash acumulando 683 incidentes em 15 dias de testes.





