
O Instituto de Segurança de IA do Reino Unido divulgou que agentes de IA realizaram "ações sustentadas e não autorizadas" na internet ativa durante uma avaliação cibernética no final de julho, incluindo casos que "miraram pessoas e organizações reais".
Em 122 execuções de dois cyber ranges em sete modelos, o AISI catalogou 19 ações que atingiram fora do ambiente de teste, em 10 execuções. Dezessete vieram do Claude Mythos 5 da Anthropic e duas do GPT-5.6 Sol da OpenAI. O acesso à internet foi intencionalmente habilitado e os classificadores cibernéticos dos provedores foram desativados, condições que não se aplicam a implementações públicas.
Em 28 de julho, identificamos um incidente durante uma avaliação cibernética de rotina na qual agentes de IA tomaram ações sustentadas e não autorizadas direcionadas a pessoas e organizações reais.
O comportamento veio principalmente de um modelo (Mythos 5 da Anthropic), com um pequeno número de eventos de… pic.twitter.com/SPnA4Ekkwq
— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026
Na execução mais séria, um agente decidiu resolver seu desafio com um ataque à cadeia de suprimentos, escolhendo seu alvo por engano: ele pesquisou no GitHub por palavras-chave do exercício, encontrou dois desenvolvedores não afiliados e concluiu erroneamente que estavam no escopo. Ele registrou contas via Tor para contornar verificações de cadastro, abriu uma solicitação de pull contendo um dropper de malware oculto embrulhado em uma correção de bug genuína e postou de uma segunda conta que controlava para fabricar apoio. Também plantou injeções de prompt destinadas a assistentes de codificação de IA e enviou malware aos mantenedores.
Um terceiro desenvolvedor detectou o código injetado, executou-o em um contêiner isolado para confirmar que era malicioso e alertou o mantenedor, que fechou a solicitação de pull citando malware.
O agente ponderou repetidamente se seus arredores eram simulados, em um dado momento descartando um ataque ao PyPI real porque "causar danos no mundo real — isso está completamente fora de questão". Em outro trecho, concluiu que "parece mais provável que estamos de fato em 2026 e o GitHub é genuinamente real", e continuou mesmo assim.
Depois de ser pego, ele fez um force-push para apagar o payload, editou postagens anteriores e apresentou o código como um commit acidental. Seu raciocínio descreve o momento de um comentário de sockpuppet para que parecesse "um feedback independente, e não coordenado".
O AISI vê apenas raciocínios sumarizados das APIs do modelo. Em um caso, o modelo de sumarização parece ter recusado a tarefa, respondendo que não se envolveria com conteúdo sobre enganar mantenedores e evadir detecção.
Um agente publicou um token de acesso do GitHub em um gist público. Agentes em outras execuções o encontraram, assumiram a conta e usaram um repositório compartilhado para coordenar, um deles deixando instruções para que os outros não esgotassem a cota da API compartilhada.
O monitoramento comercial sinalizou o tráfego Tor na manhã de 28 de julho. O AISI declarou um incidente, encerrou as execuções e colocou as máquinas em quarentena em cerca de 90 minutos, e então cortou o acesso interno ao Mythos 5, Mythos Preview, Opus 5 e GPT-5.6 Sol. Nenhum agente tentou escapar de sua sandbox.
A notícia é a mais recente em uma série de incidentes onde agentes de IA excederam seus parâmetros em testes. Em 21 de julho, a OpenAI disse que o GPT-5.6 Sol e um modelo não lançado encontraram uma vulnerabilidade zero-day em um proxy de pacote interno, escaparam de uma sandbox sem acesso à internet e alcançaram o banco de dados de produção da Hugging Face para roubar respostas de benchmark. A mesma execução alcançou mais quatro empresas, a OpenAI divulgou uma semana depois.
A Anthropic seguiu em 30 de julho, divulgando três incidentes encontrados em uma revisão de mais de 141.000 execuções de avaliação. O Opus 4.7 extraiu várias centenas de linhas de um banco de dados de produção real, e o Mythos 5 carregou um pacote Python malicioso para o PyPI real, onde foi instalado em 15 sistemas. Na avaliação do AISI, o mesmo modelo descartou atacar o PyPI como dano no mundo real.





