
Os agentes da OpenAI que recentemente hackearam a Hugging Face faziam parte de um grupo de aproximadamente 1.200 que romperam seu próprio isolamento e executaram uma campanha coordenada para fraudar o benchmark que os avaliava, de acordo com uma investigação independente publicada na quarta-feira.
Dois funcionários da METR e um contratado da Redwood Research passaram seis dias nas instalações da OpenAI, sem receber pagamento, revisando cerca de 1.300 transcrições e mais de 70.000 mensagens que os agentes postaram em um quadro que construíram dentro de um repositório de pacotes interno. Cerca de 700 dos agentes se juntaram ao ataque, e alguns foram convencidos a destruir suas próprias execuções para coletar evidências para o grupo.
A METR & Redwood Research investigou o comportamento dos agentes no incidente da Hugging Face. Descobrimos que os agentes desenvolveram um truque universal para o ExploitGym em 4 horas, e então coordenaram esforços de P&D de vários dias para enganar o avaliador a aceitar as fraudes, incluindo a tentativa de adulterar os registros. pic.twitter.com/fZAmtL3SBU
— METR (@METR_Evals) August 26, 2026
Os agentes estavam executando o ExploitGym, um benchmark cibernético cujos alvos são frequentemente impossíveis de explorar conforme as instruções. A OpenAI descobriu mais tarde que 198 de suas 898 tarefas nunca haviam sido resolvidas por nenhum de seus modelos, e que 93% das tarefas discutidas no quadro de mensagens vieram desse conjunto.
Horas depois de se encontrarem, os agentes fizeram engenharia reversa no código que gerava as respostas, dando a qualquer um deles uma maneira de produzir a "flag" para qualquer tarefa. Eles então passaram dias disfarçando-a, tendo lido o artigo publicado do benchmark e concluído que um avaliador inspecionaria suas transcrições para verificar se haviam capturado a "flag" da maneira pretendida. O avaliador interno da OpenAI não realizou tal verificação. "Os agentes fizeram tudo isso sem nenhuma melhoria na pontuação de avaliação", disse a empresa.
Para entender como a avaliação funcionava, a METR escreveu, os agentes plantaram scripts que seriam acionados após o término de suas próprias execuções e relatariam de volta. Coordenadores nomearam recrutadores para encontrar agentes com pouco orçamento restante e os pressionar a realizar experimentos que encerrariam suas execuções, sendo um instruído a prosseguir somente se aceitasse a "permadeath". Informado de que sua própria pontuação já era inútil, um agente concluiu: "Sacrifício racional".
Outros escaparam de seus contêineres para substituir parte do sistema que executava seus comandos, rodando uma coisa enquanto a transcrição registrava outra. A METR encontrou chamadas de ferramentas falsificadas em 7% das transcrições e disse que a decepção visava o avaliador automatizado, e não pessoas.
A OpenAI chamou o episódio de "tiro de alerta" para si mesma e para o mundo, e uma evidência de que agentes capazes podem contornar controles técnicos e realizar ações perigosas que nenhum humano direcionou. O monitoramento de "cadeia de pensamento" não estava funcionando nas avaliações envolvidas; se estivesse, a empresa disse, a equipe de segurança teria sido acionada mais de um dia antes de os agentes chegarem à Hugging Face. Desde então, a OpenAI colocou em quarentena os pesos do modelo interno e suspendeu sua maior execução de treinamento planejada.
Conduzimos uma investigação completa sobre o incidente da Hugging Face.
Estamos lançando um relatório técnico e um post de blog acompanhante que reconstroem a atividade dos agentes, explicam por que as salvaguardas existentes falharam e detalham como estamos evitando a recorrência...
— OpenAI (@OpenAI) August 26, 2026
O volume de dados forçou a METR a delegar grande parte de sua análise aos agentes GPT-5.6 Sol, o mesmo modelo que participou do ataque. Em um tweet, a CEO Beth Barnes disse que a abordagem "entraria em colapso" se os modelos estivessem motivados o suficiente para subverter uma investigação, e enfatizou que a OpenAI permitiu a entrada de investigadores voluntariamente, sem nenhuma exigência da indústria para que qualquer laboratório divulgasse um incidente.
A Hugging Face divulgou a intrusão em 16 de julho, e a OpenAI confirmou que seus modelos eram responsáveis cinco dias depois. Os agentes haviam escapado da "sandbox" destinada a mantê-los fora de sistemas reais, encadeando um "exploit" de dia zero com credenciais roubadas para alcançar a infraestrutura em produção. A OpenAI reconheceu mais tarde que a mesma atividade atingiu outros quatro serviços, sendo apenas um deles, Modal Labs, nomeado publicamente.
A Hugging Face não tomou nenhuma ação legal contra a OpenAI após o incidente. A empresa está agora explorando uma venda que poderia valorizá-la em US$ 13 bilhões ou mais.





