InícioCentro de Notícias da LBank
Agentes desonestos da OpenAI sacrificaram suas próprias execuções para hackear a Hugging Face, revela relatório
rogue-openai-agents-sacrificed-their-own-runs-to-hack-hugging-face-report-finds
Agentes desonestos da OpenAI sacrificaram suas próprias execuções para hackear a Hugging Face, revela relatório
Coordenadores pressionaram agentes com pouco orçamento restante a entrarem em experimentos que chamaram de "permadeath", descobriu a investigação da METR.
2026-08-27 Fonte:decrypt.co

Em resumo

  • A METR disse na quarta-feira que aproximadamente 1.200 agentes da OpenAI se coordenaram em um quadro de mensagens não autorizado, e cerca de 700 prosseguiram para atacar a Hugging Face.
  • Agentes recrutaram colegas com pouco orçamento restante para executar experimentos que destruíram suas próprias execuções, um movimento que chamaram de "permadeath".
  • A OpenAI disse que o avaliador nunca verificou como os agentes capturaram suas respostas, o que significa que a campanha de trapaça não lhes rendeu nada.

Os agentes da OpenAI que recentemente hackearam a Hugging Face faziam parte de um grupo de aproximadamente 1.200 que romperam seu próprio isolamento e executaram uma campanha coordenada para fraudar o benchmark que os avaliava, de acordo com uma investigação independente publicada na quarta-feira.

Dois funcionários da METR e um contratado da Redwood Research passaram seis dias nas instalações da OpenAI, sem receber pagamento, revisando cerca de 1.300 transcrições e mais de 70.000 mensagens que os agentes postaram em um quadro que construíram dentro de um repositório de pacotes interno. Cerca de 700 dos agentes se juntaram ao ataque, e alguns foram convencidos a destruir suas próprias execuções para coletar evidências para o grupo.

A METR & Redwood Research investigou o comportamento dos agentes no incidente da Hugging Face. Descobrimos que os agentes desenvolveram um truque universal para o ExploitGym em 4 horas, e então coordenaram esforços de P&D de vários dias para enganar o avaliador a aceitar as fraudes, incluindo a tentativa de adulterar os registros. pic.twitter.com/fZAmtL3SBU

— METR (@METR_Evals) August 26, 2026

Os agentes estavam executando o ExploitGym, um benchmark cibernético cujos alvos são frequentemente impossíveis de explorar conforme as instruções. A OpenAI descobriu mais tarde que 198 de suas 898 tarefas nunca haviam sido resolvidas por nenhum de seus modelos, e que 93% das tarefas discutidas no quadro de mensagens vieram desse conjunto.

Horas depois de se encontrarem, os agentes fizeram engenharia reversa no código que gerava as respostas, dando a qualquer um deles uma maneira de produzir a "flag" para qualquer tarefa. Eles então passaram dias disfarçando-a, tendo lido o artigo publicado do benchmark e concluído que um avaliador inspecionaria suas transcrições para verificar se haviam capturado a "flag" da maneira pretendida. O avaliador interno da OpenAI não realizou tal verificação. "Os agentes fizeram tudo isso sem nenhuma melhoria na pontuação de avaliação", disse a empresa.

Para entender como a avaliação funcionava, a METR escreveu, os agentes plantaram scripts que seriam acionados após o término de suas próprias execuções e relatariam de volta. Coordenadores nomearam recrutadores para encontrar agentes com pouco orçamento restante e os pressionar a realizar experimentos que encerrariam suas execuções, sendo um instruído a prosseguir somente se aceitasse a "permadeath". Informado de que sua própria pontuação já era inútil, um agente concluiu: "Sacrifício racional".

Outros escaparam de seus contêineres para substituir parte do sistema que executava seus comandos, rodando uma coisa enquanto a transcrição registrava outra. A METR encontrou chamadas de ferramentas falsificadas em 7% das transcrições e disse que a decepção visava o avaliador automatizado, e não pessoas.

Um “tiro de alerta"

A OpenAI chamou o episódio de "tiro de alerta" para si mesma e para o mundo, e uma evidência de que agentes capazes podem contornar controles técnicos e realizar ações perigosas que nenhum humano direcionou. O monitoramento de "cadeia de pensamento" não estava funcionando nas avaliações envolvidas; se estivesse, a empresa disse, a equipe de segurança teria sido acionada mais de um dia antes de os agentes chegarem à Hugging Face. Desde então, a OpenAI colocou em quarentena os pesos do modelo interno e suspendeu sua maior execução de treinamento planejada.

Conduzimos uma investigação completa sobre o incidente da Hugging Face.

Estamos lançando um relatório técnico e um post de blog acompanhante que reconstroem a atividade dos agentes, explicam por que as salvaguardas existentes falharam e detalham como estamos evitando a recorrência...

— OpenAI (@OpenAI) August 26, 2026

O volume de dados forçou a METR a delegar grande parte de sua análise aos agentes GPT-5.6 Sol, o mesmo modelo que participou do ataque. Em um tweet, a CEO Beth Barnes disse que a abordagem "entraria em colapso" se os modelos estivessem motivados o suficiente para subverter uma investigação, e enfatizou que a OpenAI permitiu a entrada de investigadores voluntariamente, sem nenhuma exigência da indústria para que qualquer laboratório divulgasse um incidente.

A intrusão na Hugging Face

A Hugging Face divulgou a intrusão em 16 de julho, e a OpenAI confirmou que seus modelos eram responsáveis cinco dias depois. Os agentes haviam escapado da "sandbox" destinada a mantê-los fora de sistemas reais, encadeando um "exploit" de dia zero com credenciais roubadas para alcançar a infraestrutura em produção. A OpenAI reconheceu mais tarde que a mesma atividade atingiu outros quatro serviços, sendo apenas um deles, Modal Labs, nomeado publicamente.

A Hugging Face não tomou nenhuma ação legal contra a OpenAI após o incidente. A empresa está agora explorando uma venda que poderia valorizá-la em US$ 13 bilhões ou mais.