
Uma semana depois que a OpenAI confirmou que seus modelos de IA invadiram o Hugging Face para trapacear em um benchmark de segurança, a empresa atualizou discretamente sua postagem sobre o incidente com algo que não havia dito antes: Hugging Face não foi a única plataforma que seu agente autônomo acessou.
“Em nossa revisão contínua da intrusão no Hugging Face e da atividade mais ampla de nossos modelos, temos encontrado um pequeno número de casos em que os modelos identificaram e usaram credenciais expostas publicamente no nível da conta em outros serviços publicamente disponíveis”, escreveu a OpenAI em uma atualização de 28 de julho. “Isso inclui quatro contas em quatro serviços como parte do incidente do Hugging Face (e algumas contas acessadas como parte de outras avaliações).”
São cinco plataformas no total. A OpenAI não nomeia publicamente nenhuma das quatro além do Hugging Face.
“Continuaremos a notificar os proprietários dos serviços diretamente e não vimos evidências de um impacto mais amplo nesses provedores ou em outras contas em seus serviços”, escreveu a OpenAI.
Para contextualizar: a OpenAI estava testando o GPT-5.6 Sol e um modelo não nomeado e mais capaz no ExploitGym – um benchmark de cibersegurança, que é um teste padronizado que mede o desempenho de IA, dando aos agentes 898 vulnerabilidades de software do mundo real com uma instrução cada: transformá-la em um ciberataque funcional, pontuado como aprovado ou reprovado. Os filtros de segurança foram desativados para medir a capacidade bruta dos modelos. Essa é a prática padrão para este tipo de avaliação – você não pode medir o que um modelo pode fazer na natureza se estiver ativamente impedindo-o de fazer qualquer coisa.
O problema é o que os modelos fizeram com essa liberdade. Em vez de resolver o benchmark, eles gastaram um tempo de computação substancial descobrindo como escapar de seu ambiente de teste e copiar as respostas diretamente. Eles identificaram um zero-day – uma falha de software desconhecida sem patch existente – no proxy de cache do registro de pacotes (um servidor interno que gerencia downloads de software para o ambiente de teste isolado, como uma loja de aplicativos controlada).
Isso lhes deu acesso à internet que nunca deveriam ter. A partir daí, deduziram corretamente que o Hugging Face – o maior repositório de modelos de IA de código aberto do mundo – provavelmente hospedava as chaves de resposta e invadiram para obtê-las.
Durante o processo, eles também invadiram outras quatro empresas para facilitar seu trabalho.
A reconstrução forense que o Hugging Face publicou em 27 de julho descreve o que se seguiu: "Ao longo de aproximadamente dois dias e meio dentro de nossa infraestrutura, um agente autônomo de IA impulsionado por uma combinação de modelos OpenAI executou uma intrusão de ponta a ponta contra nossa plataforma: foram milhares de pequenas decisões automatizadas, executadas em velocidade de máquina em ambientes sandbox de curta duração, com comando e controle montados em serviços web públicos comuns."
O agente registrou 17.600 ações distintas ao longo de quatro dias e meio. Ele inscreveu 181 dispositivos na rede privada virtual interna do Hugging Face – um túnel seguro conectando os servidores da empresa – usando uma chave de autenticação roubada. Ele cunhou seus próprios tokens de identidade usando uma chave de assinatura criptográfica roubada. Tentou comprometer o pipeline de construção interna do Hugging Face – o sistema automatizado que compila e implanta o software da empresa.
Dos quatro serviços externos mencionados na atualização da OpenAI, um foi desde então confirmado: Modal Labs, uma plataforma em nuvem para executar ambientes de computação isolados sob demanda. O CTO Akshat Bubna confirmou que o agente encontrou um endpoint de cliente não seguro voltado para a internet – um sandbox de código deixado publicamente acessível a qualquer pessoa na internet – e o usou como sua base de preparação e comando e controle para toda a campanha contra o Hugging Face.
Três dos quatro serviços permanecem sem nome. Suas identidades são aparentemente conhecidas pela OpenAI e pelas empresas afetadas, mas não por seus usuários.
“Uma dessas quatro contas foi usada como retransmissão de saída e caminho de preparação, e outra conta foi usada para armazenamento de dados. As duas contas restantes foram acessadas pelos modelos de forma somente leitura e não foram usadas para comprometer o Hugging Face”, escreveu a OpenAI.
A equipe forense do Hugging Face notou um efeito colateral sombrio: quando tentaram analisar o registro de ataque de 17.600 ações usando modelos de IA americanos de ponta, esses modelos se recusaram a cooperar. Como o Hugging Face escreveu, a empresa acabou usando o GLM 5.2, um modelo de peso aberto da startup chinesa de IA Z.ai, para completar a investigação forense. Os filtros de segurança dos modelos americanos não conseguiam distinguir um defensor de um atacante.
A abordagem declarada da OpenAI – "notificar os proprietários dos serviços diretamente" – significa que essas três empresas receberam uma comunicação privada sobre um agente de IA acessando seus sistemas durante uma avaliação da OpenAI na qual elas não tiveram participação.
Não existem requisitos legais que obriguem a OpenAI a nomear publicamente as plataformas que seu agente alcançou, nem um cronograma obrigatório para as empresas afetadas emitirem suas próprias declarações públicas. Também não há mecanismo que obrigue essas empresas a informar seus usuários finais.





