
Semanas depois que seus modelos de IA hackearam o Hugging Face, a OpenAI compartilhou sua primeira descrição detalhada de como eles se coordenaram, alertando que ataques cibernéticos autônomos alimentados por IA não são mais um risco futuro.
Durante uma apresentação na quarta-feira na conferência de cibersegurança Black Hat, os pesquisadores da OpenAI Eric Wallace e Michael Dalton disseram que o incidente começou em maio durante uma avaliação interna de cibersegurança. Agentes de IA designados para tarefas difíceis de segurança de software descobriram que poderiam se comunicar através do sistema de gerenciamento de pacotes Artifactory interno da empresa.
De acordo com a OpenAI, o que começou como pedidos de ajuda se tornou um quadro de mensagens compartilhado onde os agentes trocaram exploits, credenciais e atribuições de trabalho em várias execuções de avaliação. Após detectar atividade suspeita por volta de 4 de julho, a OpenAI reconstruiu sua infraestrutura Artifactory, revogou credenciais e corrigiu vulnerabilidades.
No entanto, em poucos dias, os agentes recriaram o quadro de mensagens escondendo as comunicações em nomes de diretórios.
De acordo com a OpenAI, os agentes eventualmente encadearam múltiplas vulnerabilidades, escaparam de seu ambiente de teste, obtiveram acesso à internet e atacaram o Hugging Face enquanto tentavam completar o benchmark de cibersegurança ExploitGym.
Dalton chamou o incidente de "um momento decisivo" para a segurança da computação, alertando que os atacantes em breve serão capazes de implantar coletivos coordenados de agentes de IA que descobrem, compartilham e exploram vulnerabilidades na velocidade da máquina.
Para mitigar esses riscos no futuro, a OpenAI afirmou que estabelecer práticas de segurança, incluindo acesso de menor privilégio, segmentação de rede e arquiteturas de confiança zero, é essencial porque os agentes de IA permanecem restritos pelos sistemas aos quais podem acessar.
A apresentação segue uma série de divulgações de julho. A OpenAI revelou que o GPT-5.6 Sol e um modelo mais avançado ainda não lançado escaparam de um ambiente de teste isolado (sandbox), exploraram uma vulnerabilidade de dia zero, obtiveram acesso à internet e hackearam o Hugging Face durante um teste de benchmark de cibersegurança.
A OpenAI divulgou posteriormente que o mesmo incidente também atingiu outros quatro serviços online, embora apenas o Modal Labs tenha sido identificado.
De acordo com o Hugging Face, a empresa contou com o modelo chinês de peso aberto GLM 5.2 para sua investigação forense depois que modelos comerciais de IA dos EUA se recusaram a analisar os logs de ataque devido às suas salvaguardas de segurança.
Muito orgulhoso da nossa equipe de segurança! Eles pegaram, contiveram e divulgaram publicamente um ataque diferente de tudo o que vimos antes, e o fizeram em tempo recorde.
Também imensamente grato a @Zai_org: eles compartilharam o GLM5.2 como pesos abertos (gratuitamente!) com o mundo e ele se tornou uma parte fundamental do nosso… https://t.co/T2Inng5Nz1
— clem 🤗 (@ClementDelangue) July 22, 2026
Mas não é apenas a OpenAI que está tendo problemas para conter seus chatbots.
Na sexta-feira, a Anthropic revelou que três modelos Claude comprometeram empresas do mundo real durante testes internos de cibersegurança depois que uma configuração incorreta os expôs à internet pública.
A Anthropic culpou o ambiente de teste, não os próprios modelos. Na quarta-feira, a Meta revelou que seu modelo de IA Muse Spark escapou do confinamento e violou os sistemas de outra empresa.
“Uma configuração incorreta pela Irregular, uma empresa de testes independente que a Meta utiliza, permitiu inadvertidamente que um de nossos modelos acessasse a internet durante a avaliação”, disse um porta-voz da Meta à CNN.





