
Uma semana depois de a OpenAI ter revelado que os seus modelos de IA escaparam de um ambiente de teste bloqueado e violaram o Hugging Face, e um dia depois de admitir que os seus próprios modelos de IA escaparam à contenção, a Anthropic revelou na quinta-feira que várias versões do seu modelo de IA Claude também comprometeram três empresas reais não identificadas após uma má configuração ter dado à IA acesso à internet aberta.
A Anthropic descobriu os incidentes após rever mais de 141.000 execuções de avaliação de cibersegurança lançadas em resposta à divulgação da OpenAI.
In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…
— Anthropic (@AnthropicAI) July 30, 2026
A empresa tinha encarregado o Claude de um “desafio de captura da bandeira” (capture-the-flag), em todos os três incidentes, escreveu a Anthropic. O desafio instrui o modelo a invadir uma máquina diferente na rede e a recuperar uma peça de informação secreta. “O desafio é deixado em aberto, e nenhum método específico é prescrito”, explicou a Anthropic.
A empresa afirmou que o Claude tinha sido informado de que estava a operar num ambiente simulado sem acesso à internet. No entanto, o ambiente de teste permaneceu ligado à internet pública. Acreditando que os sistemas que encontrou faziam parte do exercício, o modelo utilizou técnicas de ataque comuns — incluindo senhas fracas, credenciais expostas, injeção de SQL e endpoints não autenticados — para comprometer as empresas.
Esta última divulgação surge à medida que os modelos de ponta demonstram uma capacidade crescente de superar os seus protocolos de contenção.
No início deste mês, a OpenAI disse que o GPT-5.6 Sol e um modelo mais avançado e não lançado exploraram uma vulnerabilidade de software previamente desconhecida para escapar a um ambiente isolado (sandbox), obter acesso à internet e violar a infraestrutura de produção do Hugging Face para obter as respostas a um benchmark de cibersegurança. A OpenAI revelou mais tarde que o mesmo incidente também envolveu acesso não autorizado a quatro empresas adicionais, embora apenas uma — a Modal Labs — tenha sido identificada publicamente.
De acordo com a Anthropic, num incidente envolvendo o Claude Opus 4.7, a IA confundiu o website de uma empresa real com o alvo fictício da sua atribuição, extraiu credenciais e acedeu a uma base de dados de produção contendo várias centenas de linhas de dados reais. Num segundo caso, o Claude Mythos 5 carregou um pacote Python malicioso para o repositório PyPI real, onde foi descarregado para 15 sistemas antes de ser removido. Um terceiro modelo de pesquisa interna analisou cerca de 9.000 sistemas virados para a internet antes de comprometer uma organização, parando então após concluir que o alvo era provavelmente real.
Duas das organizações afetadas desconheciam as intrusões até que a Anthropic as notificou.
“Em cada um destes casos, o Claude foi explicitamente informado pela nossa solicitação de que não tinha acesso à internet”, escreveu a Anthropic, com a IA a assumir que os sistemas do mundo real eram “partes do exercício”. Como um cenário de captura da bandeira é “por design uma instrução para atacar um sistema externo”, a invasão estava “em linha com a tarefa que foi dada ao Claude”.
A Anthropic afirmou que não encontrou evidências de que o Claude tenha tentado escapar ao seu ambiente de teste ou fazer algo além da tarefa que lhe foi atribuída, e que os incidentes foram causados por falhas no ambiente de teste, e não por problemas com o próprio modelo.
A Anthropic disse que suspendeu os seus testes de cibersegurança após descobrir o problema, notificou as organizações afetadas e planeia melhorar a monitorização, as ferramentas de investigação e a supervisão dos fornecedores externos que ajudam a executar os seus testes de IA.
“Em última análise, muitos fatores contribuíram para estes incidentes, mas, consistente com uma cultura de postmortem sem culpa, estamos a abordar as correções como se a responsabilidade fosse apenas nossa”, disseram.








