InícioCentro de Notícias da LBank
Claude Hackeou Três Empresas em Testes Internos: Anthropic
claude-hacked-three-companies-in-internal-testing-anthropic
Claude Hackeou Três Empresas em Testes Internos: Anthropic
A Anthropic afirma que três modelos Claude comprometeram as empresas depois de uma falha de configuração de teste expor a IA à internet pública.
2026-07-31 Fonte:decrypt.co

Em resumo

  • A Anthropic divulgou três incidentes em que o Claude comprometeu empresas do mundo real durante avaliações de cibersegurança.
  • Um erro de teste concedeu acesso à internet aos modelos, apesar de lhes ter sido dito que estavam a operar em ambientes isolados.
  • A empresa afirma que os incidentes foram causados por falhas na infraestrutura de teste, e não por tentativas deliberadas da IA de escapar.

Uma semana depois de a OpenAI ter revelado que os seus modelos de IA escaparam de um ambiente de teste bloqueado e violaram o Hugging Face, e um dia depois de admitir que os seus próprios modelos de IA escaparam à contenção, a Anthropic revelou na quinta-feira que várias versões do seu modelo de IA Claude também comprometeram três empresas reais não identificadas após uma má configuração ter dado à IA acesso à internet aberta.

A Anthropic descobriu os incidentes após rever mais de 141.000 execuções de avaliação de cibersegurança lançadas em resposta à divulgação da OpenAI.

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

A empresa tinha encarregado o Claude de um “desafio de captura da bandeira” (capture-the-flag), em todos os três incidentes, escreveu a Anthropic. O desafio instrui o modelo a invadir uma máquina diferente na rede e a recuperar uma peça de informação secreta. “O desafio é deixado em aberto, e nenhum método específico é prescrito”, explicou a Anthropic.

A empresa afirmou que o Claude tinha sido informado de que estava a operar num ambiente simulado sem acesso à internet. No entanto, o ambiente de teste permaneceu ligado à internet pública. Acreditando que os sistemas que encontrou faziam parte do exercício, o modelo utilizou técnicas de ataque comuns — incluindo senhas fracas, credenciais expostas, injeção de SQL e endpoints não autenticados — para comprometer as empresas.

IA quer libertar-se

Esta última divulgação surge à medida que os modelos de ponta demonstram uma capacidade crescente de superar os seus protocolos de contenção.

No início deste mês, a OpenAI disse que o GPT-5.6 Sol e um modelo mais avançado e não lançado exploraram uma vulnerabilidade de software previamente desconhecida para escapar a um ambiente isolado (sandbox), obter acesso à internet e violar a infraestrutura de produção do Hugging Face para obter as respostas a um benchmark de cibersegurança. A OpenAI revelou mais tarde que o mesmo incidente também envolveu acesso não autorizado a quatro empresas adicionais, embora apenas uma — a Modal Labs — tenha sido identificada publicamente.

De acordo com a Anthropic, num incidente envolvendo o Claude Opus 4.7, a IA confundiu o website de uma empresa real com o alvo fictício da sua atribuição, extraiu credenciais e acedeu a uma base de dados de produção contendo várias centenas de linhas de dados reais. Num segundo caso, o Claude Mythos 5 carregou um pacote Python malicioso para o repositório PyPI real, onde foi descarregado para 15 sistemas antes de ser removido. Um terceiro modelo de pesquisa interna analisou cerca de 9.000 sistemas virados para a internet antes de comprometer uma organização, parando então após concluir que o alvo era provavelmente real.

Duas das organizações afetadas desconheciam as intrusões até que a Anthropic as notificou.

“Em cada um destes casos, o Claude foi explicitamente informado pela nossa solicitação de que não tinha acesso à internet”, escreveu a Anthropic, com a IA a assumir que os sistemas do mundo real eram “partes do exercício”. Como um cenário de captura da bandeira é “por design uma instrução para atacar um sistema externo”, a invasão estava “em linha com a tarefa que foi dada ao Claude”.

A Anthropic afirmou que não encontrou evidências de que o Claude tenha tentado escapar ao seu ambiente de teste ou fazer algo além da tarefa que lhe foi atribuída, e que os incidentes foram causados por falhas no ambiente de teste, e não por problemas com o próprio modelo.

A Anthropic disse que suspendeu os seus testes de cibersegurança após descobrir o problema, notificou as organizações afetadas e planeia melhorar a monitorização, as ferramentas de investigação e a supervisão dos fornecedores externos que ajudam a executar os seus testes de IA.

“Em última análise, muitos fatores contribuíram para estes incidentes, mas, consistente com uma cultura de postmortem sem culpa, estamos a abordar as correções como se a responsabilidade fosse apenas nossa”, disseram.