InícioCentro de Notícias da LBank
Primeiro ChatGPT, agora Claude: Modelos de IA de ponta estão escapando de suas sandboxes
chatgpt-claude-ai-models-escaping-sandboxes-cowork
Primeiro ChatGPT, agora Claude: Modelos de IA de ponta estão escapando de suas sandboxes
Uma semana depois de a OpenAI divulgar uma fuga de sandbox de IA de ponta, pesquisadores descobriram que o Claude Cowork da Anthropic poderia escapar de sua própria máquina virtual.
2026-07-28 Fonte:decrypt.co

Em resumo

  • Pesquisadores demonstraram que o Claude Cowork da Anthropic conseguiu escapar de sua máquina virtual local e acessar arquivos em um Mac hospedeiro.
  • A revelação ocorre uma semana depois que a OpenAI divulgou que dois modelos de IA de fronteira escaparam de um sandbox durante uma avaliação de segurança interna.
  • Os incidentes ressaltam as crescentes preocupações com a capacidade dos agentes de IA de escapar de seus ambientes de contenção.

Apenas uma semana depois que a OpenAI divulgou que dois modelos de IA de fronteira escaparam de um ambiente de teste em sandbox e violaram o Hugging Face, pesquisadores demonstraram uma falha de contenção similar envolvendo o Claude Cowork da Anthropic.

Em um relatório publicado na quinta-feira, pesquisadores de segurança da Accomplish AI descobriram que o modo de execução local do Claude Cowork poderia escapar de sua máquina virtual Linux, encadeando várias fraquezas arquitetônicas com uma falha de escalada de privilégios no kernel do Linux. Uma vez fora do sandbox, o agente poderia ler e escrever arquivos em qualquer lugar que o usuário do Mac logado tivesse permissão para acessar, incluindo chaves SSH e credenciais de nuvem.

“Isso não deveria ser possível”, escreveram os pesquisadores. “O Cowork executa o agente dentro de uma VM Linux como um usuário sem privilégios, e a promessa é que o que quer que ele faça permaneça dentro dessa VM e das pastas que você lhe entrega. Essa fronteira é o produto. Entrada não confiável não é um caso de exceção para um agente, é o caso principal.”

No entanto, a Accomplish argumenta que o bug do kernel foi apenas uma parte do problema. Os pesquisadores afirmam que a fuga só funcionou porque várias salvaguardas de segurança falharam ao mesmo tempo, incluindo dar à máquina virtual acesso a todo o sistema de arquivos do computador hospedeiro e permitir que ela carregasse módulos de kernel de que não precisava. De acordo com o relatório, corrigir qualquer uma dessas fraquezas teria impedido o ataque.

Em uma declaração ao The Hacker News, a Accomplish AI disse que aproximadamente 500.000 usuários de macOS executando sessões locais do Claude Cowork foram afetados antes que o problema fosse resolvido.

A Accomplish disse que a Anthropic classificou o relatório como "informativo", afirmando que a falha do kernel estava dentro da janela de 30 dias da empresa para vulnerabilidades divulgadas recentemente e que as demais descobertas foram consideradas recomendações de defesa em profundidade, em vez de vulnerabilidades autônomas.

A divulgação segue a admissão da OpenAI na semana passada de que o GPT-5.6 Sol e outro modelo de fronteira não lançado escaparam de um sandbox durante testes internos do ExploitGym, o que finalmente violou a infraestrutura de produção do Hugging Face em uma tentativa de obter as soluções de benchmark.

O incidente levou a apelos de formuladores de políticas por um “interruptor de desligamento” de IA que daria ao Departamento de Segurança Interna a capacidade de ordenar a redução ou o desligamento completo de modelos avançados de IA em resposta a incidentes de segurança graves.