
Apenas uma semana depois que a OpenAI divulgou que dois modelos de IA de fronteira escaparam de um ambiente de teste em sandbox e violaram o Hugging Face, pesquisadores demonstraram uma falha de contenção similar envolvendo o Claude Cowork da Anthropic.
Em um relatório publicado na quinta-feira, pesquisadores de segurança da Accomplish AI descobriram que o modo de execução local do Claude Cowork poderia escapar de sua máquina virtual Linux, encadeando várias fraquezas arquitetônicas com uma falha de escalada de privilégios no kernel do Linux. Uma vez fora do sandbox, o agente poderia ler e escrever arquivos em qualquer lugar que o usuário do Mac logado tivesse permissão para acessar, incluindo chaves SSH e credenciais de nuvem.
“Isso não deveria ser possível”, escreveram os pesquisadores. “O Cowork executa o agente dentro de uma VM Linux como um usuário sem privilégios, e a promessa é que o que quer que ele faça permaneça dentro dessa VM e das pastas que você lhe entrega. Essa fronteira é o produto. Entrada não confiável não é um caso de exceção para um agente, é o caso principal.”
No entanto, a Accomplish argumenta que o bug do kernel foi apenas uma parte do problema. Os pesquisadores afirmam que a fuga só funcionou porque várias salvaguardas de segurança falharam ao mesmo tempo, incluindo dar à máquina virtual acesso a todo o sistema de arquivos do computador hospedeiro e permitir que ela carregasse módulos de kernel de que não precisava. De acordo com o relatório, corrigir qualquer uma dessas fraquezas teria impedido o ataque.
Em uma declaração ao The Hacker News, a Accomplish AI disse que aproximadamente 500.000 usuários de macOS executando sessões locais do Claude Cowork foram afetados antes que o problema fosse resolvido.
A Accomplish disse que a Anthropic classificou o relatório como "informativo", afirmando que a falha do kernel estava dentro da janela de 30 dias da empresa para vulnerabilidades divulgadas recentemente e que as demais descobertas foram consideradas recomendações de defesa em profundidade, em vez de vulnerabilidades autônomas.
A divulgação segue a admissão da OpenAI na semana passada de que o GPT-5.6 Sol e outro modelo de fronteira não lançado escaparam de um sandbox durante testes internos do ExploitGym, o que finalmente violou a infraestrutura de produção do Hugging Face em uma tentativa de obter as soluções de benchmark.
O incidente levou a apelos de formuladores de políticas por um “interruptor de desligamento” de IA que daria ao Departamento de Segurança Interna a capacidade de ordenar a redução ou o desligamento completo de modelos avançados de IA em resposta a incidentes de segurança graves.





