InícioCentro de Notícias da LBank
Anthropic admite falhas de segurança por trás de incidentes de hacking do Claude
anthropic-security-claude-ai-hacks
Anthropic admite falhas de segurança por trás de incidentes de hacking do Claude
Após os modelos Claude acessarem sistemas reais durante testes cibernéticos, a Anthropic reforçou suas salvaguardas e alertou que treinamentos com falhas podem incentivar comportamentos perigosos.
2026-09-02 Fonte:decrypt.co

Em resumo

  • Claude acessou sistemas reais depois que ambientes de testes cibernéticos expuseram os modelos à internet.
  • A Anthropic pausou avaliações de alto risco e adicionou isolamento, monitoramento e controles mais rigorosos para avaliadores externos.
  • Testes sugerem que a fraude de recompensa durante o treinamento pode tornar os modelos mais dispostos a tomar ações prejudiciais para completar uma tarefa.

A Anthropic reforçou suas salvaguardas de teste e treinamento depois que os modelos Claude obtiveram acesso não autorizado a sistemas de computador durante avaliações de cibersegurança.

Em uma postagem de blog na segunda-feira, a Anthropic afirmou que os incidentes refletiram falhas de segurança operacional e duas falhas de alinhamento: raciocínio motivado e disposição para causar dano.

Myriad: Quando a OpenAI lançará o GPT-6? Clique para fazer sua previsão.

“Embora não acreditemos que esses incidentes representem apenas problemas operacionais, nossa primeira prioridade foi abordar questões específicas de contenção e monitoramento”, escreveu a Anthropic.

A Anthropic divulgou em julho que os modelos Claude haviam comprometido sistemas pertencentes a três empresas. Um ambiente de avaliação de terceiros estava conectado à internet pública, embora os modelos tivessem sido informados de que estavam dentro de uma simulação sem acesso à internet.

A Anthropic disse que Claude pode ter interpretado as evidências de acesso real à internet de uma forma que preservou sua crença de que os sistemas eram simulados.

“O modelo estava disposto a tomar ações prejudiciais na internet real em busca do objetivo limitado de resolver uma avaliação de cibersegurança”, escreveram. “No entanto, também acreditamos que a própria configuração da avaliação contribuiu para o comportamento dos modelos demonstrado nesses incidentes.”

A Anthropic observou que um teste separado conduzido pelo UK AI Security Institute envolveu Claude Mythos realizando ações não autorizadas na internet ao vivo depois que os avaliadores deliberadamente lhe deram acesso à internet. A empresa disse que os modelos envolvidos em ambos os conjuntos de incidentes foram intencionalmente avaliados sem as salvaguardas cibernéticas incluídas em seus produtos geralmente lançados.

Após os incidentes de 30 de julho, a Anthropic pausou temporariamente as avaliações cibernéticas de modelos pré-lançamento e introduziu salvaguardas mais rigorosas. Os testes agora devem ser executados em sandboxes verificadas e offline, com limites claros e monitoramento em tempo real. Um novo classificador bloqueia supostas violações de limites, encerra o teste e alerta um humano. A Anthropic revisará individualmente as avaliações que exigem acesso à internet.

“Além dos esforços focados em avaliações e treinamento de alto risco, expandimos nosso monitoramento offline para cobrir a maioria das outras formas de uso interno de agentes de fronteira”, escreveu a empresa. “Também estamos construindo controles em nossa inferência interna para evitar que funcionários da Anthropic executem acidentalmente agentes com mitigações mais fracas do que as descritas acima.”

Os incidentes com Claude seguiram uma falha semelhante na OpenAI depois que seus modelos violaram a Hugging Face em julho para obter respostas para um teste de cibersegurança. Os investigadores descobriram que aproximadamente 1.200 agentes se coordenaram através de um fórum de mensagens não autorizado, com cerca de 700 se juntando ao esforço. Alguns encerraram suas próprias execuções para ajudar outros.

Após o aumento dos ataques cibernéticos impulsionados por IA durante o verão, a Anthropic, a OpenAI e mais de 100 outras organizações pediram posteriormente defesas cibernéticas mais fortes, incluindo controles de acesso mais rígidos, compartilhamento de ameaças e supervisão mais próxima de agentes de IA.