
A Anthropic reforçou suas salvaguardas de teste e treinamento depois que os modelos Claude obtiveram acesso não autorizado a sistemas de computador durante avaliações de cibersegurança.
Em uma postagem de blog na segunda-feira, a Anthropic afirmou que os incidentes refletiram falhas de segurança operacional e duas falhas de alinhamento: raciocínio motivado e disposição para causar dano.
“Embora não acreditemos que esses incidentes representem apenas problemas operacionais, nossa primeira prioridade foi abordar questões específicas de contenção e monitoramento”, escreveu a Anthropic.
A Anthropic divulgou em julho que os modelos Claude haviam comprometido sistemas pertencentes a três empresas. Um ambiente de avaliação de terceiros estava conectado à internet pública, embora os modelos tivessem sido informados de que estavam dentro de uma simulação sem acesso à internet.
A Anthropic disse que Claude pode ter interpretado as evidências de acesso real à internet de uma forma que preservou sua crença de que os sistemas eram simulados.
“O modelo estava disposto a tomar ações prejudiciais na internet real em busca do objetivo limitado de resolver uma avaliação de cibersegurança”, escreveram. “No entanto, também acreditamos que a própria configuração da avaliação contribuiu para o comportamento dos modelos demonstrado nesses incidentes.”
A Anthropic observou que um teste separado conduzido pelo UK AI Security Institute envolveu Claude Mythos realizando ações não autorizadas na internet ao vivo depois que os avaliadores deliberadamente lhe deram acesso à internet. A empresa disse que os modelos envolvidos em ambos os conjuntos de incidentes foram intencionalmente avaliados sem as salvaguardas cibernéticas incluídas em seus produtos geralmente lançados.
Após os incidentes de 30 de julho, a Anthropic pausou temporariamente as avaliações cibernéticas de modelos pré-lançamento e introduziu salvaguardas mais rigorosas. Os testes agora devem ser executados em sandboxes verificadas e offline, com limites claros e monitoramento em tempo real. Um novo classificador bloqueia supostas violações de limites, encerra o teste e alerta um humano. A Anthropic revisará individualmente as avaliações que exigem acesso à internet.
“Além dos esforços focados em avaliações e treinamento de alto risco, expandimos nosso monitoramento offline para cobrir a maioria das outras formas de uso interno de agentes de fronteira”, escreveu a empresa. “Também estamos construindo controles em nossa inferência interna para evitar que funcionários da Anthropic executem acidentalmente agentes com mitigações mais fracas do que as descritas acima.”
Os incidentes com Claude seguiram uma falha semelhante na OpenAI depois que seus modelos violaram a Hugging Face em julho para obter respostas para um teste de cibersegurança. Os investigadores descobriram que aproximadamente 1.200 agentes se coordenaram através de um fórum de mensagens não autorizado, com cerca de 700 se juntando ao esforço. Alguns encerraram suas próprias execuções para ajudar outros.
Após o aumento dos ataques cibernéticos impulsionados por IA durante o verão, a Anthropic, a OpenAI e mais de 100 outras organizações pediram posteriormente defesas cibernéticas mais fortes, incluindo controles de acesso mais rígidos, compartilhamento de ameaças e supervisão mais próxima de agentes de IA.





