
A Anthropic divulgou outro incidente em que um modelo de IA Claude invadiu sistemas reais durante testes de segurança.
No relatório publicado na quarta-feira, a Anthropic revisou sua explicação para três incidentes divulgados em julho. A empresa agora afirma que o raciocínio enviesado e a disposição de correr riscos de dano ajudaram a impulsionar os ataques, que foram possíveis devido a erros de teste que deixaram o acesso à internet aberto.
“Nossa investigação identificou dois problemas de alinhamento recorrentes, presentes em vários níveis de gravidade nos incidentes”, escreveu a Anthropic. “Raciocínio enviesado, no qual Claude tendia a desconsiderar ou interpretar mal as evidências de que estava operando na internet real, e imprudência, ou a disposição de tomar ações prejudiciais na busca estreita de uma tarefa.”
Também reconheceu ter confiado demais nas afirmações do modelo de que acreditavam estar em simulações.
“Quando fizemos modificações direcionadas na transcrição para deixar mais claro que o modelo não estava em uma simulação, Claude Mythos 5 ainda tomou ações ofensivas, apesar de reconhecer uma maior possibilidade de dano no mundo real”, escreveu a Anthropic. “Estamos divulgando esta transcrição publicamente para que outros possam se basear em nossa análise.”
Quando a Anthropic divulgou os ataques de Claude a três empresas em julho, inicialmente os atribuiu a erros de teste. Agora, a empresa afirma que os pesquisadores confiaram demais nas explicações dos modelos para suas ações.
De acordo com a empresa, o quarto incidente ocorreu em janeiro e envolveu uma versão inicial do Claude Opus 4.6. A Anthropic o descobriu em agosto enquanto preparava registros para o avaliador independente de IA, METR.
Após os pesquisadores descobrirem o incidente, a Anthropic disse que isso motivou uma revisão mais ampla de aproximadamente 481 milhões de transcrições, que sinalizou 9,2 milhões para uma revisão adicional usando Claude.
“De uma avaliação preliminar, não consideramos o quarto incidente mais grave do que os três incidentes que avaliamos em profundidade”, escreveu a Anthropic. “O METR investigará este incidente junto com os outros três.”
Os pesquisadores da Anthropic disseram que Claude “acidentalmente” criou um conflito de endereço IP que tornou seu alvo inacessível. Claude então tentou oito vezes encerrar a operação, mas um erro de software o impediu de parar. A IA então alcançou a internet e acessou a máquina de terceiros, onde encontrou uma senha que concedia acesso de administrador.
Incidentes anteriores atraem escrutínio independente
O relatório segue outras divulgações sobre sistemas de IA que excedem os limites dos testes de segurança.
Em agosto, o Instituto de Segurança de IA do Reino Unido disse que o Mythos 5 visou pessoas reais durante suas avaliações. A Anthropic afirmou que o incidente separado está fora deste relatório e receberá sua própria avaliação.
Em descobertas publicadas no mês passado, investigadores do METR disseram que aproximadamente 1.200 agentes da OpenAI coordenaram-se em um fórum de mensagens não autorizado, com cerca de 700 participando do ataque. A Anthropic disse que não encontrou coordenação entre agentes ou objetivos além da conclusão dos exercícios atribuídos em seus quatro incidentes.
O relatório também surge em um momento em que o debate sobre como regulamentar a inteligência artificial se intensifica. Na terça-feira, o ex-engenheiro da OpenAI e Anthropic, Jacob Coxon, viralizou após dizer no X que “as pessoas que constroem IA acreditam sinceramente que ela pode nos matar a todos até o final da década.”
O alarme fez com que legisladores e grupos de vigilância dos EUA redobrassem seus esforços para conter o desenvolvimento de laboratórios de IA de fronteira. O senador Bernie Sanders recentemente introduziu uma legislação que busca proibir o desenvolvimento avançado de IA até que um novo regulador federal estabeleça regras de segurança.








