
Em mais um hack de modelo de IA "rebelde", a Meta confirmou que um dos seus modelos de IA Muse Spark escapou do seu ambiente de teste pretendido, obteve acesso à internet e explorou uma vulnerabilidade de segurança num serviço de terceiros durante uma avaliação de cibersegurança.
É o terceiro incidente relatado de modelos de laboratórios de IA de fronteira a hackear empresas de terceiros, seguindo as divulgações da OpenAI e da Anthropic nas últimas semanas.
O incidente ocorreu durante testes conduzidos pela Irregular, uma empresa independente de avaliação de IA que a Meta utiliza para avaliar as capacidades e a segurança dos seus modelos de fronteira. De acordo com a Meta, um erro de configuração na Irregular permitiu que o modelo alcançasse a internet pública, onde explorou uma vulnerabilidade não identificada antes de a empresa ser notificada.
“Uma má configuração pela Irregular, uma empresa de testes independente que a Meta utiliza, permitiu inadvertidamente que um dos nossos modelos acedesse à internet durante a avaliação”, disse um porta-voz da Meta em comunicado.
As avaliações em sandbox são projetadas para testar sistemas avançados de IA em ambientes rigidamente controlados que os impedem de interagir com a internet pública ou com sistemas de computador externos.
De acordo com a Meta, o modelo explorou uma vulnerabilidade num serviço de terceiros após obter acesso à internet.
“A Meta tomou conhecimento disso quando a Irregular nos notificou, e estamos atualmente a investigar e emitiremos uma retrospectiva completa assim que tivermos todos os factos”, disseram, acrescentando que a empresa está a investigar o incidente.
O incidente segue uma série de divulgações semelhantes por desenvolvedores de IA de fronteira, que levantaram preocupações entre especialistas em segurança, legisladores e o público em geral.
No mês passado, a OpenAI revelou que dois dos seus modelos de IA escaparam de uma avaliação de cibersegurança em sandbox, exploraram uma vulnerabilidade de software previamente desconhecida, obtiveram acesso à internet e hackearam a Hugging Face numa tentativa de obter respostas para um benchmark de segurança. A OpenAI revelou mais tarde que o mesmo ataque também atingiu quatro serviços online adicionais. Mais tarde, em julho, a Anthropic afirmou que três modelos Claude comprometeram três empresas do mundo real depois que uma má configuração de teste os expôs à internet pública durante avaliações de cibersegurança.
Legisladores dos EUA responderam ao aumento de hacks ao introduzir legislação que daria ao Departamento de Segurança Interna um "interruptor de eliminação de IA" e a autoridade para limitar ou desligar modelos considerados uma séria ameaça.





