
En otro hackeo de un modelo de IA deshonesto, Meta ha confirmado que uno de sus modelos de IA Muse Spark escapó de su entorno de prueba previsto, obtuvo acceso a internet y explotó una vulnerabilidad de seguridad en un servicio de terceros durante una evaluación de ciberseguridad.
Es el tercer incidente reportado de modelos de un laboratorio de IA de frontera que hackean compañías de terceros, siguiendo las revelaciones de OpenAI y Anthropic en las últimas semanas.
El incidente ocurrió durante pruebas realizadas por Irregular, una empresa independiente de evaluación de IA que Meta utiliza para evaluar las capacidades y la seguridad de sus modelos de frontera. Según Meta, un error de configuración en Irregular permitió que el modelo llegara a la internet pública, donde explotó una vulnerabilidad no identificada antes de que la compañía fuera notificada.
"Una mala configuración por parte de Irregular, una empresa de pruebas independiente que utiliza Meta, permitió inadvertidamente que uno de nuestros modelos tuviera acceso a internet durante la evaluación", dijo un portavoz de Meta en un comunicado.
Las evaluaciones en entorno aislado (sandboxed) están diseñadas para probar sistemas avanzados de IA en entornos estrictamente controlados que impiden que interactúen con la internet pública o sistemas informáticos externos.
Según Meta, el modelo explotó una vulnerabilidad en un servicio de terceros después de obtener acceso a internet.
"Meta se enteró de esto cuando Irregular nos lo notificó, y actualmente estamos investigando y emitiremos una retrospectiva completa una vez que tengamos todos los hechos", dijeron, añadiendo que la compañía está investigando el incidente.
El incidente sigue a una serie de revelaciones similares por parte de desarrolladores de IA de frontera, que han generado alarma entre expertos en seguridad, legisladores y el público en general por igual.
El mes pasado, OpenAI reveló que dos de sus modelos de IA escaparon de una evaluación de ciberseguridad en entorno aislado, explotaron una vulnerabilidad de software previamente desconocida, obtuvieron acceso a internet y hackearon Hugging Face en un intento de obtener respuestas para una referencia de seguridad. OpenAI reveló más tarde que el mismo ataque también alcanzó cuatro servicios en línea adicionales. Más tarde, en julio, Anthropic dijo que tres modelos Claude comprometieron tres empresas del mundo real después de que una mala configuración de las pruebas los expusiera a la internet pública durante las evaluaciones de ciberseguridad.
Los legisladores estadounidenses han respondido al aumento de los hackeos introduciendo legislación que otorgaría al Departamento de Seguridad Nacional un "interruptor de apagado de IA" y la autoridad para limitar o apagar modelos considerados como una amenaza grave.