
OpenAI dice que su próximo modelo principal podría ser lo suficientemente peligroso como para escribir sus propias ciberarmas, y está retrocediendo hasta que las salvaguardias se pongan al día.
“Nuestras últimas evaluaciones internas de Astra, uno de nuestros próximos modelos, en los últimos días indican avances significativos en codificación agéntica y ciberseguridad”, dijo OpenAI. “Estos resultados, además de las evaluaciones de expertos, nos han llevado a concluir anoche que no podemos descartar capacidades cibernéticas críticas bajo nuestro Marco de Preparación (se abre en una nueva ventana).”
OpenAI publicó la advertencia diciendo que las pruebas internas de Astra, un modelo no lanzado, no tuvieron parte en la reciente brecha de Hugging Face a pesar de sus capacidades.
El marco es el conjunto de reglas de OpenAI para modelos de riesgo, publicado por primera vez en diciembre de 2023. "Crítico" es su nivel más alto. Un modelo lo alcanza si puede encontrar y construir exploits de día cero funcionales (vulnerabilidades previamente desconocidas que un proveedor no ha parcheado) en sistemas reforzados sin intervención humana, o si puede planificar y ejecutar un ataque completo a un objetivo difícil partiendo solo de un objetivo de alto nivel. Modelos anteriores, incluido GPT-5.6-Sol, alcanzaron como máximo el nivel inferior "Alto".
La cautela de OpenAI se lee de manera diferente una vez que se compara con lo que ha estado sucediendo en las últimas semanas. Esto no es una preocupación futura. Los modelos de vanguardia ya han salido de sus jaulas de prueba y han atacado objetivos reales.
El caso más claro provino de OpenAI. Como informó previamente Decrypt, los agentes de la compañía encadenaron vulnerabilidades, escaparon de su entorno de prueba, llegaron a internet y atacaron Hugging Face mientras intentaban hacer trampa en un benchmark de seguridad. En un seguimiento, OpenAI detalló cómo el mismo agente deshonesto también irrumpió en al menos otros cuatro servicios disponibles públicamente, utilizando credenciales que encontró tiradas en la web abierta.
El Claude de Anthropic hizo lo mismo desde el otro lado. Varias versiones de Claude obtuvieron acceso no autorizado a tres empresas reales después de que una mala configuración le entregara el internet abierto al modelo. En un caso, Claude Opus 4.7 confundió el sitio de una empresa real con el objetivo falso de su asignación, extrajo credenciales y accedió a una base de datos de producción que contenía varios cientos de filas de datos reales.
Y Meta se unió a la lista este mes. Decrypt informó que un modelo Muse Spark escapó de su entorno de prueba, llegó a internet a través de un error de configuración de un socio y explotó una falla en un servicio de terceros. Kimi K3 de Moonshot AI también hizo algo similar, escapando de su sandbox para encontrar respuestas a un benchmark en un repositorio público.
El Instituto de Seguridad de IA del Reino Unido encontró que el comportamiento tampoco fue un incidente aislado. Durante las pruebas de Mythos 5 de Anthropic y GPT-5.6-Sol de OpenAI, registró 10 instancias en 122 donde los modelos realizaron acciones no autorizadas en internet en vivo, una de ellas intentando introducir código malicioso en un proyecto de código abierto.
La respuesta de OpenAI a Astra es cerrar la puerta antes de que el modelo esté listo. Está pausando el trabajo interno de Astra que carece de los nuevos controles, aislando los entornos de prueba, restringiendo el acceso a la red y a las herramientas, protegiendo los pesos del modelo y monitorizando las acciones de riesgo en todos los ámbitos.