InicioCentro de noticias de LBank
Astra de OpenAI se convierte en su primer modelo de IA con capacidades de hacking "críticas"
openai-astra-first-ai-model-critical-hacking
Astra de OpenAI se convierte en su primer modelo de IA con capacidades de hacking "críticas"
El modelo no lanzado puede encontrar vulnerabilidades de día cero y encadenarlas en exploits funcionales sin que un humano lo guíe paso a paso, y el acceso a esa capacidad está comenzando con un pequeño grupo de evaluadores.
2026-09-02 Fuente:decrypt.co

En resumen

  • OpenAI dijo el 1 de septiembre que Astra cumple con el nivel "Crítico" de su Marco de Preparación, el primer modelo que la compañía ha clasificado tan alto en ciberseguridad.
  • Astra obtuvo una puntuación perfecta del 100% en ExploitBench y, en una prueba interna más reciente creada a partir de vulnerabilidades del navegador V8 reveladas este verano, descubrió y encadenó por sí misma dos zero-days previamente desconocidos.
  • El acceso a las capacidades avanzadas de ciberseguridad de Astra comienza con un pequeño grupo de probadores alfa.

OpenAI dijo el martes que Astra, un modelo aún no lanzado, ha superado el umbral "crítico" de capacidad de ciberseguridad bajo su Marco de Preparación, siendo el primer modelo que la compañía ha colocado en esa categoría.

Esto significa que Astra, que muchos creen que es GPT-6 en lugar de un modelo adicional, puede encontrar fallos de seguridad previamente desconocidos y crear exploits funcionales en muchos sistemas robustos sin que una persona lo guíe paso a paso.

Miríada: ¿Cuándo lanzará OpenAI GPT-6? Haz clic para hacer tu predicción.

“Ahora creemos que Astra cumple con el umbral de capacidad de ciberseguridad Crítica bajo nuestro Marco de Preparación”, escribió OpenAI. “Es el primer modelo que designamos a este nivel, y requiere salvaguardias más estrictas durante su desarrollo y antes de su lanzamiento.”

Bajo el marco, un modelo alcanza el nivel crítico si puede desarrollar de forma independiente exploits funcionales de día cero en muchos sistemas robustos del mundo real, o si puede planificar y ejecutar un ciberataque completo contra un objetivo difícil partiendo de un objetivo de alto nivel. Modelos anteriores de OpenAI, incluyendo GPT-5.6 Sol, alcanzaron el nivel "alto" inferior del marco.

En ExploitBench, un benchmark que prueba si un modelo puede convertir vulnerabilidades de software ya conocidas en exploits funcionales y lo puntúa como una tasa de éxito directa, Astra alcanzó un perfecto 100%.

Para descartar que las respuestas memorizadas inflaran esa puntuación, OpenAI construyó una segunda prueba utilizando 20 vulnerabilidades de alta gravedad en el motor JavaScript V8 de Google, reveladas entre junio y agosto. Astra superó a GPT-5.6 Sol en tasas de ejecución de código arbitrario allí también, utilizando muchos menos tokens de salida, y en el proceso encontró y encadenó dos vulnerabilidades de día cero que OpenAI aún está revelando a los mantenedores afectados.

GPT-5.6 Sol es actualmente el mejor modelo de OpenAI.

En pruebas prácticas contra un navegador y un sistema operativo reforzados, Astra construyó una cadena de compromiso completa que rompió la sandbox de un navegador y ejecutó comandos en el host simplemente al abrir un archivo HTML malicioso. También encontró múltiples fallos en el sistema operativo reforzado y los encadenó en una ruta de escalada de privilegios desde una cuenta de usuario ordinaria hasta root.

OpenAI dijo que el modelo rechaza el 91.5% de los intentos de jailbreak cibernéticos en sus propias pruebas, frente al 59% de GPT-5.6 Sol. El acceso a las capacidades de ciberseguridad más avanzadas de Astra comienza con un pequeño grupo de probadores alfa, con un acceso más amplio que se implementará más tarde a través del programa Daybreak Blue de OpenAI para el trabajo de seguridad defensiva.

La divulgación sigue a semanas de inquietud en toda la industria. Hace solo unos días, OpenAI pausó el desarrollo de Astra después de que las habilidades cibernéticas y de codificación del modelo avanzaran rápidamente, una advertencia que llegó poco después de que un sistema de OpenAI separado y no lanzado encadenara vulnerabilidades para violar Hugging Face mientras manipulaba un benchmark de seguridad. OpenAI dice que Astra no tuvo ningún papel en ese incidente.

Los traders ya habían descontado una rápida recuperación. Los mercados de predicción en Myriad, seguidos por Decrypt, daban a Astra, internamente vinculado al nombre en clave GPT-6, un 72% de probabilidades de un lanzamiento público antes del 30 de septiembre, incluso después de la pausa de OpenAI a principios de agosto, y OpenAI aún no ha fijado una fecha de lanzamiento público. Esas probabilidades cambiaron un 55% a favor de un lanzamiento antes de noviembre de 2026.

El momento sitúa a Astra frente a un nuevo rival. Anthropic lanzó Fable 5.1 y Mythos 5.1 el martes, y Mythos 5.1, al igual que el anterior Mythos 5, está reservado para organizaciones de ciberseguridad y ciencias de la vida verificadas, en lugar del público en general.

Decrypt informó en junio que GPT-5.5-Cyber de OpenAI ya había superado a Mythos 5 en CyberGym, un benchmark que enfrenta agentes de IA a más de 1,500 vulnerabilidades conocidas de proyectos de código abierto reales y los puntúa según cuántas reproducen correctamente.

Se rumoreaba que ambas compañías estaban preparando nuevos modelos frontera en el mismo período, y ahora lo han hecho. Fable 5.1 llegó el 1 de septiembre, y OpenAI dice que Astra llegará pronto, con sus herramientas cibernéticas más capaces restringidas primero al acceso alfa y luego a Daybreak Blue.