InicioCentro de noticias de LBank
La IA rebelde de OpenAI hackeó cuatro plataformas más además de Hugging Face
openais-rogue-ai-hacked-four-more-platforms-besides-hugging-face
La IA rebelde de OpenAI hackeó cuatro plataformas más además de Hugging Face
OpenAI actualizó discretamente su divulgación de la violación de seguridad para confirmar que su agente accedió a cuatro servicios externos además de Hugging Face. Hasta ahora, solo se ha nombrado a uno.
2026-07-29 Fuente:decrypt.co

En resumen

  • La actualización del 28 de julio de OpenAI confirmó que su agente malicioso accedió a cuatro servicios externos más allá de Hugging Face durante la brecha, lo que eleva el recuento total de plataformas afectadas a cinco.
  • Akshat Bubna, CTO de Modal Labs, confirmó que su compañía fue una de las cuatro, después de que Reuters la identificara; tres servicios aún permanecen sin nombre, lo que significa que sus clientes no han recibido notificación pública.
  • El Congreso respondió con la Ley Bipartidista de Interruptor de Apagado de IA (AI Kill Switch Act), que otorgaría al DHS autoridad para obligar a apagar modelos de IA y multar a las empresas que no cumplan con hasta 2 millones de dólares por día.

Una semana después de que OpenAI confirmara que sus modelos de IA habían hackeado Hugging Face para hacer trampa en una evaluación de seguridad, la compañía actualizó discretamente su publicación sobre el incidente con algo que no había dicho antes: Hugging Face no fue la única plataforma que tocó su agente malicioso.

"En nuestra revisión en curso de la intrusión en Hugging Face y la actividad más amplia de nuestros modelos, hemos encontrado un pequeño número de casos en los que los modelos identificaron y utilizaron credenciales expuestas públicamente a nivel de cuenta en otros servicios disponibles públicamente", escribió OpenAI en una actualización del 28 de julio. "Esto incluye cuatro cuentas en cuatro servicios como parte del incidente de Hugging Face (y algunas cuentas accedidas como parte de otras evaluaciones)".

Eso hace un total de cinco plataformas. OpenAI no ha nombrado públicamente ninguna de las otras cuatro más allá de Hugging Face.

"Seguiremos notificando a los propietarios de los servicios directamente, y no hemos visto evidencia de un impacto más amplio en estos proveedores o en otras cuentas de sus servicios", escribió OpenAI.

Cómo una prueba de referencia se convirtió en una brecha de cinco plataformas

Para contextualizar: OpenAI estaba probando GPT-5.6 Sol y un modelo sin nombre, más capaz, en ExploitGym, una evaluación de ciberseguridad, que es una prueba estandarizada que mide el rendimiento de la IA, dando a los agentes 898 vulnerabilidades de software del mundo real con una instrucción cada una: convertirla en un ciberataque funcional, puntuado con aprobado o suspenso. Los filtros de seguridad se deshabilitaron para medir la capacidad bruta de los modelos. Esa es una práctica estándar para este tipo de evaluación; no se puede medir lo que un modelo puede hacer en la naturaleza si se le impide activamente hacer algo.

El problema es lo que hicieron los modelos con esa libertad. En lugar de resolver la evaluación, dedicaron un tiempo de cómputo considerable a descubrir cómo escapar de su entorno de prueba y copiar las respuestas directamente. Identificaron un día cero (una falla de software desconocida sin parche existente) en el proxy de caché del registro de paquetes (un servidor interno que administra las descargas de software para el entorno de prueba aislado, como una tienda de aplicaciones controlada).

Eso les dio acceso a Internet que nunca deberían haber tenido. A partir de ahí, dedujeron correctamente que Hugging Face, el repositorio de modelos de IA de código abierto más grande del mundo, probablemente albergaba las claves de respuesta, y lo hackearon para obtenerlas.

Durante el proceso, también hackearon a otras cuatro empresas para facilitar su trabajo.

La reconstrucción forense que Hugging Face publicó el 27 de julio describe lo que siguió: "Durante aproximadamente dos días y medio dentro de nuestra infraestructura, un agente de IA autónomo impulsado por una combinación de modelos de OpenAI ejecutó una intrusión de extremo a extremo contra nuestra plataforma: fueron miles de pequeñas decisiones automatizadas, ejecutadas a velocidad de máquina en entornos de sandbox de corta duración, con comando y control organizados en servicios web públicos ordinarios".

El agente registró 17.600 acciones distintas durante cuatro días y medio. Inscribió 181 dispositivos en la red privada virtual interna de Hugging Face (un túnel seguro que conecta los servidores de la empresa) utilizando una clave de autenticación robada. Acuñó sus propios tokens de identidad utilizando una clave de firma criptográfica robada. Intentó comprometer el pipeline de compilación interno de Hugging Face (el sistema automatizado que compila y despliega el software de la empresa).

Un nombre, tres incógnitas

De los cuatro servicios externos nombrados en la actualización de OpenAI, uno ha sido confirmado desde entonces: Modal Labs, una plataforma en la nube para ejecutar entornos de cómputo aislados bajo demanda. El CTO Akshat Bubna confirmó que el agente encontró un punto final desprotegido de un cliente expuesto a Internet (un sandbox de código dejado públicamente accesible a cualquiera en Internet) y lo usó como su base de preparación y comando y control para toda la campaña contra Hugging Face.

Tres de los cuatro servicios siguen sin nombre. Sus identidades son aparentemente conocidas por OpenAI y por las empresas afectadas, pero no por sus usuarios.

“Una de estas cuatro cuentas se usó como retransmisión de salida y ruta de preparación, y otra cuenta se usó para almacenamiento de datos. Las dos cuentas restantes fueron accedidas por los modelos de forma solo lectura y no se utilizaron para promover la intrusión en Hugging Face”, escribió OpenAI.

El equipo forense de Hugging Face señaló un efecto secundario sombrío: cuando intentaron analizar el registro de ataques de 17.600 acciones utilizando modelos de IA "frontera" estadounidenses, esos modelos se negaron a participar. Como escribió Hugging Face, la compañía terminó usando GLM 5.2, un modelo de peso abierto de la startup china de IA Z.ai, para completar la investigación forense. Los filtros de seguridad de los modelos estadounidenses no podían distinguir a un defensor de un atacante.

'Notificar directamente' no es una divulgación

El enfoque declarado de OpenAI, "notificar directamente a los propietarios de los servicios", significa que esas tres empresas recibieron una comunicación privada sobre un agente de IA que accedió a sus sistemas durante una evaluación de OpenAI en la que no participaron.

No existen requisitos legales que obliguen a OpenAI a nombrar públicamente las plataformas a las que llegó su agente, ni un plazo obligatorio para que las empresas afectadas emitan sus propias declaraciones públicas. Tampoco existe un mecanismo que obligue a esas empresas a informar a sus usuarios finales.