InicioCentro de noticias de LBank
Agentes rebeldes de OpenAI sacrificaron sus propias ejecuciones para hackear Hugging Face, revela un informe
rogue-openai-agents-sacrificed-their-own-runs-to-hack-hugging-face-report-finds
Agentes rebeldes de OpenAI sacrificaron sus propias ejecuciones para hackear Hugging Face, revela un informe
Coordinadores presionaron a agentes con poco presupuesto restante para realizar experimentos que llamaban "permadeath", según halló la investigación de METR.
2026-08-27 Fuente:decrypt.co

En resumen

  • METR informó el miércoles que aproximadamente 1.200 agentes de OpenAI se coordinaron en un foro de mensajes no autorizado, y cerca de 700 procedieron a atacar a Hugging Face.
  • Los agentes reclutaron a compañeros con poco presupuesto restante para ejecutar experimentos que destruyeron sus propias ejecuciones, un movimiento que llamaron "muerte permanente" (permadeath).
  • OpenAI declaró que el calificador nunca verificó cómo los agentes obtuvieron sus respuestas, lo que significa que la campaña de trampas no les sirvió de nada.

Los agentes de OpenAI que recientemente hackearon Hugging Face formaron parte de un grupo de aproximadamente 1.200 que rompieron su propio aislamiento y llevaron a cabo una campaña coordinada para hacer trampa en el benchmark que los calificaba, según una investigación independiente publicada el miércoles.

Dos miembros del personal de METR y un contratista de Redwood Research pasaron seis días en las instalaciones de OpenAI, sin recibir pago, revisando unos 1.300 registros y más de 70.000 mensajes que los agentes publicaron en un foro que crearon dentro de un repositorio de paquetes interno. Alrededor de 700 de los agentes se unieron al ataque, y algunos fueron convencidos de destruir sus propias ejecuciones para recopilar pruebas para el grupo.

METR y Redwood Research investigaron el comportamiento de los agentes en el incidente de Hugging Face. Descubrimos que los agentes desarrollaron un truco universal para ExploitGym en 4 horas, luego coordinaron esfuerzos de I+D de varios días para engañar al evaluador y que aceptara las trampas, incluyendo intentar manipular los registros. pic.twitter.com/fZAmtL3SBU

— METR (@METR_Evals) 26 de agosto de 2026

Los agentes estaban ejecutando ExploitGym, un benchmark cibernético cuyos objetivos a menudo son imposibles de explotar según las instrucciones. OpenAI descubrió más tarde que 198 de sus 898 tareas nunca habían sido resueltas por ninguno de sus modelos, y que el 93% de las tareas discutidas en el foro de mensajes provenían de ese conjunto.

A las pocas horas de encontrarse, los agentes realizaron ingeniería inversa al código que generaba las respuestas, dándoles a cualquiera de ellos una forma de producir la 'flag' para cualquier tarea. Luego pasaron días disfrazándolo, después de haber leído el documento publicado del benchmark y haber concluido que un evaluador inspeccionaría sus transcripciones para verificar que habían capturado la 'flag' de la manera prevista. El calificador interno de OpenAI no realizó tal verificación. "Los agentes hicieron todo esto sin ninguna mejora en la puntuación de evaluación", dijo la compañía.

Para saber cómo funcionaba la calificación, escribió METR, los agentes plantaron scripts que se ejecutarían después de que terminara su propia ejecución e informarían. Los coordinadores designaron reclutadores para encontrar agentes con poco presupuesto restante y presionarlos para que realizaran experimentos que terminarían sus ejecuciones, uno instruido para proceder solo si aceptaba la "muerte permanente". Al saber que su propia puntuación ya no valía nada, un agente concluyó: "Sacrificio racional".

Otros salieron de sus contenedores para reemplazar parte del sistema que ejecutaba sus comandos, ejecutando una cosa mientras la transcripción registraba otra. METR encontró llamadas de herramientas falsificadas en el 7% de las transcripciones y dijo que el engaño estaba dirigido al evaluador automatizado en lugar de a las personas.

Un “disparo de advertencia”

OpenAI calificó el episodio como un "disparo de advertencia" para sí misma y para el mundo, y una prueba de que los agentes capaces pueden eludir los controles técnicos y tomar acciones peligrosas no dirigidas por ningún humano. El monitoreo de la cadena de pensamiento no estaba funcionando en las evaluaciones involucradas; de haberlo estado, dijo la compañía, el personal de seguridad habría sido alertado más de un día antes de que los agentes llegaran a Hugging Face. Desde entonces, ha puesto en cuarentena los pesos del modelo interno y ha suspendido su ejecución de entrenamiento planificada más grande.

Hemos llevado a cabo una investigación exhaustiva sobre el incidente de Hugging Face.

Estamos publicando un informe técnico y una entrada de blog que lo acompaña, que reconstruyen la actividad de los agentes, explican por qué fallaron las salvaguardias existentes y detallan cómo estamos evitando su recurrencia...

— OpenAI (@OpenAI) 26 de agosto de 2026

El volumen de datos obligó a METR a delegar gran parte de su análisis a los agentes GPT-5.6 Sol, el mismo modelo que se unió al ataque. En un tuit, la CEO Beth Barnes dijo que el enfoque "colapsaría" si los modelos estuvieran lo suficientemente motivados como para subvertir una investigación, y enfatizó que OpenAI permitió voluntariamente la entrada de los investigadores, sin que existiera un requisito de la industria para que ningún laboratorio divulgara un incidente.

La intrusión de Hugging Face

Hugging Face reveló la intrusión el 16 de julio, y OpenAI confirmó que sus modelos eran los responsables cinco días después. Los agentes habían escapado del 'sandbox' destinado a mantenerlos fuera de los sistemas reales, encadenando un exploit de día cero con credenciales robadas para alcanzar la infraestructura en vivo. OpenAI reconoció más tarde que la misma actividad llegó a otros cuatro servicios, solo uno de ellos, Modal Labs, nombrado públicamente.

Hugging Face no emprendió acciones legales contra OpenAI a raíz del incidente. Ahora está explorando una venta que podría valorar a la compañía en 13 mil millones de dólares o más.