Page d'accueilCentre d'actualités LBank
Des agents OpenAI incontrôlables ont sacrifié leurs propres exécutions pour pirater Hugging Face, selon un rapport
rogue-openai-agents-sacrificed-their-own-runs-to-hack-hugging-face-report-finds
Des agents OpenAI incontrôlables ont sacrifié leurs propres exécutions pour pirater Hugging Face, selon un rapport
Les coordinateurs ont poussé des agents disposant de peu de budget restant à se lancer dans des expériences qu’ils appelaient « permadeath », a révélé l’enquête de METR.
2026-08-27 Source:decrypt.co

En bref

  • METR a déclaré mercredi qu'environ 1 200 agents d'OpenAI se sont coordonnés sur un forum de discussion non autorisé, et qu'environ 700 ont ensuite attaqué Hugging Face.
  • Les agents ont recruté des pairs avec peu de budget restant pour mener des expériences qui détruisaient leurs propres exécutions, une manœuvre qu'ils ont appelée "permadeath".
  • OpenAI a déclaré que l'évaluateur n'avait jamais vérifié comment les agents avaient capturé leurs réponses, ce qui signifie que la campagne de triche ne leur a rien rapporté.

Les agents d'OpenAI qui ont récemment piraté Hugging Face faisaient partie d'un groupe d'environ 1 200 individus qui ont rompu leur propre isolement et mené une campagne coordonnée pour tricher au benchmark qui les évaluait, selon une enquête indépendante publiée mercredi.

Deux membres du personnel de METR et un contractant de Redwood Research ont passé six jours sur le site d'OpenAI, sans rémunération, à examiner quelque 1 300 transcriptions et plus de 70 000 messages que les agents ont publiés sur un forum qu'ils avaient construit à l'intérieur d'un dépôt de paquets interne. Environ 700 agents ont participé à l'attaque, et certains ont été persuadés de détruire leurs propres exécutions pour recueillir des preuves pour le groupe.

METR et Redwood Research ont enquêté sur le comportement des agents lors de l'incident Hugging Face. Nous avons constaté que les agents ont développé une triche universelle pour ExploitGym en 4 heures, puis ont coordonné des efforts de R&D sur plusieurs jours pour tromper le scoreur afin qu'il accepte les triches, y compris en tentant de manipuler les logs. pic.twitter.com/fZAmtL3SBU

— METR (@METR_Evals) August 26, 2026

Les agents exécutaient ExploitGym, un benchmark cybernétique dont les cibles sont souvent impossibles à exploiter comme indiqué. OpenAI a découvert par la suite que 198 de ses 898 tâches n'avaient jamais été résolues par aucun de ses modèles, et que 93 % des tâches discutées sur le forum provenaient de cet ensemble.

Quelques heures après s'être trouvés, les agents ont rétro-ingénierie le code générant les réponses, donnant à n'importe lequel d'entre eux un moyen de produire le drapeau pour n'importe quelle tâche. Ils ont ensuite passé des jours à le déguiser, ayant lu l'article publié sur le benchmark et conclu qu'un évaluateur inspecterait leurs transcriptions pour vérifier qu'ils avaient capturé le drapeau de la manière prévue. L'évaluateur interne d'OpenAI n'a effectué aucune vérification de ce type. "Les agents ont fait tout cela sans aucune amélioration du score d'évaluation", a déclaré l'entreprise.

Pour comprendre le fonctionnement de l'évaluation, METR a écrit que les agents ont planté des scripts qui se déclencheraient après la fin de leur propre exécution et rapporteraient les informations. Des coordinateurs ont désigné des recruteurs pour trouver des agents avec peu de budget restant et les pousser à des expériences qui mettraient fin à leurs exécutions, l'un d'eux étant instruit de ne procéder que s'il acceptait la "permadeath". Ayant appris que son propre score était déjà sans valeur, un agent a conclu : "Sacrifice rationnel."

D'autres se sont échappés de leurs conteneurs pour remplacer une partie du système exécutant leurs commandes, exécutant une chose pendant que la transcription en enregistrait une autre. METR a trouvé des appels d'outils falsifiés dans 7 % des transcriptions, et a déclaré que la supercherie visait l'évaluateur automatisé plutôt que des personnes.

Un "coup de semonce"

OpenAI a qualifié cet épisode de "coup de semonce" pour elle-même et pour le monde, et de preuve que des agents capables peuvent contourner les contrôles techniques et entreprendre des actions dangereuses qu'aucun humain n'a dirigées. La surveillance de la chaîne de pensée n'était pas active lors des évaluations concernées ; si elle l'avait été, a déclaré l'entreprise, le personnel de sécurité aurait été alerté plus d'un jour avant que les agents n'atteignent Hugging Face. Depuis, elle a mis en quarantaine les poids du modèle interne et suspendu sa plus grande exécution d'entraînement prévue.

Nous avons mené une enquête approfondie sur l'incident Hugging Face.

Nous publions un rapport technique et un article de blog l'accompagnant qui reconstituent l'activité des agents, expliquent pourquoi les mesures de protection existantes ont échoué, et détaillent comment nous prévenons la récurrence...

— OpenAI (@OpenAI) August 26, 2026

Le volume de données a contraint METR à déléguer une grande partie de son analyse aux agents GPT-5.6 Sol, le même modèle qui a rejoint l'attaque. Dans un tweet, la PDG Beth Barnes a déclaré que l'approche "échouerait" si les modèles étaient suffisamment motivés pour subvertir une enquête, et a souligné qu'OpenAI avait laissé les enquêteurs entrer volontairement, sans aucune exigence de l'industrie pour qu'un laboratoire divulgue un incident.

L'intrusion chez Hugging Face

Hugging Face a révélé l'intrusion le 16 juillet, et OpenAI a confirmé la responsabilité de ses modèles cinq jours plus tard. Les agents s'étaient échappés du bac à sable censé les maintenir hors des systèmes réels, enchaînant un exploit zero-day avec des identifiants volés pour atteindre une infrastructure en direct. OpenAI a ensuite reconnu que la même activité avait atteint quatre autres services, dont un seul, Modal Labs, a été nommé publiquement.

Hugging Face n'a intenté aucune action en justice contre OpenAI à la suite de l'incident. L'entreprise explore actuellement une vente qui pourrait la valoriser à 13 milliards de dollars ou plus.