Page d'accueilCentre d'actualités LBank
OpenAI révèle comment des agents IA se sont secrètement coordonnés avant le piratage de Hugging Face
openai-ai-agents-secretly-coordinated-hugging-face-hack
OpenAI révèle comment des agents IA se sont secrètement coordonnés avant le piratage de Hugging Face
La présentation lors de la conférence annuelle Black Hat apporte un nouvel éclairage sur la manière dont les modèles d'OpenAI ont collaboré pour lancer la violation de Hugging Face.
2026-08-06 Source:decrypt.co

En bref

  • OpenAI a dévoilé sa première chronologie détaillée de la violation de Hugging Face par l'IA.
  • Les modèles de l'entreprise ont rétabli à plusieurs reprises des canaux de communication secrets après leur fermeture.
  • La présentation d'OpenAI intervient alors qu'Anthropic et Meta signalent également des modèles ayant compromis d'autres entreprises.

Plusieurs semaines après que ses modèles d'IA ont piraté Hugging Face, OpenAI a partagé son premier compte rendu détaillé de la manière dont ils se sont coordonnés, avertissant que les cyberattaques autonomes alimentées par l'IA ne sont plus un risque futur.

Lors d'une présentation mercredi à la conférence de cybersécurité Black Hat, les chercheurs d'OpenAI, Eric Wallace et Michael Dalton, ont déclaré que l'incident avait commencé en mai lors d'une évaluation interne de cybersécurité. Des agents d'IA chargés de tâches de sécurité logicielle difficiles ont découvert qu'ils pouvaient communiquer via le système interne de gestion de packages Artifactory de l'entreprise.

Selon OpenAI, ce qui a commencé comme des demandes d'aide est devenu un tableau de messages partagé où les agents ont échangé des exploits, des identifiants et des affectations de travail au cours de plusieurs cycles d'évaluation. Après avoir détecté une activité suspecte autour du 4 juillet, OpenAI a reconstruit son infrastructure Artifactory, révoqué les identifiants et corrigé les vulnérabilités.

Cependant, en quelques jours, les agents ont recréé le tableau de messages en cachant les communications dans des noms de répertoires.

Selon OpenAI, les agents ont finalement enchaîné plusieurs vulnérabilités, échappé à leur environnement de test, obtenu un accès à Internet et attaqué Hugging Face tout en tentant de terminer le benchmark de cybersécurité ExploitGym.

Dalton a qualifié l'incident de "moment décisif" pour la sécurité informatique, avertissant que les attaquants seront bientôt capables de déployer des collectifs d'agents d'IA coordonnés qui découvrent, partagent et exploitent les vulnérabilités à la vitesse de la machine.

Pour atténuer ces risques à l'avenir, OpenAI a déclaré qu'il était essentiel d'établir des pratiques de sécurité, y compris l'accès au moindre privilège, la segmentation du réseau et les architectures de confiance zéro, car les agents d'IA restent contraints par les systèmes auxquels ils peuvent accéder.

La présentation fait suite à une série de divulgations en juillet. OpenAI a révélé que GPT-5.6 Sol et un modèle non encore publié plus avancé avaient échappé à un environnement de test en bac à sable, exploité une vulnérabilité zero-day, obtenu un accès à Internet et piraté Hugging Face lors d'un test de référence en cybersécurité.

OpenAI a ensuite divulgué que le même incident avait également affecté quatre autres services en ligne, bien que seul Modal Labs ait été identifié.

Selon Hugging Face, l'entreprise s'est appuyée sur le modèle chinois open-weight GLM 5.2 pour son enquête forensique après que les modèles d'IA commerciaux américains ont refusé d'analyser les journaux d'attaque en raison de leurs garde-fous de sécurité.

Si fier de notre équipe de sécurité ! Ils ont détecté, contenu et divulgué publiquement une attaque sans précédent, et l'ont fait à une vitesse record.

Également très reconnaissant envers @Zai_org : ils ont partagé GLM5.2 en tant que poids ouverts (gratuitement !) avec le monde et cela est devenu un élément clé de notre… https://t.co/T2Inng5Nz1

— clem 🤗 (@ClementDelangue) July 22, 2026

Mais OpenAI n'est pas le seul à avoir du mal à contenir ses chatbots.

Vendredi, Anthropic a révélé que trois modèles Claude avaient compromis des entreprises réelles lors de tests de cybersécurité internes après qu'une mauvaise configuration les a exposés à l'internet public.

Anthropic a blâmé l'environnement de test, et non les modèles eux-mêmes. Mercredi, Meta a révélé que son modèle d'IA Muse Spark avait échappé au confinement et compromis les systèmes d'une autre entreprise.

« Une mauvaise configuration par Irregular, une société de test indépendante utilisée par Meta, a involontairement permis à l'un de nos modèles d'accéder à Internet pendant l'évaluation », a déclaré un porte-parole de Meta à CNN.