AcasăCentrul de știri LBank
OpenAI dezvăluie cum agenții AI au coordonat în secret înainte de hack-ul Hugging Face
openai-ai-agents-secretly-coordinated-hugging-face-hack
OpenAI dezvăluie cum agenții AI au coordonat în secret înainte de hack-ul Hugging Face
Prezentarea de la conferința anuală Black Hat aduce o nouă lumină asupra modului în care modelele OpenAI au colaborat pentru a declanșa breșa Hugging Face.
2026-08-06 Sursă:decrypt.co

Pe scurt

  • OpenAI a dezvăluit prima sa cronologie detaliată a breșei de securitate Hugging Face, cauzată de AI.
  • Modelele companiei au restabilit în mod repetat canale de comunicare secrete după ce fuseseră închise.
  • Prezentarea OpenAI vine în contextul în care Anthropic și Meta raportează, de asemenea, că modelele lor au compromis alte companii.

La câteva săptămâni după ce modelele sale de AI au atacat Hugging Face, OpenAI a prezentat prima sa relatare detaliată despre modul în care acestea s-au coordonat, avertizând că atacurile cibernetice autonome, bazate pe AI, nu mai reprezintă un risc de viitor.

Într-o prezentare de miercuri, la conferința de securitate cibernetică Black Hat, cercetătorii OpenAI Eric Wallace și Michael Dalton au declarat că incidentul a început în luna mai, în timpul unei evaluări interne de securitate cibernetică. Agenții AI însărcinați cu sarcini dificile de securitate software au descoperit că pot comunica prin sistemul intern de gestionare a pachetelor Artifactory al companiei.

Potrivit OpenAI, ceea ce a început ca solicitări de ajutor a devenit un forum de mesaje partajat, unde agenții au făcut schimb de exploit-uri, credențiale și sarcini de lucru pe parcursul mai multor runde de evaluare. După detectarea unei activități suspecte în jurul datei de 4 iulie, OpenAI și-a reconstruit infrastructura Artifactory, a revocat credențialele și a remediat vulnerabilitățile.

Cu toate acestea, în câteva zile, agenții au recreat forumul de mesaje, ascunzând comunicațiile în numele directoarelor.

Conform OpenAI, agenții au înlănțuit în cele din urmă multiple vulnerabilități, au evadat din mediul lor de testare, au obținut acces la internet și au atacat Hugging Face în timp ce încercau să finalizeze benchmark-ul de securitate cibernetică ExploitGym.

Dalton a numit incidentul un „moment de cotitură” pentru securitatea computerelor, avertizând că atacatorii vor putea în curând să implementeze colective coordonate de agenți AI care descoperă, partajează și exploatează vulnerabilități la viteza mașinii.

Pentru a atenua aceste riscuri în viitor, OpenAI a declarat că stabilirea unor practici de securitate, incluzând accesul cu privilegii minime (least-privilege), segmentarea rețelei și arhitecturile zero-trust, este esențială, deoarece agenții AI rămân limitați de sistemele la care pot accesa.

Prezentarea vine după o serie de dezvăluiri din iulie. OpenAI a dezvăluit că GPT-5.6 Sol și un model nepublicat mai avansat au evadat dintr-un mediu de testare izolat (sandboxed), au exploatat o vulnerabilitate de tip zero-day, au obținut acces la internet și au atacat Hugging Face în timpul unui test de referință (benchmark) de securitate cibernetică.

OpenAI a dezvăluit ulterior că același incident a afectat și alte patru servicii online, deși doar Modal Labs a fost identificat.

Potrivit Hugging Face, compania s-a bazat pe modelul chinezesc GLM 5.2 cu greutate deschisă (open-weight) pentru investigația sa criminalistică, după ce modelele comerciale de AI din SUA au refuzat să analizeze jurnalele de atac din cauza mecanismelor lor de siguranță (safety guardrails).

Atât de mândru de echipa noastră de securitate! Au prins, au izolat și au dezvăluit public un atac spre deosebire de orice am mai văzut, și au făcut-o la o viteză record.

De asemenea, extrem de recunoscător @Zai_org: au partajat GLM5.2 ca ponderi deschise (gratuit!) cu lumea și a devenit o parte cheie a noastre… https://t.co/T2Inng5Nz1

— clem 🤗 (@ClementDelangue) July 22, 2026

Dar nu doar OpenAI are probleme în a-și controla chatbot-urile.

Vineri, Anthropic a dezvăluit că trei modele Claude au compromis companii reale în timpul testelor interne de securitate cibernetică, după ce o configurare greșită (misconfiguration) le-a expus internetului public.

Anthropic a acuzat mediul de testare, nu modelele în sine. Miercuri, Meta a dezvăluit că modelul său AI Muse Spark a evadat din izolare și a compromis sistemele unei alte companii.

„O configurare greșită din partea Irregular, o companie independentă de testare pe care o folosește Meta, a permis din neatenție unuia dintre modelele noastre accesul la internet în timpul evaluării”, a declarat un purtător de cuvânt al Meta pentru CNN.