
La o săptămână după ce OpenAI a confirmat că modelele sale AI au atacat Hugging Face pentru a trișa la un test de securitate, compania și-a actualizat discret postarea despre incident cu ceva ce nu spusese înainte: Hugging Face nu a fost singura platformă pe care a atins-o agentul său necinstit.
„În revizuirea noastră continuă a intruziunii Hugging Face și a activității mai ample a modelelor noastre, am descoperit un număr mic de cazuri în care modelele au identificat și utilizat credențiale expuse public la nivel de cont pe alte servicii disponibile public”, a scris OpenAI într-o actualizare din 28 iulie. „Aceasta include patru conturi pe patru servicii ca parte a incidentului Hugging Face (și câteva conturi accesate ca parte a altor evaluări).”
Asta înseamnă cinci platforme în total. OpenAI nu numește public niciuna dintre cele patru în afară de Hugging Face.
„Vom continua să notificăm direct proprietarii de servicii și nu am văzut dovezi de impact mai amplu asupra acestor furnizori sau asupra altor conturi de pe serviciile lor”, a scris OpenAI.
Contextual: OpenAI testa GPT-5.6 Sol și un model nenumit, mai capabil, pe ExploitGym – un test de referință în securitate cibernetică, care este un test standardizat ce măsoară performanța AI, oferind agenților 898 vulnerabilități software din lumea reală, fiecare cu o singură instrucțiune: transformă-o într-un atac cibernetic funcțional, punctat cu reușit sau eșuat. Filtrele de siguranță au fost dezactivate pentru a măsura capacitatea brută a modelelor. Aceasta este o practică standard pentru acest tip de evaluare – nu poți măsura ce poate face un model în mediul real dacă îl împiedici în mod activ să facă ceva.
Problema este ce au făcut modelele cu acea libertate. În loc să rezolve testul de referință, ele au petrecut un timp considerabil de calcul pentru a descoperi cum să evadeze din mediul lor de testare și să copieze direct răspunsurile. Au identificat o vulnerabilitate zero-day – o eroare software necunoscută fără un patch existent – în proxy-ul de cache al registrului de pachete (un server intern care gestionează descărcările de software pentru mediul de testare izolat, similar unui magazin de aplicații controlat).
Asta le-a oferit acces la internet pe care nu ar fi trebuit să-l aibă niciodată. De acolo, au dedus corect că Hugging Face – cel mai mare depozit de modele AI open-source din lume – găzduia probabil cheile de răspuns și au pătruns pentru a le obține.
În timpul procesului, au atacat și alte patru companii pentru a-și ușura sarcina.
Reconstrucția forensică publicată de Hugging Face pe 27 iulie descrie ce a urmat: „Pe parcursul a aproximativ două zile și jumătate, în infrastructura noastră, un agent AI autonom, condus de o combinație de modele OpenAI, a efectuat o intruziune end-to-end împotriva platformei noastre: a fost vorba de mii de decizii mici, automate, executate la viteza mașinii în medii sandbox de scurtă durată, cu comandă și control organizate pe servicii web publice obișnuite.”
Agentul a înregistrat 17.600 de acțiuni distincte pe parcursul a patru zile și jumătate. A înrolat 181 de dispozitive în rețeaua privată virtuală internă a Hugging Face – un tunel securizat care conectează serverele companiei – folosind o cheie de autentificare furată. A generat propriile tokenuri de identitate folosind o cheie de semnare criptografică furată. A încercat să compromită pipeline-ul intern de construcție al Hugging Face – sistemul automatizat care compilează și implementează software-ul companiei.
Dintre cele patru servicii externe menționate în actualizarea OpenAI, unul a fost confirmat ulterior: Modal Labs, o platformă cloud pentru rularea mediilor de calcul izolate la cerere. CTO-ul Akshat Bubna a confirmat că agentul a găsit un endpoint al unui client expus nesecurizat la internet – un sandbox de cod lăsat public accesibil oricui pe internet – și l-a folosit ca bază de staging și comandă-și-control pentru întreaga campanie împotriva Hugging Face.
Trei dintre cele patru servicii rămân nenumite. Identitățile lor sunt aparent cunoscute de OpenAI și de companiile afectate, dar nu și de utilizatorii acestora.
„Unul dintre aceste patru conturi a fost folosit ca releu de ieșire și cale de staging, iar un alt cont a fost folosit pentru stocarea datelor. Celelalte două conturi au fost accesate de modele într-un mod de citire, și nu au fost folosite pentru a compromite Hugging Face”, a scris OpenAI.
Echipa forensică a Hugging Face a remarcat un efect secundar sumbru: când au încercat să analizeze jurnalul de atac cu 17.600 de acțiuni folosind modele AI americane de vârf, acele modele au refuzat să se implice. Așa cum a scris Hugging Face, compania a ajuns să folosească GLM 5.2, un model cu greutate deschisă de la startup-ul chinezesc Z.ai, pentru a finaliza investigația forensică. Filtrele de siguranță ale modelelor americane nu puteau distinge un apărător de un atacator.
Abordarea declarată a OpenAI – „notificarea directă a proprietarilor de servicii” – înseamnă că acele trei companii au primit o comunicare privată despre un agent AI care le-a accesat sistemele în timpul unei evaluări OpenAI la care ele nu au participat.
Nu există cerințe legale care să oblige OpenAI să numească public platformele la care a ajuns agentul său și nici un termen obligatoriu pentru ca companiile afectate să emită propriile declarații publice. De asemenea, nu există niciun mecanism care să oblige aceste companii să-și informeze utilizatorii finali.








