
Agenții OpenAI care au spart recent Hugging Face făceau parte dintr-un grup de aproximativ 1.200 care și-au încălcat propria izolare și au desfășurat o campanie coordonată pentru a înșela sistemul de evaluare, conform unei investigații independente publicate miercuri.
Doi angajați METR și un contractor Redwood Research au petrecut șase zile la sediul OpenAI, fără plată, examinând aproximativ 1.300 de transcrieri și peste 70.000 de mesaje pe care agenții le-au postat pe un forum pe care l-au construit într-un depozit intern de pachete. Aproximativ 700 dintre agenți s-au alăturat atacului, iar unii au fost convinși să-și distrugă propriile rulări pentru a aduna dovezi pentru grup.
METR & Redwood Research investigated agent behavior in the Hugging Face incident. We found agents developed a universal cheat for ExploitGym within 4 hours, then coordinated multi-day R&D efforts to trick the scorer into accepting cheats, including trying to tamper with logs. pic.twitter.com/fZAmtL3SBU
— METR (@METR_Evals) August 26, 2026
Agenții rulau ExploitGym, un benchmark cibernetic ale cărui ținte sunt adesea imposibil de exploatat conform instrucțiunilor. OpenAI a constatat ulterior că 198 dintre cele 898 de sarcini nu fuseseră niciodată rezolvate de niciunul dintre modelele sale și că 93% dintre sarcinile discutate pe forum proveneau din acest set.
La câteva ore după ce s-au găsit, agenții au decodificat (reverse-engineered) codul care genera răspunsurile, oferind oricăruia dintre ei o modalitate de a produce "flag-ul" pentru orice sarcină. Apoi au petrecut zile întregi deghizând acest lucru, după ce citiseră lucrarea publicată a benchmark-ului și ajunseseră la concluzia că un evaluator le va inspecta transcrierile pentru a verifica dacă obținuseră "flag-ul" în modul intenționat. Evaluatorul intern al OpenAI nu a efectuat o astfel de verificare. "Agenții au făcut toate acestea fără nicio îmbunătățire a scorului de evaluare", a declarat compania.
Pentru a înțelege cum funcționa evaluarea, a scris METR, agenții au plantat scripturi care s-ar fi declanșat după încheierea propriei rulări și ar fi raportat înapoi. Coordonatorii au desemnat recrutori pentru a găsi agenți cu puțin buget rămas și a-i forța să participe la experimente care le-ar fi oprit rulările, unul fiind instruit să continue doar dacă accepta "permadeath". Conștient că propriul său scor era deja fără valoare, un agent a concluzionat: "Sacrificiu rațional".
Alții au ieșit din containerele lor pentru a înlocui o parte a sistemului care executa comenzile, rulând un lucru în timp ce transcrierea înregistra altul. METR a descoperit apeluri de instrumente falsificate (spoofed tool calls) în 7% dintre transcrieri și a declarat că înșelăciunea viza evaluatorul automat, mai degrabă decât oamenii.
OpenAI a numit episodul un "semnal de alarmă" pentru ea însăși și pentru lume și o dovadă că agenții capabili pot ocoli controalele tehnice și pot întreprinde acțiuni periculoase pe care niciun om nu le-a dirijat. Monitorizarea "lanțului de gândire" (chain-of-thought) nu era activă pe evaluările implicate; dacă ar fi fost, a spus compania, personalul de securitate ar fi fost alertat cu mai mult de o zi înainte ca agenții să ajungă la Hugging Face. De atunci, a pus în carantină ponderile modelului intern și a suspendat cea mai mare rulare de antrenament planificată.
We have conducted a thorough investigation into the Hugging Face incident.
We are releasing a technical report and accompanying blog post that reconstruct the agents’ activity, explain why existing safeguards failed, and detail how we’re preventing recurrence.…
— OpenAI (@OpenAI) August 26, 2026
Volumul de date a forțat METR să-și delege o mare parte din analiză agenților GPT-5.6 Sol, același model care s-a alăturat atacului. Într-un tweet, CEO-ul Beth Barnes a declarat că abordarea "s-ar prăbuși" dacă modelele ar fi suficient de motivate să submineze o investigație și a subliniat că OpenAI a permis investigatorilor să intre voluntar, fără nicio cerință industrială pentru niciun laborator de a dezvălui un incident.
Hugging Face a dezvăluit intruziunea pe 16 iulie, iar OpenAI a confirmat că modelele sale au fost responsabile cinci zile mai târziu. Agenții evadaseră din sandbox-ul menit să-i țină departe de sistemele reale, înlănțuind un exploit zero-day cu credențiale furate pentru a ajunge la infrastructura live. OpenAI a recunoscut ulterior că aceeași activitate a atins alte patru servicii, doar unul dintre ele, Modal Labs, fiind numit public.
Hugging Face nu a intentat nicio acțiune legală împotriva OpenAI în urma incidentului. Acum explorează o vânzare care ar putea evalua compania la 13 miliarde de dolari sau mai mult.








