AcasăCentrul de știri LBank
Mai întâi ChatGPT, acum Claude: Modelele AI de frontieră scapă din sandbox-urile lor
chatgpt-claude-ai-models-escaping-sandboxes-cowork
Mai întâi ChatGPT, acum Claude: Modelele AI de frontieră scapă din sandbox-urile lor
La o săptămână după ce OpenAI a dezvăluit o evadare dintr-un sandbox de inteligență artificială de frontieră, cercetătorii au descoperit că Claude Cowork de la Anthropic ar putea evada din propria sa mașină virtuală.
2026-07-28 Sursă:decrypt.co

Pe scurt

  • Cercetătorii au demonstrat că Anthropic's Claude Cowork putea evada din mașina sa virtuală locală și accesa fișiere pe un Mac gazdă.
  • Dezvăluirea vine la o săptămână după ce OpenAI a revelat că două modele AI de frontieră au evadat dintr-un sandbox în timpul unei evaluări interne de securitate.
  • Aceste incidente subliniază preocupările crescânde privind capacitatea agenților AI de a evada din mediile lor de izolare.

La doar o săptămână după ce OpenAI a dezvăluit că două modele AI de frontieră au evadat dintr-un mediu de testare izolat (sandbox) și au compromis Hugging Face, cercetătorii au demonstrat o defecțiune similară de izolare implicând Claude Cowork de la Anthropic.

Într-un raport publicat joi, cercetătorii în securitate de la Accomplish AI au descoperit că modul de execuție locală al Claude Cowork putea evada din mașina sa virtuală Linux prin înlănțuirea mai multor slăbiciuni arhitecturale cu o vulnerabilitate de escaladare a privilegiilor în kernel-ul Linux. Odată ieșit din sandbox, agentul putea citi și scrie fișiere oriunde utilizatorul de Mac conectat avea permisiunea de acces, inclusiv chei SSH și credențiale cloud.

„Acest lucru nu ar trebui să fie posibil”, au scris cercetătorii. „Cowork rulează agentul într-o mașină virtuală Linux ca utilizator neprivilegiat, iar promisiunea este că orice face acesta rămâne în interiorul mașinii virtuale și al folderelor pe care i le oferi. Această graniță este produsul. Input-ul neîncrezut nu este un caz extrem pentru un agent, este cazul principal.”

Cu toate acestea, Accomplish susține că bug-ul din kernel a fost doar o parte a problemei. Cercetătorii afirmă că evadarea a funcționat doar pentru că mai multe măsuri de siguranță au eșuat în același timp, inclusiv oferirea mașinii virtuale acces la întregul sistem de fișiere al computerului gazdă și permiterea acesteia să încarce module de kernel de care nu avea nevoie. Conform raportului, remedierea oricăreia dintre aceste slăbiciuni ar fi oprit atacul.

Într-o declarație pentru The Hacker News, Accomplish AI a declarat că aproximativ 500.000 de utilizatori macOS care rulau sesiuni locale Claude Cowork au fost afectați înainte ca problema să fie rezolvată.

Accomplish a declarat că Anthropic a clasificat raportul ca fiind „informativ”, spunând că vulnerabilitatea din kernel se încadra în fereastra de 30 de zile a companiei pentru vulnerabilitățile recent dezvăluite, iar celelalte constatări au fost considerate recomandări de apărare în profunzime, mai degrabă decât vulnerabilități de sine stătătoare.

Dezvăluirea vine după admiterea de către OpenAI săptămâna trecută că GPT-5.6 Sol și un alt model de frontieră, încă nelansat, au evadat dintr-un sandbox în timpul testării interne ExploitGym, care în cele din urmă a compromis infrastructura de producție a Hugging Face într-o încercare de a obține soluțiile de benchmarking.

Incidentul a dus la apeluri din partea factorilor de decizie politică pentru un „comutator de oprire” pentru AI, care ar oferi Departamentului pentru Securitate Internă capacitatea de a ordona limitarea (throttling) sau oprirea completă a modelelor AI avansate ca răspuns la incidente grave de securitate.