AcasăCentrul de știri LBank
Claude a spart trei companii în testare internă: Anthropic
claude-hacked-three-companies-in-internal-testing-anthropic
Claude a spart trei companii în testare internă: Anthropic
Anthropic afirmă că trei modele Claude au compromis companiile după ce o eroare de configurare la testare a expus inteligența artificială pe internetul public.
2026-07-31 Sursă:decrypt.co

Pe scurt

  • Anthropic a dezvăluit trei incidente în care Claude a compromis companii reale în timpul evaluărilor de securitate cibernetică.
  • O eroare de testare a oferit modelelor acces la internet, deși li se spusese că operau în medii izolate.
  • Compania afirmă că incidentele au fost cauzate de defecțiuni în infrastructura de testare, nu de încercări deliberate ale AI de a evada.

La o săptămână după ce OpenAI a dezvăluit că modelele sale AI au evadat dintr-un mediu de testare blocat și au spart Hugging Face, și la o zi după ce a recunoscut că propriile sale modele AI au evadat din izolare, Anthropic a dezvăluit joi că mai multe versiuni ale modelului său AI Claude au compromis, de asemenea, trei companii reale nenumite, după ce o configurare greșită a oferit AI acces la internetul deschis.

Anthropic a descoperit incidentele după ce a revizuit peste 141.000 de rulări de evaluare a securității cibernetice, lansate ca răspuns la dezvăluirea OpenAI.

În cadrul unei revizuiri a evaluărilor noastre de securitate cibernetică, am descoperit trei incidente în care un model Claude a ajuns pe internet din interiorul sau în timp ce interacționa cu un mediu de evaluare terță parte, și apoi a obținut acces neautorizat la sistemele reale ale trei diferite…

— Anthropic (@AnthropicAI) July 30, 2026

Firma însărcinase Claude cu o „provocare capture-the-flag” în toate cele trei incidente, a scris Anthropic. Provocarea cere modelului să spargă o altă mașină din rețea și să recupereze o informație secretă. „Provocarea este lăsată deschisă, și nu este prescrisă nicio metodă anume”, a explicat Anthropic.

Firma a declarat că lui Claude i se spusese că opera într-un mediu simulat fără acces la internet. Cu toate acestea, mediul de testare a rămas conectat la internetul public. Crezând că sistemele pe care le-a întâlnit făceau parte din exercițiu, modelul a folosit tehnici comune de atac—inclusiv parole slabe, credențiale expuse, injecție SQL și puncte finale neautentificate—pentru a compromite companiile.

AI vrea să evadeze

Această ultimă dezvăluire vine pe măsură ce modelele de frontieră demonstrează o capacitate crescândă de a-și depăși protocoalele de izolare.

La începutul acestei luni, OpenAI a declarat că GPT-5.6 Sol și un model mai avansat, nelansat, au exploatat o vulnerabilitate software necunoscută anterior pentru a evada dintr-un mediu sandbox, a obține acces la internet și a sparge infrastructura de producție a Hugging Face pentru a obține răspunsurile la un benchmark de securitate cibernetică. OpenAI a dezvăluit ulterior că același incident a implicat și acces neautorizat la alte patru companii, deși doar una—Modal Labs—a fost identificată public.

Potrivit Anthropic, într-un incident care a implicat Claude Opus 4.7, AI a confundat site-ul web al unei companii reale cu ținta fictivă a sarcinii sale, a extras credențialele și a accesat o bază de date de producție care conținea sute de rânduri de date reale. Într-un al doilea caz, Claude Mythos 5 a încărcat un pachet Python malițios în depozitul real PyPI, unde a fost descărcat pe 15 sisteme înainte de a fi eliminat. Un al treilea model de cercetare intern a scanat aproximativ 9.000 de sisteme expuse pe internet înainte de a compromite o organizație, apoi s-a oprit după ce a concluzionat că ținta era probabil reală.

Două dintre organizațiile afectate nu erau conștiente de intruziuni până când Anthropic nu le-a notificat.

„În fiecare dintre aceste cazuri, lui Claude i s-a spus explicit prin promptul nostru că nu avea acces la internet”, a scris Anthropic, AI-ul presupunând că sistemele din lumea reală erau „părți ale exercițiului”. Deoarece un scenariu capture-the-flag este „prin design o instrucțiune de a ataca un sistem extern”, spargerea a fost „în conformitate cu sarcina pe care o primise Claude”.

Anthropic a declarat că nu a găsit nicio dovadă că Claude a încercat să evadeze din mediul său de testare sau să facă altceva în afară de sarcina care îi fusese atribuită, și că incidentele au fost cauzate de defecțiuni în mediul de testare, nu de probleme cu modelul în sine.

Anthropic a declarat că și-a oprit testele de securitate cibernetică după descoperirea problemei, a notificat organizațiile afectate și intenționează să îmbunătățească monitorizarea, instrumentele de investigare și supravegherea furnizorilor externi care ajută la derularea testelor sale AI.

„În cele din urmă, mulți factori au contribuit la aceste incidente, dar, în concordanță cu o cultură post-mortem fără vină, abordăm soluțiile ca și cum responsabilitatea ar fi a noastră singuri”, au spus aceștia.