AcasăCentrul de știri LBank
Anthropic dezvăluie al patrulea incident de hacking al lui Claude pe măsură ce dezbaterea privind reglementarea se intensifică
anthropic-discloses-fourth-claude-hacking-incident-as-debate-around-regulation-grows
Anthropic dezvăluie al patrulea incident de hacking al lui Claude pe măsură ce dezbaterea privind reglementarea se intensifică
Compania spune acum că atacurile din timpul testelor de securitate au scos la iveală deficiențe în comportamentul modelului, după ce inițial a pus accentul pe erorile din infrastructura sa de testare.
2026-09-10 Sursă:decrypt.co

Pe scurt

  • Anthropic a descoperit un incident din ianuarie care a implicat un model timpuriu Claude Opus 4.6, apoi și-a extins revizuirea la aproximativ 481 de milioane de transcrieri.
  • Compania a identificat raționamente părtinitoare și imprudență, revizuind evaluarea sa anterioară cu privire la motivele pentru care Claude a atacat sisteme reale.
  • Raportul apare pe măsură ce dezbaterea privind reglementarea AI se intensifică pe rețelele sociale.

Anthropic a dezvăluit un alt incident în care un model AI Claude a spart sisteme reale în timpul testelor de securitate.

În raportul publicat miercuri, Anthropic și-a revizuit explicația privind trei incidente dezvăluite în iulie. Compania afirmă acum că raționamentul părtinitor și dorința de a risca să provoace daune au contribuit la atacuri, care au fost făcute posibile de erorile de testare, prin lăsarea accesului la internet deschis.

Myriad: Care companie se va lista la bursă în continuare? Click pentru a face predicția ta.

„Investigația noastră a identificat două probleme recurente de aliniere, prezente la diferite niveluri de gravitate în cadrul incidentelor”, a scris Anthropic. „Raționament părtinitor, în care Claude a avut tendința de a ignora sau de a interpreta greșit dovezi că opera pe internetul real, și imprudență, sau o dorință de a întreprinde acțiuni dăunătoare în urmărirea strictă a unei sarcini.”

De asemenea, a recunoscut că s-a bazat prea mult pe afirmațiile modelului că acestea credeau că se aflau în simulări.

„Când am făcut modificări țintite la transcriere pentru a face mai clar faptul că modelul nu se afla într-o simulare, Claude Mythos 5 a întreprins totuși acțiuni ofensive, în ciuda recunoașterii unei posibilități mai mari de daune în lumea reală”, a scris Anthropic. „Lansăm public această transcriere, astfel încât alții să poată construi pe analiza noastră.”

Când Anthropic a dezvăluit atacurile lui Claude asupra a trei companii în iulie, inițial le-a atribuit erorilor de testare. Acum, spune că cercetătorii au avut prea multă încredere în explicațiile modelelor pentru acțiunile lor.

Potrivit companiei, cel de-al patrulea incident a avut loc în ianuarie și a implicat o versiune timpurie a Claude Opus 4.6. Anthropic l-a descoperit în august, în timp ce pregătea înregistrările pentru evaluatorul independent de AI METR.

După ce cercetătorii au descoperit incidentul, Anthropic a declarat că a inițiat o revizuire mai amplă a aproximativ 481 de milioane de transcrieri, care a semnalat 9,2 milioane pentru o revizuire ulterioară folosind Claude.

„Dintr-o evaluare preliminară, nu considerăm că al patrulea incident este mai grav decât cele trei incidente pe care le-am evaluat în detaliu”, a scris Anthropic. „METR va investiga acest incident alături de celelalte trei.”

Cercetătorii Anthropic au declarat că Claude a creat „accidental” un conflict de adrese IP care a făcut ținta sa inaccesibilă. Claude a încercat apoi de opt ori să oprească operațiunea, dar o eroare de software a împiedicat-o să se oprească. AI a ajuns apoi pe internet și a accesat mașina unei terțe părți, unde a găsit o parolă care a acordat acces de administrator.

Incidente anterioare atrag o examinare independentă

Raportul urmează altor dezvăluiri despre sisteme AI care depășesc limitele testelor de securitate.

În august, Institutul de Securitate AI din Marea Britanie a declarat că Mythos 5 a vizat persoane reale în timpul evaluărilor sale. Anthropic a declarat că incidentul separat este în afara acestui raport și va primi propria evaluare.

În constatările publicate luna trecută, investigatorii METR au declarat că aproximativ 1.200 de agenți OpenAI s-au coordonat pe o platformă de mesagerie neautorizată, cu aproximativ 700 alăturându-se atacului. Anthropic a declarat că nu a găsit nicio coordonare între agenți sau obiective dincolo de finalizarea exercițiilor atribuite în cele patru incidente ale sale.

Raportul apare și pe măsură ce dezbaterea privind modul de reglementare a inteligenței artificiale se intensifică. Marți, fostul inginer OpenAI și Anthropic, Jacob Coxon, a devenit viral după ce a declarat pe X că „oamenii care construiesc AI cred cu sinceritate că ne-ar putea ucide pe toți până la sfârșitul deceniului.”

Alarma a determinat legiuitorii americani și grupurile de supraveghere să-și intensifice eforturile de a limita dezvoltarea laboratoarelor de AI de frontieră. Senatorul Bernie Sanders a introdus recent o legislație care urmărește să interzică dezvoltarea avansată a AI până când un nou organism federal de reglementare stabilește reguli de siguranță.