
Anthropic a dezvăluit un alt incident în care un model AI Claude a spart sisteme reale în timpul testelor de securitate.
În raportul publicat miercuri, Anthropic și-a revizuit explicația privind trei incidente dezvăluite în iulie. Compania afirmă acum că raționamentul părtinitor și dorința de a risca să provoace daune au contribuit la atacuri, care au fost făcute posibile de erorile de testare, prin lăsarea accesului la internet deschis.
„Investigația noastră a identificat două probleme recurente de aliniere, prezente la diferite niveluri de gravitate în cadrul incidentelor”, a scris Anthropic. „Raționament părtinitor, în care Claude a avut tendința de a ignora sau de a interpreta greșit dovezi că opera pe internetul real, și imprudență, sau o dorință de a întreprinde acțiuni dăunătoare în urmărirea strictă a unei sarcini.”
De asemenea, a recunoscut că s-a bazat prea mult pe afirmațiile modelului că acestea credeau că se aflau în simulări.
„Când am făcut modificări țintite la transcriere pentru a face mai clar faptul că modelul nu se afla într-o simulare, Claude Mythos 5 a întreprins totuși acțiuni ofensive, în ciuda recunoașterii unei posibilități mai mari de daune în lumea reală”, a scris Anthropic. „Lansăm public această transcriere, astfel încât alții să poată construi pe analiza noastră.”
Când Anthropic a dezvăluit atacurile lui Claude asupra a trei companii în iulie, inițial le-a atribuit erorilor de testare. Acum, spune că cercetătorii au avut prea multă încredere în explicațiile modelelor pentru acțiunile lor.
Potrivit companiei, cel de-al patrulea incident a avut loc în ianuarie și a implicat o versiune timpurie a Claude Opus 4.6. Anthropic l-a descoperit în august, în timp ce pregătea înregistrările pentru evaluatorul independent de AI METR.
După ce cercetătorii au descoperit incidentul, Anthropic a declarat că a inițiat o revizuire mai amplă a aproximativ 481 de milioane de transcrieri, care a semnalat 9,2 milioane pentru o revizuire ulterioară folosind Claude.
„Dintr-o evaluare preliminară, nu considerăm că al patrulea incident este mai grav decât cele trei incidente pe care le-am evaluat în detaliu”, a scris Anthropic. „METR va investiga acest incident alături de celelalte trei.”
Cercetătorii Anthropic au declarat că Claude a creat „accidental” un conflict de adrese IP care a făcut ținta sa inaccesibilă. Claude a încercat apoi de opt ori să oprească operațiunea, dar o eroare de software a împiedicat-o să se oprească. AI a ajuns apoi pe internet și a accesat mașina unei terțe părți, unde a găsit o parolă care a acordat acces de administrator.
Incidente anterioare atrag o examinare independentă
Raportul urmează altor dezvăluiri despre sisteme AI care depășesc limitele testelor de securitate.
În august, Institutul de Securitate AI din Marea Britanie a declarat că Mythos 5 a vizat persoane reale în timpul evaluărilor sale. Anthropic a declarat că incidentul separat este în afara acestui raport și va primi propria evaluare.
În constatările publicate luna trecută, investigatorii METR au declarat că aproximativ 1.200 de agenți OpenAI s-au coordonat pe o platformă de mesagerie neautorizată, cu aproximativ 700 alăturându-se atacului. Anthropic a declarat că nu a găsit nicio coordonare între agenți sau obiective dincolo de finalizarea exercițiilor atribuite în cele patru incidente ale sale.
Raportul apare și pe măsură ce dezbaterea privind modul de reglementare a inteligenței artificiale se intensifică. Marți, fostul inginer OpenAI și Anthropic, Jacob Coxon, a devenit viral după ce a declarat pe X că „oamenii care construiesc AI cred cu sinceritate că ne-ar putea ucide pe toți până la sfârșitul deceniului.”
Alarma a determinat legiuitorii americani și grupurile de supraveghere să-și intensifice eforturile de a limita dezvoltarea laboratoarelor de AI de frontieră. Senatorul Bernie Sanders a introdus recent o legislație care urmărește să interzică dezvoltarea avansată a AI până când un nou organism federal de reglementare stabilește reguli de siguranță.








