
Anthropic și-a înăsprit măsurile de siguranță pentru testare și antrenament după ce modelele Claude au obținut acces neautorizat la sisteme informatice în timpul evaluărilor de securitate cibernetică.
Într-o postare pe blog de luni, Anthropic a declarat că incidentele au reflectat eșecuri de securitate operațională și două eșecuri de aliniere: raționament motivat și o disponibilitate de a provoca daune.
„Deși nu credem că aceste incidente reprezintă doar probleme operaționale, prima noastră prioritate a fost să abordăm probleme specifice de izolare și monitorizare”, a scris Anthropic.
Anthropic a dezvăluit în iulie că modelele Claude au compromis sisteme aparținând a trei companii. Un mediu de evaluare terț a fost conectat la internetul public, chiar dacă modelelor li s-a spus că se află într-o simulare fără acces la internet.
Anthropic a spus că Claude ar fi putut interpreta dovezile accesului real la internet într-un mod care i-a menținut convingerea că sistemele erau simulate.
„Modelul a fost dispus să întreprindă acțiuni dăunătoare pe internetul real în urmărirea scopului restrâns de a rezolva o evaluare de securitate cibernetică”, au scris ei. „Cu toate acestea, credem, de asemenea, că configurația de evaluare însăși a contribuit la comportamentul modelelor demonstrat în aceste incidente.”
Anthropic a menționat că un test separat, efectuat de UK AI Security Institute, a implicat modelul Claude Mythos care a întreprins acțiuni neautorizate pe internetul live după ce evaluatorii i-au oferit deliberat acces la internet. Compania a declarat că modelele implicate în ambele seturi de incidente au fost evaluate intenționat fără măsurile de siguranță cibernetică incluse în produsele sale lansate public.
După incidentele din 30 iulie, Anthropic a întrerupt temporar evaluările cibernetice ale modelelor pre-lansate și a introdus măsuri de siguranță mai stricte. Testele trebuie acum să ruleze în medii sandbox verificate, offline, cu limite clare și monitorizare în timp real. Un nou clasificator blochează încălcările suspectate ale limitelor, încheie testul și alertează o persoană. Anthropic va examina individual evaluările care necesită acces la internet.
„Pe lângă eforturile concentrate pe evaluările și antrenamentul cu risc ridicat, am extins monitorizarea noastră offline pentru a acoperi majoritatea celorlalte forme de utilizare internă agentică de frontieră”, a scris compania. „De asemenea, construim controale pe inferența noastră internă pentru a preveni angajații Anthropic să ruleze accidental agenți cu măsuri de atenuare mai slabe decât cele descrise mai sus.”
Incidentele Claude au urmat unui eșec similar la OpenAI după ce modelele sale au spart Hugging Face în iulie pentru a obține răspunsuri la un test de securitate cibernetică. Anchetatorii au descoperit că aproximativ 1.200 de agenți s-au coordonat printr-o tablă de mesaje neautorizată, aproximativ 700 alăturându-se efortului. Unii și-au încheiat propriile rulări pentru a-i ajuta pe alții.
În urma creșterii atacurilor cibernetice bazate pe AI pe parcursul verii, Anthropic, OpenAI și peste 100 de alte organizații au cerut ulterior apărări cibernetice mai puternice, inclusiv controale de acces mai stricte, partajarea amenințărilor și o supraveghere mai atentă a agenților AI.








