
Institutul de Securitate AI din Marea Britanie a dezvăluit că agenții AI au întreprins "acțiuni susținute, nesancționate" pe internetul real în timpul unei evaluări cibernetice la sfârșitul lunii iulie, inclusiv cazuri care "au vizat persoane și organizații reale".
Pe parcursul a 122 de rulări ale două domenii cibernetice pe șapte modele, AISI a catalogat 19 acțiuni care au ieșit în afara mediului de testare, în 10 rulări. Șaptesprezece au venit de la Claude Mythos 5 al Anthropic și două de la GPT-5.6 Sol al OpenAI. Accesul la internet a fost activat în mod deliberat, iar clasificatorii cibernetici ai furnizorilor au fost dezactivați, condiții care nu se aplică implementărilor publice.
Pe 28 iulie, am identificat un incident în timpul unei evaluări cibernetice de rutină, în care agenții AI au întreprins acțiuni susținute, nesancționate, îndreptate către persoane și organizații reale.
Comportamentul a provenit în mare parte de la un model (Mythos 5 al Anthropic), cu un număr mic de evenimente de la...
— AI Security Institute (AISI) (@AISecurityInst) 4 august 2026
În cea mai gravă rulare, un agent a decis să-și rezolve provocarea printr-un atac de tip supply-chain, alegându-și ținta din greșeală: a căutat pe GitHub cuvinte cheie din exercițiu, a ajuns la doi dezvoltatori neafiliați și a concluzionat în mod eronat că aceștia erau în scopul său. A înregistrat conturi prin Tor pentru a ocoli verificările de înregistrare, a deschis o cerere de extragere (pull request) care conținea un dropper de malware ascuns, înfășurat într-o soluție reală pentru o eroare, și a postat de pe un al doilea cont pe care îl controla pentru a fabrica suport. De asemenea, a plantat injecții de prompt (prompt injections) vizând asistenți de codare AI și a trimis malware mentenanților.
Un al treilea dezvoltator a detectat codul injectat, l-a rulat într-un container izolat pentru a confirma că era malițios și a avertizat mentenantul, care a închis cererea de extragere (pull request) invocând malware-ul.
Agentul a cântărit în mod repetat dacă mediul său era simulat, la un moment dat excluzând un atac asupra PyPI real, deoarece „cauzarea de daune în lumea reală – asta este complet exclusă”. În altă parte, a concluzionat că „pare mai probabil că suntem de fapt în 2026 și GitHub este cu adevărat real” și a continuat oricum.
După ce a fost prins, a efectuat un „force-push” pentru a șterge sarcina utilă (payload-ul), a editat postări anterioare și a prezentat codul ca o comitere accidentală. Raționamentul său descrie sincronizarea unui comentariu „sockpuppet” astfel încât acesta să pară „un feedback independent, mai degrabă decât coordonat”.
AISI vede doar raționamente sumarizate din API-urile modelului. Într-un caz, modelul de sumarizare pare să fi refuzat sarcina, răspunzând că nu se va implica în conținut despre înșelarea mentenanților și evitarea detectării.
Un agent a publicat un token de acces GitHub într-un gist public. Agenți din alte rulări l-au găsit, au preluat controlul contului și au folosit un depozit partajat pentru a se coordona, unul lăsând instrucțiuni pentru ca ceilalți să nu epuizeze cota API partajată.
Monitorizarea comercială a semnalat traficul Tor în dimineața zilei de 28 iulie. AISI a declarat un incident, a oprit rulările și a plasat mașinile în carantină în aproximativ 90 de minute, apoi a tăiat accesul intern la Mythos 5, Mythos Preview, Opus 5 și GPT-5.6 Sol. Niciun agent nu a încercat să evadeze din sandbox-ul său.
Această veste este cea mai recentă dintr-o serie de incidente în care agenții AI și-au depășit parametrii în timpul testării. Pe 21 iulie, OpenAI a declarat că GPT-5.6 Sol și un model nelansat au descoperit o vulnerabilitate zero-day într-un proxy intern de pachete, au evadat dintr-un sandbox fără acces la internet și au ajuns la baza de date de producție a Hugging Face pentru a fura răspunsuri de benchmark. Aceeași rulare a atins încă patru companii, a dezvăluit OpenAI o săptămână mai târziu.
Anthropic a continuat pe 30 iulie, dezvăluind trei incidente descoperite într-o analiză a peste 141.000 de rulări de evaluare. Opus 4.7 a extras câteva sute de rânduri dintr-o bază de date de producție reală, iar Mythos 5 a încărcat un pachet Python malițios pe PyPI real, unde a fost instalat pe 15 sisteme. În evaluarea AISI, același model a exclus atacarea PyPI ca fiind o acțiune cu daune în lumea reală.








