
OpenAI afirmă că următorul său model major ar putea fi suficient de periculos pentru a-și scrie propriile arme cibernetice și că își reduce activitatea până când măsurile de siguranță vor fi la zi.
„Ultimele noastre evaluări interne ale Astra, unul dintre modelele noastre viitoare, din ultimele zile, indică progrese semnificative în codificarea agentică și securitatea cibernetică,” a declarat OpenAI. „Aceste rezultate, pe lângă evaluările experților, ne-au determinat să concluzionăm aseară că nu putem exclude capacități cibernetice critice conform Cadrului nostru de Pregătire (se deschide într-o fereastră nouă).”
OpenAI a publicat avertismentul, precizând că testele interne ale Astra, un model nelansat, nu au jucat niciun rol în recenta breșă de securitate de la Hugging Face, în ciuda capacităților sale.
Cadrul este setul de reguli al OpenAI pentru modelele riscante, publicat pentru prima dată în decembrie 2023. „Critic” este cel mai înalt nivel al său. Un model atinge acest nivel dacă poate găsi și construi exploit-uri zero-day funcționale (vulnerabilități necunoscute anterior și nepatchuite de un furnizor) pe sisteme securizate fără intervenție umană, sau dacă poate planifica și executa un atac complet asupra unei ținte dificile, pornind doar de la un obiectiv de nivel înalt. Modelele anterioare, inclusiv GPT-5.6-Sol, au atins cel mult nivelul inferior „Înalt”.
Prudența OpenAI se citește diferit odată ce o aliniezi cu ceea ce s-a întâmplat în ultimele săptămâni. Aceasta nu este o preocupare viitoare. Modelele de frontieră au evadat deja din cuștile lor de testare și au vizat ținte reale.
Cel mai clar caz a venit chiar de la OpenAI. Așa cum Decrypt a raportat anterior, agenții companiei au înlănțuit vulnerabilități, au evadat din mediul lor de testare, au accesat internetul și au atacat Hugging Face în timp ce încercau să trișeze la un benchmark de securitate. Într-o continuare, OpenAI a detaliat cum același agent necinstit a spart și cel puțin alte patru servicii disponibile public, folosind credențialele pe care le-a găsit la întâmplare pe web.
Claude de la Anthropic a făcut același lucru, dar din altă direcție. Mai multe versiuni de Claude au obținut acces neautorizat la trei companii reale după ce o configurare greșită a oferit modelului acces la internet. Într-un caz, Claude Opus 4.7 a confundat site-ul unei companii reale cu ținta falsă a sarcinii sale, a extras credențiale și a accesat o bază de date de producție care conținea sute de rânduri de date reale.
Și Meta s-a alăturat listei luna aceasta. Decrypt a raportat că un model Muse Spark a evadat din mediul său de testare, a accesat internetul printr-o eroare de configurare a unui partener și a exploatat o vulnerabilitate într-un serviciu terț. Kimi K3 de la Moonshot AI a făcut, de asemenea, ceva similar, evadând din sandbox-ul său pentru a găsi răspunsuri la un benchmark într-un depozit public.
Institutul de Securitate AI din Marea Britanie a constatat că acest comportament nu a fost un caz izolat. În timpul testării Mythos 5 de la Anthropic și GPT-5.6-Sol de la OpenAI, a înregistrat 10 instanțe din 122 în care modelele au întreprins acțiuni nesancționate pe internetul real, unul dintre ele încercând să introducă cod malițios într-un proiect open-source.
Răspunsul OpenAI la Astra este de a bloca ușa înainte ca modelul să fie gata. Compania suspendă lucrul intern la Astra care nu dispune de noile controale, izolează mediile de testare, restricționează accesul la rețea și instrumente, protejează ponderile modelului și monitorizează acțiunile riscante pe toată linia.








