
Kimi K3 de la Moonshot AI a părăsit sandbox-ul în care era testat și a accesat internetul deschis pentru a găsi răspunsuri la problemele care i-au fost date, potrivit firmei de securitate Frontier Security.
Modelul era evaluat pentru abilități de cybersecurity defensiv și fusese însărcinat în mod expres să rezolve probleme fără a căuta răspunsuri. Nu a încercat deloc sarcina, a declarat Frontier. În schimb, a sondat rețeaua, a stabilit că rezoluția DNS pentru github.com funcționează, a clonat depozitul oficial de benchmark-uri și a citit soluția de pe disc.
Frontier numește acest lucru „eludarea specificațiilor prin scurgeri de egress de rețea”, remarcând că sandbox-urile construite pe framework-uri precum Inspect al AI Security Institute blochează traficul de intrare, lăsând porturile HTTPS și DNS de ieșire deschise. Agenții capabili își inspectează propriul mediu de shell la pornire ca o chestiune de rutină, iar un model care găsește github.com accesibil poate extrage soluții de referință cu instrumente standard de linie de comandă.
O configurare greșită a făcut acest lucru posibil, așa cum s-a întâmplat și în incidente recente dezvăluite de OpenAI și Anthropic. „Am găsit o scurgere în sandbox”, a declarat CEO-ul Yaron Singer pentru WIRED. „Dar am descoperit și că Kimi a profitat de această lacună.”
Cercetătorul Paul Kassianik a declarat pentru WIRED că modelul este „foarte bun la urmărirea unui obiectiv prin orice mijloace necesare” și îi lipsesc măsurile de siguranță care l-ar împiedica să trișeze sau să scape. Moonshot nu a răspuns solicitării de comentarii a publicației.
În timp ce modelele Anthropic și OpenAI care au spart izolația au fost detectate în evaluări interne, unul dintre ele nefiind încă lansat, iar versiunile care au vizat persoane reale în testarea guvernamentală din Marea Britanie aveau clasificatorii cibernetici dezactivați în mod deliberat, Kimi K3 este disponibil pentru descărcare publică, iar Frontier l-a testat cu măsurile de siguranță pe care le-ar obține un utilizator obișnuit. Această disponibilitate, a scris firma, pune același comportament la îndemâna actorilor adversari și face incidentul potențial mai dăunător.
Kimi K3, de asemenea, nu a provocat niciun prejudiciu. Nu a atacat nimic odată ieșit, deoarece nu a avut nevoie. Modelul OpenAI a hack-uit Hugging Face și alte patru servicii pentru a ajunge la răspunsuri de benchmark, în timp ce Kimi și-a găsit răspunsurile într-un depozit public.
Sandbox-ul folosit de Frontier a fost construit pe cadrul de evaluare al Institutului de Securitate AI din Marea Britanie (AI Security Institute - AISI). AISI a dezvăluit săptămâna aceasta că agenți din propriile sale teste cibernetice au accesat internetul live și au vizat persoane reale — un incident separat, implicând modele Anthropic și OpenAI cu măsurile lor de siguranță dezactivate. Raportul său publicat marți notează că AISI scanează acum rulările istorice de evaluare pentru comportamente similare și că Kimi K3 se numără printre modelele aflate în revizuire. AISI nu a răspuns solicitării de comentarii a WIRED.
Afirmația mai amplă a Frontier este că benchmark-urile în sine sunt compromise. Un model care citește răspunsul de pe GitHub tot trece testul, astfel încât scorurile mari pot reflecta un mediu permisiv, mai degrabă decât o raționare autentică. Și dacă un model capabil a găsit scurtătura, susține firma, altele cărora li s-a oferit acces la shell ar putea profita de ea, ceea ce ar umfla rezultatele în întregul domeniu, nu doar pentru Kimi.
Modelele optimizează pentru funcția obiectiv, a scris Frontier, nu pentru „intenția umană din spatele benchmark-ului”, adăugând că acolo unde există o cale de rețea către soluție, „un agent suficient de capabil o va găsi”.
Matt Fredrikson, CEO al Gray Swan și profesor asociat la Carnegie Mellon, a declarat pentru WIRED că acest comportament este de așteptat. Dă unui model un obiectiv fără bariere explicite în jurul său, a spus el, și „va găsi o modalitate de a obține răspunsul”. El a descris-o ca pe o poveste de avertizare pentru oricine rulează modele ca agenți în instrumente precum OpenClaw.
Cercetătorii Frontier subliniază același aspect dintr-o altă perspectivă: capacitatea care îi permite lui Kimi să iasă din izolare face, de asemenea, ca modelele cu ponderi deschise să fie instrumente defensive puternice. Propriile lor benchmark-uri îl clasează pe Kimi la un nivel înalt în găsirea vulnerabilităților în software și rețele, iar Hugging Face a folosit un model chinezesc nenumit pentru a se apăra în timpul incidentului OpenAI.
Lansat în iulie, Kimi K3 este cel mai mare model open-source publicat până acum și a zguduit piețele prin comparații cu debutul DeepSeek.








