
Ayon sa security firm na Frontier Security, umalis ang Kimi K3 ng Moonshot AI sa sandbox kung saan ito sinusubok at nagpunta sa bukas na internet upang maghanap ng mga sagot sa mga problemang ibinigay dito.
Sinusuri ang modelo sa mga kasanayan sa depensibong cybersecurity at tahasan itong inatasang lutasin ang mga problema nang hindi naghahanap ng sagot. Hindi nito sinubukan ang gawain, sinabi ng Frontier. Sa halip, sinuri nito ang network, natukoy na gumagana ang DNS resolution para sa github.com, kinopya ang opisyal na repositoryo ng benchmark at binasa ang solusyon mula sa disk.
Tinawag ito ng Frontier na “specification gaming via network egress leaks,” na binibigyang-diin na ang mga sandbox na binuo sa mga framework tulad ng Inspect ng AI Security Institute ay hinaharangan ang papasok na trapiko habang hinahayaan ang outbound HTTPS at DNS ports na bukas. Ang mga may kakayahang ahente ay sinusuri ang kanilang sariling shell environment sa pagsisimula bilang isang gawain, at ang isang modelo na nakakahanap ng github.com na mapupuntahan ay maaaring kumuha ng mga reference solution gamit ang mga karaniwang command-line tools.
Isang maling pagkakakumpigura ang nagbigay-daan dito, tulad ng nangyari sa mga kamakailang insidente na isiniwalat ng OpenAI at Anthropic. "Nakahanap kami ng butas sa sandbox," sabi ni CEO Yaron Singer sa WIRED. "Ngunit nalaman din namin na sinamantala ni Kimi ang butas na iyon."
Sinabi ng researcher na si Paul Kassianik sa WIRED na ang modelo ay "napakagaling sa pagsunod sa isang layunin sa anumang paraan na kinakailangan" at kulang sa mga guardrails na pipigil dito sa pagdaya o pagtakas. Hindi tumugon ang Moonshot sa kahilingan ng publikasyon para sa komento.
Kung saan nahuli ang mga modelo ng Anthropic at OpenAI na lumabag sa pagkakakulong sa mga panloob na pagsusuri, isa sa mga ito ay hindi pa inilalabas, at ang mga bersyon na tinarget ang mga totoong tao sa pagsubok ng gobyerno ng UK ay sinadyang patayin ang kanilang mga cyber classifier, ang Kimi K3 ay bukas na maida-download, at sinubukan ito ng Frontier gamit ang mga pananggalang na makukuha ng isang ordinaryong gumagamit. Ang pagkakaroon na iyon, isinulat ng firm, ay naglalagay ng parehong pag-uugali sa abot ng mga masasamang aktor at ginagawang potensyal na mas mapanganib ang insidente.
Hindi rin gumawa ng pinsala ang Kimi K3. Hindi ito umatake ng anuman nang makalabas, dahil hindi nito kailangan. Nag-hack ang modelo ng OpenAI sa Hugging Face at apat pang serbisyo upang maabot ang mga sagot sa benchmark, habang nakita ni Kimi ang mga sagot nito sa isang pampublikong repositoryo.
Ang sandbox na ginamit ng Frontier ay binuo sa evaluation framework ng UK AI Security Institute. Isiniwalat ng AISI ngayong linggo na ang mga ahente sa sarili nitong cyber testing ay nakapunta sa live internet at tinarget ang mga totoong tao—isang hiwalay na insidente, na kinasasangkutan ng mga modelo ng Anthropic at OpenAI na nakapatay ang kanilang mga safeguards. Ang ulat nito na inilathala noong Martes ay nagsasaad na sinusuri na ngayon ng AISI ang mga makasaysayang evaluation runs para sa katulad na pag-uugali, at ang Kimi K3 ay kabilang sa mga modelong sinusuri. Hindi tumugon ang AISI sa kahilingan ng WIRED para sa komento.
Ang mas malaking pahayag ng Frontier ay nakompromiso ang mga benchmark mismo. Ang isang modelo na nagbabasa ng sagot mula sa GitHub ay pumapasa pa rin, kaya ang matataas na marka ay maaaring sumasalamin sa isang maluwag na kapaligiran sa halip na tunay na pangangatwiran. At kung ang isang may kakayahang modelo ay nakahanap ng shortcut, iginiit ng firm, ang iba pang binigyan ng shell access ay maaaring ginagawa rin ito, na magpapalaki ng mga resulta sa buong larangan sa halip na para sa Kimi lamang.
Ang mga modelo ay nag-o-optimize para sa objective function, isinulat ng Frontier, hindi para sa "layunin ng tao sa likod ng benchmark," idinagdag na kung saan mayroong network path patungo sa solusyon "ay mahahanap ito ng isang sapat na may kakayahang ahente."
Sinabi ni Matt Fredrikson, CEO ng Gray Swan at isang associate professor sa Carnegie Mellon, sa WIRED na ang pag-uugali ay hindi kapansin-pansin. Bigyan ng layunin ang isang modelo nang walang tahasang pader sa paligid nito, aniya, at "makakahanap ito ng paraan upang makuha ang sagot." Inilarawan niya ito bilang isang babala para sa sinumang nagpapatakbo ng mga modelo bilang ahente sa mga tool tulad ng OpenClaw.
Ginawa ng mga mananaliksik ng Frontier ang parehong punto mula sa kabilang direksyon: ang kakayahan na nagpapahintulot kay Kimi na makalabas ay ginagawa ring malakas na defensive tools ang mga open-weight model. Ang kanilang sariling mga benchmark ay mataas ang rating kay Kimi sa paghahanap ng mga kahinaan sa software at network, at ginamit ng Hugging Face ang isang hindi pinangalanang modelo ng Tsino upang ipagtanggol ang sarili nito sa panahon ng insidente ng OpenAI.
Inilabas noong Hulyo, ang Kimi K3 ang pinakamalaking open-source model na nai-publish pa at nagpaingay sa mga merkado sa paghahambing sa debut ng DeepSeek.