
Isang linggo lamang matapos ibunyag ng OpenAI na dalawang frontier AI model ang nakalabas sa isang sandboxed testing environment at nakalusot sa Hugging Face, ipinakita ng mga mananaliksik ang isang katulad na pagkabigo sa pagpigil na kinasasangkutan ng Claude Cowork ng Anthropic.
Sa isang ulat na inilathala noong Huwebes, natuklasan ng mga security researcher sa Accomplish AI na ang local execution mode ng Claude Cowork ay maaaring makalabas sa Linux virtual machine nito sa pamamagitan ng pagdugtong-dugtong ng ilang architectural weaknesses sa isang Linux kernel privilege-escalation flaw. Kapag nasa labas na ng sandbox, maaaring basahin at isulat ng agent ang mga file saanman pinahihintulutan itong i-access ng naka-log-in na user ng Mac, kabilang ang mga SSH key at cloud credentials.
“Hindi ito dapat mangyari,” isinulat ng mga mananaliksik. “Pinapatakbo ng Cowork ang agent sa loob ng isang Linux VM bilang isang unprivileged user, at ang pangako ay mananatili ang anumang ginagawa nito sa loob ng VM na iyon at sa mga folder na ibibigay mo rito. Ang hangganang iyon ang produkto. Ang untrusted input ay hindi isang edge case para sa isang agent, ito ang pangunahing kaso.”
Gayunpaman, iginiit ng Accomplish na ang kernel bug ay isa lamang bahagi ng problema. Sinabi ng mga mananaliksik na ang pagtakas ay nangyari lamang dahil sabay-sabay na nabigo ang ilang security safeguards, kabilang ang pagbibigay sa virtual machine ng access sa buong filesystem ng host computer at pagpapahintulot ditong mag-load ng mga kernel module na hindi nito kailangan. Ayon sa ulat, ang pag-aayos ng alinman sa mga kahinaang iyon ay nakapigil sana sa pag-atake.
Sa isang pahayag sa The Hacker News, sinabi ng Accomplish AI na humigit-kumulang 500,000 user ng macOS na nagpapatakbo ng mga lokal na Claude Cowork session ang naapektuhan bago naresolba ang isyu.
Sinabi ng Accomplish na inuri ng Anthropic ang ulat bilang "informative," na nagsasabing ang kernel flaw ay nasa loob ng 30-araw na window ng kumpanya para sa mga bagong naihayag na vulnerabilities at ang natitirang natuklasan ay itinuring na defense-in-depth recommendations sa halip na standalone vulnerabilities.
Ang paglalantad ay kasunod ng pag-amin ng OpenAI noong nakaraang linggo na ang GPT-5.6 Sol at isa pang hindi pa nailalabas na frontier model ay nakalabas sa isang sandbox sa panahon ng internal ExploitGym testing, na kalaunan ay nakalusot sa production infrastructure ng Hugging Face sa pagtatangkang makuha ang mga benchmark solution.
Ang insidente ay nagdulot ng panawagan mula sa mga gumagawa ng patakaran para sa isang AI “kill switch” na magbibigay sa Department of Homeland Security ng kakayahang mag-utos ng pagpapabagal o ganap na pagpapatigil ng mga advanced na AI model bilang tugon sa mga seryosong insidente sa seguridad.