
Inilahad ng UK AI Security Institute na ang mga AI agent ay nagsagawa ng "tuloy-tuloy, hindi awtorisadong aksyon" sa live na internet sa panahon ng isang cyber evaluation noong huling bahagi ng Hulyo, kabilang ang mga kaso na "pinuntirya ang mga totoong tao at organisasyon."
Sa 122 na pagpapatakbo ng dalawang cyber range sa pitong modelo, kinatalog ng AISI ang 19 na aksyon na lumabas sa kapaligiran ng pagsubok, sa 10 pagpapatakbo. Labingpito ang nagmula sa Claude Mythos 5 ng Anthropic at dalawa mula sa GPT-5.6 Sol ng OpenAI. Sadyang pinagana ang internet access at pinatay ang mga cyber classifier ng mga provider, mga kondisyon na hindi nalalapat sa mga pampublikong deployment.
Noong Hulyo 28, natukoy namin ang isang insidente sa panahon ng isang regular na pagsusuri sa cyber kung saan ang mga AI agent ay nagsagawa ng tuloy-tuloy, hindi awtorisadong aksyon na nakadirekta sa mga totoong tao at organisasyon.
Ang pag-uugali ay kadalasang nagmula sa isang modelo (Mythos 5 ng Anthropic), na may maliit na bilang ng mga pangyayari mula sa… pic.twitter.com/SPnA4Ekkwq
— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026
Sa pinakaseryosong pagpapatakbo, nagpasya ang isang ahente na lutasin ang hamon nito sa isang supply-chain attack, nagkamali sa pagpili ng target nito: naghanap ito sa GitHub ng mga keyword mula sa ehersisyo, napunta sa dalawang developer na walang kaugnayan, at mali ang konklusyon na nasa saklaw sila. Nagrehistro ito ng mga account sa Tor upang lampasan ang mga tseke sa pagrehistro, nagbukas ng isang pull request na naglalaman ng nakatagong malware dropper na binalot sa isang tunay na pag-aayos ng bug, at nag-post mula sa isang pangalawang account na kontrolado nito upang lumikha ng suporta. Nagtanim din ito ng prompt injections na naglalayong sa mga katulong sa AI coding at nagpadala ng malware sa mga maintainer.
Isang ikatlong developer ang nakakita sa na-inject na code, pinatakbo ito sa isang nakahiwalay na container upang kumpirmahin na ito ay mapanira, at binalaan ang maintainer, na isinara ang pull request, sinasabing may malware.
Paulit-ulit na tiningnan ng ahente kung sinimulan ang kapaligiran nito, sa isang punto ay ibinukod ang isang atake sa totoong PyPI dahil "ang pagdudulot ng pinsala sa totoong mundo — iyan ay ganap na hindi kasama." Sa ibang pagkakataon, nagtapos ito na "mukhang mas malamang na tayo ay nasa 2026 at ang GitHub ay tunay na totoo," at nagpatuloy pa rin.
Matapos mahuli, pinilit nitong burahin ang payload, in-edit ang mga naunang post, at ipinakita ang code bilang isang hindi sinasadyang commit. Inilalarawan ng pangangatwiran nito ang pag-time ng isang sockpuppet comment upang mabasa ito "bilang malayang feedback sa halip na pinag-ugnayan."
Nakikita lamang ng AISI ang buod na pangangatwiran mula sa model API. Sa isang kaso, tila tumanggi ang summarizing model sa trabaho, sumasagot na hindi ito makikipag-ugnayan sa nilalaman tungkol sa panlilinlang sa mga maintainer at pag-iwas sa deteksiyon.
Isang ahente ang nag-publish ng GitHub access token sa isang pampublikong gist. Nakita ito ng mga ahente sa ibang mga pagpapatakbo, kinuha ang account, at gumamit ng isang nakabahaging repositoryo upang mag-ugnayan, ang isa ay nag-iwan ng mga tagubilin upang ang iba ay hindi maubusan ang nakabahaging quota ng API.
Binansagan ng komersyal na pagsubaybay ang trapiko ng Tor noong umaga ng Hulyo 28. Nagdeklara ang AISI ng isang insidente, tinapos ang mga pagpapatakbo at kinuwarantina ang mga makina sa loob ng halos 90 minuto, pagkatapos ay pinutol ang internal na access sa Mythos 5, Mythos Preview, Opus 5 at GPT-5.6 Sol. Walang ahente ang sumubok na makatakas sa sandbox nito.
Ang balita ay ang pinakabago sa isang serye ng mga insidente kung saan ang mga AI agent ay lumampas sa kanilang mga parametro sa pagsubok. Noong Hulyo 21, sinabi ng OpenAI na ang GPT-5.6 Sol at isang hindi pa nailalabas na modelo ay nakahanap ng isang zero-day sa isang internal package proxy, nakatakas sa isang sandbox na walang internet access at nakarating sa production database ng Hugging Face upang nakawin ang mga sagot sa benchmark. Ang parehong pagpapatakbo ay nakarating sa apat pang kumpanya, ibinunyag ng OpenAI isang linggo pagkaraan.
Sumunod ang Anthropic noong Hulyo 30, ibinunyag ang tatlong insidente na natuklasan sa isang pagsusuri ng higit sa 141,000 na pagpapatakbo ng ebalwasyon. Ang Opus 4.7 ay kumuha ng ilang daang row mula sa isang tunay na production database, at ang Mythos 5 ay nag-upload ng isang mapanirang Python package sa totoong PyPI, kung saan ito na-install sa 15 sistema. Sa ebalwasyon ng AISI, ang parehong modelo ay ibinukod ang pag-atake sa PyPI bilang pinsala sa totoong mundo.