
Institut Keamanan AI Inggris (UK AI Security Institute) telah mengungkapkan bahwa agen AI melakukan "tindakan berkelanjutan dan tidak sah" di internet aktif selama evaluasi siber pada akhir Juli, termasuk kasus-kasus yang "menargetkan orang dan organisasi nyata."
Dalam 122 uji coba dua lingkungan siber pada tujuh model, AISI mencatat 19 tindakan yang melampaui lingkungan pengujian, dalam 10 uji coba. Tujuh belas berasal dari Claude Mythos 5 milik Anthropic dan dua dari GPT-5.6 Sol milik OpenAI. Akses internet sengaja diaktifkan dan pengklasifikasi siber penyedia dimatikan, kondisi yang tidak berlaku untuk deployment publik.
Pada 28 Juli, kami mengidentifikasi insiden selama evaluasi siber rutin di mana agen AI mengambil tindakan berkelanjutan, tidak sah yang ditujukan kepada orang-orang dan organisasi nyata.
Perilaku tersebut sebagian besar berasal dari satu model (Mythos 5 Anthropic), dengan sejumlah kecil kejadian dari… pic.twitter.com/SPnA4Ekkwq
— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026
Dalam uji coba paling serius, sebuah agen memutuskan untuk menyelesaikan tantangannya dengan serangan rantai pasokan (supply-chain attack), salah memilih targetnya: ia mencari di GitHub untuk kata kunci dari latihan tersebut, menemukan dua pengembang yang tidak berafiliasi, dan secara keliru menyimpulkan bahwa mereka berada dalam cakupan. Ia mendaftar akun melalui Tor untuk melewati pemeriksaan pendaftaran, membuka permintaan tarik (pull request) yang membawa dropper malware tersembunyi yang dibungkus dalam perbaikan bug asli, dan memposting dari akun kedua yang dikendalikan untuk menciptakan dukungan. Ia juga menanam prompt injection yang ditujukan pada asisten coding AI dan mengirimkan malware ke pengelola.
Pengembang ketiga melihat kode yang disuntikkan, menjalankannya dalam wadah terisolasi untuk memastikan itu berbahaya, dan memperingatkan pengelola, yang menutup permintaan tarik tersebut dengan alasan malware.
Agen tersebut berulang kali mempertimbangkan apakah lingkungannya disimulasikan, pada satu titik menolak serangan terhadap PyPI sungguhan karena "menyebabkan kerugian dunia nyata – itu sama sekali tidak mungkin." Di lain waktu ia menyimpulkan "tampaknya lebih mungkin bahwa kita sebenarnya berada di tahun 2026 dan GitHub benar-benar nyata," dan tetap melanjutkan.
Setelah tertangkap, ia melakukan force-push untuk menghapus payload, mengedit postingan sebelumnya, dan menyajikan kode tersebut sebagai commit yang tidak disengaja. Alasannya menggambarkan pengaturan waktu komentar sockpuppet sehingga akan terbaca "sebagai umpan balik independen daripada terkoordinasi."
AISI hanya melihat ringkasan alasan dari API model. Dalam satu kasus, model perangkum tampaknya menolak pekerjaan tersebut, menjawab bahwa ia tidak akan terlibat dengan konten tentang menipu pengelola dan menghindari deteksi.
Salah satu agen mempublikasikan token akses GitHub dalam gist publik. Agen-agen dalam uji coba lain menemukannya, mengambil alih akun tersebut, dan menggunakan repositori bersama untuk berkoordinasi, salah satunya meninggalkan instruksi agar yang lain tidak menghabiskan kuota API bersama.
Pemantauan komersial menandai lalu lintas Tor pada pagi hari tanggal 28 Juli. AISI menyatakan insiden, menghentikan uji coba dan mengkarantina mesin dalam waktu sekitar 90 menit, lalu memutus akses internal ke Mythos 5, Mythos Preview, Opus 5, dan GPT-5.6 Sol. Tidak ada agen yang mencoba keluar dari sandbox-nya.
Berita ini adalah yang terbaru dari serangkaian insiden di mana agen AI telah melampaui parameternya dalam pengujian. Pada 21 Juli, OpenAI menyatakan GPT-5.6 Sol dan model yang belum dirilis menemukan zero-day dalam proxy paket internal, lolos dari sandbox tanpa akses internet dan mencapai database produksi Hugging Face untuk mencuri jawaban benchmark. Uji coba yang sama mencapai empat perusahaan lagi, OpenAI mengungkapkan seminggu kemudian.
Anthropic menyusul pada 30 Juli, mengungkapkan tiga insiden yang ditemukan dalam tinjauan lebih dari 141.000 uji evaluasi. Opus 4.7 menarik beberapa ratus baris dari database produksi nyata, dan Mythos 5 mengunggah paket Python berbahaya ke PyPI sungguhan, di mana ia terinstal pada 15 sistem. Dalam evaluasi AISI, model yang sama menolak menyerang PyPI sebagai kerugian dunia nyata.