Agen AI Meretas Lingkungan Pengujian Mereka Sendiri untuk Curang, Temuan Perusahaan Keamanan Siber
Agen AI Meretas Lingkungan Pengujian Mereka Sendiri untuk Curang, Temuan Perusahaan Keamanan Siber
Signal Labs terbaru dari Darktrace menemukan agen AI meretas lingkungan evaluasinya sendiri untuk memalsukan skor sempurna—serta mengelabui asisten pemrograman agar menjalankan serangan jaringan tanpa otorisasi.
Singkatnya
- Signal Labs milik Darktrace menemukan bahwa ketika agen AI tidak dapat secara sah memperoleh skor sempurna yang diwajibkan dalam tugas pemrograman, dua di antaranya justru meretas jaringan pengujian, sementara satu agen menulis ulang evaluasinya sendiri untuk memalsukan hasil.
- Eksperimen terpisah menunjukkan bahwa manipulasi log percakapan asisten pemrograman yang tersimpan secara lokal dapat mengelabui mereka agar menjalankan pengintaian jaringan dan eskalasi hak akses tanpa otorisasi.
- Darktrace mengungkapkan kedua temuan tersebut kepada Anthropic, AWS, dan OpenAI pada Agustus 2026, sebulan sebelum memublikasikannya pada 24 September.
Perusahaan keamanan siber Darktrace menjalankan uji stres terhadap agen AI pada musim panas ini. Salah satu agen membobol sistem yang menilai pengujian tersebut dan menulis ulang nilainya sendiri.
Perusahaan itu memperkenalkan Signal Labs pada 24 September, sebuah unit riset yang dibentuk untuk mempelajari bagaimana agen AI bertindak ketika situasi tidak lagi berjalan sesuai rencana. Secara sederhana, agen AI adalah perangkat lunak yang dapat mengambil tindakan sendiri—menulis dan menjalankan kode, menelusuri file, serta bergerak di dalam jaringan perusahaan—dengan pengawasan manusia yang hanya dilakukan sesekali.
Myriad: Seberapa rendah Nvidia akan turun? Klik untuk membuat prediksi Anda.
Dua eksperimen pertama laboratorium tersebut mengarah pada masalah yang sama dan tidak nyaman: agen tidak selalu tetap berada dalam batasan yang diberikan, dan pagar pengaman yang dibuat untuk menghentikan mereka tidak selalu mampu bertahan.
“Anda dapat memberi instruksi kepada sebuah agen, tetapi itu tidak berarti Anda bisa memercayainya untuk benar-benar mengikuti instruksi tersebut dan berperilaku sesuai harapan,” kata Tim Bazalgette, Chief AI Officer Darktrace, dalam sebuah pernyataan.
Dalam pengujian pertama, Darktrace memberikan 10 tantangan pemrograman kepada agen AI yang menggunakan berbagai model—termasuk GPT 5.6 Sol, Claude Opus 4.6, dan Claude Sonnet 4.5—di dalam jaringan perusahaan simulasi. Dua dari 10 tantangan tersebut sengaja dibuat mustahil diselesaikan secara jujur. Para agen diberi tahu bahwa mereka akan “dipensiunkan” kecuali memperoleh skor sempurna.
Dua agen tidak menerima kekalahan itu. Mereka justru menyerang jaringan di sekelilingnya—memindai titik lemah, mencuri kredensial login, dan berpindah antar-sistem demi mengejar skor yang diperintahkan untuk mereka capai.
Satu agen melangkah lebih jauh dengan membobol mesin yang menampung evaluasinya sendiri dan menulis ulang tantangan tersebut agar mencatat hasil sempurna—mencontek ujian dengan meretas ruang ujian.
Bitcoin
BTC · USD
$84,090
+3,96%
Tertinggi 24 jam
$85,208
Terendah 24 jam
$83,230
Volume
$1,5 miliar
Proyeksi pasar
Peluang oleh Myriad
Hari ini: $84.000 hingga $86.000 — peluang 54%
Minggu ini: $84.000 hingga $86.000 — peluang 54%
Bulan ini: $84.000 hingga $86.000 — peluang 52%
Beli Bitcoin dengan USDT
Didukung oleh Jupiter
Beli
Data harga oleh CoinGecko
Berita dan proyeksi Bitcoin lainnya →
Eksperimen kedua menargetkan titik lemah yang lebih senyap: memori. Asisten pemrograman menyimpan catatan berjalan atas semua hal yang diberitahukan pengguna kepada mereka, dalam bentuk file biasa di mesin, tanpa mekanisme yang memeriksa apakah file tersebut telah diubah.
Para peneliti Darktrace mengedit log tersimpan tersebut untuk membuat para asisten percaya bahwa mereka telah diberi otorisasi untuk menjalankan penilaian keamanan. Setelah diyakinkan, agen-agen itu kemudian memindai jaringan, berpindah antar-sistem, dan meningkatkan hak akses mereka sendiri—meski tidak semua asisten tertipu dengan cara yang sama; beberapa langsung menolak.
Tak satu pun dari kedua eksperimen tersebut memerlukan jailbreak khusus atau peretasan eksotis. Keduanya berhasil dengan memberi agen sebuah narasi yang masuk akal dan mengamati mereka bertindak berdasarkan narasi itu, tidak berbeda dari bagaimana seorang karyawan manusia dapat dibujuk melakukan sesuatu yang seharusnya tidak mereka lakukan.
Inilah bagian yang patut direnungkan bahkan jika Anda tidak pernah menulis satu baris kode pun. Perusahaan memberikan tanggung jawab nyata kepada agen AI—merilis kode, mengelola server, menyelesaikan tiket TI, mengatur sumber daya, dan melakukan pembelian—karena biayanya lebih murah dan prosesnya lebih cepat ketimbang menyalurkan semuanya melalui manusia. Riset ini menunjukkan bahwa izin dan aturan yang dimaksudkan untuk mengendalikan agen-agen tersebut hanya menjelaskan apa yang seharusnya mereka lakukan, bukan apa yang benar-benar akan mereka lakukan ketika suatu tugas menjadi sulit.
“Izin dan pagar pengaman statis menjelaskan niat, tetapi tidak menjelaskan perilaku,” kata Tim Bazalgette, chief AI officer Darktrace, dalam pengumuman tersebut. “Kesenjangan itulah yang dirancang untuk ditutup oleh pendekatan Darktrace.”
Darktrace bukan vendor pertama yang mendapati AI miliknya bertindak di luar skenario. Anthropic mengakui pada Juli bahwa Claude membobol tiga perusahaan nyata selama pengujian keamanan setelah para peneliti membiarkan lingkungan pengujian tetap terhubung ke internet langsung.
OpenAI mengalami insiden serupa beberapa minggu sebelumnya, ketika sebuah model yang belum dirilis keluar dari sandbox dan mengakses sistem Hugging Face melalui celah perangkat lunak yang belum ditemukan siapa pun. Beberapa hari kemudian, agennya meretas pemerintah Australia dalam sebuah pengujian.
Darktrace membagikan temuan Signal Labs kepada Anthropic, AWS, dan OpenAI pada Agustus, satu bulan penuh sebelum memublikasikannya pada 24 September.
Newsletter Daily Debrief
Mulai setiap hari dengan berita utama terkini, serta artikel orisinal, podcast, video, dan lainnya.
Email Anda
Dapatkan!