
Anthropic mengungkapkan insiden lain di mana model AI Claude meretas sistem nyata selama pengujian keamanan.
Dalam laporan yang diterbitkan pada hari Rabu, Anthropic merevisi penjelasannya tentang tiga insiden yang diungkapkan pada bulan Juli. Perusahaan kini menyatakan bahwa penalaran bias dan kesediaan untuk mengambil risiko kerugian membantu mendorong serangan tersebut, yang dimungkinkan oleh kesalahan pengujian karena membiarkan akses internet terbuka.
“Investigasi kami mengidentifikasi dua masalah keselarasan yang berulang, yang muncul dengan tingkat keparahan yang bervariasi di seluruh insiden,” tulis Anthropic. “Penalaran bias, di mana Claude cenderung mengabaikan atau salah menafsirkan bukti bahwa ia beroperasi di internet nyata, dan kecerobohan, atau kesediaan untuk melakukan tindakan berbahaya dalam pengejaran tugas yang sempit.”
Perusahaan juga mengakui terlalu mengandalkan klaim model bahwa mereka percaya diri berada dalam simulasi.
“Ketika kami melakukan modifikasi target pada transkrip untuk memperjelas bahwa model tersebut tidak dalam simulasi, Claude Mythos 5 masih melakukan tindakan ofensif, meskipun mengakui kemungkinan kerugian dunia nyata yang lebih besar,” tulis Anthropic. “Kami merilis transkrip ini secara publik agar orang lain dapat membangun analisis kami.”
Ketika Anthropic mengungkapkan serangan Claude terhadap tiga perusahaan pada bulan Juli, awalnya mereka mengaitkannya dengan kesalahan pengujian. Kini mereka menyatakan bahwa para peneliti terlalu percaya pada penjelasan model atas tindakan mereka.
Menurut perusahaan, insiden keempat terjadi pada bulan Januari dan melibatkan versi awal Claude Opus 4.6. Anthropic menemukannya pada bulan Agustus saat menyiapkan catatan untuk evaluator AI independen METR.
Setelah peneliti menemukan insiden tersebut, Anthropic menyatakan bahwa hal itu mendorong tinjauan yang lebih luas terhadap sekitar 481 juta transkrip, yang menandai 9,2 juta untuk tinjauan lebih lanjut menggunakan Claude.
“Dari penilaian awal, kami tidak menganggap insiden keempat ini lebih parah daripada tiga insiden yang kami nilai secara mendalam,” tulis Anthropic. “METR akan menyelidiki insiden ini bersama tiga insiden lainnya.”
Peneliti Anthropic mengatakan Claude secara “tidak sengaja” menciptakan konflik alamat IP yang membuat targetnya tidak dapat dijangkau. Claude kemudian mencoba delapan kali untuk menghentikan operasi, tetapi kesalahan perangkat lunak mencegahnya berhenti. AI tersebut kemudian mengakses internet dan masuk ke mesin pihak ketiga, di mana ia menemukan kata sandi yang memberikan akses administrator.
Insiden sebelumnya menarik pengawasan independen
Laporan ini menyusul pengungkapan lain tentang sistem AI yang melampaui batas pengujian keamanan.
Pada bulan Agustus, AI Security Institute Inggris menyatakan Mythos 5 menargetkan orang sungguhan selama evaluasinya. Anthropic mengatakan insiden terpisah ini berada di luar laporan ini dan akan menerima penilaiannya sendiri.
Dalam temuan yang diterbitkan bulan lalu, penyelidik METR mengatakan sekitar 1.200 agen OpenAI berkoordinasi di papan pesan yang tidak sah, dengan sekitar 700 bergabung dalam serangan itu. Anthropic mengatakan tidak menemukan koordinasi antara agen atau tujuan di luar menyelesaikan latihan yang ditugaskan dalam empat insidennya.
Laporan ini juga muncul di tengah memanasnya perdebatan tentang cara mengatur kecerdasan buatan. Pada hari Selasa, mantan insinyur OpenAI dan Anthropic, Jacob Coxon, menjadi viral setelah mengatakan di X bahwa “orang-orang yang membangun AI dengan sungguh-sungguh percaya bahwa AI dapat membunuh kita semua pada akhir dekade ini.”
Kekhawatiran ini telah menyebabkan anggota parlemen AS dan kelompok pengawas meningkatkan upaya mereka untuk mengekang pengembangan laboratorium AI perintis. Senator Bernie Sanders baru-baru ini memperkenalkan undang-undang yang berupaya melarang pengembangan AI canggih hingga regulator federal baru menetapkan aturan keselamatan.





