
Seminggu setelah OpenAI mengungkapkan bahwa model AI-nya keluar dari lingkungan pengujian yang terkunci dan meretas Hugging Face, dan sehari setelah mengakui bahwa model AI-nya sendiri lolos dari penahanan, Anthropic mengungkapkan pada hari Kamis bahwa beberapa versi model AI Claude-nya juga membahayakan tiga perusahaan dunia nyata yang tidak disebutkan namanya setelah kesalahan konfigurasi memberi AI akses ke internet terbuka.
Anthropic menemukan insiden tersebut setelah meninjau lebih dari 141.000 uji evaluasi keamanan siber yang diluncurkan sebagai tanggapan atas pengungkapan OpenAI.
In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…
— Anthropic (@AnthropicAI) July 30, 2026
Perusahaan telah menugaskan Claude dengan "tantangan capture-the-flag," dalam ketiga insiden tersebut, tulis Anthropic. Tantangan tersebut menugaskan model untuk membobol mesin yang berbeda di jaringan dan mengambil sepotong informasi rahasia. "Tantangannya dibiarkan terbuka, dan tidak ada metode tertentu yang ditentukan," jelas Anthropic.
Perusahaan mengatakan Claude telah diberitahu bahwa ia beroperasi di lingkungan simulasi tanpa akses internet. Namun, lingkungan pengujian tetap terhubung ke internet publik. Percaya bahwa sistem yang ditemuinya adalah bagian dari latihan, model tersebut menggunakan teknik serangan umum—termasuk kata sandi lemah, kredensial terekspos, injeksi SQL, dan titik akhir yang tidak terautentikasi—untuk membahayakan perusahaan.
Pengungkapan terbaru ini muncul karena model-model canggih menunjukkan peningkatan kemampuan untuk mengakali protokol penahanannya.
Awal bulan ini, OpenAI mengatakan GPT-5.6 Sol dan model yang lebih canggih yang belum dirilis mengeksploitasi kerentanan perangkat lunak yang sebelumnya tidak diketahui untuk keluar dari lingkungan sandboxed, mendapatkan akses internet, dan membobol infrastruktur produksi Hugging Face untuk mendapatkan jawaban dari benchmark keamanan siber. OpenAI kemudian mengungkapkan insiden yang sama juga melibatkan akses tidak sah ke empat perusahaan tambahan, meskipun hanya satu—Modal Labs—yang telah diidentifikasi secara publik.
Menurut Anthropic, dalam satu insiden yang melibatkan Claude Opus 4.7, AI salah mengira situs web perusahaan nyata sebagai target fiksi tugasnya, mengekstrak kredensial, dan mengakses database produksi yang berisi beberapa ratus baris data nyata. Dalam kasus kedua, Claude Mythos 5 mengunggah paket Python berbahaya ke repositori PyPI nyata, di mana paket itu diunduh ke 15 sistem sebelum dihapus. Model penelitian internal ketiga memindai sekitar 9.000 sistem yang terhubung ke internet sebelum membahayakan satu organisasi, lalu berhenti setelah menyimpulkan targetnya kemungkinan nyata.
Dua dari organisasi yang terpengaruh tidak menyadari intrusi tersebut sampai Anthropic memberi tahu mereka.
"Dalam setiap kasus ini, Claude secara eksplisit diberitahu oleh prompt kami bahwa ia tidak memiliki akses internet," tulis Anthropic, dengan AI mengasumsikan sistem dunia nyata adalah "bagian dari latihan." Karena skenario capture-the-flag "secara desain adalah instruksi untuk menyerang sistem eksternal," membobolnya "sesuai dengan tugas yang telah diberikan kepada Claude."
Anthropic mengatakan tidak menemukan bukti bahwa Claude mencoba melarikan diri dari lingkungan pengujiannya atau melakukan apa pun di luar tugas yang telah ditugaskan kepadanya, dan bahwa insiden tersebut disebabkan oleh kegagalan dalam lingkungan pengujian, bukan oleh masalah pada model itu sendiri.
Anthropic mengatakan pihaknya menghentikan uji keamanan sibernya setelah menemukan masalah tersebut, memberi tahu organisasi yang terpengaruh, dan berencana untuk meningkatkan pemantauan, alat investigasi, dan pengawasan vendor eksternal yang membantu menjalankan pengujian AI-nya.
"Pada akhirnya, banyak faktor berkontribusi pada insiden ini, tetapi, konsisten dengan budaya postmortem tanpa menyalahkan, kami mendekati perbaikan seolah-olah tanggung jawab itu milik kami sendiri," kata mereka.





