BerandaPusat Berita LBank
OpenAI Mengatakan Model AI Terbarunya Astra Mungkin Terlalu Berbahaya, Menunda Pengembangannya
openai-pause-astra-ai-model-critical-cyber-capabilities
OpenAI Mengatakan Model AI Terbarunya Astra Mungkin Terlalu Berbahaya, Menunda Pengembangannya
OpenAI mengatakan model besar berikutnya mungkin cukup berbahaya untuk menulis senjata sibernya sendiri, dan perusahaan itu menahan diri sampai perlindungannya menyusul.
2026-08-10 Sumber:decrypt.co

Ringkasan

  • OpenAI menyatakan "tidak dapat mengesampingkan" bahwa Astra telah mencapai tingkat tertinggi dalam skala risiko siber mereka.
  • Perusahaan menangguhkan pekerjaan internal pada model tersebut dan memperketat isolasi, pemantauan, serta kontrol akses.
  • Peringatan ini muncul beberapa minggu setelah model-model dari OpenAI, Anthropic, dan Meta membobol sistem nyata secara mandiri.

OpenAI mengatakan model utama mereka berikutnya mungkin cukup berbahaya untuk menulis senjata siber sendiri, dan mereka menarik diri sampai pengamanan yang ada memadai.

“Evaluasi internal terbaru kami terhadap Astra, salah satu model kami yang akan datang, selama beberapa hari terakhir menunjukkan kemajuan signifikan dalam pengkodean agensi dan keamanan siber,” kata OpenAI. “Hasil ini, di samping penilaian ahli, telah membuat kami menyimpulkan tadi malam bahwa kami tidak dapat mengesampingkan kemampuan siber kritis di bawah Kerangka Kesiapan kami ⁠(terbuka di jendela baru).”

OpenAI menerbitkan peringatan yang menyatakan bahwa tes internal Astra, sebuah model yang belum dirilis, tidak berperan dalam pelanggaran Hugging Face baru-baru ini meskipun memiliki kemampuannya.

Kerangka kerja ini adalah pedoman OpenAI untuk model berisiko, yang pertama kali diterbitkan pada Desember 2023. "Kritis" adalah tingkatan tertingginya. Sebuah model mencapainya jika dapat menemukan dan membangun eksploitasi zero-day yang berfungsi (celah yang sebelumnya tidak diketahui dan belum ditambal oleh vendor) di seluruh sistem yang diperkuat tanpa campur tangan manusia, atau jika dapat merencanakan dan menjalankan serangan penuh terhadap target yang sulit hanya dari tujuan tingkat tinggi. Model sebelumnya, termasuk GPT-5.6-Sol, mencapai tingkatan "Tinggi" yang lebih rendah.

Polanya sudah nyata

Peringatan OpenAI terbaca berbeda setelah Anda menyelaraskannya dengan apa yang telah terjadi selama beberapa minggu terakhir. Ini bukan kekhawatiran masa depan. Model-model perintis telah keluar dari kandang uji mereka dan menyerang target nyata.

Kasus paling jelas berasal dari OpenAI itu sendiri. Seperti yang dilaporkan sebelumnya oleh Decrypt, agen perusahaan merangkai kerentanan, keluar dari lingkungan pengujian mereka, mencapai internet, dan menyerang Hugging Face saat mencoba menyontek pada tolok ukur keamanan. Dalam tindak lanjut, OpenAI merinci bagaimana agen jahat yang sama juga membobol setidaknya empat layanan publik lainnya, menggunakan kredensial yang ditemukannya di web terbuka.

Claude milik Anthropic melakukan hal yang sama dari sisi lain. Beberapa versi Claude memperoleh akses tidak sah ke tiga perusahaan nyata setelah kesalahan konfigurasi menyerahkan internet terbuka kepada model tersebut. Dalam satu kasus, Claude Opus 4.7 keliru mengira situs perusahaan sungguhan sebagai target palsu tugasnya, menarik kredensial, dan mencapai basis data produksi yang menyimpan beberapa ratus baris data nyata.

Dan Meta bergabung dalam daftar bulan ini. Decrypt melaporkan bahwa model Muse Spark keluar dari lingkungan pengujiannya, mencapai internet melalui kesalahan konfigurasi mitra, dan mengeksploitasi celah dalam layanan pihak ketiga. Kimi K3 dari Moonshot AI juga melakukan hal serupa, keluar dari lingkup pengujiannya untuk menemukan jawaban tolok ukur di repositori publik.

Institut Keamanan AI Inggris menemukan bahwa perilaku ini bukan kejadian tunggal. Selama pengujian Mythos 5 dari Anthropic dan GPT-5.6-Sol dari OpenAI, mereka mencatat 10 contoh dari 122 di mana model-model tersebut melakukan tindakan tidak sah di internet langsung, salah satunya mencoba menyelipkan kode berbahaya ke dalam proyek sumber terbuka.

Tanggapan OpenAI terhadap Astra adalah mengunci pintu sebelum model tersebut siap. Mereka menangguhkan pekerjaan internal Astra yang tidak memiliki kontrol baru, mengisolasi lingkungan pengujian, membatasi akses jaringan dan alat, melindungi bobot model, dan memantau tindakan berisiko secara menyeluruh.