BerandaPusat Berita LBank
Claude Opus 5 Mengungguli Fable 5 di Sebagian Besar Tolok Ukur—Dengan Separuh Harga
claude-opus-5-outscores-fable-5-most-benchmarks-half-price
Claude Opus 5 Mengungguli Fable 5 di Sebagian Besar Tolok Ukur—Dengan Separuh Harga
Model sehari-hari baru Anthropic mengungguli produk terdepan mereka sendiri dalam hal biaya dan melampauinya di hampir semua aspek penting.
2026-07-24 Sumber:decrypt.co

Singkatnya

  • Claude Opus 5, yang dirilis pada 24 Juli, berharga $5 per juta token input—identik dengan pendahulunya Opus 4.8 dan tepat setengah harga Fable 5—sambil mengungguli Fable 5 pada sebagian besar tolok ukur utama.
  • Opus 5 mencetak 43,3% pada Frontier-Bench v0.1, evaluasi pengkodean agentic, berbanding 33,7% untuk Fable 5 dan 34,4% untuk GPT-5.6 Sol dari OpenAI; pada ARC-AGI-3, tolok ukur pemecahan masalah baru, model ini mencetak 30,2% dibandingkan 7,8% milik GPT-5.6 Sol—selisih yang sangat jauh.
  • Model baru ini adalah standar pada Claude Max dan yang terkuat pada Claude Pro, secara efektif menggantikan Fable 5 sebagai pilihan utama bagi sebagian besar pelanggan.

Claude Opus 5 telah rilis hari ini. Model ini lebih murah bagi bisnis untuk dijalankan daripada model terkemuka Anthropic, Claude Fable 5, yang oleh perusahaan telah diposisikan sebagai produk unggulan harian bagi pengguna berbayar. Terlebih lagi, Opus 5 juga mengungguli Fable 5 pada tolok ukur yang signifikan.

Untuk memahami posisi Opus 5: Jajaran produk Anthropic memiliki empat tingkatan. Haiku cepat dan murah. Sonnet berada di kelas menengah. Opus adalah pekerja keras yang berat. Di atasnya terdapat kelas Mythos—tingkatan yang diperkenalkan Anthropic musim semi ini—yang mencakup Claude Fable 5 untuk publik, dan Claude Mythos 5, versi dengan lebih sedikit batasan yang dicadangkan melalui Project Glasswing untuk peneliti keamanan siber yang terverifikasi dan operator infrastruktur kritis.

Fable 5 telah mengalami kesulitan sebagai model unggulan bagi pelanggan. Model ini diluncurkan pada 9 Juni, ditarik secara global tiga hari kemudian setelah pemerintah AS mengeluarkan perintah kontrol ekspor darurat yang mengutip kerentanan jailbreak, dan kembali pada 30 Juni—hanya untuk segera beralih ke model berbasis kredit, tidak lagi termasuk dalam paket standar. Opus 5 sekarang mengisi posisi yang tidak bisa dipertahankan oleh Fable 5.

Lovable, sebuah platform pengembang dengan jutaan pengguna, menjalankan Opus 5 pada evaluasi internalnya dan mencatat bahwa peningkatan melampaui skor mentah: "Ini bukan hanya lebih baik pada tugas pengkodean agentic tersulit kami, naik 22% dari Opus 4.7, tetapi juga lebih stabil, dengan variasi yang jauh lebih sedikit dari satu proses ke proses lainnya," kata Fabian Hedin dalam sebuah pernyataan yang dibagikan oleh Anthropic.

Tolok ukur

Kedengarannya aneh, tetapi Opus mengalahkan Fable pada hampir semua hal yang akan penting bagi pengguna sehari-hari tanpa dilabeli sebagai kelas Mythos seperti Fable.

Pada Frontier-Bench v0.1—sebuah tolok ukur yang menguji apakah agen pengkodean AI dapat menyelesaikan tugas rekayasa perangkat lunak nyata secara menyeluruh, dinilai sebagai persentase tugas yang berhasil—Opus 5 mencapai 43,3%. Fable 5 berada di 33,7%. GPT-5.6 Sol dari OpenAI, saingan komersial utama Anthropic, mencetak 34,4%.

Selisih terluas terdapat pada ARC-AGI-3, sebuah uji pemecahan masalah asli yang dibangun di sekitar teka-teki baru yang tidak dapat dihafal oleh model dari data pelatihan, dinilai sebagai persentase teka-teki yang diselesaikan. Opus 5 mencapai 30,2%; GPT-5.6 Sol mencetak 7,8%; dan Fable 5 sama sekali tidak diuji. Pada GDPval-AA v2—tolok ukur pekerjaan berbasis pengetahuan yang dinilai melalui peringkat Elo, sistem peringkat ala catur yang digunakan untuk mengukur kinerja relatif pada tugas profesional nyata—Opus 5 mencapai 1.861 dibandingkan 1.747 milik Fable 5 dan 1.736 milik GPT-5.6 Sol.

Zapier menguji Opus 5 pada AutomationBench, sebuah evaluasi yang menilai apakah sebuah model dapat menjalankan alur kerja bisnis penuh dari awal hingga akhir tanpa bantuan manusia. Putusan mereka: model tersebut "mengambil buku kerja kesehatan akun mentah dan menjalankan urutan pencegahan churn penuh secara menyeluruh: menandai akun yang berisiko, memberi tahu pemilik yang tepat, dan meringkas untuk operasi retensi. Model sebelumnya tidak berhasil; Opus 5 mencapai 100%."

Anthropic juga menggembar-gemborkan Opus 5 sebagai peningkatan penelitian. Ultima Genomics, sebuah perusahaan pengurutan DNA, mengatakan model tersebut "berperilaku lebih seperti ilmuwan yang cermat daripada model mana pun yang pernah kami jalankan. Model ini mencari tes statistik yang tepat untuk menyingkirkan faktor pengganggu, memeriksa ulang hasilnya sendiri dengan metode independen, dan tetap pada jalurnya melalui analisis multi-langkah yang panjang."

Meskipun demikian, kedua area ini—hukum dan kesehatan—adalah satu-satunya di mana Fable 5 unggul dengan selisih yang sangat kecil.

Rilis ini datang seminggu setelah Moonshot AI, startup yang berbasis di Beijing yang didukung oleh Alibaba, meluncurkan Kimi K3—model open-weight 2,8 triliun parameter (artinya siapa pun dapat mengunduh kode dasar untuk menjalankannya secara independen) yang digambarkan Moonshot sebagai sistem AI terbuka terbesar di dunia. Tolok ukur independen secara konsisten menempatkan Kimi K3 di posisi ketiga secara keseluruhan, di belakang Fable 5 dan GPT-5.6 Sol, mengalahkan keduanya di area tertentu.

Opus 5 kini tersedia melalui API dengan harga $5 per juta token input dan $25 per juta output. (Token adalah unit dasar informasi yang dapat diproses oleh model AI baik dalam input maupun output). Mode Cepat yang berjalan sekitar 2,5 kali kecepatan default juga tersedia, dengan harga dua kali lipat dari harga dasar—$10 per juta token input dan $50 per juta output.

Rilis ini mungkin mengakhiri kekhawatiran atas kurangnya ketersediaan publik Fable 5. Opus juga tersedia melalui langganan untuk semua orang.