
Enam minggu. Itulah waktu yang dibutuhkan Anthropic untuk beralih dari Opus 4.7 ke Opus 4.8.
Model baru ini lebih cepat dan lebih cerdas dalam uji benchmark, serta dilengkapi dengan serangkaian fitur baru—tetapi harganya tidak berubah: Harganya $5 per juta token input dan $25 per juta token output, sama seperti sebelumnya.
Ada juga mode cepat yang menjalankan model yang sama dengan kecepatan 2,5 kali lipat dengan biaya input $10 dan output $50 per juta yang mengejutkan. Anthropic mengatakan tarif tersebut kini tiga kali lebih murah dari biaya mode cepat pada model sebelumnya, yang merupakan cara bagus untuk mengatakan bahwa sebelumnya jauh lebih mahal.
SWE-bench Pro mungkin merupakan benchmark terpenting untuk dipantau dan mendapatkan gambaran seberapa bagus model ini. Ini mengukur apakah AI benar-benar dapat memecahkan masalah rekayasa perangkat lunak multi-bahasa yang sulit yang diambil dari codebase produksi nyata—dinilai sebagai persentase masalah yang berhasil diselesaikan.
Pada pengujian tersebut, Opus 4.8 mencapai 69,2%, naik dari 64,3% untuk Opus 4.7. GPT-5.5 dari OpenAI mencetak 58,6%, dan Gemini 3.1 Pro dari Google tertinggal di 54,2%. Untuk model dengan titik harga yang sama, itu adalah peningkatan yang signifikan.
Pada Humanity's Last Exam—pertanyaan tingkat ahli di berbagai disiplin ilmu akademik, dinilai sebagai persentase yang benar—Opus 4.8 mencapai 49,8% tanpa alat dan 57,9% dengan alat, mengungguli ketiga pesaingnya. OSWorld-Verified, yang menguji tugas penggunaan komputer dunia nyata seperti menavigasi UI perangkat lunak, mencapai 83,4%, sedikit melampaui skor Opus 4.7 sebesar 82,8%.
Satu-satunya kekalahan: Terminal-Bench 2.1, yang mengukur kinerja AI pada tugas baris perintah. GPT-5.5 memimpin dengan 78,2%, sementara Opus 4.8 mencetak 74,6%—lebih baik dari 66,1% Opus 4.7 dan di depan Gemini 70,3%, tetapi posisi kedua pada akhirnya tetap kalah.
Anthropic kini memungkinkan pengguna mengontrol seberapa keras model tersebut berpikir. "High" adalah pengaturan default dan menangani sebagian besar tugas dengan baik, sementara "Extra"—disebut "xhigh" di dalam Claude Code—menggunakan lebih banyak komputasi untuk masalah yang lebih sulit. "Max" adalah tingkat paling tinggi. "Low" dan "Medium" mendedikasikan lebih sedikit token untuk tugas yang sama, menghemat waktu dengan imbalan akurasi.
Kontrol upaya terletak di samping pemilih model di claude.ai dan Cowork, tersedia di semua paket. Anthropic mengatakan default high menggunakan token yang kira-kira sama dengan default Opus 4.7 dengan hasil yang lebih baik—yang bisa jadi rekayasa yang mengesankan atau pesan yang baik, dan mungkin keduanya.
Penting juga untuk diingat bahwa tokenizer baru Anthropic untuk Opus menggunakan lebih banyak token per tugas. Jadi pengguna Claude pasti akan menghabiskan lebih banyak uang untuk menyelesaikan sesuatu, jika mereka memilih Opus daripada Claude Sonnet—model yang kurang mumpuni, tetapi mungkin cukup baik untuk tugas sehari-hari dan masalah kompleks yang tidak mencapai tingkat ilmu pengetahuan atau pengkodean mutakhir.
Batasan laju di Claude Code juga ditingkatkan untuk mengakomodasi penggunaan token yang lebih tinggi yang dihasilkan oleh pengaturan Extra dan Max.
Tim keselarasan Anthropic mengatakan Opus 4.8 "mencapai titik tertinggi baru dalam ukuran sifat prososial kami seperti mendukung otonomi pengguna dan bertindak demi kepentingan terbaik pengguna." Secara lebih konkret: tingkat penipuan dan tingkat kerja sama penyalahgunaan jauh lebih rendah daripada Opus 4.7, dan sebanding dengan Claude Mythos Preview—model paling terkunci Anthropic.
Opus 4.8 juga empat kali lebih kecil kemungkinannya daripada 4.7 untuk membiarkan bug dalam kodenya sendiri lolos tanpa menandainya.
Perbandingan Mythos itu memerlukan konteks. Mythos adalah tingkatan di atas Opus secara keseluruhan—Anthropic menggambarkannya sebagai "lebih besar dan lebih cerdas daripada model Opus kami." Saat ini hanya ada sebagai pratinjau, dapat diakses oleh segelintir organisasi terkemuka yang melakukan pekerjaan keamanan siber melalui Project Glasswing.
AI Security Institute Inggris menemukan bahwa ia dapat secara otonom menyelesaikan "The Last Ones", simulasi serangan jaringan perusahaan 32 langkah yang biasanya membutuhkan waktu 20 jam bagi tim merah manusia. Itulah mengapa belum dijual. Anthropic mengatakan perlindungan siber yang lebih kuat sedang dalam proses, dan berharap dapat membawa model kelas Mythos kepada semua orang "dalam beberapa minggu mendatang."
Juga diluncurkan hari ini: alur kerja dinamis di Claude Code, dalam pratinjau penelitian. Fitur ini memungkinkan Claude menulis skrip orkestrasinya sendiri dan meluncurkan sub-agen paralel dalam satu sesi, memverifikasi output mereka, dan melaporkan kembali—persis seperti yang telah dilakukan Hermes selama beberapa waktu.
Alur kerja dinamis tersedia untuk pengguna paket Enterprise, Team, dan Max, dan Anthropic secara terbuka menyatakan bahwa mereka menggunakan lebih banyak token secara signifikan daripada sesi Claude Code standar.
Harga $5/$25 Anthropic terlihat sangat berbeda dibandingkan dengan apa yang telah dilakukan China belakangan ini.
DeepSeek V4 Pro membuat diskon 75% permanennya minggu lalu: $0,435 per juta token input dan $0,87 per juta token output. Xiaomi MiMo V2.5 Pro berjalan pada tarif yang sama melalui penyedia seperti OpenRouter.
Mode cepat Anthropic berharga $10 input dan $50 output per juta—lebih mahal dari Opus 4.8 standar itu sendiri, dan kira-kira 57 kali lebih banyak per token output daripada DeepSeek V4 Pro. Perusahaan telah menghabiskan jutaan dolar dalam inferensi pada model Amerika. Gunakan Opus secara liar dan perusahaan Anda dapat mencapai jutaan dolar dengan cukup cepat.
Jawaban Anthropic terhadap kesenjangan harga adalah kualitas dan keamanan. Pada SWE-bench Pro, Opus 4.8 mengalahkan kedua model Cina. Dalam hal keselarasan, tidak ada yang mendekati benchmark yang diterbitkan Anthropic.
Hal-hal tersebut penting di lingkungan produksi di mana model yang secara diam-diam bekerja sama dengan input buruk adalah risiko yang nyata—industri yang diatur, pekerjaan hukum, dan apa pun di mana "tampaknya baik-baik saja" bukanlah laporan pasca-insiden yang dapat diterima. Bagi yang lain, kesenjangan ini sulit untuk diabaikan.
Kami melakukan uji coding singkat untuk membuat game zombie 3D untuk melihat bagaimana Claude Opus 4.8 bersaing dengan ChatGPT dan DeepSeek, yang bisa dibilang merupakan pesaingnya yang paling populer dari AS dan Cina. Kami mengatur Opus 4.8 pada default high, GPT-5.5 pada high effort, dan DeepSeek V4 Pro pada high effort—tiga model, satu perintah, tanpa percobaan ulang.
GPT-5.5 selesai lebih dulu. Permainannya tidak memiliki visual zombie dan efek suara. Memang cepat, tapi sama sekali tidak sesuai dengan brief.
DeepSeek V4 Pro menempati posisi kedua dengan gerakan mouse, karakter zombie sungguhan, efek suara, mekanisme yang solid, dan estetika yang bersih. Tidak ada keluhan di sana.
Opus 4.8 membutuhkan waktu sekitar tiga kali lebih lama dari GPT-5.5, tetapi menghasilkan splash screen terbaik, desain zombie terbaik, mekanisme game terbaik, dan efek suara yang lumayan. Itu yang paling lambat, tetapi output terbaik. Namun, itu mungkin tidak cukup untuk membenarkan penggunaannya dibandingkan DeepSeek, mengingat kesenjangan biaya.
Semua game tersedia di Profil Itch.io kami. GPT-5.5 menghasilkan Zombie Typing, Opus menghasilkan Typing Dead, dan DeepSeek v4 Pro menghasilkan game tanpa nama yang langsung membawa Anda ke dalam aksi. Mari kita sebut saja TypeSeek.
Tinjauan komparatif lengkap akan segera hadir. Untuk saat ini: Claude Opus 4.8 mengkode lebih baik dari GPT-5.5 dan Opus 4.7 untuk jenis tugas ini, dengan harga yang sama yang telah ditetapkan Anthropic sejak 4.7. Developer yang sudah membayar $5 per juta token baru saja mendapatkan model yang lebih baik secara gratis.