BerandaPusat Berita LBank
Grok 4.5 Baru Telah Dirilis. Elon Musk Klaim Mampu Bersaing dengan Claude Opus Tahun Lalu
grok-4-5-elon-musk-claude-opus
Grok 4.5 Baru Telah Dirilis. Elon Musk Klaim Mampu Bersaing dengan Claude Opus Tahun Lalu
Model pengkodean baru SpaceXAI lebih murah dan lebih cepat dibandingkan model unggulan Anthropic dan OpenAI—dan menurut pengakuan Musk sendiri, setidaknya satu generasi di belakang mereka.
2026-07-08 Sumber:decrypt.co

Ringkasan

  • SpaceXAI merilis Grok 4.5 pada 8 Juli dengan harga $2 per juta token input dan $6 per juta output, kurang dari setengah harga model sebanding dari Anthropic dan OpenAI.
  • Elon Musk mengumumkan di X bahwa model tersebut "secara kasar sebanding dengan Opus 4.7," model unggulan Anthropic sebelumnya yang kini digantikan oleh Opus 4.8, sambil mengunggulkan kecepatan dan biaya dibandingkan kinerja tolok ukur.
  • Grok 4.5 belum tersedia di Uni Eropa; SpaceXAI menyatakan akses di Eropa diharapkan pada pertengahan Juli.

SpaceXAI milik Elon Musk merilis Grok 4.5 pada hari Rabu, model publik pertamanya sejak merger SpaceX-xAI ditutup pada Februari dan kesepakatan SpaceX senilai $60 miliar yang sedang berlangsung untuk mengakuisisi Cursor. Model ini menargetkan pengembang, insinyur, dan apa yang disebut perusahaan sebagai "pekerja pengetahuan"—kategori yang tampaknya mencakup semua orang mulai dari pengembang perangkat lunak hingga pengacara yang meninjau kontrak hingga tim keuangan yang membangun model Excel.

Penawaran perusahaan bukanlah bahwa itu adalah model terbaik. Ini adalah bahwa itu murah, setidaknya untuk model Barat. Grok 4.5 berharga $2 per juta token input dan $6 per juta output. Claude Opus 4.8, model unggulan utama Anthropic, berharga $5 input dan $25 output. GPT 5.6 Sol, model tier teratas baru OpenAI yang juga diluncurkan pada hari Rabu, dihargai $5 input dan $30 output.

Musk mengumumkan di X dan mengklarifikasi posisi sebenarnya model barunya. Ia menyebutnya "secara kasar sebanding dengan Opus 4.7, tetapi jauh lebih cepat." Opus 4.7 adalah model unggulan Anthropic sebelumnya; Opus 4.8 sejak itu telah menggantikannya. Claude Fable 5 kini merupakan penawaran teratas Anthropic.

Dia membingkainya sebagai pertukaran yang disengaja: kecepatan dan biaya di atas kemampuan mentah, dengan insinyur di Tesla dan SpaceX sebagai bukti utilitas dunia nyata.

Apa yang sebenarnya ditunjukkan oleh tolok ukur

SpaceXAI menerbitkan empat hasil tolok ukur saat peluncuran, dan gambarannya beragam. DeepSWE 1.1 mengukur seberapa andal AI dapat menutup bug perangkat lunak nyata yang diajukan oleh pengembang, menggunakan pengaturan pengujian standar sehingga model dapat dibandingkan secara adil, dinilai berdasarkan persentase masalah yang diperbaiki. Grok 4.5 mencetak 53%, di belakang Claude Opus 4.8 dengan 59% dan GPT 5.5 dengan 67%. Claude Fable 5, model perbatasan Anthropic, menduduki puncak grafik dengan 70%.

Pada SWE Bench Pro, tolok ukur lain yang mengukur kumpulan masalah rekayasa perangkat lunak yang dinilai berdasarkan tingkat resolusi, Grok 4.5 mencetak 64,7%, cukup untuk mengalahkan GPT 5.5 dengan 58,6% pada pengujian khusus itu. Opus 4.8 masih memimpin dengan 69,2%, dan Fable 5 berada di 80,4%.

Tolok ukur perusahaan membandingkan dengan GPT 5.5, bukan GPT 5.6, karena yang terakhir juga diluncurkan pada hari Rabu, beberapa jam setelah pengumuman Grok 4.5.

SpaceXAI melatih Grok 4.5 bekerja sama dengan Cursor AI yang baru diakuisisi pada puluhan ribu GPU Nvidia GB300 di dalam Colossus, superkomputer Memphis dengan total kapasitas lebih dari 200.000 GPU. Laboratorium yang modelnya berada di atasnya pada tolok ukur yang sama tidak memiliki perangkat keras yang mendekati itu. Model yang keluar kompetitif, hanya saja bukan yang pertama.

Pola tersebut telah diikuti oleh Grok di beberapa rilis. SpaceXAI secara konsisten muncul dengan komputasi besar dan skor peringkat ketiga. Apa yang berubah dengan Grok 4.5 adalah harga dan sinyal pelatihan.

Di mana argumen untuk itu sebenarnya berlaku

Argumen yang lebih baik bukanlah kinerja mentah; itu adalah perhitungan efisiensi. Pada tugas SWE Bench Pro, Grok 4.5 menggunakan rata-rata 15.954 token output untuk menyelesaikan setiap pekerjaan. Opus 4.8 menghabiskan 67.020 token untuk pekerjaan yang sama, selisih 4,2x.

Untuk tim yang menjalankan AI dalam volume besar, perbedaan itu terakumulasi menjadi penghematan nyata di atas harga per token yang sudah lebih rendah. Bahkan dengan Grok 4.5 mencetak skor yang sangat rendah dalam tolok ukur kualitas, token yang lebih murah dan efisiensi yang lebih tinggi dalam penggunaan memungkinkan lebih banyak iterasi tanpa menghabiskan terlalu banyak.

Model ini juga berjalan pada 80 token per detik, yang merupakan wilayah model cepat. Grok 4.5 dilatih menggunakan data sesi pengembang dari Cursor, termasuk jejak debugging dan edit kode nyata daripada repositori statis. Seperti yang diakui Musk di pengadilan, praktik pelatihan xAI sebelumnya telah menarik pengawasan; kali ini pipeline berjalan melalui platform yang sedang dalam proses dibeli secara langsung oleh SpaceX.

Untuk pengembang yang menjalankan tugas pengodean bervolume tinggi, perhitungannya berhasil: kira-kira kemampuan Opus 4.7 dengan biaya 60% lebih rendah per token input. Bagi siapa pun yang mengejar batas terdepan, Claude Fable 5 memimpin setiap kategori yang dipilih SpaceXAI untuk diterbitkan. Uji cepat kami menggunakan Grok yang dibangun di Hermes cukup mengecewakan untuk penulisan kreatif dan dapat diterima untuk tugas pengodean sederhana.

Model ini tersedia melalui API, di Hermes dan Grok build dengan setengah juta token konteks (sedikit kurang dari 400.000 kata). Pengguna Eropa harus menunggu sebelum menggunakannya; SpaceXAI mengatakan Grok 4.5 akan tersedia di Uni Eropa pada pertengahan Juli.