
Grok 4.5 của Elon Musk’s SpaceXAI đã được phát hành vào thứ Tư, đây là mô hình công khai đầu tiên của công ty kể từ khi thương vụ sáp nhập SpaceX-xAI hoàn tất vào tháng 2 và thỏa thuận trị giá 60 tỷ USD sắp tới của SpaceX để mua lại Cursor. Nó nhắm đến các lập trình viên, kỹ sư và những người mà công ty gọi là "nhân viên tri thức"—một danh mục rõ ràng bao gồm tất cả mọi người từ nhà phát triển phần mềm đến luật sư xem xét hợp đồng và đội ngũ tài chính xây dựng các mô hình Excel.
Điểm mạnh mà công ty đưa ra không phải là nó là mô hình tốt nhất. Mà là nó rẻ, ít nhất là đối với một mô hình phương Tây. Grok 4.5 có giá 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra. Claude Opus 4.8, mô hình chủ lực chính của Anthropic, có giá 5 USD đầu vào và 25 USD đầu ra. GPT 5.6 Sol, mô hình cao cấp mới của OpenAI cũng ra mắt vào thứ Tư, có giá 5 USD đầu vào và 30 USD đầu ra.
Musk đã đăng trên X và làm rõ vị trí thực sự của mô hình mới của ông. Ông gọi nó là "tương đương khoảng Opus 4.7, nhưng nhanh hơn nhiều." Opus 4.7 là mô hình chủ lực trước đây của Anthropic; Opus 4.8 đã thay thế nó. Claude Fable 5 hiện là sản phẩm cao cấp nhất của Anthropic.
Ông coi đó là một sự đánh đổi có chủ đích: tốc độ và chi phí thay vì khả năng thô, với các kỹ sư tại Tesla và SpaceX là bằng chứng về tiện ích trong thế giới thực.
SpaceXAI đã công bố bốn kết quả điểm chuẩn khi ra mắt, và bức tranh có vẻ trái chiều. DeepSWE 1.1 đo lường độ tin cậy của AI trong việc khắc phục các lỗi phần mềm thực tế do nhà phát triển gửi, sử dụng thiết lập thử nghiệm tiêu chuẩn để các mô hình có thể được so sánh công bằng, được chấm điểm theo tỷ lệ phần trăm các vấn đề đã được khắc phục. Grok 4.5 đạt 53%, đứng sau Claude Opus 4.8 với 59% và GPT 5.5 với 67%. Claude Fable 5, mô hình tiên phong của Anthropic, đứng đầu bảng với 70%.
Trên SWE Bench Pro, một điểm chuẩn khác đo lường tập hợp các vấn đề kỹ thuật phần mềm được chấm điểm theo tỷ lệ giải quyết, Grok 4.5 đạt 64.7%, đủ để vượt qua GPT 5.5 với 58.6% trong thử nghiệm cụ thể đó. Opus 4.8 vẫn dẫn đầu với 69.2%, và Fable 5 đạt 80.4%.
Điểm chuẩn của công ty so sánh với GPT 5.5, chứ không phải GPT 5.6, vì GPT 5.6 cũng ra mắt vào thứ Tư, vài giờ sau thông báo về Grok 4.5.
SpaceXAI đã đào tạo Grok 4.5 với sự hợp tác của Cursor AI mới được mua lại trên hàng chục nghìn GPU Nvidia GB300 bên trong Colossus, siêu máy tính Memphis với tổng dung lượng hơn 200,000 GPU. Các phòng thí nghiệm có mô hình đứng trên Grok 4.5 trong các điểm chuẩn tương tự không sở hữu phần cứng nào gần với con số đó. Mô hình được tạo ra có tính cạnh tranh, nhưng không phải là tốt nhất.
Kiểu mẫu đó đã theo Grok qua nhiều lần phát hành. SpaceXAI liên tục xuất hiện với năng lực tính toán khổng lồ và điểm số ở vị trí thứ ba. Điều thay đổi với Grok 4.5 là giá cả và tín hiệu đào tạo.
Lý lẽ tốt hơn không phải là hiệu suất thô; đó là bài toán hiệu quả. Trong các tác vụ SWE Bench Pro, Grok 4.5 sử dụng trung bình 15.954 token đầu ra để hoàn thành mỗi công việc. Opus 4.8 tiêu tốn 67.020 token cho cùng một công việc, một khoảng cách 4.2 lần.
Đối với các nhóm chạy AI với khối lượng lớn, sự khác biệt đó cộng dồn thành khoản tiết kiệm đáng kể ngoài mức giá thấp hơn cho mỗi token. Ngay cả khi Grok 4.5 đạt điểm thấp trong các điểm chuẩn chất lượng, các token rẻ hơn và hiệu quả sử dụng cao hơn cho phép nhiều lần lặp hơn mà không tốn quá nhiều chi phí.
Mô hình này cũng chạy ở tốc độ 80 token mỗi giây, nằm trong lãnh thổ của các mô hình nhanh. Grok 4.5 được đào tạo trên dữ liệu phiên của nhà phát triển từ Cursor, bao gồm các dấu vết gỡ lỗi và chỉnh sửa mã thực tế thay vì các kho lưu trữ tĩnh. Như Musk đã thừa nhận tại tòa án, các hoạt động đào tạo của xAI đã từng bị giám sát trước đây; lần này quy trình chạy qua một nền tảng mà SpaceX đang trong quá trình mua lại hoàn toàn.
Đối với các nhà phát triển thực hiện các tác vụ mã hóa khối lượng lớn, phép toán này hiệu quả: khả năng tương đương Opus 4.7 với chi phí token đầu vào ít hơn 60%. Đối với bất kỳ ai đang theo đuổi giới hạn, Claude Fable 5 dẫn đầu mọi danh mục mà SpaceXAI đã chọn công bố. Thử nghiệm nhanh của chúng tôi bằng cách sử dụng bản dựng Grok trên Hermes cho thấy kết quả kém ấn tượng đối với viết sáng tạo và chấp nhận được đối với một tác vụ mã hóa đơn giản.
Mô hình này có sẵn thông qua API, trên Hermes và bản dựng Grok với nửa triệu token ngữ cảnh (ít hơn một chút so với 400.000 từ). Người dùng châu Âu sẽ phải đợi trước khi sử dụng nó; SpaceXAI cho biết Grok 4.5 sẽ đến EU vào giữa tháng 7.