
Claude Opus 5 ra mắt hôm nay. Nó rẻ hơn để các doanh nghiệp sử dụng so với mô hình hàng đầu của Anthropic, Claude Fable 5, mà công ty đã định vị là sản phẩm tiên phong hàng ngày cho người dùng trả phí. Hơn nữa, Opus 5 còn vượt trội hơn Fable 5 trên các tiêu chuẩn quan trọng.
Để hiểu vị trí của Opus 5: Dòng sản phẩm của Anthropic có bốn cấp độ. Haiku nhanh và rẻ. Sonnet là tầm trung. Opus là dòng chuyên xử lý nặng. Trên đó là lớp Mythos—một cấp độ được Anthropic giới thiệu vào mùa xuân này—bao gồm Claude Fable 5 cho công chúng, và Claude Mythos 5, một phiên bản ít hạn chế hơn, dành riêng cho các nhà nghiên cứu an ninh mạng được kiểm định và các nhà điều hành cơ sở hạ tầng quan trọng thông qua Project Glasswing.
Fable 5 đã có một khởi đầu khó khăn với tư cách là flagship dành cho người đăng ký. Nó ra mắt vào ngày 9 tháng 6, bị rút khỏi toàn cầu ba ngày sau đó khi chính phủ Hoa Kỳ ban hành lệnh kiểm soát xuất khẩu khẩn cấp với lý do có lỗ hổng jailbreak, và trở lại vào ngày 30 tháng 6—chỉ để chuyển ngay sang mô hình chỉ dùng tín dụng, không còn được bao gồm trong các gói tiêu chuẩn. Opus 5 hiện lấp đầy vị trí mà Fable 5 không thể duy trì.
Lovable, một nền tảng nhà phát triển với hàng triệu người dùng, đã chạy Opus 5 trên các đánh giá nội bộ của mình và nhận thấy những cải tiến vượt xa điểm số thô: "Nó không chỉ tốt hơn trong các tác vụ mã hóa tác tử khó nhất của chúng tôi, tăng 22% so với Opus 4.7, mà còn ổn định hơn, với ít biến động hơn đáng kể giữa các lần chạy," Fabian Hedin cho biết trong một tuyên bố được Anthropic chia sẻ.
Nghe có vẻ lạ, nhưng Opus đánh bại Fable trên hầu hết mọi khía cạnh quan trọng đối với người dùng hàng ngày, mà không được gắn nhãn là lớp Mythos như Fable.
Trên Frontier-Bench v0.1—một tiêu chuẩn đánh giá liệu các tác tử mã hóa AI có thể hoàn thành các tác vụ kỹ thuật phần mềm thực tế từ đầu đến cuối, được tính bằng tỷ lệ phần trăm các tác vụ đã vượt qua—Opus 5 đạt 43.3%. Fable 5 đạt 33.7%. GPT-5.6 Sol của OpenAI, đối thủ thương mại chính của Anthropic, đạt 34.4%.
Khoảng cách lớn nhất nằm ở ARC-AGI-3, một bài kiểm tra khả năng giải quyết vấn đề thực sự được xây dựng xung quanh các câu đố mới mà mô hình không thể ghi nhớ từ dữ liệu đào tạo, được tính bằng tỷ lệ phần trăm các câu đố đã giải. Opus 5 đạt 30.2%; GPT-5.6 Sol đạt 7.8%; và Fable 5 hoàn toàn không được kiểm tra. Trên GDPval-AA v2—một tiêu chuẩn công việc tri thức được chấm điểm qua hệ thống xếp hạng Elo, hệ thống xếp hạng kiểu cờ vua được sử dụng để đo lường hiệu suất tương đối trong các nhiệm vụ chuyên môn thực tế—Opus 5 đạt 1,861 so với 1,747 của Fable 5 và 1,736 của GPT-5.6 Sol.
Zapier đã thử nghiệm Opus 5 trên AutomationBench, một bài đánh giá chấm điểm liệu một mô hình có thể thực hiện toàn bộ quy trình làm việc kinh doanh từ đầu đến cuối mà không cần sự trợ giúp của con người. Phán quyết của họ: mô hình "đã lấy một sổ làm việc về tình trạng tài khoản thô và chạy một chuỗi ngăn chặn khách hàng bỏ đi hoàn chỉnh từ đầu đến cuối: gắn cờ các tài khoản có nguy cơ, thông báo cho chủ sở hữu phù hợp và tóm tắt cho các hoạt động giữ chân khách hàng. Các mô hình trước đây không vượt qua; Opus 5 đạt 100%."
Anthropic cũng đang giới thiệu Opus 5 như một bản nâng cấp nghiên cứu. Ultima Genomics, một công ty giải trình tự DNA, cho biết mô hình "hoạt động giống một nhà khoa học cẩn thận hơn bất kỳ mô hình nào chúng tôi từng chạy. Nó tìm kiếm các bài kiểm tra thống kê phù hợp để loại trừ các yếu tố gây nhiễu, kiểm tra chéo kết quả của chính nó bằng các phương pháp độc lập và duy trì lộ trình thông qua các phân tích đa bước dài."
Tuy nhiên, hai lĩnh vực này—pháp lý và y tế—là những lĩnh vực duy nhất mà Fable 5 vượt trội hơn một chút.
Bản phát hành này ra mắt một tuần sau khi Moonshot AI, một startup có trụ sở tại Bắc Kinh được Alibaba hậu thuẫn, ra mắt Kimi K3—một mô hình mã nguồn mở 2.8 nghìn tỷ tham số (nghĩa là bất kỳ ai cũng có thể tải xuống mã cơ bản để chạy độc lập) mà Moonshot mô tả là hệ thống AI mở lớn nhất thế giới. Các tiêu chuẩn độc lập luôn xếp Kimi K3 thứ ba tổng thể, sau cả Fable 5 và GPT-5.6 Sol, nhưng đánh bại hai mô hình đó ở một số lĩnh vực cụ thể.
Opus 5 hiện có sẵn thông qua API với giá 5 đô la cho mỗi triệu token đầu vào và 25 đô la cho mỗi triệu token đầu ra. (Token là đơn vị thông tin cơ bản mà mô hình AI có thể xử lý ở cả đầu vào và đầu ra). Chế độ Nhanh (Fast mode) chạy với tốc độ xấp xỉ 2.5 lần tốc độ mặc định cũng có sẵn, với giá gấp đôi giá cơ bản—10 đô la cho mỗi triệu token đầu vào và 50 đô la cho mỗi triệu token đầu ra.
Bản phát hành này có thể chấm dứt lo ngại về việc Fable 5 không có sẵn rộng rãi. Opus cũng có sẵn thông qua đăng ký cho mọi người.