Trang chủTrung tâm tin tức LBank
Anthropic ra mắt Claude Fable 5.1, vượt hơn gấp đôi phiên bản tiền nhiệm trên bài kiểm tra chuẩn quan trọng
anthropic-claude-fable-5-1
Anthropic ra mắt Claude Fable 5.1, vượt hơn gấp đôi phiên bản tiền nhiệm trên bài kiểm tra chuẩn quan trọng
Fable 5.1 và phiên bản bị giới hạn của nó, Mythos 5.1, xuất hiện ba tháng sau khi các biện pháp kiểm soát xuất khẩu buộc Anthropic phải gỡ Fable 5 khỏi mạng trong 18 ngày
2026-09-01 Nguồn:decrypt.co

Tóm tắt

  • Anthropic đã phát hành Claude Fable 5.1 và Claude Mythos 5.1 vào ngày 1 tháng 9, đạt 52.6% trên Terminal-Bench-Science 0.1 so với 24.7% của Fable 5, và 55.8% trên Terminal-Bench 4.0 so với 42.0%.
  • Đọc cache hiện giảm 75% chi phí, cắt giảm chi phí công việc điển hình khoảng 25% và các công việc đòi hỏi tác nhân cao lên đến 45%, với giá cơ bản không đổi ở mức 10 USD/50 USD cho mỗi triệu token.
  • Fable 5.1 không được bao gồm trong gói Pro hoặc các vị trí Team tiêu chuẩn, những gói này sẽ chạy nó bằng tín dụng sử dụng; các vị trí Max và Team hoặc Enterprise cao cấp được bao gồm trong giới hạn sử dụng hàng tuần lên đến 50%.

Anthropic đã phát hành Claude Fable 5.1 và Claude Mythos 5.1 vào thứ Ba, đây là bản cập nhật đầu tiên cho dòng mô hình lớp Mythos kể từ khi Fable 5 ra mắt vào ngày 9 tháng 6.

Công ty tuyên bố các mô hình AI mới là “tiên tiến nhất thế giới cho công việc lập trình và kiến thức”, và nó ra mắt ba tháng sau một chu kỳ phát hành đã bao gồm việc ngừng kiểm soát xuất khẩu kéo dài 18 ngày, một cuộc tranh cãi về giá giữa mùa hè về quyền truy cập đăng ký, và một bản phát hành Claude Opus 5 vào tháng 7 đã hạ giá Fable 5.

Vô số: Khi nào OpenAI sẽ phát hành GPT-6? Nhấn để đưa ra dự đoán của bạn.

Theo Anthropic, Fable 5.1 và Mythos 5.1 là cùng một mô hình cơ bản với các bộ lọc an toàn khác nhau được gắn vào. Fable 5.1 có sẵn rộng rãi cho bất kỳ ai có tài khoản Claude. Mythos 5.1 vẫn bị hạn chế đối với các chuyên gia an ninh mạng và khoa học đời sống đã được kiểm định thông qua Chương trình Xác minh An ninh mạng và Chương trình Xác minh Khoa học đời sống của Anthropic, đây là những chương trình kế nhiệm cho lộ trình truy cập Project Glasswing đã kiểm soát Mythos 5.

Các tiêu chuẩn thực sự đo lường điều gì

Con số nổi bật của Anthropic đến từ Terminal-Bench-Science 0.1, một tiêu chuẩn kiểm tra xem một tác nhân AI có thể thực hiện các nhiệm vụ nghiên cứu khoa học trong môi trường dòng lệnh hay không, được chấm điểm theo tỷ lệ đạt.

Fable 5.1 đạt 52.6% so với 24.7% của Fable 5 và 29.0% của Opus 5, cao hơn gấp đôi so với phiên bản tiền nhiệm.

Terminal-Bench 4.0 kiểm tra khả năng lập trình tác nhân thông qua một terminal—viết, chạy và gỡ lỗi mã qua các phiên dòng lệnh đa bước, được chấm điểm theo phần trăm nhiệm vụ hoàn thành đúng. Fable 5.1 đạt 55.8%, tăng từ 42.0% của Fable 5 và vượt qua 52.3% của Opus 5.

Mythos 5.1, chạy với các bộ lọc an ninh mạng nhẹ hơn, đạt 60.9% trên cùng bài kiểm tra; Anthropic cho biết sự khác biệt này phản ánh các nhiệm vụ mà hệ thống bảo vệ của họ đã chặn và chuyển hướng đến Opus 4.8.

Trong bài kiểm tra cuối cùng của nhân loại (Humanity's Last Exam), một bài kiểm tra suy luận đa ngành được xây dựng từ các câu hỏi cấp chuyên gia từ hàng tá lĩnh vực học thuật và được chấm điểm theo tỷ lệ đạt, Fable 5.1 đạt 60.9% khi không có công cụ bên ngoài và 65.0% khi có công cụ, cả hai đều vượt qua Opus 5, cho thấy đây là mô hình tiên tiến nhất của Anthropic cho mục đích học thuật.

Nơi nó vượt trội so với Opus 5, và nơi các con số trở nên phức tạp hơn

Opus 5 ra mắt vào tháng 7 với chi phí mỗi token bằng một nửa Fable 5 trong khi vượt trội hơn Fable 5 trên hầu hết các tiêu chuẩn chính, khiến mô hình hàng đầu này trở nên thừa thãi đối với hầu hết người dùng trả phí.

Fable 5.1 đã đảo ngược tình thế: Nó hiện vượt qua Opus 5 trên mọi tiêu chuẩn mà Anthropic công bố, bao gồm cả những tiêu chuẩn mà Opus 5 trước đây đã đánh bại Fable 5.

Nhưng Fable 5.1 vẫn có chi phí mỗi token gấp đôi Opus 5—10 USD đầu vào và 50 USD đầu ra so với 5 USD và 25 USD của Opus 5. Token là đơn vị thông tin cơ bản mà một mô hình có thể xử lý (thường khoảng hai phần ba một từ tiếng Anh trung bình), và các công ty trả tiền để sử dụng vì các quy trình làm việc nặng thường làm cạn kiệt nhanh chóng hạn ngạch đã đặt trong các gói đăng ký.

Anthropic tự quảng bá mô hình này dựa trên mức độ nỗ lực hơn là điểm số thô: họ nói rằng việc chạy Fable 5.1 ở mức độ suy luận thấp hoặc trung bình sẽ khớp hoặc vượt trội so với kết quả cũ của Fable 5 với chi phí thấp hơn nhiều, đồng thời dành các cấp độ nỗ lực cao nhất cho các vấn đề làm khó mọi thứ khác.

Đối với công việc thường ngày, lập luận bỏ qua hoàn toàn Opus 5 trở nên yếu hơn khi mức độ nỗ lực giảm xuống.

Quyền truy cập tuân theo cách phân chia tương tự đã áp dụng cho Fable 5 sau nhiều tháng Anthropic điều chỉnh các điều khoản. Trên các gói Pro và các vị trí Team hoặc Enterprise tiêu chuẩn, Fable 5.1 được tính hoàn toàn từ tín dụng sử dụng trả theo mức dùng API, vì nó không nằm trong giới hạn hàng tuần của các gói đó. Trên các gói Max và các vị trí Team hoặc Enterprise cao cấp, nó được bao gồm như một phần tiêu chuẩn của gói đăng ký với tối đa 50% mức sử dụng hàng tuần.

Claude Fable 5.1 hiện đã có sẵn trên Claude API, Amazon Bedrock, Google Cloud và Microsoft Foundry, với ID mô hình "claude-fable-5-1."