Trang chủTrung tâm tin tức LBank
Anthropic Claude Opus 4.8 đã ra mắt: Lập trình AI nâng cao, Bảo mật thông minh hơn — Giá vẫn cao ngất ngưởng
anthropic-claude-opus-4-8-better-ai-coding-smarter-safety-huge-price
Anthropic Claude Opus 4.8 đã ra mắt: Lập trình AI nâng cao, Bảo mật thông minh hơn — Giá vẫn cao ngất ngưởng
Mô hình AI hàng đầu mới nhất của Anthropic, Claude Opus 4.8, ra mắt với khả năng suy luận sắc bén hơn, sự căn chỉnh chặt chẽ hơn và mức giá không thay đổi.
2026-05-28 Nguồn:decrypt.co

Tóm lược

  • Anthropic đã phát hành Claude Opus 4.8 vào thứ Năm, chỉ sáu tuần sau Opus 4.7.
  • Bản cập nhật đi kèm với những cải tiến về kỹ thuật phần mềm, khả năng suy luận và các tiêu chuẩn sử dụng máy tính với mức giá không đổi: 5 USD/25 USD cho mỗi triệu token đầu vào/đầu ra.
  • Điểm an toàn (alignment scores) của Opus 4.8 hiện đã ngang bằng với Claude Mythos Preview, mô hình tiên tiến bị hạn chế của Anthropic, với tỷ lệ hành vi lừa đảo hoặc dễ bị lạm dụng thấp hơn đáng kể so với phiên bản tiền nhiệm.

Sáu tuần. Đó là khoảng thời gian Anthropic cần để chuyển từ Opus 4.7 lên Opus 4.8.

Mô hình mới nhanh hơn và thông minh hơn trong các bài kiểm tra benchmark, đồng thời đi kèm với một bộ tính năng mới—nhưng giá không thay đổi: 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra, vẫn như trước.

Ngoài ra còn có chế độ nhanh chạy cùng một mô hình với tốc độ nhanh hơn 2,5 lần với giá 10 USD đầu vào và 50 USD đầu ra cho mỗi triệu. Anthropic cho biết mức giá đó hiện rẻ hơn ba lần so với chi phí của chế độ nhanh trên các mô hình trước đây, đây là một cách nói tế nhị rằng trước đây nó đắt hơn nhiều.

SWE-bench Pro có lẽ là tiêu chuẩn quan trọng nhất để theo dõi và đánh giá mức độ tốt của mô hình này. Nó đo lường liệu một AI có thực sự có thể giải quyết các vấn đề kỹ thuật phần mềm đa ngôn ngữ khó khăn được lấy từ các cơ sở mã sản xuất thực tế hay không—được chấm điểm bằng phần trăm các vấn đề đã vượt qua.

Trong bài kiểm tra đó, Opus 4.8 đạt 69,2%, tăng từ 64,3% của Opus 4.7. GPT-5.5 của OpenAI đạt 58,6%, và Gemini 3.1 Pro của Google theo sau với 54,2%. Đối với một mô hình ở cùng mức giá, đó là một bước nhảy vọt đáng kể.

Trong bài kiểm tra "Kỳ thi cuối cùng của nhân loại" (Humanity's Last Exam)—các câu hỏi cấp độ chuyên gia trên hàng chục lĩnh vực học thuật, được chấm điểm theo phần trăm đúng—Opus 4.8 đạt 49,8% khi không có công cụ và 57,9% khi có công cụ, vượt trội so với cả ba đối thủ. OSWorld-Verified, kiểm tra các tác vụ sử dụng máy tính trong thế giới thực như điều hướng giao diện phần mềm, đạt 83,4%, nhích nhẹ so với điểm 82,8% của Opus 4.7.

Điểm yếu duy nhất: Terminal-Bench 2.1, đo lường hiệu suất AI trong các tác vụ dòng lệnh. GPT-5.5 dẫn đầu với 78,2%, trong khi Opus 4.8 đạt 74,6%—tốt hơn 66,1% của Opus 4.7 và vượt trên 70,3% của Gemini, nhưng vị trí thứ hai vẫn là thua cuộc.

Năm cách để suy nghĩ

Anthropic hiện cho phép người dùng kiểm soát mức độ "suy nghĩ" của mô hình. "High" là mặc định và xử lý hầu hết các tác vụ tốt, trong khi "Extra"—được gọi là "xhigh" bên trong Claude Code—chi tiêu nhiều tài nguyên tính toán hơn cho các vấn đề khó hơn. "Max" là mức cao nhất. "Low" và "Medium" dành ít token hơn cho cùng một tác vụ, tiết kiệm thời gian đổi lấy độ chính xác.

Kiểm soát mức độ nỗ lực nằm cạnh bộ chọn mô hình trong claude.ai và Cowork, có sẵn trên tất cả các gói. Anthropic cho biết chế độ High mặc định sử dụng số token tương đương với mặc định của Opus 4.7 nhưng mang lại kết quả tốt hơn—điều này có thể là kỹ thuật ấn tượng hoặc cách truyền thông tốt, và có lẽ là cả hai.

Cũng cần lưu ý rằng bộ mã hóa token mới của Anthropic cho Opus sử dụng nhiều token hơn cho mỗi tác vụ. Vì vậy, người dùng Claude chắc chắn sẽ tốn nhiều tiền hơn để hoàn thành công việc, nếu họ chọn Opus thay vì Claude Sonnet—một mô hình kém mạnh mẽ hơn, nhưng có lẽ đủ tốt cho các tác vụ hàng ngày và các vấn đề phức tạp không đạt đến cấp độ khoa học hoặc lập trình tiên tiến.

Giới hạn tốc độ trong Claude Code cũng được nâng lên để phù hợp với việc tiêu thụ token cao hơn mà các cài đặt Extra và Max tạo ra.

Gần an toàn như Claude Mythos

Nhóm nghiên cứu về tính an toàn của Anthropic cho biết Opus 4.8 "đạt mức cao mới trong các thước đo về đặc điểm ủng hộ xã hội như hỗ trợ quyền tự chủ của người dùng và hành động vì lợi ích tốt nhất của người dùng." Cụ thể hơn: tỷ lệ lừa đảo và tỷ lệ hợp tác lạm dụng thấp hơn đáng kể so với Opus 4.7, và tương đương với Claude Mythos Preview—mô hình được kiểm soát chặt chẽ nhất của Anthropic.

Opus 4.8 cũng ít có khả năng gấp bốn lần so với 4.7 trong việc bỏ qua các lỗi trong mã của chính nó mà không gắn cờ.

Sự so sánh với Mythos cần được hiểu rõ hơn. Mythos hoàn toàn ở một cấp độ cao hơn Opus—Anthropic mô tả nó là "lớn hơn và thông minh hơn các mô hình Opus của chúng tôi." Hiện tại, nó chỉ tồn tại dưới dạng bản xem trước, có thể truy cập bởi một số ít các tổ chức được kiểm duyệt đang thực hiện công việc an ninh mạng thông qua Project Glasswing.

Viện An ninh AI của Vương quốc Anh nhận thấy nó có thể tự động hoàn thành "The Last Ones," một mô phỏng tấn công mạng doanh nghiệp gồm 32 bước mà thông thường các nhóm đỏ của con người phải mất 20 giờ. Đó là lý do tại sao nó chưa được bán ra. Anthropic cho biết các biện pháp bảo vệ an ninh mạng mạnh mẽ hơn đang được triển khai và dự kiến sẽ mang các mô hình cấp Mythos đến với mọi người "trong vài tuần tới."

Cũng được ra mắt hôm nay: quy trình làm việc động trong Claude Code, trong bản xem trước nghiên cứu. Tính năng này cho phép Claude tự viết các tập lệnh điều phối và khởi tạo các tác nhân phụ song song trong một phiên duy nhất, xác minh đầu ra của chúng và báo cáo lại—giống như những gì Hermes đã làm từ lâu.

Quy trình làm việc động có sẵn cho người dùng gói Enterprise, Team và Max, và Anthropic thẳng thắn rằng chúng tiêu tốn nhiều token hơn đáng kể so với một phiên Claude Code tiêu chuẩn.

Khoảng cách giá ngày càng nới rộng

Mức giá 5 USD/25 USD của Anthropic trông rất khác so với những gì Trung Quốc đã làm gần đây.

DeepSeek V4 Pro đã giảm giá vĩnh viễn 75% vào tuần trước: 0,435 USD cho mỗi triệu token đầu vào và 0,87 USD cho mỗi triệu token đầu ra. Xiaomi MiMo V2.5 Pro chạy với cùng mức giá thông qua các nhà cung cấp như OpenRouter.

Chế độ nhanh của Anthropic có giá 10 USD đầu vào và 50 USD đầu ra cho mỗi triệu—đắt hơn cả Opus 4.8 tiêu chuẩn, và khoảng 57 lần cho mỗi token đầu ra so với DeepSeek V4 Pro. Các tập đoàn đã chi hàng triệu đô la cho việc suy luận trên các mô hình của Mỹ. Nếu sử dụng Opus một cách thoải mái, doanh nghiệp của bạn có thể nhanh chóng chạm đến hàng triệu đô la.

Câu trả lời của Anthropic cho khoảng cách giá là chất lượng và an toàn. Trên SWE-bench Pro, Opus 4.8 đánh bại cả hai mô hình của Trung Quốc. Về tính an toàn, cả hai đều không thể sánh với các tiêu chuẩn đã công bố của Anthropic.

Những điều đó rất quan trọng trong môi trường sản xuất nơi một mô hình âm thầm hợp tác với các đầu vào xấu là một rủi ro thực sự—các ngành công nghiệp được quản lý, công việc pháp lý và bất kỳ thứ gì mà "có vẻ ổn" không phải là một báo cáo sau sự cố có thể chấp nhận được. Đối với những người khác, khoảng cách này rất khó bỏ qua.

Chúng tôi đã thử nghiệm

Chúng tôi đã chạy một bài kiểm tra mã hóa nhanh để tạo một trò chơi zombie 3D để xem Claude Opus 4.8 so với ChatGPT và DeepSeek, được cho là những đối thủ cạnh tranh phổ biến nhất của nó từ Mỹ và Trung Quốc. Chúng tôi đặt Opus 4.8 ở chế độ high mặc định, GPT-5.5 ở chế độ high effort, và DeepSeek V4 Pro ở chế độ high effort—ba mô hình, một yêu cầu, không thử lại.

GPT-5.5 hoàn thành trước. Trò chơi của nó không có hình ảnh zombie và không có hiệu ứng âm thanh. Chắc chắn là nhanh, nhưng nó hoàn toàn bỏ lỡ yêu cầu.

DeepSeek V4 Pro về thứ hai với chuyển động chuột, nhân vật zombie thực tế, hiệu ứng âm thanh, cơ chế vững chắc và giao diện gọn gàng. Không có gì phải phàn nàn ở đây.

Opus 4.8 mất khoảng gấp ba lần thời gian so với GPT-5.5, nhưng mang lại màn hình khởi động đẹp nhất, thiết kế zombie tốt nhất, cơ chế trò chơi tốt nhất và hiệu ứng âm thanh khá. Nó chậm nhất, nhưng cho ra kết quả tốt nhất. Tuy nhiên, điều đó có lẽ không đủ để biện minh cho việc sử dụng nó thay vì DeepSeek, với khoảng cách chi phí.

Tất cả các trò chơi đều có sẵn trên Hồ sơ Itch.io của chúng tôi. GPT-5.5 tạo ra Zombie Typing, Opus tạo ra Typing Dead, và DeepSeek v4 Pro tạo ra một trò chơi không tên đưa bạn thẳng vào hành động. Hãy gọi nó là TypeSeek.

Một bài đánh giá so sánh đầy đủ sẽ sớm ra mắt. Hiện tại: Claude Opus 4.8 mã hóa tốt hơn GPT-5.5 và Opus 4.7 cho loại tác vụ này, với cùng mức giá mà Anthropic đã tính từ phiên bản 4.7. Các nhà phát triển đã trả 5 USD cho mỗi triệu token giờ đây đã có một mô hình tốt hơn miễn phí.