Trang chủTrung tâm tin tức LBank
DeepSeek V4 Đã Ra Mắt—Phiên Bản Pro Giá Chỉ Bằng 2% So Với GPT 5.5 Pro
deepseek-v4-launch-pro-version-costs-less-gpt-5-pro
DeepSeek V4 Đã Ra Mắt—Phiên Bản Pro Giá Chỉ Bằng 2% So Với GPT 5.5 Pro
Phòng thí nghiệm Trung Quốc từng gây chấn động Phố Wall vừa ra mắt mô hình lớn nhất và hiệu quả nhất của mình, chỉ vài giờ sau khi OpenAI phát hành GPT-5.5.
2026-04-24 Nguồn:decrypt.co

Tóm tắt

  • DeepSeek đã phát hành mô hình V4-Pro mới với 1.6 nghìn tỷ tham số.
  • Chi phí là 1.74 USD / 3.48 USD cho mỗi triệu token đầu vào/đầu ra, xấp xỉ 1/20 giá của Claude Opus 4.7 và rẻ hơn 98% so với GPT 5.5 Pro.
  • DeepSeek đã đào tạo V4 một phần trên chip Huawei Ascend, lách các hạn chế xuất khẩu của Hoa Kỳ, và cho biết rằng một khi 950 siêu nút mới đi vào hoạt động vào cuối năm 2026, giá vốn đã thấp của mô hình Pro sẽ còn giảm hơn nữa.

DeepSeek đã trở lại, và xuất hiện vài giờ sau khi OpenAI ra mắt GPT-5.5. Trùng hợp ư? Có thể. Nhưng nếu bạn là một phòng thí nghiệm AI của Trung Quốc mà chính phủ Hoa Kỳ đã cố gắng kìm hãm bằng lệnh cấm xuất khẩu chip trong ba năm qua, thì khả năng căn thời điểm của bạn sẽ trở nên rất sắc bén.

Phòng thí nghiệm có trụ sở tại Hàng Châu hôm nay đã phát hành các phiên bản xem trước của DeepSeek-V4-Pro và DeepSeek-V4-Flash, cả hai đều là mã nguồn mở, cả hai đều có cửa sổ ngữ cảnh một triệu token. Điều đó có nghĩa là bạn có thể làm việc với một ngữ cảnh có kích thước xấp xỉ Bộ ba Chúa tể những chiếc nhẫn trước khi mô hình sụp đổ. Cả hai cũng có giá thấp hơn đáng kể so với bất kỳ sản phẩm tương tự nào ở phương Tây, và cả hai đều miễn phí cho những ai có khả năng chạy cục bộ.

Sự đột phá lớn cuối cùng của DeepSeek—R1 vào tháng 1 năm 2025—đã xóa sổ 600 tỷ USD khỏi vốn hóa thị trường của Nvidia chỉ trong một ngày, khi các nhà đầu tư đặt câu hỏi liệu các công ty Mỹ có thực sự cần những khoản đầu tư khổng lồ như vậy để tạo ra kết quả mà một phòng thí nghiệm nhỏ của Trung Quốc đạt được với một phần nhỏ chi phí. V4 là một bước đi khác: thầm lặng hơn, kỹ thuật hơn và tập trung hơn vào hiệu quả cho bất kỳ ai thực sự xây dựng với AI.

Hai mô hình, hai nhiệm vụ rất khác nhau

Trong số hai mô hình mới, DeepSeek V4-Pro là mô hình lớn nhất, với tổng cộng 1.6 nghìn tỷ tham số. Để dễ hình dung, tham số là "cài đặt" nội bộ hoặc "tế bào não" mà một mô hình sử dụng để lưu trữ kiến thức và nhận diện các mẫu—càng nhiều tham số, mô hình càng có thể chứa thông tin phức tạp hơn về mặt lý thuyết. Điều đó làm cho nó trở thành mô hình mã nguồn mở lớn nhất trên thị trường LLM cho đến nay. Kích thước có vẻ phi lý cho đến khi bạn biết rằng nó chỉ kích hoạt 49 tỷ trong số chúng cho mỗi lần suy luận.

Đây là thủ thuật Mixture-of-Experts mà DeepSeek đã tinh chỉnh kể từ V3: Toàn bộ mô hình nằm ở đó, nhưng chỉ phần liên quan của nó mới được kích hoạt cho bất kỳ yêu cầu nào. Nhiều kiến thức hơn, cùng mức chi phí tính toán.

“DeepSeek-V4-Pro-Max, chế độ nỗ lực suy luận tối đa của DeepSeek-V4-Pro, đã nâng cao đáng kể khả năng kiến thức của các mô hình mã nguồn mở, vững chắc khẳng định mình là mô hình mã nguồn mở tốt nhất hiện có,” Deepseek viết trong thẻ chính thức của mô hình trên Huggingface. “Nó đạt hiệu suất hàng đầu trong các bài kiểm tra mã hóa và thu hẹp đáng kể khoảng cách với các mô hình độc quyền hàng đầu trong các tác vụ suy luận và tác tử.”

V4-Flash là phiên bản thực tế: tổng cộng 284 tỷ tham số, 13 tỷ tham số hoạt động. Nó được thiết kế để nhanh hơn, rẻ hơn, và theo các tiêu chuẩn riêng của DeepSeek, “đạt hiệu suất suy luận tương đương với phiên bản Pro khi được cấp một ngân sách tư duy lớn hơn.”

Cả hai đều hỗ trợ một triệu token ngữ cảnh. Con số đó tương đương khoảng 750.000 từ—khoảng toàn bộ bộ ba “Chúa tể những chiếc nhẫn” và hơn thế nữa. Và đó là một tính năng tiêu chuẩn, không phải là một cấp độ cao cấp.

Bí quyết (không mấy bí mật) của Deepseek: Làm cho sự chú ý không còn tệ ở quy mô lớn

Đây là phần kỹ thuật dành cho những người đam mê hoặc những ai quan tâm đến công nghệ đằng sau mô hình. Deepseek không che giấu bí mật của mình, và mọi thứ đều có sẵn miễn phí—báo cáo đầy đủ có trên Github.

Cơ chế chú ý AI tiêu chuẩn—cơ chế cho phép một mô hình hiểu mối quan hệ giữa các từ—có một vấn đề mở rộng quy mô nghiêm trọng. Mỗi khi bạn tăng gấp đôi độ dài ngữ cảnh, chi phí tính toán tăng gần gấp bốn lần. Vì vậy, chạy một mô hình trên một triệu token không chỉ đắt gấp đôi so với 500.000 token. Nó đắt gấp bốn lần. Đây là lý do tại sao ngữ cảnh dài trong lịch sử đã là một hộp kiểm mà các phòng thí nghiệm thêm vào rồi âm thầm giới hạn tốc độ.

DeepSeek đã phát minh ra hai loại cơ chế chú ý mới để khắc phục điều này. Loại thứ nhất, Compressed Sparse Attention (Chú ý thưa nén), hoạt động theo hai bước. Đầu tiên, nó nén các nhóm token—ví dụ, cứ 4 token—thành một mục duy nhất. Sau đó, thay vì chú ý đến tất cả các mục nén đó, nó sử dụng một "Lightning Indexer" để chỉ chọn những kết quả phù hợp nhất cho bất kỳ truy vấn nào. Mô hình của bạn chuyển từ việc chú ý đến một triệu token sang chú ý đến một tập hợp nhỏ hơn nhiều gồm các phần quan trọng nhất, giống như một thủ thư không đọc mọi cuốn sách nhưng biết chính xác kệ nào cần kiểm tra.

Loại thứ hai, Heavily Compressed Attention (Chú ý nén mạnh), tích cực hơn. Nó gom mỗi 128 token thành một mục duy nhất—không có lựa chọn thưa thớt, chỉ là nén thô bạo. Bạn mất chi tiết tinh vi, nhưng bạn có được một cái nhìn tổng thể cực kỳ rẻ. Hai loại chú ý này chạy xen kẽ trong các lớp, vì vậy mô hình có được cả chi tiết và tổng quan.

Kết quả, từ bài báo kỹ thuật: Với một triệu token, V4-Pro sử dụng 27% sức mạnh tính toán mà phiên bản tiền nhiệm (V3.2) cần. Bộ nhớ KV cache—bộ nhớ mà mô hình cần để theo dõi ngữ cảnh—giảm xuống chỉ còn 10% so với V3.2. V4-Flash thậm chí còn đẩy mạnh hơn: 10% tính toán, 7% bộ nhớ.

Và điều này đã giúp Deepseek có thể cung cấp mức giá trên mỗi token rẻ hơn nhiều so với các đối thủ cạnh tranh, đồng thời mang lại kết quả tương đương. Để quy đổi ra tiền đô la: GPT-5.5 ra mắt ngày hôm qua với giá 5 đô la đầu vào và 30 đô la đầu ra cho mỗi triệu token, với GPT-5.5 Pro có giá 30 đô la cho mỗi triệu token đầu vào và 180 đô la cho mỗi triệu token đầu ra.

Deepseek V4-Pro có giá 1.74 đô la đầu vào và 3.48 đô la đầu ra. V4-Flash có giá 0.14 đô la đầu vào và 0.28 đô la đầu ra. CEO của Cline, Saoud Rizwan, đã chỉ ra rằng nếu Uber sử dụng DeepSeek thay vì Claude, ngân sách AI năm 2026 của họ—theo báo cáo là đủ cho bốn tháng sử dụng—đã có thể kéo dài bảy năm.

deepseek v4 is now the cheapest sota model available at 1/20th the cost of opus 4.7.

for perspective, if uber used deepseek instead of claude their 2026 ai budget would have lasted 7 years instead of only 4 months. pic.twitter.com/i9rJZzvRBV

— Saoud Rizwan (@sdrzn) April 24, 2026

Các tiêu chuẩn đánh giá

DeepSeek làm một điều bất thường trong báo cáo kỹ thuật của mình: Công bố những khoảng cách. Hầu hết các bản phát hành mô hình đều chọn lọc những tiêu chuẩn mà họ thắng. DeepSeek đã thực hiện so sánh đầy đủ với GPT-5.4 và Gemini-3.1-Pro, nhận thấy khả năng suy luận của V4-Pro kém hơn các mô hình đó khoảng ba đến sáu tháng, và vẫn công bố điều đó.

Điểm mà V4-Pro-Max thực sự thắng: Codeforces, tiêu chuẩn lập trình thi đấu, được đánh giá như cờ vua của con người. V4-Pro đạt 3.206 điểm, xếp thứ khoảng 23 trong số những người tham gia cuộc thi thực tế. Trên Apex Shortlist, một bộ sưu tập các bài toán khó về toán và STEM, nó đạt tỷ lệ đỗ và chạm 90.2% so với 85.9% của Opus 4.6 và 78.1% của GPT-5.4. Trên SWE-Verified, đo lường khả năng của một mô hình giải quyết các vấn đề GitHub thực tế được lấy từ các kho lưu trữ mã nguồn mở thực, nó đạt 80.6%—tương đương với Claude Opus 4.6.

Những điểm còn yếu: tiêu chuẩn đa nhiệm MMLU-Pro (Gemini-3.1-Pro đạt 91.0% so với V4-Pro là 87.5%), tiêu chuẩn kiến thức chuyên môn GPQA Diamond (Gemini 94.3 so với V4-Pro 90.1), và Humanity's Last Exam, một tiêu chuẩn cấp độ sau đại học nơi Gemini-3.1-Pro đạt 44.4% vẫn vượt qua V4-Pro là 37.7%.

Cụ thể về ngữ cảnh dài, V4-Pro dẫn đầu các mô hình mã nguồn mở và đánh bại Gemini-3.1-Pro trên tiêu chuẩn CorpusQA (một thử nghiệm mô phỏng phân tích tài liệu thực tế với một triệu token), nhưng thua Claude Opus 4.6 trên MRCR—một thử nghiệm đo lường khả năng của mô hình tìm kiếm các "kim" cụ thể được chôn sâu trong một "đống cỏ khô" rất dài.

Được xây dựng để chạy tác tử, không chỉ trả lời câu hỏi

Phần liên quan đến tác tử là điều khiến bản phát hành này trở nên thú vị đối với các nhà phát triển thực sự đưa sản phẩm ra thị trường.

V4-Pro có thể chạy trong Claude Code, OpenCode và các công cụ mã hóa AI khác. Theo khảo sát nội bộ của DeepSeek trên 85 nhà phát triển đã sử dụng V4-Pro làm tác tử mã hóa chính, 52% cho biết nó sẵn sàng trở thành mô hình mặc định của họ, 39% nghiêng về phía đồng ý, và chưa đến 9% nói không. Các nhân viên nội bộ cho biết nó vượt trội hơn Claude Sonnet và tiệm cận Claude Opus 4.5 trong các tác vụ mã hóa tác tử.

Artificial Analysis, đơn vị thực hiện đánh giá độc lập các mô hình AI trên các tác vụ thực tế, đã xếp V4-Pro đứng đầu trong số tất cả các mô hình mã nguồn mở trên GDPval-AA—một tiêu chuẩn kiểm tra công việc tri thức có giá trị kinh tế trong các lĩnh vực tài chính, pháp lý và nghiên cứu, được tính điểm theo Elo. V4-Pro-Max đạt 1.554 Elo, vượt GLM-5.1 (1.535) và M2.7 của MiniMax (1.514). Để tham khảo, Claude Opus 4.6 đạt 1.619 trên cùng tiêu chuẩn này—vẫn dẫn trước, nhưng khoảng cách đang được rút ngắn.

DeepSeek V4 Pro is the #1 open weights model on GDPval-AA, our agentic real-world work tasks evaluation@deepseek_ai has released V4 Pro (1.6T total / 49B active) and V4 Flash (284B total / 13B active). V4 is DeepSeek's first new size since V3, with all intermediate models… pic.twitter.com/2kJWVrKQjF

— Artificial Analysis (@ArtificialAnlys) April 24, 2026

V4 của Deepseek cũng giới thiệu một thứ gọi là “tư duy xen kẽ.” Trong các mô hình trước đây, nếu bạn đang chạy một tác tử thực hiện nhiều lời gọi công cụ—ví dụ, nó tìm kiếm trên web, sau đó chạy một số mã, rồi tìm kiếm lại—ngữ cảnh suy luận của mô hình sẽ bị xóa giữa các vòng. Mỗi bước mới, mô hình phải xây dựng lại mô hình tinh thần của mình từ đầu. V4 giữ lại toàn bộ chuỗi suy nghĩ qua các lời gọi công cụ, vì vậy một quy trình làm việc tác tử gồm 20 bước không bị mất trí nhớ giữa chừng. Điều này quan trọng hơn những gì nó nghe có vẻ đối với bất kỳ ai đang chạy các pipeline tự động phức tạp.

Deepseek và cuộc chiến AI Mỹ-Trung

Hoa Kỳ đã hạn chế xuất khẩu chip Nvidia cao cấp sang Trung Quốc kể từ năm 2022. Mục tiêu đã nêu là làm chậm sự phát triển AI của Trung Quốc, nhưng lệnh cấm chip đã không ngăn cản DeepSeek mà thay vào đó, buộc họ phải phát minh ra một kiến trúc hiệu quả hơn và xây dựng nguồn cung phần cứng trong nước.

DeepSeek không phát hành V4 trong một môi trường trống rỗng—không gian AI gần đây đã bùng nổ với các hoạt động: Anthropic đã xuất xưởng Claude Opus 4.7 vào ngày 16 tháng 4—một mô hình mà Decrypt đã thử nghiệm và thấy mạnh về mã hóa và suy luận, với mức sử dụng token đặc biệt cao. Một ngày trước đó, Anthropic cũng đang sở hữu Claude Mythos, một mô hình an ninh mạng mà họ nói rằng không thể phát hành công khai vì nó quá giỏi trong các cuộc tấn công mạng tự động.

Xiaomi đã ra mắt MiMo V2.5 Pro vào ngày 22 tháng 4, chuyển sang hoàn toàn đa phương thức—hình ảnh, âm thanh, video. Chi phí 1 đô la đầu vào và 3 đô la đầu ra cho mỗi triệu token. Nó sánh ngang với Opus 4.6 trên hầu hết các tiêu chuẩn mã hóa. Ba tháng trước, không ai nói về Xiaomi như một công ty AI tiên phong. Giờ đây, họ đang xuất xưởng các mô hình cạnh tranh nhanh hơn hầu hết các phòng thí nghiệm phương Tây.

GPT-5.5 của OpenAI đã ra mắt ngày hôm qua với chi phí tăng vọt lên tới 180 đô la cho mỗi triệu token đầu ra trong phiên bản Pro. Nó đánh bại V4-Pro trên Terminal Bench 2.0 (82.7% so với 70.0%), vốn kiểm tra các quy trình làm việc của tác tử dòng lệnh phức tạp. Nhưng nó có chi phí cao hơn đáng kể so với V4-Pro cho các tác vụ tương đương. Cùng ngày đó, Tencent đã phát hành Hy3, một mô hình tiên tiến khác tập trung vào hiệu quả.

Điều này có ý nghĩa gì đối với bạn

Với rất nhiều mô hình mới có sẵn, câu hỏi mà các nhà phát triển đang thực sự đặt ra là: Khi nào thì sự cao cấp đáng giá?

Đối với doanh nghiệp, phép toán có thể đã thay đổi. Một mô hình dẫn đầu các tiêu chuẩn mã nguồn mở với giá 1.74 đô la cho mỗi triệu token đầu vào có nghĩa là các quy trình xử lý tài liệu quy mô lớn, đánh giá pháp lý hoặc tạo mã đã từng đắt đỏ sáu tháng trước giờ đây trở nên rẻ hơn nhiều. Ngữ cảnh một triệu token có nghĩa là bạn có thể đưa toàn bộ cơ sở mã hoặc hồ sơ quy định vào một yêu cầu duy nhất thay vì chia nhỏ chúng thành nhiều lần gọi.

Bên cạnh đó, bản chất mã nguồn mở của nó có nghĩa là nó không chỉ có thể chạy miễn phí trên phần cứng cục bộ, mà còn có thể được tùy chỉnh và cải thiện dựa trên nhu cầu và trường hợp sử dụng của công ty.

Đối với các nhà phát triển và những người xây dựng độc lập, V4-Flash là mô hình đáng chú ý. Với giá 0.14 đô la đầu vào và 0.28 đô la đầu ra, nó rẻ hơn các mô hình từng được coi là lựa chọn tiết kiệm một năm trước—và nó xử lý hầu hết các tác vụ mà phiên bản Pro đảm nhiệm. Các điểm cuối deepseek-chat và deepseek-reasoner hiện có của DeepSeek đã được định tuyến tới V4-Flash trong các chế độ không tư duy và tư duy tương ứng, vì vậy nếu bạn đang sử dụng API, bạn đã sử dụng nó rồi.

Hiện tại các mô hình này chỉ là văn bản. DeepSeek cho biết họ đang phát triển khả năng đa phương tiện, điều đó có nghĩa là các phòng thí nghiệm lớn khác từ Xiaomi đến OpenAI vẫn có lợi thế đó. Cả hai mô hình đều được cấp phép MIT và có sẵn trên Hugging Face hôm nay. Các điểm cuối deepseek-chat và deepseek-reasoner cũ sẽ ngừng hoạt động vào ngày 24 tháng 7 năm 2026.