
Moonshot AI vừa phát hành mô hình mã nguồn mở lớn nhất của Trung Quốc từ trước đến nay, và nó đã vượt qua Claude Fable 5 về khả năng viết kịch bản.
Trên bảng xếp hạng Writing Elo của Towards AI—một tiêu chuẩn mà các mô hình viết kịch bản thực tế được đánh giá ẩn danh so với các phiên bản đã xuất bản, được chấm điểm bằng hệ thống Elo tương tự như xếp hạng cờ vua—Kimi K3 đạt 2.840, cao hơn Fable 5 (tối đa) với 2.760. Đây là một thứ hạng mà đội ngũ Anthropic đã thống trị trong lịch sử.
Big news from our internal writing benchmark (early results): Kimi K3 by @Kimi_Moonshot is now #1 for writing in our editorial voice, at 2840 Elo, surpassing Claude Fable 5.
That is a jump from #21 to #1 over its predecessor, Kimi K2.6. And it runs at about $0.25 per script: 5x… https://t.co/000EosInEc pic.twitter.com/V18t7g4pHu
— Louis-François Bouchard 🎥🤖 (@Whats_AI) July 16, 2026
K3 cũng giành vị trí dẫn đầu trên bảng xếp hạng Frontend Code Leaderboard của Arena AI—một bảng xếp hạng được xây dựng từ hàng nghìn phiếu bầu của con người theo cặp về các tác vụ tạo mã, cũng được chấm điểm Elo—với 1.679 điểm so với 1.631 của Fable 5. Đứng đầu ở sáu trong bảy lĩnh vực frontend.
Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5.
This is a 17-place jump from Kimi-k2.6 (#18 -> #1).
In Frontend, Kimi-K3 ranked #1 in 6 of 7 domains: Brand & Marketing, Reference-Based Design, Data & Analytics,… https://t.co/YDN3BufGkC pic.twitter.com/Oa6teaQnWp
— Arena.ai (@arena) July 16, 2026
Chỉ số Artificial Analysis Intelligence Index—một điểm số được xây dựng từ chín đánh giá độc lập bao gồm lập trình, suy luận, tác vụ đại lý và kiến thức, được đánh giá từ 0 đến 100—đặt K3 ở mức 57, với Claude Fable 5 ở mức 60, GPT-5.6 Sol ở mức 59 và Claude Opus 4.8 ở mức 56. Điều này xếp K3 là mô hình có khả năng thứ ba trên tổng hợp, với Fable 5 chỉ vượt qua 3%.
Kimi K3 is beating Fable 5 head to head on BridgeBench.
Same task, blind judge panel.
K3 has won 7 of 8 arenas, including Refactoring 9-0 and Debugging 6-1.
Fable 5's only win: Speed.
Fable 5 went 142-36 against GPT 5.6 Sol and is now losing 2 to 1 to an open source model… pic.twitter.com/CaRSjbIwUW
— Bridgebench (@bridgebench) July 17, 2026
Kimi K3 is the best performing model on https://t.co/SnZ54Xok7n, ahead of Fable, reaching a comparable success rate in less time.
This is the first time that an open model is ahead of all proprietary ones for this comprehensive web engineering benchmark.
Notes:
▪️ Benchmarks… pic.twitter.com/2MqvbAxAaw
— Guillermo Rauch (@rauchg) July 16, 2026
Nếu bạn muốn có một ý tưởng về những gì nó có thể làm, đây là kết quả zero-shot của một lời nhắc yêu cầu mô hình xây dựng bản sao iOS. Để so sánh, đây là sự gần đúng tốt nhất được chia sẻ trên mạng xã hội bằng GPT 5.6 Sol và một lời nhắc chi tiết hơn nhiều.
K3 gói gọn 2.8 nghìn tỷ tham số—các giá trị số lưu trữ kiến thức của mô hình—trong một kiến trúc hỗn hợp chuyên gia (mixture-of-experts). Hỗn hợp chuyên gia chia các tham số đó thành 896 mạng con "chuyên gia" và chỉ kích hoạt một phần nhỏ cho bất kỳ tác vụ nào. Đó là cách bạn có được trí thông minh cấp độ tiên tiến mà không làm quá tải phòng máy chủ.
Moonshot AI cho biết: "Đây là mô hình mã nguồn mở đầu tiên trên thế giới thuộc lớp 3 nghìn tỷ tham số, được thiết kế cho các kịch bản trí tuệ tiên tiến bao gồm mã hóa dài hạn, công việc tri thức và suy luận." Đây không phải là lời quảng cáo sáo rỗng: DeepSeek's V4-Pro đạt tối đa 1.6 nghìn tỷ tham số, K2 của Moonshot đạt một nghìn tỷ. K3 gần như tăng gấp đôi đối thủ mã nguồn mở gần nhất về kích thước.
Nó đi kèm với một cửa sổ ngữ cảnh một triệu token—token là đơn vị thông tin cơ bản mà AI xử lý, khoảng ba phần tư một từ mỗi token—khả năng hiểu hình ảnh và video gốc, và khả năng suy luận liên tục.
Hai kỹ thuật kiến trúc hỗ trợ việc tăng hiệu suất. Kimi Delta Attention tăng tốc giải mã cho các chuỗi dài—nhanh hơn tới 6.3 lần ở ngữ cảnh triệu token. Attention Residuals định tuyến thông tin một cách chọn lọc qua các lớp mô hình thay vì tích lũy đồng đều, tăng khoảng 25% hiệu quả đào tạo với chi phí tính toán tăng thêm dưới 2%—tổng cộng mang lại hiệu quả mở rộng tốt hơn khoảng 2.5 lần so với K2.
Kimi K3 có giá 3 USD cho mỗi triệu token đầu vào và 15 USD cho mỗi triệu token đầu ra—mức giá tương đương với Claude Sonnet 5, mô hình tầm trung của Anthropic. Sự khác biệt là Sonnet 5 là sản phẩm tầm trung của Anthropic; K3 chỉ thấp hơn Fable 5 ba điểm trên chỉ số tổng hợp Artificial Analysis. Tính trên mỗi tác vụ trong bộ chín điểm chuẩn đó, K3 có chi phí 0.94 USD so với 1.04 USD của GPT-5.6 Sol và 1.80 USD của Opus 4.8.
Nói cách khác, mô hình này mang lại hiệu suất hàng đầu với mức giá tầm trung.
Như Decrypt đã đưa tin vào tháng 5, khoảng cách về giá giữa AI tiên tiến của Trung Quốc và Mỹ đã là 15–30 lần vào đầu năm nay. K3 không phá giá ở mức của DeepSeek—nó định giá như một mô hình tầm trung của phương Tây—nhưng mang lại hiệu suất gần như tiên tiến ở cấp độ đó. Đối với các nhóm xây dựng trên API, điều này thể hiện một cải thiện lớn về chi phí.
Nếu Anthropic tiến hành ý định chỉ cung cấp Fable 5 qua API, K3 sẽ trở thành lựa chọn mã nguồn mở thay thế gần nhất cho bất kỳ mô hình nào hiện đang đứng thứ hai trong ngành—với chi phí trên mỗi tác vụ bằng một nửa so với Opus 4.8. Đó là kịch bản mà những người theo dõi điểm chuẩn đang tính toán.
Việc ra mắt K3 là một lập luận mà những người ủng hộ kiểm soát xuất khẩu chip của Hoa Kỳ không muốn có. Hoa Kỳ đã hạn chế xuất khẩu GPU Nvidia H800 sang Trung Quốc vào cuối năm 2023; Moonshot xác nhận đã đào tạo các mô hình trước đó trên các chip này. Tài liệu điểm chuẩn của K3 đề cập đến H200 và cái mà công ty gọi là "một GPGPU từ một nhà cung cấp thay thế"—được hiểu rộng rãi là phần cứng Huawei Ascend—mà không chỉ rõ phần cứng đó nằm ở đâu.
Chủ tịch Moonshot AI Yutong Zhang đã trực tiếp nêu rõ hạn chế này tại Davos năm nay, theo Silicon Republic: "Chúng tôi biết chúng tôi không có điều kiện xa xỉ để chỉ đơn giản mở rộng khả năng tính toán… Điều đó buộc chúng tôi phải tập trung vào nghiên cứu cơ bản và hiệu quả." Các nhà phân tích của Bank of America, trong một ghi chú sau khi ra mắt, đã viết rằng K3 chứng minh "khả năng mở rộng đào tạo trước, kết hợp với đổi mới kiến trúc, vẫn có thể mang lại những bước nhảy vọt cho các mô hình hàng đầu của Trung Quốc" dưới những hạn chế đó.
Moonshot là một trong những startup AI được gọi là "Hổ AI" đã cùng nhau thay đổi bức tranh mô hình toàn cầu mà không cần tiếp cận các con chip mà Washington nói rằng họ sẽ cần. Việc đó là một lập luận cho việc kiểm soát xuất khẩu chặt chẽ hơn hay một lập luận cho thấy chúng không hiệu quả là một câu hỏi chính sách mà Washington chưa giải quyết.
Tỷ lệ ảo giác của K3 trên AA-Omniscience—một điểm chuẩn đo lường tần suất một mô hình tự tin bịa ra câu trả lời mà nó không biết—đã tăng từ 39% lên 51% so với phiên bản tiền nhiệm K2.6. Tổng thể nhiều câu trả lời đúng hơn; nhưng cũng nhiều câu bịa đặt hơn. Mô hình cũng thừa nhận trong tài liệu của mình rằng nó có thể "quá chủ động," đưa ra các quyết định bất ngờ thay mặt người dùng trong các tác vụ tự động dài.
Đối với các nhóm đã sử dụng công cụ dựa trên Kimi K2.6 và muốn nâng cấp, K3 là một bước tiến đáng kể trên hầu hết các mặt—nhưng sự chênh lệch về ảo giác đó đáng để kiểm tra kỹ lưỡng trước khi bạn tin tưởng nó với bất cứ điều gì cần sự chính xác.
Nếu bạn muốn dùng thử miễn phí, bạn có thể. Nó có sẵn trên trang web chính thức của Kimi. Nhưng chúc may mắn: Máy chủ quá tải đến mức các tác vụ liên tục bị gián đoạn do hạn chế về lưu lượng truy cập, khiến nó gần như không thể sử dụng được. Một giải pháp thay thế tốt hơn là trả tiền để đăng ký hoặc sử dụng nó qua API.
Các trọng số sẽ được phát hành vào ngày 27 tháng 7. Những trọng số này sẽ có sẵn cho các doanh nghiệp và công ty lớn. Hiện tại, không có GPU nội địa nào, dù lớn đến đâu, có thể xử lý một mô hình có kích thước này.