Trang chủTrung tâm tin tức LBank
Xiaomi MiMo của Trung Quốc Hiện Nhanh Gấp 15 Lần So Với ChatGPT và Claude
xiaomi-mimo-ultraspeed-ai-model-faster-chatgpt-claude
Xiaomi MiMo của Trung Quốc Hiện Nhanh Gấp 15 Lần So Với ChatGPT và Claude
MiMo-V2.5-Pro-UltraSpeed của Xiaomi đã vượt xa ngưỡng tốc độ mà các công ty chip tùy chỉnh đã mất nhiều năm để phát triển – trên các GPU thông thường.
2026-06-08 Nguồn:decrypt.co

Tóm tắt

  • Xiaomi và đối tác suy luận TileRT đã phá vỡ tốc độ 1.000 mã thông báo mỗi giây trên mô hình một nghìn tỷ tham số, lần đầu tiên ở quy mô đó, sử dụng một cụm 8 GPU tiêu chuẩn—không phải chip tùy chỉnh.
  • Tốc độ này đến từ lượng tử hóa FP4 trên các lớp chuyên gia của mô hình và giải mã suy đoán DFlash, đề xuất một khối mã thông báo đầy đủ trong một lần duy nhất thay vì từng mã một.
  • Chương trình thử nghiệm API giới hạn sẽ mở từ ngày 9 tháng 6 đến ngày 23 tháng 6, với giá gấp 3 lần mức giá MiMo tiêu chuẩn cho tốc độ tạo ra dữ liệu nhanh gấp khoảng 10 lần.

Hầu hết mọi người đều biết Xiaomi là thương hiệu điện thoại Trung Quốc. Thương hiệu sản xuất xe máy điện giá rẻ và máy lọc không khí. Không hẳn là công ty bạn mong đợi sẽ phá vỡ một kỷ lục lớn về tốc độ suy luận AI vào một buổi sáng thứ Hai.

Tuy nhiên. Xiaomi vừa phát hành MiMo-V2.5-Pro-UltraSpeed, một chế độ phục vụ cho mô hình chủ lực nghìn tỷ tham số của họ, đạt hơn 1.000 mã thông báo mỗi giây—đỉnh điểm gần 1.200 trong các bản demo.

Tham số là các trọng số số học nội bộ định nghĩa cách một mô hình suy nghĩ—càng nhiều tham số, các mẫu nó có thể nhận diện càng phức tạp. Mã thông báo là các đoạn văn bản mà mô hình đọc và ghi, trung bình khoảng ba phần tư một từ.

Xiaomi đã thực hiện điều này trên một cụm 8 GPU tiêu chuẩn. Phần cứng tiêu chuẩn, không có chip tùy chỉnh. Điều đó thay đổi cách tính toán về việc ai thực sự có thể triển khai tốc độ này trong sản xuất.

Để đặt con số đó vào ngữ cảnh dễ hiểu: theo Artificial Analysis, GPT-5.5—mà hầu hết người dùng ChatGPT đang nói chuyện—đạt 68. Claude Opus 4.6 đạt khoảng 71 với mô hình cấp thấp hơn, Haiku, chạm 98 mã thông báo mỗi giây. Gemini Flash đạt 192 mã thông báo mỗi giây. MiMo-V2.5-Pro-UltraSpeed đạt 1.000, trên một mô hình sánh ngang Opus về điểm chuẩn mã hóa.

Cerebras và Groq đã xây dựng toàn bộ doanh nghiệp xung quanh vấn đề này. Cerebras đã thiết kế một con chip quy mô wafer có kích thước bằng một chiếc đĩa ăn, chứa 44GB bộ nhớ trên chip để loại bỏ nút thắt băng thông làm chậm quá trình suy luận GPU. Nó đạt 969 mã thông báo mỗi giây trên Llama 3.1 405B của Meta—ấn tượng, nhưng đó là mô hình 405 tỷ tham số, nhỏ hơn một nửa so với MiMo-V2.5-Pro. Kiến trúc Đơn vị Xử lý Ngôn ngữ (LPU) tùy chỉnh của Groq đạt tốc độ tối đa khoảng 300–750 mã thông báo mỗi giây tùy thuộc vào mô hình.

Cả hai đều không chạy trên phần cứng bạn có thể thuê từ AWS ngay đêm nay.

Xiaomi đã thực hiện điều đó trên các GPU thương mại chỉ bằng phần mềm—một sự kết hợp giữa các thủ thuật cấp độ mô hình và một công cụ suy luận được xây dựng chuyên dụng tên là TileRT.

Điều gì thực sự đang diễn ra bên dưới

Hai kỹ thuật mang lại tốc độ này. Kỹ thuật đầu tiên là Lượng tử hóa FP4: thay vì chạy mô hình ở độ chính xác số học 8-bit hoặc 16-bit đầy đủ, Xiaomi thu nhỏ các lớp chuyên gia—chiếm phần lớn trong 1 nghìn tỷ tham số—xuống 4-bit. Dung lượng bộ nhớ giảm, áp lực băng thông giảm, tốc độ tăng. Nhược điểm thường là một sự suy giảm chất lượng nhỏ. Giải pháp của Xiaomi rất tinh tế: chỉ các lớp chuyên gia được nén, mọi thứ khác vẫn giữ độ chính xác đầy đủ. Với cách tiếp cận này, sự suy giảm chất lượng được mô tả là gần bằng không.

Thứ hai là giải mã suy đoán DFlash. Giải mã suy đoán thông thường có một mô hình nháp nhỏ đoán vài mã thông báo tiếp theo, sau đó mô hình lớn xác minh chúng song song. DFlash bỏ qua hoàn toàn việc phác thảo tuần tự—nó điền toàn bộ một khối vị trí bị che trong một lần truyền tiến duy nhất. Trong các tác vụ mã hóa, mô hình lớn chấp nhận trung bình 6,3 trên 8 mã thông báo được đề xuất cho mỗi vòng xác minh. Đó là sáu mã thông báo được xác nhận trong một bước thay vì một.

TileRT kết nối tất cả lại với nhau. Nó giữ toàn bộ đường ống tính toán liên tục nằm trong GPU—không có chi phí khởi chạy cho mỗi toán tử, không có khoảng trống thực thi.

Xiaomi gọi cách tiếp cận này là "đồng thiết kế mô hình-hệ thống cực đoan," và cụm từ này là chính xác: Không kỹ thuật nào một mình đạt được 1.000 mã thông báo mỗi giây, nhưng sự hiệp đồng giữa tất cả các phương pháp đã làm được.

MiMo-V2.5-Pro là một mô hình cấp độ tiên tiến. Chúng tôi đã đưa tin về việc ra mắt V2.5 Pro vào tháng 4—nó sánh ngang Claude Opus trên hầu hết các điểm chuẩn mã hóa và có chi phí khoảng 0,43 đô la đầu vào / 0,87 đô la đầu ra cho mỗi triệu mã thông báo. Opus có giá 5 đô la đầu vào / 25 đô la đầu ra cho mỗi triệu mã thông báo.

UltraSpeed tăng tốc chính xác mô hình MiMo V2.5 Pro đó, không phải một phiên bản rút gọn.

Suy luận đủ nhanh thay đổi cách bạn có thể sử dụng mô hình. Bạn có thể chạy hàng chục đường dẫn suy luận song song thay vì chờ đợi một câu trả lời. Phát hiện gian lận, tạo tín hiệu giao dịch, các vòng lặp tác nhân thời gian thực—tất cả đều có những hạn chế độ trễ nghiêm ngặt mà 60 mã thông báo mỗi giây không thể đáp ứng. Ở tốc độ 1.000 mã thông báo mỗi giây, chúng có thể.

Xiaomi đang định giá tốc độ này gấp 3 lần mức giá MiMo-V2.5-Pro tiêu chuẩn cho tốc độ đầu ra nhanh gấp khoảng 10 lần. Chương trình thử nghiệm API diễn ra từ ngày 9–23 tháng 6, dựa trên ứng dụng, ưu tiên cho các nhà phát triển doanh nghiệp và chuyên nghiệp. Điểm kiểm soát FP4-DFlash đã được mã nguồn mở trên Hugging Face để cộng đồng thử nghiệm.