Trang chủTrung tâm tin tức LBank
Z.AI của Trung Quốc Ra mắt GLM-5.2: Mô hình Sánh ngang Claude Opus—Không sử dụng Chip Nvidia
china-z-ai-glm-5-2-model-rivals-claude-opus
Z.AI của Trung Quốc Ra mắt GLM-5.2: Mô hình Sánh ngang Claude Opus—Không sử dụng Chip Nvidia
GLM-5.2 của Z.ai đạt hiệu suất chỉ kém 1% so với Claude Opus 4.8 trên các tiêu chuẩn chấm điểm mã hóa dài hạn, hoạt động hoàn toàn trên nền tảng chip Huawei và có chi phí trên mỗi token thấp hơn tới 82% so với các mô hình tiên tiến của phương Tây.
2026-06-18 Nguồn:decrypt.co

Tóm tắt

  • GLM-5.2 chỉ kém Claude Opus 4.8 1% trên FrontierSWE—một tiêu chuẩn đo lường các dự án kỹ thuật tự động kéo dài nhiều giờ—đồng thời vượt trội hơn GPT-5.5 trong cùng thử nghiệm. Nó được phát hành theo giấy phép MIT mà không có bất kỳ hạn chế khu vực nào.
  • Mô hình này được xây dựng hoàn toàn trên chip Huawei Ascend mà không có bất kỳ phần cứng NVIDIA nào tham gia.
  • Unsloth AI đã phát hành các phiên bản lượng tử hóa GGUF 2-bit giúp thu nhỏ mô hình từ 1.51TB xuống còn 238GB. Bạn vẫn sẽ cần 256GB RAM hoặc VRAM—nhưng tại thời điểm đó, bạn có thể chạy nó.

Z.ai đã ra mắt GLM-5.2 vào ngày 16 tháng 6, hứa hẹn hiệu suất hàng đầu, vượt qua GLM 5.1 vốn đã tiên tiến.

Phòng thí nghiệm có trụ sở tại Bắc Kinh, vốn đã nằm trong Danh sách Thực thể của Hoa Kỳ kể từ tháng 1 năm 2025, dường như đang hưởng lợi từ những lo ngại ngày càng tăng về cách tiếp cận AI của Mỹ. Trong tuần qua, lệnh cấm Anthropic Fable và việc phát hành mô hình mới này đã giúp cổ phiếu của zAI tăng 90%, đạt mức cao kỷ lục mới.

GLM 5.2 có những con số để chứng minh cho sự cường điệu này.

Trên FrontierSWE—một tiêu chuẩn đánh giá liệu một tác nhân AI có thể hoàn thành các dự án kỹ thuật mở kéo dài nhiều giờ, bao gồm tối ưu hóa hệ thống, xây dựng mã quy mô lớn và nghiên cứu ML ứng dụng, được chấm điểm theo tỷ lệ thống trị—GLM-5.2 đạt 74.4 so với 75.1 của Claude Opus 4.8. Nó vượt qua GPT-5.5 ở mức 72.6. Trên SWE-bench Pro, kiểm tra khả năng tự động giải quyết các vấn đề GitHub trong thế giới thực được chấm điểm là tỷ lệ vượt qua, GLM-5.2 đạt 62.1 so với 58.6 của GPT-5.5—và vượt xa người tiền nhiệm GLM-5.1 ở mức 58.4.

Bước nhảy vọt về chất lượng này khiến nó trở thành mô hình mã nguồn mở tốt nhất cho đến nay trong Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index), tổng hợp kết quả của 9 điểm số khác nhau để đánh giá chất lượng tổng thể của một mô hình AI. Các tiêu chuẩn của OpenRouter đặt nó vào cùng loại với Claude Fable 5 hiện đã bị cấm.

Phần cứng được sử dụng để đạt được thành tựu này là một phần thú vị khác của câu chuyện. GLM-5.2 được huấn luyện trên chip Huawei Ascend—không hề có phần cứng Nvidia nào trong toàn bộ quy trình. Emad Mostaque, người sáng lập Stability AI, ước tính tổng chi phí huấn luyện khoảng 25 triệu USD, trong đó 80% là chi phí sau huấn luyện, điều này khiến nó cực kỳ rẻ so với các đối thủ cạnh tranh.

Như Decrypt đã đưa tin vào đầu năm nay, Z.ai đã huấn luyện các mô hình hình ảnh trên máy chủ Huawei Ascend Atlas mà không cần một con chip Mỹ nào. GLM-5.2 nâng cấp cơ sở hạ tầng đó lên một tầm cao mới—một mô hình mixture-of-experts với 744 tỷ tham số và cửa sổ ngữ cảnh thực sự 1 triệu token, gấp năm lần giới hạn 200K trên GLM-5.1, cùng với giấy phép MIT có nghĩa là không có chỉ thị chính phủ nào có thể thay đổi quyền truy cập.

Token là các khối văn bản mà một mô hình có thể đọc và tạo ra, trong khi Tham số là số lượng cài đặt và giá trị nội bộ xác định cách mô hình xử lý thông tin và tạo ra phản hồi.

Dành cho ai và chi phí bao nhiêu

Đối với các nhà phát triển, cửa sổ ngữ cảnh là một thay đổi trong hoạt động. Điều hướng toàn bộ kho lưu trữ, tái cấu trúc nhiều tệp và các đường dẫn tác nhân dài mà trước đây yêu cầu phân đoạn giờ đây trở thành quy trình làm việc một lần gọi. Giá API là 1.40 USD cho mỗi triệu token đầu vào và 4.40 USD cho mỗi triệu token đầu ra—so với 5 USD đầu vào và 25 USD đầu ra của Claude Opus 4.8. Gói Coding Plan có giá khởi điểm khoảng 18 USD mỗi tháng và hoạt động trực tiếp trong Claude Code, Cline, Kilo Code và hầu hết các môi trường tác nhân phổ biến.

Triển khai cục bộ cũng khả thi về mặt kỹ thuật. Unsloth AI đã phát hành các phiên bản lượng tử hóa GGUF 2-bit giúp nén mô hình từ 1.51TB xuống còn 238GB trong khi vẫn giữ được độ chính xác khoảng 82%.

Tuy nhiên, đừng quá phấn khích. Điều đó vẫn có nghĩa là nó yêu cầu 256GB bộ nhớ hợp nhất hoặc sự kết hợp RAM/VRAM tương ứng—một Mac Studio M4 Ultra tối đa hoặc một máy trạm với GPU tầm trung và 256GB RAM hệ thống với khả năng offloading mixture-of-experts. Đó vẫn là một khoản tiền lớn, nhưng ít nhất là thứ bạn có thể mua và chạy tại nhà nếu bạn thực sự muốn.

Chúng tôi đã thực hiện một thử nghiệm nhanh, yêu cầu GLM-5.2 xây dựng trò chơi tiêu chuẩn của chúng tôi kết hợp cơ chế gõ phím với một trò chơi bắn súng. Giao diện người dùng không phải là đẹp nhất—các mô hình khác tạo ra giao diện trông bóng bẩy hơn, nhưng trải nghiệm đa dạng nhất: các kịch bản khác nhau qua các đợt, các loại kẻ thù thay đổi, các trùm xuất hiện sau trong quá trình chơi.

Nó đã tạo ra nhiều trạng thái trò chơi đa dạng hơn bất kỳ thứ gì khác mà chúng tôi đã thử nghiệm cho cùng một tác vụ trong thiết lập zero-shot.

Nếu bạn muốn chơi, nó đã có sẵn trên hồ sơ Itch.io của chúng tôi.

Sự đa dạng đó cho thấy nơi GLM-5.2 có ý nghĩa kinh tế nhất. Đối với các quy trình làm việc tạo nhiều lượt và các đường dẫn tác nhân nơi sự đa dạng của đầu ra quan trọng hơn sự hoàn thiện, các tính toán ở mức giá mã nguồn mở rất khó để tranh cãi. Đối với các tác vụ khó nhất và kéo dài—SWE-Marathon, nơi nó đạt 13.0 so với 26.0 của Opus 4.8—khoảng cách với biên giới đóng vẫn còn rất lớn, và rộng 13 điểm.

Trọng số mã nguồn mở đã có sẵn trên HuggingFace theo giấy phép MIT. Các trọng số đã được lượng tử hóa cũng có sẵn trên HuggingFace. Những người đăng ký Gói mã hóa GLM có thể chuyển đổi ngay bây giờ với chuỗi mô hình GLM-5.2, và nó cũng có sẵn để thử nghiệm miễn phí trên z.AI với một số hạn chế sử dụng.