
Microsoft đã phát hành mô hình an ninh mạng chuyên dụng đầu tiên của mình có tên MAI-Cyber-1-Flash và tích hợp nó vào MDASH, một hệ thống săn lùng lỗ hổng mà công ty này cho biết đã đánh bại Mythos 5 của Anthropic và GPT-5.6 Sol của OpenAI, đồng thời có chi phí thấp hơn 50% so với cấu hình MDASH tốt nhất hiện tại của Microsoft, theo công ty.
Theo Microsoft, thiết lập kết hợp này đã đạt 95,95% điểm trên CyberGym. CyberGym là một tiêu chuẩn đánh giá yêu cầu các tác nhân AI tái tạo 1.507 lỗ hổng đã biết trên 188 dự án mã nguồn mở, sau đó chấm điểm dựa trên tỷ lệ được tái tạo thành công trong môi trường được kiểm soát.
Điều đó đã đưa MDASH vượt lên trên GPT-5.5 Cyber với 85,6%, Mythos 5 với 83,8%, GPT-5.6 Sol với 83,6% và Gemini 3.5 Flash Cyber với 83,2%. Kết quả này do Microsoft tự báo cáo và chưa xuất hiện trên bảng xếp hạng công khai của CyberGym tại thời điểm xuất bản, mặc dù tiêu chuẩn này sử dụng bộ dữ liệu kiểm tra công khai và một thước đo thành công đã được xác định.
MAI-Cyber-1-Flash không hoạt động đơn lẻ. Microsoft cho biết nó xử lý tới 90% tác vụ, trong khi MDASH chuyển 10% trường hợp khó nhất cho GPT-5.4. Điều này quan trọng vì các token—các đoạn văn bản mà AI xử lý—tốn tiền mỗi khi một mô hình đọc mã hoặc tạo ra một câu trả lời.
Đây là lần đầu tiên một mô hình của Microsoft được xây dựng để tối ưu hiệu quả có khả năng đánh bại một mô hình tiên tiến dày đặc được xây dựng với các khả năng tổng quát. Giám đốc điều hành Microsoft Satya Nadella đã viết: “Khi kết hợp với MDASH, (MAI-Cyber-1-Flash) mang lại hiệu suất đẳng cấp thế giới với chi phí bằng 50% so với các mô hình hàng đầu.”
Hôm nay, chúng tôi công bố một loạt cập nhật mang đến cho khách hàng bảo mật cấp độ tiên tiến với chi phí bằng một nửa.
MAI-Cyber-1-Flash là mô hình an ninh mạng đầu tiên của chúng tôi, được xây dựng từ đầu để tìm ra những lỗ hổng thách thức nhất trong các cơ sở mã phức tạp. Khi kết hợp với MDASH, nó… pic.twitter.com/npcIihN1H7
— Satya Nadella (@satyanadella) July 27, 2026
Một mô hình (trong trường hợp này là MAI-Cyber-1-Flash) là AI suy luận trên mã. Một bộ khung (trong trường hợp này là MDASH) là bộ máy xung quanh nó: các tác nhân, công cụ, kiểm tra và quy trình làm việc quyết định nơi cần tìm, thách thức các phát hiện nghi ngờ, loại bỏ các bản sao và chứng minh rằng một lỗi có thể được kích hoạt.
MDASH sử dụng hơn 100 tác nhân chuyên biệt được giao nhiệm vụ kiểm tra mã, tranh luận về tính xác thực của một phát hiện và xây dựng bằng chứng khái niệm—một bản trình diễn hoạt động chứng minh sự tồn tại của lỗ hổng.
Microsoft cho biết các lần quét không thường xuyên và các bản vá lỗi bị trì hoãn đang dần lỗi thời khi AI giúp việc phát hiện lỗi trở nên rẻ hơn. Công ty lập luận rằng hàng thập kỷ dữ liệu bảo mật mang lại lợi thế cho họ, đồng thời cho biết thêm: “Không ai có thể tạo ra lịch sử này.”
Kể từ khi Claude Mythos ra mắt, các chuyên gia an ninh mạng đã cố gắng vượt qua hoặc sánh ngang với khả năng của nó. Các nhà nghiên cứu đã tái tạo hoạt động săn lùng lỗ hổng kiểu Mythos bằng các mô hình công khai với chi phí dưới 30 USD mỗi lần quét. Dawid Moczadło, một trong những nhà nghiên cứu tham gia, cho biết “lợi thế cạnh tranh đang chuyển từ quyền truy cập mô hình sang xác thực.”
Phần khan hiếm đang trở thành hệ thống chứng minh các phát hiện mà không làm ngập các nhà phát triển trong các cảnh báo sai.
Decrypt cũng báo cáo rằng GPT-5.5 Cyber gần đây đã dẫn đầu CyberGym công khai với số điểm 85,6%, vượt qua Mythos một cách sít sao. Điểm số của Microsoft cao hơn khoảng 10 điểm so với GPT-5.5 Cyber và 7,5 điểm so với kết quả trước đó của MDASH, nhưng nó đánh giá toàn bộ hệ thống chứ không phải chỉ riêng MAI-Cyber-1-Flash.
Microsoft đang đưa MDASH vào giai đoạn xem trước riêng tư thông qua Microsoft Security Exposure Management trong cổng Defender. Khách hàng có thể quét các kho lưu trữ Git, xem các phát hiện được xếp hạng từ không chắc chắn đến đã được chứng minh và sử dụng Defender CLI để tạo các đề xuất sửa mã để nhà phát triển xem xét.
Bản xem trước hiện tại giới hạn các kho lưu trữ ở khoảng 256MB và cho phép một lần quét đồng thời cho mỗi tenant. Dự án Perception dự kiến sẽ mở rộng cùng một phương pháp đa tác nhân vượt ra ngoài việc quét mã sang các quy trình giám sát mối đe dọa và khắc phục rộng hơn.