PangunaLBank News Center
Ayon sa Microsoft, Natalo ng MDASH ang Claude Mythos at GPT-5.6 Sol sa Pagsusuri sa Cybersecurity
microsoft-mdash-beats-claude-mythos-gpt-5-6-sol-cybersecurity
Ayon sa Microsoft, Natalo ng MDASH ang Claude Mythos at GPT-5.6 Sol sa Pagsusuri sa Cybersecurity
Sabi ng Microsoft, pinapahintulutan ng bago nitong cyber model ang mahigit 100 AI agents na makahanap ng mga depekto sa software sa kalahati ng halaga ng kasalukuyan nitong pinakamahusay na MDASH configuration.
2026-07-27 Pinagmulan:decrypt.co

Sa maikling salita

  • Sinasabi ng Microsoft na nakakuha ang MDASH ng 95.95% sa CyberGym, na tinalo ang GPT-5.5 Cyber, Mythos 5, GPT-5.6 Sol, at Gemini 3.5 Flash Cyber.
  • Hawak ng MAI-Cyber-1-Flash ang hanggang 90% ng gawain, habang ipinapadala ng MDASH ang pinakamahirap na kaso sa GPT-5.4.
  • Ang scanner ay nasa pribadong preview sa pamamagitan ng Microsoft Defender, kung saan maaaring suriin ng mga team ang mga natuklasan at bumuo ng mga iminungkahing pag-aayos.

Inilabas ng Microsoft ang una nitong nakatuon na modelo ng cybersecurity na pinangalanang MAI-Cyber-1-Flash at isinaksak ito sa MDASH, isang sistema sa paghahanap ng vulnerability na sinasabi nitong tinalo ang Mythos 5 ng Anthropic at GPT-5.6 Sol ng OpenAI habang nagkakahalaga ng 50% na mas mababa kaysa sa kasalukuyang pinakamahusay na konfigurasyon ng MDASH ng Microsoft, ayon sa kumpanya.

Ang pinagsamang setup ay nakakuha ng 95.95% sa CyberGym, ayon sa Microsoft. Ang CyberGym ay isang benchmark na humihingi sa mga AI agent na gayahin ang 1,507 kilalang vulnerabilities sa 188 open-source na proyekto, pagkatapos ay binibigyan sila ng score batay sa porsyento na matagumpay na nagaya sa isang kontroladong kapaligiran.

Ito ang naglagay sa MDASH nang mas mataas kaysa sa GPT-5.5 Cyber sa 85.6%, Mythos 5 sa 83.8%, GPT-5.6 Sol sa 83.6%, at Gemini 3.5 Flash Cyber sa 83.2%. Ang resulta ay iniulat mismo ng Microsoft at hindi pa lumalabas sa pampublikong leaderboard ng CyberGym sa oras ng paglathala, bagaman ang benchmark ay gumagamit ng isang pampublikong test set at isang tinukoy na sukatan ng tagumpay.

Ang MAI-Cyber-1-Flash ay hindi gumagana nang mag-isa. Sinasabi ng Microsoft na hawak nito ang hanggang 90% ng mga gawain, habang irinaruta ng MDASH ang pinakamahirap na 10% sa GPT-5.4. Mahalaga ito dahil ang mga token—ang mga tipak ng teksto na pinoproseso ng isang AI—ay nagkakahalaga ng pera sa bawat pagbasa ng modelo ng code o paggawa ng sagot.

Larawan: Microsoft

Ito ang kauna-unahang pagkakataon na ang isang modelo ng Microsoft na binuo para sa kahusayan ay kayang talunin ang isang siksik na state-of-the-art na modelo na binuo na may pangkalahatang kakayahan sa isip. "Kapag pinagsama sa MDASH, ang (MAI-Cyber-1-Flash) ay naghahatid ng world-class na pagganap sa 50 porsyento ng halaga ng mga nangungunang modelo," isinulat ni CEO ng Microsoft na si Satya Nadella.

Today, we are announcing a series of updates that give customers frontier-grade security at half the cost.

MAI-Cyber-1-Flash is our first cybersecurity model, built ground up to find the most challenging vulnerabilities in complex code bases. When combined with MDASH, it… pic.twitter.com/npcIihN1H7

— Satya Nadella (@satyanadella) July 27, 2026

Ang isang modelo (sa kasong ito ay MAI-Cyber-1-Flash) ay ang AI na nag-iisip tungkol sa code. Ang isang harness (MDASH sa kasong ito) ay ang makinarya sa paligid nito: ang mga ahente, kagamitan, pagsusuri, at workflow na nagpapasya kung saan titingin, hahamon sa mga pinaghihinalaang natuklasan, mag-aalis ng mga duplicate, at magpapatunay na maaaring ma-trigger ang isang bug.

Gumagamit ang MDASH ng mahigit 100 espesyal na ahente na nakatalaga upang suriin ang code, talakayin kung tunay ang isang natuklasan, at bumuo ng isang proof of concept—isang gumaganang demonstrasyon na umiiral ang depekto.

Sinabi ng Microsoft na ang paminsan-minsang pag-scan at naantalang mga patch ay nagiging luma na habang pinapababa ng AI ang gastos sa pagtuklas ng bug. Ikinakatwiran ng kumpanya na ang mga dekada ng datos sa seguridad ay nagbibigay dito ng bentahe, at idinagdag, "Walang sinuman ang makakagawa ng kasaysayang ito."

Mula nang ilabas ang Claude Mythos, sinusubukan ng mga eksperto sa cybersecurity na talunin o pantayan ang mga kakayahan nito. Ginaya ng mga mananaliksik ang Mythos-style vulnerability hunting gamit ang mga pampublikong modelo sa halagang mas mababa sa $30 bawat scan. Sinabi ni Dawid Moczadło, isa sa mga mananaliksik na kasama, "ang moat ay lumilipat mula sa model access patungo sa validation."

Ang mahirap mahanap na bahagi ay nagiging ang sistema na nagpapatunay ng mga natuklasan nang hindi binabaon ang mga developer sa ilalim ng mga maling alarma.

Iniulat din ng Decrypt na kamakailan ay kinuha ng GPT-5.5 Cyber ang pampublikong CyberGym lead na may 85.6% score, bahagyang tinalo ang Mythos. Ang score ng Microsoft ay halos 10 puntos sa itaas ng GPT-5.5 Cyber at 7.5 puntos sa itaas ng nakaraang resulta ng MDASH, ngunit sinusuri nito ang buong sistema sa halip na ang MAI-Cyber-1-Flash nang mag-isa.

Inilalagay ng Microsoft ang MDASH sa pribadong preview sa pamamagitan ng Microsoft Security Exposure Management sa Defender portal. Maaaring i-scan ng mga customer ang mga Git repository, tingnan ang mga natuklasan na niraranggo mula sa hindi malamang hanggang sa napatunayan, at gamitin ang Defender CLI upang bumuo ng mga iminungkahing pag-aayos ng code para sa pagsusuri ng developer.

Kasalukuyang nililimitahan ng preview ang mga repository sa humigit-kumulang 256MB at pinapayagan ang isang sabay-sabay na pag-scan bawat tenant. Inaasahang palalawakin ng Project Perception ang parehong multi-agent na diskarte lampas sa code scanning sa mas malawak na pagsubaybay sa banta at mga workflow ng pagwawasto.