
Inilabas ng Mistral AI ang Mistral Medium 3.5 noong Abril 29. Inihayag ng lab na nakabase sa Paris ang isang siksik na 128-bilyong-parameter na modelo, isang set ng mga agentic na feature—at agad na nakatanggap ng maraming online na “meh” na reaksyon.
Ang paglabas ay dumating sa tatlong bahagi. Una, ang modelo mismo. Pangalawa, ang remote coding agents sa pamamagitan ng Mistral Vibe CLI—mga cloud-based na coding session na maaaring mag-push ng pull requests sa GitHub at tumakbo nang sabay-sabay nang hindi ka nakaupo sa isang terminal. Pangatlo, ang Work Mode sa Le Chat, ang ChatGPT-style na consumer interface ng Mistral, na ngayon ay humahawak ng multi-step na autonomous na gawain tulad ng pag-triage ng email, synthesis ng pananaliksik, at cross-tool workflows.
Malalaking ambisyon, ngunit isang magulong katotohanan sa benchmark.
Ang Medium 3.5 ay nakakuha ng 77.6% sa SWE-Bench Verified—isang coding benchmark na sumusubok kung ang isang modelo ay kayang ayusin ang totoong mga isyu sa GitHub sa pamamagitan ng pagbuo ng mga gumaganang patch. Nakuha rin nito ang 91.4% sa τ³-Telecom, na sumusukat sa paggamit ng agentic tool sa mga espesyalisadong kapaligiran. Pinagsama rin ng Mistral ang tatlong dating hiwalay na modelo (Medium 3.1, Magistral, at Devstral 2) sa isang set ng weights na may configurable na reasoning effort bawat request.
Ang pinag-isang modelo na pumalit sa tatlo ay isang tunay na tagumpay sa inhinyero. Ang problema ay kung magkano ito at sino ang kalaban nito.
Ang Mistral ay naniningil ng $1.50 kada milyong input token at $7.50 kada milyong output token. Ang Qwen 3.6 ng Alibaba na may 27 bilyong parameter—mas mababa sa isang-kapat ng bilang ng parameter ng Medium 3.5—ay nakakuha ng 72.4% sa parehong SWE-Bench Verified benchmark at available sa ilalim ng Apache 2.0, ibig sabihin ay maaari mo itong i-download at patakbuhin nang libre.
Ang mga parameter ang nagtatakda ng kakayahan ng isang AI na matuto, mag-isip, at mag-imbak ng impormasyon. Kung mas maraming parameter, mas malawak ang saklaw ng kaalaman ng modelo.
Kapag tiningnan ang mga open-source leaderboard, kitang-kita ang sitwasyon. Ang mga nangungunang puwesto ay pagmamay-ari ng Qwen ng Alibaba, GLM mula sa Zhipu AI ng Tsina, at MiMo-V2 mula sa Xiaomi, na lahat ay mas mura, mas malakas, at mas mapagkumpitensya kaysa sa bagong release ng Mistral. Ang Medium 3.5 ay hindi pa nakakapasok sa mga pangunahing independent leaderboard—nakabinbin pa ang mga third-party na pagsusuri.
Ang tanging maganda lamang, ayon sa ilan, ay ang Mistral ay, sa puntong ito, ang nag-iisang non-Chinese na modelo na may seryosong presensya sa open-source na usapan.
Sa tingin ko, ang Mistral ay may ika-10 pinakamataas na valuation sa buong AI scene (mga ganoon).
Samantalang sila ay patuloy na naglalabas ng ilan sa mga pinakamasamang modelo.
Nakaraos sila sa pamamagitan ng burukrasya, lobbying at pulitika ng Europa.
Lahat dahil nakumbinsi nila ang mga baliw na burukrata… https://t.co/kh7ASvdi7C
— Youssof Altoukhi (@Youssofal_) April 29, 2026
Si Pedro Domingos, isang propesor ng machine learning sa University of Washington, ay hindi naging malumanay:
"Ang mga regular na kumpanya ng AI ay ipinagyayabang kung gaano kagaling ang kanilang modelo sa mga benchmark. Tanging ang Mistral lang ang ipinagyayabang kung gaano kahina ang sa kanila."
Ang mga regular na kumpanya ng AI ay ipinagyayabang kung gaano kagaling ang kanilang modelo sa mga benchmark. Tanging ang Mistral lang ang ipinagyayabang kung gaano kahina ang sa kanila. pic.twitter.com/WcAKskaVpL
— Pedro Domingos (@pmddomingos) April 30, 2026
Sinundan niya ito ng isang mas matalim na tanong: "Hindi ko alam kung ano ang mas masahol, para sa Europa na hindi makasali sa AI race o para ito ay irepresenta ng isang katawa-tawang tulad ng Mistral."
Si Youssof Altoukhi, founder ng Yoyo Studios, ay nagkalkula: Ang Qwen 3.6, na may 27 bilyong parameter, ay 4.7 beses na mas maliit kaysa sa Medium 3.5 at nakakakuha ng maihahambing na marka sa coding. Ang pagpepresyo ng output ng Medium 3.5 ay naglalagay dito sa tabi ng mga closed model na nakakakuha ng mas mataas na marka sa bawat pangunahing benchmark.
"Kung hindi dahil sa kanilang galing sa pulitika, matagal na silang nalugi," aniya.
Hindi lahat ay puro pagwawalang-bahala. Nahuli ng AI developer na si Michal Langmajer ang pag-aalinlangan:
"Tunay akong nagagalak na mayroon pa ring non-US, non-Chinese lab na sumusubok bumuo ng frontier LLMs ngunit kailangan nating pagbutihin ang laro sa Europa. Ang kanilang bagong flagship model ay 'hindi ang pinakamahusay' sa anumang benchmark, ngunit nagkakahalaga ng ilang beses na mas mahal kaysa sa karamihan ng mga kakumpitensya."
Tunay akong nagagalak na mayroon pa ring non-US, non-Chinese lab na sumusubok bumuo ng frontier LLMs (@MistralAI) ngunit kailangan nating pagbutihin ang laro sa Europa.
Ang kanilang bagong flagship model ay 'hindi ang pinakamahusay' sa anumang benchmark, ngunit nagkakahalaga ng ilang beses na mas mahal kaysa sa karamihan ng mga kakumpitensya...
— Michal Langmajer (@MichalLangmajer) April 30, 2026
Ikinatwiran ng ilang developer na ang open weights ay para sa tibay, hindi para sa leaderboard. Ang isang modelo na maaaring i-download, i-fine-tune, at i-self-host ng sinuman ay hindi kailangang manalo sa mga ranggo ngayon upang manatiling relevant. Itinuro naman ng iba ang totoong enterprise deployments ng Mistral sa buong Europa bilang ebidensya na ang moat ay hindi lamang purong teknikal.
Dito nakasalalay ang aktwal na bentahe ng Mistral.
Ang mga European enterprise sa ilalim ng GDPR, mga bangko na humahawak ng sensitibong data ng customer, at mga gobyerno na hindi magruruta ng AI workloads sa pamamagitan ng imprastraktura ng Tsina ay may limitadong opsyon. Gaya ng iniulat ng Decrypt noong Disyembre, lumagda ang HSBC ng multi-year deal sa Mistral partikular upang i-self-host ang mga modelo sa sarili nitong imprastraktura. Ang apela ng isang open-weight lab na nakabase sa EU na may $14 bilyong valuation ay hindi lumalabas sa mga benchmark table—ngunit lumalabas ito sa mga desisyon sa pagkuha ng serbisyo.
Hindi ang pinakamahusay sa coding, at hindi rin ang pinakamura. Ngunit ito ay: hindi Amerikano, hindi Tsino, naba-audit, maaaring i-self-host, at ligal na ligtas para sa European enterprise.