
Inilabas ng Alibaba ang Qwen3.8-Max noong Lunes, tinawag itong pinakamakapangyarihang modelo na nabuo nila kailanman. Ang mga weights ay ilalabas sa Hugging Face at ModelScope sa susunod na linggo—ito ang unang pagkakataon na nagbigay ang kumpanya ng isang modelo sa Max scale.
Malaki ang mga specs: 2.4 trilyong parameter sa kabuuan, na may 95 bilyon na nakabukas sa anumang sandali. Ang mga parameter ay ang bilang ng mga 'dials' na kayang hawakan ng isang modelo.
Ito ay lubos na mahalaga para sa kahusayan dahil nangangahulugan ito na hindi ito mangangailangan ng napakaraming resources upang tumakbo. Isipin ito bilang isang malaking aklatan kung saan ang nauugnay na istante lamang ang umiilaw para sa bawat tanong. Ang maliliit na negosyo at lab na may sapat na hardware ay maaari na ngayong magpatakbo ng isang state-of-the-art na modelo nang hindi gumagastos nang kasinglaki ng isang malaking datacenter.
Ang post ng paglabas ng Alibaba ay nilalampasan ang karaniwang pahayag ng paghabol sa benchmark at sa halip ay nakasandal sa pagtitiis. Ginugol ng modelo ang 16 na araw sa pagbuo ng isang coding tool nang mag-isa—265 na commits, 127 pull requests, 151 na isyu, walang tao na humahawak sa keyboard. Ginugol nito ang limang araw sa pag-reproduce ng isang research paper na hindi pa nito nakikita ang code, at pagkatapos ay tinalo ang sariling resulta ng paper ng 2.7 puntos. Sa isang 24-oras na kumpetisyon sa machine learning, natapos ito nang mas maaga kaysa sa 458 sa 526 na human teams.
Ang Qwen3.8-Max ay may kasamang mga tagubilin para sa Claude Code at Codex, ang mga coding tool na ginawa ng Anthropic at OpenAI. Ang API ng Alibaba ay gumagamit ng mga protocol ng parehong kumpanya. Karamihan sa mga coding benchmark nito ay pinatakbo sa loob ng Claude Code.
At ang mga benchmark na iyon ay hindi ito pinapaboran. Sa 31 text tests, ang Fable 5 ng Anthropic ay nakakuha ng 15 unang puwesto, ang GPT-5.6 Sol ng OpenAI ay nakakuha ng siyam, ang Qwen ay nakakuha ng pito. Sa 12 coding tests, isang beses lamang nanalo ang Qwen. Gayunpaman, sa mga tuntunin ng intelligence costs, ang modelong ito ay lubhang mura at mahusay, na nangangahulugang kahit na nangangailangan ito ng mas maraming iterations o pangangatwiran, ang gastos sa pagkumpleto ng trabaho ay magiging mas mababa, halos 30% ng singil ng Claude Fable 5.
Gayunpaman, lumipat sa multimodal na gawain—mga dokumento, video, spatial reasoning—at ang mga ranggo ay bumaliktad. Nangunguna ang Qwen sa halos buong talahanayan na iyon.
Mayroon ding pagbabago sa business strategy. Noong Abril, tinanggal ng Alibaba ang free tier ng Qwen Code, kung saan ang koponan ay lumipat sa mga closed, paid models matapos ang pag-alis ng mga pinuno. Ang aming review ng Qwen 3.7 Max ay nagpahiwatig na ang bersyon ng Plus ay magiging open habang ang Max ay nanatiling naka-lock sa likod ng API.
Bukas na ngayon ang pintuan na iyon, at hindi aksidente ang timing. Ang mga Chinese open-weight models ay mula sa mas mababa sa 2% ng tokens sa OpenRouter noong huling bahagi ng 2024 patungo sa humigit-kumulang 61% sa kalagitnaan ng 2026. Nalampasan ng Qwen ang Llama ng Meta bilang pinakabinuksang-sarili na modelo sa mundo.
Samantala, pinaghihigpitan ng Washington ang Fable 5 at Mythos 5 sa ilalim ng export controls noong Hunyo, at ang Beijing ay naiulat na pinag-iisipan ang sarili nitong mga limitasyon sa mga Chinese models na pumupunta sa ibang bansa.
Kaya ang Alibaba ay natatalo sa papel at nananalo sa distribusyon. Kung makakapag-download ka ng isang bagay na malapit sa kalidad nang libre, maayos na ang ikalawang puwesto.