
Nagbalik ang DeepSeek, at lumabas ito ilang oras matapos ilabas ng OpenAI ang GPT-5.5. Nagkataon lang? Marahil. Ngunit kung isa kang Chinese AI lab na sinusubukan pigilan ng gobyerno ng U.S. sa pamamagitan ng pagbabawal sa pag-export ng chip sa loob ng nakaraang tatlong taon, nagiging matalim ang iyong pakiramdam sa timing.
Inilabas ng lab na nakabase sa Hangzhou ang mga preview na bersyon ng DeepSeek-V4-Pro at DeepSeek-V4-Flash ngayon, parehong open-weight, at parehong may isang milyong token context windows. Nangangahulugan iyon na maaari kang gumana sa isang konteksto na halos kasinglaki ng Lord of the Rings Trilogy bago mag-collapse ang modelo. Pareho rin itong mas mura kaysa sa anumang maihahambing sa Kanluran, at parehong libre para sa mga kayang patakbuhin nang lokal.
Ang huling malaking paggambala ng DeepSeek—R1 noong Enero 2025—ay nagtanggal ng $600 bilyon mula sa market cap ng Nvidia sa isang araw habang tinanong ng mga investor kung talagang kailangan ng mga kumpanya sa Amerika ng napakalaking investment upang makagawa ng mga resulta na nakamit ng isang maliit na Chinese lab sa maliit na bahagi lamang ng gastos. Ang V4 ay ibang uri ng galaw: mas tahimik, mas teknikal, at mas nakatuon sa kahusayan para sa sinumang talagang bumubuo gamit ang AI.
Sa dalawang bagong modelo, ang V4-Pro ng DeepSeek ang malaki, na may 1.6 trilyong kabuuang parameter. Upang ilagay iyon sa perspektibo, ang mga parameter ay ang panloob na "setting" o "brain cells" na ginagamit ng isang modelo upang mag-imbak ng kaalaman at makilala ang mga pattern—mas maraming parameter ang isang modelo, mas kumplikadong impormasyon ang teoretikal nitong kayang hawakan. Ginagawa nitong pinakamalaking open-source model sa merkado ng LLM hanggang ngayon. Maaaring nakakatawa ang laki hanggang malaman mong 49 bilyon lang sa mga ito ang aktibo sa bawat inference pass.
Ito ang trick ng Mixture-of-Experts na pinino ng DeepSeek mula noong V3: Naroon ang buong modelo, ngunit ang nauugnay lamang na bahagi nito ang gumagana para sa anumang partikular na kahilingan. Mas maraming kaalaman, parehong compute bill.
“Ang DeepSeek-V4-Pro-Max, ang maximum reasoning effort mode ng DeepSeek-V4-Pro, ay malaki ang pag-unlad sa mga kakayahan sa kaalaman ng mga open-source model, matatag na naitatag ang sarili bilang pinakamahusay na open-source model na available ngayon,” isinulat ng Deepseek sa opisyal na card ng modelo sa Huggingface. “Nakakamit nito ang top-tier performance sa mga coding benchmark at malaki ang pinupunan ang agwat sa mga nangungunang closed-source model sa reasoning at agentic tasks.”
Ang V4-Flash ay ang praktikal: 284 bilyong kabuuang parameter, 13 bilyong aktibo. Idinisenyo ito upang maging mas mabilis, mas mura, at ayon sa sariling benchmark ng DeepSeek, “nakakamit ang maihahambing na reasoning performance sa bersyon ng Pro kapag binigyan ng mas malaking thinking budget.”
Parehong sumusuporta sa isang milyong tokens ng konteksto. Ito ay halos 750,000 salita—halos ang buong trilogy ng “Lord of the Rings” at dagdag pa. At iyon ay bilang isang standard na feature, hindi premium tier.
Narito ang teknikal na bahagi para sa mga nerds o sa mga interesado sa salamangka na nagpapagana sa modelo. Hindi itinatago ng Deepseek ang mga lihim nito, at lahat ay available nang libre—ang buong papel ay available sa Github.
Ang standard AI attention—ang mekanismo na nagpapahintulot sa isang modelo na maunawaan ang mga relasyon sa pagitan ng mga salita—ay may brutal na problema sa scaling. Sa bawat pagdoble ng haba ng konteksto, ang gastos sa compute ay halos maging quadruple. Kaya ang pagpapatakbo ng isang modelo sa isang milyong tokens ay hindi lamang dalawang beses na mas mahal kaysa sa 500,000 tokens. Apat na beses itong mas mahal. Ito ang dahilan kung bakit ang mahabang konteksto ay kasaysayang isang checkbox na idinaragdag ng mga lab at pagkatapos ay tahimik na pinipigilan sa likod ng mga rate limit.
Naimbento ng DeepSeek ang dalawang bagong uri ng attention upang malampasan ito. Ang una, Compressed Sparse Attention, ay gumagana sa dalawang hakbang. Una nitong kino-compress ang mga grupo ng tokens—halimbawa, bawat 4 na tokens—sa isang solong entry. Pagkatapos, sa halip na dumalo sa lahat ng mga naka-compress na entry, ginagamit nito ang isang "Lightning Indexer" upang piliin lamang ang pinakanauugnay na mga resulta para sa anumang partikular na query. Ang iyong modelo ay mula sa pagdalo sa isang milyong tokens patungo sa pagdalo sa isang mas maliit na set ng pinakamahalagang chunks, parang isang librarian na hindi nagbabasa ng bawat libro ngunit alam kung anong shelf ang dapat tingnan.
Ang ikalawa, Heavily Compressed Attention, ay mas agresibo. Kino-collapse nito ang bawat 128 tokens sa isang solong entry—walang sparse selection, purong compression lamang. Nawawala ang fine-grained na detalye, ngunit nakakakuha ka ng lubhang murang global view. Ang dalawang uri ng attention ay tumatakbo sa mga alternatibong layer, kaya nakukuha ng modelo ang detalye at ang pangkalahatang-ideya.
Ang resulta, mula sa teknikal na papel: Sa isang milyong tokens, ang V4-Pro ay gumagamit ng 27% ng compute na kailangan ng nauna nitong modelo (V3.2). Ang KV cache—ang memorya na kailangan ng modelo upang subaybayan ang konteksto—ay bumaba sa 10% lamang ng V3.2. Mas pinabilis pa ng V4-Flash iyon: 10% ng compute, 7% ng memorya.
At ito ay nagresulta sa pag-aalok ng Deepseek ng mas murang presyo bawat token kaysa sa mga kakumpitensya nito, habang nagbibigay ng maihahambing na resulta. Upang ilagay iyon sa dolyar: Ang GPT-5.5 ay inilunsad kahapon sa $5 input at $30 output bawat milyong tokens, na ang GPT-5.5 Pro ay nagkakahalaga ng $30 bawat milyong input tokens at $180 bawat milyong output tokens.
Ang Deepseek V4-Pro ay nagkakahalaga ng $1.74 input at $3.48 output. Ang V4-Flash ay nagkakahalaga ng $0.14 input at $0.28 output. Itinuro ni Cline CEO Saoud Rizwan na kung ginamit ng Uber ang DeepSeek sa halip na Claude, ang badyet nito sa AI para sa 2026—na iniulat na sapat para sa apat na buwan ng paggamit—ay tumagal sana ng pitong taon.
deepseek v4 is now the cheapest sota model available at 1/20th the cost of opus 4.7.
for perspective, if uber used deepseek instead of claude their 2026 ai budget would have lasted 7 years instead of only 4 months. pic.twitter.com/i9rJZzvRBV
— Saoud Rizwan (@sdrzn) April 24, 2026
May ginagawa ang DeepSeek na hindi karaniwan sa teknikal nitong ulat: Inilalabas nito ang mga agwat. Karamihan sa mga paglabas ng modelo ay pumipili ng mga benchmark kung saan sila nanalo. Ginawa ng DeepSeek ang buong paghahambing laban sa GPT-5.4 at Gemini-3.1-Pro, natuklasan na ang reasoning ng V4-Pro ay nahuhuli sa mga modelong iyon ng humigit-kumulang tatlo hanggang anim na buwan, at inilathala pa rin ito.
Kung saan talagang nanalo ang V4-Pro-Max: Codeforces, competitive programming benchmark, rated tulad ng chess ng tao. Nakakuha ang V4-Pro ng 3,206, inilalagay ito sa ika-23 sa mga aktwal na kalahok sa paligsahan ng tao. Sa Apex Shortlist, isang piniling set ng mahihirap na problema sa matematika at STEM, nakakuha ito ng pass rate at umabot sa 90.2% kumpara sa 85.9% ng Opus 4.6 at 78.1% ng GPT-5.4. Sa SWE-Verified, na sumusukat kung kaya ng isang modelo na ayusin ang tunay na mga isyu sa GitHub na kinuha mula sa aktwal na open-source repositories, nakakuha ito ng 80.6%—katumbas ng Claude Opus 4.6.
Kung saan ito nahuhuli: multitasking benchmark MMLU-Pro (Gemini-3.1-Pro sa 91.0% kumpara sa V4-Pro sa 87.5%), expert knowledge benchmark GPQA Diamond (Gemini 94.3 kumpara sa V4-Pro 90.1), at Humanity's Last Exam, isang graduate-level benchmark kung saan ang 44.4% ng Gemini-3.1-Pro ay nalampasan pa rin ang 37.7% ng V4-Pro.
Sa mahabang konteksto partikular, nangunguna ang V4-Pro sa mga open-source model at tinalo ang Gemini-3.1-Pro sa CorpusQA benchmark (isang pagsubok na naglilikha ng real document analysis sa isang milyong tokens), ngunit natatalo sa Claude Opus 4.6 sa MRCR—isang pagsubok na sumusukat kung gaano kahusay ang isang modelo sa pagkuha ng mga partikular na karayom na nakabaon nang malalim sa isang napakahabang haystack.
Ang mga agentic stuff ay kung saan nagiging interesante ang paglabas na ito para sa mga developer na talagang naglalabas ng mga produkto.
Kaya ng V4-Pro na tumakbo sa Claude Code, OpenCode, at iba pang AI coding tools. Ayon sa internal na survey ng DeepSeek sa 85 developer na gumamit ng V4-Pro bilang kanilang pangunahing coding agent, 52% ang nagsabing handa na itong maging default nilang modelo, 39% ang sumusuporta rito, at mas kaunti sa 9% ang nagsabing hindi. Sinabi ng mga internal na empleyado na nalalampasan nito ang Claude Sonnet at lumalapit sa Claude Opus 4.5 sa mga agentic coding tasks.
Ang Artificial Analysis, na nagsasagawa ng mga independiyenteng ebalwasyon ng mga modelo ng AI sa mga real-world na gawain, ay niranggo ang V4-Pro bilang una sa lahat ng open-weight model sa GDPval-AA—isang benchmark na sumusubok sa economically valuable knowledge work sa finance, legal, at research tasks, na may score sa pamamagitan ng Elo. Nakakuha ang V4-Pro-Max ng 1,554 Elo, na nangunguna sa GLM-5.1 (1,535) at M2.7 ng MiniMax (1,514). Para sa sanggunian, ang Claude Opus 4.6 ay nakakuha ng 1,619 sa parehong benchmark—nangunguna pa rin, ngunit lumiliit ang agwat.
DeepSeek V4 Pro is the #1 open weights model on GDPval-AA, our agentic real-world work tasks evaluation@deepseek_ai has released V4 Pro (1.6T total / 49B active) and V4 Flash (284B total / 13B active). V4 is DeepSeek's first new size since V3, with all intermediate models… pic.twitter.com/2kJWVrKQjF
— Artificial Analysis (@ArtificialAnlys) April 24, 2026
Ipinakilala rin ng Deepseek's V4 ang tinatawag na “interleaved thinking.” Sa mga nakaraang modelo, kung nagpapatakbo ka ng isang ahente na gumagawa ng maraming tool calls—halimbawa, naghanap sa web, pagkatapos ay nagpatakbo ng ilang code, pagkatapos ay naghanap muli—ang reasoning context ng modelo ay nabubura sa pagitan ng mga round. Sa bawat bagong hakbang, kailangan ng modelo na buuin muli ang mental nitong modelo mula sa simula. Pinapanatili ng V4 ang buong chain of thought sa lahat ng tool calls, kaya ang 20-step na agent workflow ay hindi magdurusa sa amnesia sa kalagitnaan. Mahalaga ito kaysa sa tunog nito para sa sinumang nagpapatakbo ng mga kumplikadong automated pipeline.
Nilimitahan ng U.S. ang pag-export ng mga high-end na Nvidia chip sa China mula pa noong 2022. Ang layunin ay pabagalin ang pag-unlad ng Chinese AI, ngunit hindi pinigilan ng pagbabawal sa chip ang DeepSeek at sa halip ay ginawa silang bumuo ng mas mahusay na arkitektura at gumawa ng sariling hardware supply.
Hindi inilabas ng DeepSeek ang V4 sa kawalan—ang espasyo ng AI ay puno ng aktibidad kamakailan: Inilabas ng Anthropic ang Claude Opus 4.7 noong Abril 16—isang modelo na sinubok ng Decrypt at natagpuang malakas sa coding at reasoning, na may kapansin-pansing mataas na token usage. Ang araw bago iyon, ang Anthropic ay mayroon ding Claude Mythos, isang cybersecurity model na sinasabi nitong hindi nito maaaring ilabas sa publiko dahil napakahusay nito sa autonomous network attacks.
Inilabas ng Xiaomi ang MiMo V2.5 Pro noong Abril 22, na naging full multimodal—image, audio, video. Nagkakahalaga ng $1 input at $3 output bawat milyong tokens. Natapatan nito ang Opus 4.6 sa karamihan ng mga coding benchmark. Tatlong buwan na ang nakakaraan, walang nag-uusap tungkol sa Xiaomi bilang isang frontier AI company. Ngayon ay naglalabas na ito ng mga kakumpitensiyang modelo nang mas mabilis kaysa sa karamihan ng mga lab sa Kanluran.
Ang GPT-5.5 ng OpenAI ay dumating kahapon na may mga gastos na umabot sa $180 bawat milyong tokens ng output sa Pro na bersyon. Natalo nito ang V4-Pro sa Terminal Bench 2.0 (82.7% kumpara sa 70.0%), na sumusubok sa mga kumplikadong command-line agent workflow. Ngunit mas mahal ito kaysa sa V4-Pro para sa katumbas na mga gawain. Sa parehong araw, inilabas ng Tencent ang Hy3, isa pang state-of-the-art na modelo na nakatuon sa kahusayan.
Kaya sa dami ng bagong modelong available, ang tanong na talagang tinatanong ng mga developer: Kailan sulit ang premium?
Para sa enterprise, maaaring nagbago ang matematika. Ang isang modelo na nangunguna sa mga open-source benchmark sa halagang $1.74 bawat milyong input token ay nangangahulugang ang malakihang pagproseso ng dokumento, legal na pagsusuri, o mga pipeline ng pagbuo ng code na mahal anim na buwan na ang nakalipas ay mas mura na ngayon. Ang isang milyong token context ay nangangahulugang maaari kang maglagay ng buong codebases o regulatory filings sa isang solong kahilingan sa halip na hatiin ang mga ito sa maraming tawag.
Bukod pa rito, ang open-source nature nito ay nangangahulugang hindi lamang ito maaaring patakbuhin nang libre sa lokal na hardware, kundi maaari rin itong i-customize at pagbutihin batay sa mga pangangailangan at use case ng kumpanya.
Para sa mga developer at solo builders, ang V4-Flash ang dapat abangan. Sa $0.14 input at $0.28 output, mas mura ito kaysa sa mga modelo na itinuturing na budget option isang taon na ang nakakaraan—at kaya nitong hawakan ang karamihan ng mga gawain na ginagawa ng bersyon ng Pro. Ang kasalukuyang deepseek-chat at deepseek-reasoner endpoints ng DeepSeek ay nagro-route na sa V4-Flash sa non-thinking at thinking modes ayon sa pagkakabanggit, kaya kung gumagamit ka ng API, ginagamit mo na ito.
Ang mga modelo ay text-only sa ngayon. Sinabi ng DeepSeek na gumagawa ito sa mga multimodal capabilities, na nangangahulugang ang ibang malalaking lab mula sa Xiaomi hanggang OpenAI ay mayroon pa ring kalamangan na iyon. Parehong MIT licensed ang mga modelo at available sa Hugging Face ngayon. Ang lumang deepseek-chat at deepseek-reasoner endpoints ay magre-retire sa Hulyo 24, 2026.