首頁LBank 新聞中心
AI 模型 Ox Alpha 免費,勝過 Claude Fable,且無人知道其開發者是誰
mysterious-ai-model-ox-alpha
AI 模型 Ox Alpha 免費,勝過 Claude Fable,且無人知道其開發者是誰
Ox Alpha 在基準測試中名列前茅,可讀取百萬個 token、支援影片輸入,並讓開發者猜測其背後的開發者是誰。
2026-08-24 來源:decrypt.co

簡報

  • Ox Alpha,一個免費的「隱形模型」,於8月20日在OpenRouter、OpenCode、Cline和Nous Research的portal+上線。
  • 一個廣為流傳的說法稱,Ox Alpha在DeepSWE上超越了Claude Fable 5和GPT-5.6 Sol,此說法源自於一個10項任務的樣本;但兩次獨立的完整113項任務運行結果均接近63%,與GPT-5.6 Sol大致持平。
  • Google、小米、DeepSeek和微軟的MAI都被提出可能是其背後的模型;但最流行的理論指向智譜AI的GLM-5.3系列。

AI愛好者對一個名為Ox Alpha的AI模型感到非常興奮,該模型於8月20日在OpenRouter上出現,但未附帶任何公司名稱。

該列表將其描述為「一個專為編碼、持續代理工作和生產工作負載設計的推理模型」,由一家選擇在預覽期間保持匿名的第三方供應商打造。

Myriad:OpenAI何時會發布GPT-6?點擊進行預測。

更重要的是,這個神秘的AI模型在令人印象深刻的編碼基準測試中,已經超越了Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol。

DeepSWE是一個衡量編碼代理在首次嘗試時正確解決真實GitHub問題的頻率的基準測試,以在91個儲存庫中提取的113個任務中通過任務的百分比來衡量,它顯示Ox Alpha與最優秀的模型具有競爭力。

開發者Ben Davis進行了初步的10項任務樣本測試,Ox Alpha在首次通過時達到80%,領先於Claude Fable 5的65%和GPT-5.6 Sol的52%。這個數字在一天內迅速傳播開來,各種版本仍在流傳,仿佛Ox Alpha對這兩個模型擁有明顯優勢。

I ran this thing through 10 tasks on DeepSWE (so there could be a ton of variance in it's real score, this is a subset), but uh...

gpt-5.6-sol: 52%
fable: 65%
whatever the hell this is: 80% (was a near miss on the "x"s so actually over 80%)

I am very confused https://t.co/VfH6n5i7xc pic.twitter.com/NdDSTjoHLj

— Ben Davis (@davis7) August 21, 2026

截至8月22日,Ox Alpha在Artificial Analysis或LMSys Arena上仍沒有任何記錄。

該模型可免費使用,單一上下文窗口可讀取約100萬個tokens,並接受文本、圖像和視頻作為輸入,同時返回文本。它還支持工具和函數調用,儘管其JSON輸出不強制遵守模式——這對於期望結構化響應的開發者來說是一個真正的缺口。

OpenCode表示其路由每天可處理100兆個tokens;Nous Research透過其自有入口網站提供該模型免費使用,聲稱容量為1千兆。Tokens是模型可以處理的基本信息單位,這樣的吞吐量使其與當今市場上最常用且功能最強大的模型不相上下。

這些數字讓人很容易得出結論,該模型非常出色,以至於他們預期會有大量使用,並且提供商擁有足夠的基礎設施來支持負載。

Ox Alpha (stealth model) is free for the next week

- 1M Context
- Multi-modal
- Zero Data Retention

Generous rate limits, near unlimited usage

We have capacity for 100T tokens per day, lets see what you can do

— OpenCode (@opencode) August 20, 2026

為何眾人矚目

Stripe執行長Patrick Collison,其公司於8月19日同意收購OpenRouter,在X上的一篇貼文中稱Ox Alpha「非常令人印象深刻」。這位知名科技高管的這句話,在模型發布數小時內就將其推入了更廣泛的討論。

$ ori --model stealth/ox-alpha

It's very impressive. https://t.co/LRISKwKTOL

— Patrick Collison (@patrickc) August 21, 2026

至今無人出面聲稱其所有權。AI分析師Andrew Curran週五發文稱,人們對於Ox Alpha的來源「似乎更不確定」。

隨著該模型的日益普及,猜測遊戲迅速分歧。開發者們提出了微軟未發布的MAI系列、小米的MiMo系列、DeepSeek、阿里巴巴的通義千問(Qwen),甚至Google的Gemini——足夠多的人猜測是Gemini,以至於一位開發者開玩笑說Google正在用競爭對手的隱形模型來為自己的產品做宣傳。但這些候選模型大多數都未能經受住證據的檢驗。

小米MiMo v2.5接受音頻輸入,而Ox Alpha明確拒絕此一主要功能。DeepSeek從未推出視頻功能,且發布的是開放權重而非進行隱形預覽。Google和通義千問(Qwen)都完全使用不同的分詞器和視頻編碼器,因此很難將其與這些模型建立確鑿聯繫。

剩下的線索指向智譜AI的模型家族。獨立指紋識別顯示,Ox Alpha的分詞器在所有標準化測試中與GLM-5.3完全匹配,其視頻token消耗在四個獨立片段中與GLM-5V-Turbo完全一致,並且它還共享GLM獨特的錯誤和音頻拒絕行為。

Ox Alpha's tokenizer is one for one identical to GLM's. No other lab's tokenizer gets past 4/11 when it comes to tokenizer similarity.https://t.co/3K25G4U2hX
(h/t: @sushsrinivasan)

(3/n) pic.twitter.com/dNwwZmCYZ7

— Ananay (@ananayarora) August 21, 2026

然而,一個細節使完美匹配變得複雜。GLM-5.3於8月14日發布時是一個純文本模型,比Ox Alpha以完整的視頻支持出現早了六天。如果指紋識別成立,Ox Alpha更可能是該系列未發布的多模態升級版,而非完全相同的副本——分析師已開始將其稱為GLM-5.3 Flash。

智譜AI對Ox Alpha至今未發表任何公開聲明。

究竟什麼是隱形模型?

隱形模型是指透過OpenRouter等路由平台,在未署名的情況下發布的前沿AI系統,讓實驗室在承諾公開發布之前收集實際使用數據。

這種模式已成為中國實驗室的常態。智譜AI自己的Pony Alpha在二月份的五天內被揭露為GLM-5,小米的Hunter Alpha在三月份被證實是MiMo-V2-Pro,而美團的Owl Alpha則匿名運行了兩個月,直到六月份才確認其為LongCat-2.0。

Ox Alpha目前已在OpenRouter上線,模型ID為stealth/ox-alpha,並可透過OpenCode、Cline和Nous Portal免費查詢。OpenCode的發布聲明指出,免費窗口從8月20日首次亮相起約為一週,這表示截止日期可能在8月27日左右——此後,如果前四個匿名模型的模式成立,最終可能會有公司揭示其真實身份。