
Meta 是最新推出編碼代理的科技巨頭,正競相與領先的 AI 巨頭 Anthropic 和 OpenAI 競爭。
該公司在官方公告中寫道:「我們很高興發布 Muse Code(測試版),這是一款由我們最新模型 Muse Spark 1.2 驅動的終端編碼代理。這標誌著我們邁向前沿的下一步,更大、功能更強大的模型正在開發中。」
作為一種代理式編碼工具,Muse Code 專為大型程式碼庫的軟體工程而建構。根據 Meta 的說法,它「負責處理大型程式碼庫中複雜的軟體工程任務:規劃變更、編寫程式碼並驗證結果。它可以為每項任務協調多個持久性子代理,更快、更準確且以更少的干預解決困難問題。」
最引人注目的細節是其運行時。Muse Code 將每個模型調用、工具運行、批准和編輯記錄到一個作為單一真相來源的本地事件日誌中。Meta 表示:「這個單一真相來源使運行時能夠精確重播並在重啟後安全恢復:崩潰後,代理可以精確地從停止的地方恢復。」對於長時間運行的任務來說,這項功能比純粹的速度更重要,而這也是競爭對手尚未強調的賣點。
它還附帶預設技能。「/plan」指令將任務轉化為一個需要批准的計畫,而「/grill」則對該計畫進行壓力測試直到其穩固,並且「/goal」致力於成功完成目標,類似於 Hermes 的做法。Meta 表示,它將 Muse Spark 1.2 與 Muse Code 共同訓練,因此核心大型語言模型(LLM)和代理能夠協同合作。
Muse Spark 1.2 是對 Muse Spark 1.1 進行的專注於編碼的更新。Meta 表示,它「顯著擴大了在編碼任務上的訓練計算規模,同時擴展了訓練環境的多樣性,從而改進了程式碼生成、複雜除錯和端到端開發者工作流程。」圖表說明了一切。
在 Terminal-Bench 2.1 上,Muse Spark 1.2 搭配 Muse Code 的得分為 82.9%,落後於 Opus 5 上的 Claude Code (86.7%),但領先於 Codex 上的 GPT-5.6 Terra (81.8%) 和 Grok Build (81.6%)。
衡量代理式編碼能力的 DeepSWE 1.1 測試結果更為接近:Muse 為 59.3%,而 Opus 5 為 65.0%,Codex 為 64.8%。在 Meta 內部編碼基準測試中,Muse 達到 70.6%,而 Opus 5 則為 79.4%。
加速圖表顛倒了順序。在超過 1,000 次工具調用中,Opus 5 相較於基準線的增益最大(約 74–75%),而 Muse Spark 1.2 則處於中游,約為 61–69%,具體取決於運行情況。Meta 的觀點是,該代理會隨著工具調用的累積而不斷改進,這正是你期望從一個長期導向的編碼器那裡獲得的行為。
最有趣的演示是長期性和多模態的。在壓力測試中,Meta 表示 Muse Code「在 Nvidia Hopper GPU 上,透過超過 1,000 次工具調用(長達 24 小時)疊代優化 GPU 核心。」這意味著它能夠隨著時間的推移而改進。
還有一個視覺編碼的角度。在一個演示中,使用者將一個房屋的飛越影片以 mp4 格式拖放到終端,Muse Code「解釋該影片並產生一個視覺豐富且具備預訂功能的網站。」將原始影片讀取到一個可運行的網路應用程式中,是 Meta 在整個 Muse 系列中一直推廣的多模態賣點。
查看發佈推文串:
這是 Muse Code 多模態視覺編碼能力的一個例子。在此演示中,用戶將一個房屋的飛越影片以 mp4 檔案形式輸入終端。Muse Code 解釋該影片並產生一個視覺豐富且具備預訂功能的網站。 pic.twitter.com/3CAfIMYmAB
— AI at Meta (@AIatMeta) August 5, 2026
儘管如此,Meta 在這場競爭中起步較晚。OpenAI 的 Codex 已經運行並行雲端代理;DeepSeek 也開發了自己的 Claude Code 競爭對手,而 Hermes 或 OpenClaw 等代理工具也已是功能更強大的良好替代品。Muse Code 的優勢在於其防崩潰運行時和子代理設計,而非基準測試的領先地位。
代理式編碼的風險一如既往:一個在崩潰後能恢復並持續調用工具長達 24 小時的代理,既強大又不可預測。Meta 押注開發者們渴望這種自主性,並正在推出此產品。
Muse Code 可透過輸入以下指令安裝並進行測試:
curl -fsSL https://dev.meta.ai/install.sh | bash