Meta 發表了 Muse Spark 1.3,這是其五個月內推出的第四款模型。獨立測試顯示,該模型在代理任務方面取得了顯著進展,但與頂尖模型仍有差距。這款模型的主要賣點是其價格。

Meta 透過 Muse Code 和 Meta Model API 發布了 Muse Spark 1.3。該系列於四月推出,1.1 版在七月發布,1.2 版則在八月。根據 Artificial Analysis 的報告,xhigh 等級現已可用,而運算需求更高的 max 等級則需在進一步的安全測試後才會推出,目前僅限合作夥伴預覽。

Muse Spark 1.3 的輸入和輸出每百萬個 token 價格維持不變,分別為 1.25 美元和 4.25 美元,這使得單一索引任務的成本為 0.55 美元。目前沒有任何得分達到 59 分或更高的模型比它便宜,而同等索引水平的競爭對手價格介於 0.94 美元至 1.23 美元之間。不過,Muse Spark 1.3 的成本確實高於 1.2 版的 0.40 美元。

在 Intelligence Index 評測中,max 等級獲得 62 分,xhigh 等級獲得 61 分,相較於八月的 57 分和七月的 53 分有所提升。這次的進步主要歸因於該指數對測試項目的權重分配。其中,GDPval-AA v2 佔 20%,Terminal-Bench 2.1 佔 16%,τ³-Bench Banking 佔 14%,而 Meta 最大的進步恰好集中在這三個測試項目上。

在 τ³-Banking 測試中,代理程式在模擬銀行情境下操作工具,max 等級達到了 52% 的分數。根據 Artificial Analysis 的數據,這目前是第一名,也是該模型唯一取得絕對領先的項目。可用的 xhigh 等級達到 47%,與 Claude Fable 5.1 (max) 和 GLM-5.3-Flash 並列,而非領先。其前身 1.2 版的得分為 35%。

在測試終端編碼能力的 Terminal-Bench 2.1 中,xhigh 等級從 80% 上升到 85%,max 等級則達到 86%,但 Claude Fable 5.1 仍以其 max 等級的 91.4%、xhigh 等級的 91.0% 和 high 等級的 89.9% 保持領先地位。

在該指數權重最高的 GDPval-AA v2 測試中,Meta 的分數從 1,615 提升至 1,709 和 1,754,此分數是根據人類專家在 220 項真實世界專業任務中表現為 1,000 分的標準進行校準。Claude Fable 5.1 (max) 的分數為 1,853。

Meta 透過增加運算資源來取得 max 版本的優勢,其推理 token 的消耗比 xhigh 版本多出 62%。

在代理任務測試之外,該模型表現仍處於中等水平。

在提出專家級科學問題的 GPQA Diamond 測試中,Muse Spark 的分數從 90% 上升到 94%。這屬於頂尖群體,但仍低於 Gemini 3.8 Flash (high) 的 95.3% 和 Grok 4.6 (high) 的 94.9%。

在涵蓋研究物理學的 CritPt 測試中,分數從 18% 大幅躍升至 26%,但仍遠落後於 GPT-5.6 Sol (max) 的 32.3% 和 Claude Fable 5.1 (xhigh) 的 31.1%。

有兩項分數相較於 1.2 版實際上有所下降。AA-LCR 從 83% 下降到 79%。AA-Omniscience 中的事實準確性下降了最多三個百分點,因為該模型在不確定時更常拒絕回答。

Meta 和 Artificial Analysis 都尚未公布 max 版本的價格。更大規模的模型和開源權重版本也正在開發中。