今天,我們很高興推出 Muse Spark 1.1,這是 Meta Superintelligence Labs 的最新模型,也是 Muse Spark 的重大升級版。Muse Spark 1.1 是一個為代理任務打造的多模態推理模型,在工具與電腦使用、程式碼撰寫和多模態理解方面都有顯著提升。

這些改進讓 Muse Spark 1.1 推進了效能與效率的極限。結合本週推出的 Muse Image,這次發布讓我們更接近個人超級智慧的願景:一個能幫助您追求目標、實現想像、深化人際關係並對您最重視的事物採取行動的模型。

隨著這次發布,我們也推出了全新 Meta Model API 的公開預覽版,開發者可以透過它存取 Muse Spark 1.1。此模型目前已在 Meta AI 應用程式和 meta.ai 的「思考」模式中提供。

Muse Spark 1.1 在需要跨多種外部應用程式和服務進行規劃與協調的個人代理任務中,展現了卓越的效能。它能零樣本泛化到新的原生工具、MCP 伺服器和自訂技能。

它處理複雜專案的速度比 Muse Spark 快得多,因為它經過訓練,能協調多代理系統以優化端到端延遲。作為主要代理,它能收集上下文、制定計畫,並將執行任務委派給並行的子代理。作為子代理,它會遵守其職責、理解可用工具,並知道何時需要回報給主要代理。

Muse Spark 1.1 能主動管理其一百萬個 token 的上下文視窗。它能記住操作、從早期工作中檢索資訊,並以一種方式壓縮內容,以保留後續工作所需的關鍵步驟。

Muse Spark 1.1 擅長處理跨多個應用程式、資訊即時變化的電腦使用工作流程。它能在長時間的會話中保持上下文,適應不斷變化的需求,並以最少的人工干預導航不熟悉的介面。

Muse Spark 1.1 不會一次一個點擊地推理每個桌面步驟,而是理解何時自動化以及何時直接使用介面。我們訓練該模型在自動化更快時編寫腳本,在直接互動更簡單時點擊,並在每個步驟生成批次操作。

例如,在代理式的晚宴組織中,實際應用中會出現改變任務的新上下文。Muse Spark 1.1 在下訂單時會注意到這些變化,並在無需用戶干預的情況下進行必要的更新。

Muse Spark 1.1 在涉及大型複雜程式碼庫的實際任務中,程式碼撰寫效能大幅提升。它能診斷並修復複雜的錯誤,在企業級系統中實作新功能,並執行大規模的程式碼遷移。在建立網路應用程式和端到端問答等使用案例中,Muse Spark 1.1 比我們第一個模型展現出巨大的進步。

我們訓練模型以順暢地適應各種框架,並可靠地處理複雜的多輪動態。Muse Spark 1.1 在流行的代理式程式碼撰寫設定中表現良好,支援規劃模式、目標條件、子代理委派和上下文壓縮等常見功能。

在 OpenCode 中的偵錯示範中,Muse Spark 1.1 建立了一個聊天網路應用程式,自動截圖以識別用戶可見的故障,追溯問題到相關程式碼以實作修復,並驗證這些更改。該模型無縫地結合了程式碼撰寫、多模態理解和工具呼叫。

在 Meta 內部,開發者和研究人員每天都在使用 Muse Spark 1.1,以更快地建構和更智慧地工作。在我們主要的內部程式碼評估基準 Meta Internal Coding Bench 上,Muse Spark 1.1 顯著優於 Muse Spark,並與領先的替代方案具有競爭力。

研究人員現在也透過在他們的工作流程中利用 Muse Spark 1.1,來自動化模型開發和評估任務。例如,在 OpenCode 中的 DeepSWE 評估中,Muse Spark 1.1 會在 DeepSWE 任務的子集上,根據不同的推理強度進行自我評估,並根據結果生成分析儀表板。

除了程式碼撰寫和代理能力外,Muse Spark 1.1 在感知、多模態推理和工具使用方面也表現出色。它能與真實環境互動,並產生有根據的輸出,其優勢包括視覺到程式碼的產物生成、超詳細的圖像和影片字幕,以及多模態使用案例的代理工作流程執行。

Muse Spark 1.1 的多模態能力在感知和行動需要同時發生時尤其有價值。該模型可以檢查視覺和音訊,在漫長的工作流程中保留細節,並在代表用戶操作電腦時使用這些細節。

例如,在 Facebook Marketplace 代理中,Muse Spark 1.1 使用智慧型手機拍攝的影片,提取有用的照片並對產品進行推理,以操作用戶的瀏覽器並代表用戶在 Facebook Marketplace 上發布商品。

在部署之前,我們根據「進階 AI 擴展框架」進行了廣泛的安全評估,該框架定義了我們最先進模型的評估、威脅模型和部署閾值。

在所有前沿風險類別,包括化學與生物、網路安全和失控,我們的評估顯示 Muse Spark 1.1 在安全範圍內運行。Muse Spark 1.1 對於直接越獄以及來自不受信任資料、提示詞注入和開發者提示詞攻擊的間接攻擊,都展現出強大的抵抗力。

因此,它展現了更好的對抗性穩健性、更低的幻覺率和減少的奉承行為。我們關於 1.1 版本的完整安全立場已記錄在我們的 Muse Spark 1.1 評估報告中。

開發者現在首次可以透過全新 Meta Model API 的公開預覽版,開始使用 Muse Spark 1.1 進行開發。Muse Spark 1.1 的早期合作夥伴稱讚該模型是一個完整的代理基礎,結合了長上下文處理能力與強大的程式碼撰寫和推理能力,足以處理大規模的代理工作負載。

Replit 執行長 Amjad Masad 表示:「Muse Spark 最令人印象深刻的是它將如此多的功能整合到一個模型中:龐大的一百萬 token 上下文、完整的多模態支援(圖像、影片、PDF)、內建帶引用的搜尋、強大的推理能力、頂級的程式碼撰寫能力(特別是前端和設計)、結構化輸出以及並行工具呼叫,所有這些都整合在一個乾淨、與 OpenAI 相容的套件中。這是一個完整的代理基礎。」

Cline 執行長 Saoud Rizwan 說:「Meta 明顯正在為嚴肅的代理式程式碼撰寫而努力,它具有強大的工具使用能力,且價格合理,使其能夠大規模運行實際的程式碼工作負載。這種組合很稀有,這正是我們希望 Cline 開發者能提早接觸的原因。」

Box 的 AI 產品副總裁 Yashodha Bhavnani 提到:「當針對 Box 的企業工作評估集進行測試時,Muse Spark 提供了與當今領先的前沿模型相媲美的企業級能力。這種智慧水平,結合其在專業服務、公共部門和工業營運等行業中結構化、程序化工作流程方面的優勢,使其成為組織的引人注目選擇。」

OpenClaw Foundation 的 Dave Morin 則表示:「Muse Spark 1.1 是一個用於運行代理的絕佳模型。它快速、強大,並且與 OpenClaw 結合使用時非常有趣。」

我們很高興能發布 Muse Spark 1.1,這證明了我們的研究動力。我們還有更強大的模型正在訓練中,並期待分享未來的發展。