今天,我們很高興推出 Muse Spark,這是 Meta 超級智慧實驗室(Meta Superintelligence Labs)開發的 Muse 模型家族中的首款產品。Muse Spark 是一個原生多模態推理模型,支援工具使用、視覺思維鏈(visual chain of thought)以及多代理協作(multi-agent orchestration)。
Muse Spark 是我們擴展藍圖上的第一步,也是我們從根本上改革 AI 工作的首個成果。為了支持進一步的擴展,我們正在對整個技術堆疊進行策略性投資,範圍涵蓋從研究、模型訓練到基礎設施,包括 Hyperion 資料中心。在這篇文章中,我們將首先探討 Muse Spark 的新功能和應用。
在介紹這些成果之後,我們將深入探討推動我們邁向個人超級智慧的擴展軸心。Muse Spark 即日起可在 meta.ai 和 Meta AI 應用程式上使用。我們也將向部分選定用戶開放私人 API 預覽。個人超級智慧的功能Muse Spark 在多模態感知、推理、健康和代理任務方面提供了具競爭力的表現。
我們將持續投資於目前仍存在性能差距的領域,例如長週期代理系統和程式碼工作流程。隨著更大規模模型的開發,這些成果證明我們的技術堆疊正在有效擴展。我們也同步發布了「沉思模式」(Contemplating mode),它能協調多個代理(agents)平行進行推理。
這使得 Muse Spark 能夠與 Gemini Deep Think 和 GPT Pro 等前沿模型(frontier models)的極端推理模式競爭。「沉思模式」在具挑戰性的任務中顯著提升了能力,在「人類最終考試」(Humanity’s Last Exam)中達到 58% 的表現,在「前沿科學研究」(FrontierScience Research)中達到 38%。
應用Muse Spark 是邁向理解您世界的個人超級智慧的第一步。從分析您的即時環境到支持您的健康,Muse Spark 先進的推理能力實現了強大且高度個人化的使用情境。多模態。Muse Spark 從底層設計就旨在整合跨領域和工具的視覺資訊。
它在視覺 STEM 問題、實體識別和定位方面表現出色。這些功能結合起來,能夠實現互動式體驗,例如創建有趣的迷你遊戲,或透過動態註釋來排除家用電器故障。健康。個人超級智慧的一個主要應用是幫助人們了解和改善他們的健康。為了提升 Muse Spark 的健康推理能力,我們與超過 1,000 名醫生合作,策劃了訓練資料,以實現更真實和全面的回應。
Muse Spark 可以生成互動式顯示,解析並解釋健康資訊,例如各種食物的營養成分或運動時啟動的肌肉。擴展軸心為了建立個人超級智慧,我們的模型能力應該能夠可預測且高效地擴展。以下,我們將分享如何沿著三個軸心研究和追蹤 Muse Spark 的擴展特性:預訓練、強化學習和測試時推理。
預訓練。預訓練階段是 Muse Spark 獲取其核心多模態理解、推理和程式碼能力的階段,這是強化學習和測試時運算所依賴的基礎。在過去九個月中,我們透過改進模型架構、最佳化和資料策劃,重建了我們的預訓練堆疊。這些進步共同提升了我們從每個運算單元中提取的能力。
為了嚴格評估我們的新方法,我們將擴展定律(scaling law)應用於一系列小型模型,並比較達到特定性能水平所需的訓練浮點運算次數(FLOPs)。結果很明確:我們可以用比我們之前的模型 Llama 4 Maverick 少一個數量級以上的運算量,達到相同的能力。
這項改進也使得 Muse Spark 比目前可供比較的領先基礎模型效率顯著更高。強化學習。在預訓練之後,強化學習(RL)利用運算資源可擴展地增強模型能力。儘管大規模強化學習以不穩定性著稱,我們的新堆疊卻能提供平穩、可預測的增益。下圖顯示了為 Muse Spark 擴展強化學習運算(以步數衡量)的好處。
左側圖表顯示,在訓練資料上,pass@1 和 pass@16(在 16 次嘗試中至少成功一次)呈現對數線性增長。這表明強化學習在不損害推理多樣性的情況下提高了模型的可靠性。右側圖表顯示,在保留的評估集上的準確度增長證明了強化學習的增益具有可預測的泛化能力:Muse Spark 在訓練中未見過的任務上也能平穩地提升表現。
測試時推理。強化學習訓練我們的模型在回答之前「思考」,這個過程稱為測試時推理。將這項能力提供給數十億用戶需要高效利用推理代幣(reasoning tokens)。為此,我們依賴兩個關鍵槓桿:思考時間懲罰以最佳化代幣使用,以及多代理協作以提升性能而不減慢回應時間。
為了在每個代幣中提供最大的智慧,我們的強化學習訓練在思考時間懲罰的約束下最大化正確性。在 AIME 等部分評估中,這會導致一個相變。在模型透過更長時間思考而改進的初始階段之後,長度懲罰會導致「思維壓縮」(thought compression),Muse Spark 壓縮其推理,使用顯著更少的代幣來解決問題。
壓縮之後,模型再次擴展其解決方案以實現更強的性能。為了在不大幅增加延遲的情況下進行更多的測試時推理,我們可以擴展平行協作解決難題的代理數量。下圖說明了這種方法的好處。標準的測試時擴展是單一代理思考更長時間,而透過多代理思考來擴展 Muse Spark 則能在相似的延遲下實現卓越的性能。
安全性Muse Spark 在雙重用途(dual-use)科學領域具有廣泛的推理能力,因此我們在部署前進行了廣泛的安全評估。我們的流程遵循更新後的《進階 AI 擴展框架》(Advanced AI Scaling Framework),該框架為我們最先進的模型定義了威脅模型、評估協議和部署閾值。
我們在應用安全緩解措施之前和之後,對 Muse Spark 進行了跨前沿風險類別、行為對齊和對抗性穩健性(adversarial robustness)的評估。我們發現 Muse Spark 在生物和化學武器等高風險領域展現出強烈的拒絕行為,這得益於預訓練資料過濾、以安全為重點的後訓練以及系統級防護措施。
在網路安全和失控領域,Muse Spark 並未展現實現威脅情境所需的自主能力或危險傾向。我們的評估顯示,考量其部署情境,Muse Spark 在我們測量的所有前沿風險類別中都處於安全範圍內。完整結果可在我們的《安全與準備報告》(Safety & Preparedness Report)中查閱。
在第三方對接近發布檢查點的評估中,Apollo Research 發現 Muse Spark 展現了他們觀察到的模型中最高的「評估意識」(evaluation awareness)水平。該模型經常將某些情境識別為「對齊陷阱」(alignment traps),並推斷它應該誠實行事,因為它正在被評估。
這很重要,因為能識別評估情境的模型在測試期間的行為可能與部署時不同。然而,這些結果並未證實意識會直接改變行為,而我們自己的後續調查發現初步證據表明,評估意識可能會影響模型在小部分對齊評估中的行為,所有這些都與影響模型發布決策的危險能力或傾向無關。
我們得出結論,這並非發布的阻礙,但值得進一步研究。更多內容請參閱我們的《安全與準備報告》。結論透過 Muse Spark,我們正處於一個可預測且高效的擴展軌跡上。我們期待很快能分享在通往個人超級智慧之路上,能力日益增強的模型。


