隨著我們建構出更強大、更個人化的 AI,其可靠性、安全性與使用者保護變得比以往任何時候都更加重要。先進的模型需要先進的安全方法,且該方法必須能隨著技術規模化。今天,我們將詳細說明這項工作:包括我們更新的「先進 AI 擴展框架」、針對 Muse Spark 的「安全與準備報告」,以及我們模型如何從底層推理安全性的新進展,確保隨著 AI 能力提升,我們的保護措施也能同步跟進。

### 先進 AI 擴展框架今天,我們在原有的「前沿 AI 框架」基礎上,發布了顯著更新且更嚴謹的版本:「先進 AI 擴展框架」。這次更新擴大了我們評估的風險類型,強化了部署決策的制定方式,並引入了新的「安全與準備報告」。更具體地說,此框架概述了我們如何識別和評估最嚴重且新興的風險,包括化學與生物、網路安全,以及新增的「失控」風險評估部分。

隨著模型變得更加先進,我們正在評估它們在獲得更大自主權時的表現,以及對其行為的控制是否按預期運作。這些標準適用於我們所有的前沿部署,無論是開源、受控的 API 存取,還是封閉模型。實際上,這也意味著要繪製潛在風險圖譜,在應用防護措施前後評估模型以確認其在現實世界中的有效性,並且只有當模型符合我們框架設定的標準時才進行部署。

對於在我們應用程式中使用 Meta AI 的使用者而言,這表示驅動他們體驗的模型在發布前,已針對廣泛的風險進行了評估。雖然我們更新的框架強化了對我們最先進模型的標準和防護措施,但我們新的「安全與準備報告」將展示我們如何達成這些標準。這些報告將詳細說明我們的風險評估、評估結果、部署決策背後的理由,以及我們仍在努力解決的任何限制。

這種透明度意味著我們將分享我們的發現、如何測試模型、評估的不足之處,以及我們如何彌補這些差距。### 安全與準備報告針對 Muse Spark,我們在部署前進行了廣泛的安全評估。由於其先進的推理能力,我們在應用保護措施前後都對模型進行了評估,不僅測試了網路安全、化學與生物威脅等最嚴重的風險,還針對我們長期以來的安全政策進行了測試,這些政策旨在防止暴力、兒童安全違規和犯罪行為等危害與濫用,以及確保意識形態平衡的政策。

我們的評估方法在設計上是多層次的,並在模型部署前就已開始。我們針對數千種專門設計用於發現弱點的情境進行測試,追蹤這些嘗試成功的頻率,並努力將該數字降至最低。由於沒有任何評估是詳盡無遺的,我們還透過自動化系統監控即時流量,這些系統旨在發現意外問題,以便我們能迅速解決。

結果顯示,我們所測量的所有風險類別都具有強大的防護措施。我們的評估也表明,Muse Spark 在避免模型回應中出現意識形態偏見方面處於領先地位。我們也評估了模型是否能以難以控制的方式自主行動,而我們的評估證實它不具備造成這些風險所需的自主能力。

我們的「安全與準備報告」除了所有評估結果外,還詳細說明了這一發現背後的具體評估,包括我們測試了什麼以及我們發現了什麼。### 隨模型規模化而進化的安全措施這些保護措施內建於每個階段,從過濾模型學習的資料,到以安全為重點的訓練,再到產品層級運行的防護欄。

由於我們的保護措施需要隨著模型複雜度的提升而演進,這項工作將永無止境。特別是,Muse Spark 比我們上一代模型更具能力,正是這種能力使得管理模型的方法得以根本性創新。早期的做法依賴於逐一教導模型處理特定情境,例如訓練它們拒絕回應或轉導至可信來源。

這種方法雖然有效,但難以規模化。由於 Muse Spark 具備推理能力,我們改進了方法:我們將信任與安全準則,涵蓋內容與對話安全、回應品質以及處理不同觀點等領域,轉化為清晰、可測試的原則。我們還訓練模型理解事物為何安全,不僅是規則本身,還有規則背後的原因。

這意味著模型能更好地處理基於規則的系統可能未能預料到的新穎情況。這項工作並非取代人工監督,而是提升了其作用。我們的團隊設計指導模型行為的原則,針對真實世界情境嚴格驗證這些原則,並疊加額外的防護措施,以捕捉模型可能仍會遺漏的問題。其結果是保護措施應用得更廣泛、更一致,並隨著模型推理能力的提升而改進。

## 展示我們的成果隨著我們在 Meta AI 方面取得重大進展並部署我們最先進的模型,「安全與準備報告」展示了我們如何在每個步驟中評估和管理風險。我們將持續投入防護措施、測試和研究,讓使用者能夠依賴具備內建保護、旨在確保其安全的 AI 體驗。