AI 能力已邁入新篇章,這也要求 AI 政策必須跟上腳步。沒有任何一家公司、產業或政府能獨自應對這項挑戰。我們必須把握當前時機,優先採取有意義的行動,而非追求完美的政策。以下是我們正在做的事情:
推動強制性的國家級 AI 安全要求:我們希望與美國國會合作,制定基於能力、具強制性的國家級 AI 安全法規。
維持各州立法動能:在國會採取行動之前,我們將繼續支持各州立法,以強化更廣泛的 AI 安全生態系。今天,我們宣布支持加州四項法案:SB 813 關於獨立安全評估的整體基礎設施、AB 1405 關於 AI 稽核員標準、SB 1119 關於保護年輕人,以及 AB 1864 關於防範 AI 驅動的生物威脅。
推進產業主導的標準:我們將與其他前沿實驗室合作,推進前沿 AI 標準,無論政府是否支持,現在就開始建立自願性規範。
建立全球標準:我們將倡導兼容的國際方法,以衡量能力、管理風險、保留人類控制權,並決定何時以及如何減緩或停止開發,即使這意味著減緩模型能力的進步。
我們的首席科學家 Jakub Pachocki 最近撰文指出,機器智慧的快速崛起,包括遞歸式自我改進的潛力,都要求「極度謹慎」。OpenAI 將繼續尋求對齊和監測的技術解決方案,建立防禦系統,並在必要時減緩開發速度。然而,單一實驗室內部的技術工作將不足以應對。我們還需要共同的標準,包括何時應該減緩或停止開發。
這項挑戰的利害關係極其巨大。先進的 AI 可以加速新藥開發、強化關鍵基礎設施、擴大經濟機會,並協助解決人類世代努力仍無法攻克的科學問題。然而,使模型更有用的能力也伴隨著風險,且這些能力不會僅限於少數前沿實驗室。全球開發的模型,包括開源模型,將日益接近當今的前沿水平並廣泛普及。
Astra 的能力、AI 驅動研究加速的早期證據,以及 Jakub 的文章都指向同一個方向:AI 正在快速發展,政策也必須隨之推進。
Greg Brockman 曾描述一個「防禦者窗口」:這是一個有限的時期,前沿 AI 可以幫助防禦者強化關鍵系統,以免強大的攻擊能力廣泛傳播。政策制定者也面臨類似的時刻:一個正在關閉的窗口,必須在 AI 能力超越負責治理的機構之前,建立持久的保障措施。隨著能力增長,對安全的信心必須日益決定 AI 進步的速度。安全並非進步的阻礙;它正是讓進步走得更遠、造福更多人的基礎。
我們已在模型開發生命週期中強化了監測、對齊和安全保障措施,包括對前沿研究工作負載進行更強的隔離、擴大在工具輔助訓練和評估期間的模型行為監測,以及更明確的疑慮升級規則。對於 Astra,我們還引入了對完整軌跡(包括思維鏈)的普遍監測,並在更廣泛的內部部署之前設置了強制性的對齊評估關卡。
這些保障措施必須持續領先於 AI 能力。當進程可能帶來不可接受的安全風險時,我們將減緩或停止開發或部署我們無法充分保障的系統,正如我們過去所做,並按照我們的準備框架所要求。
為遞歸式自我改進做準備:完全自主的遞歸式自我改進,即 AI 系統獨立驅動後續世代、能力日益增強的 AI,目前尚未發生。除非且直到能夠安全地實現,我們不應追求它。
然而,AI 已經在加速用於開發和對齊下一代模型的部分研究。我們最新的研究顯示,AI 代理可以執行一些需要熟練研究人員數天才能完成的任務。這雖然不是遞歸式自我改進,但卻是其發展方向的證據。
這種加速也必須且能夠導向安全。我們的目標是安全地建立自動化 AI 研究員,在人類監督下推進深度學習和對齊,利用每一代 AI 來幫助使下一代更安全、更對齊、更容易控制,而不僅僅是更強大。
各國政府應制定共同的方法來衡量這項進展,保留有意義的人類控制權,並建立共同的安全門檻,以決定何時以及如何減緩或停止開發。如果我們無法在不減緩能力增長的情況下達到某些安全門檻,我們應該優先考慮前者。科技越強大,周圍的保障措施就必須越堅固。
與國會合作制定強制性國家級 AI 安全要求:AI 加速開發的前景,要求的不僅僅是自願承諾。美國需要具強制性、基於能力的國家級法規,並且能夠隨著技術發展而演進。
我們的《前沿 AI 民主治理藍圖》為建立持久的聯邦框架指明了道路:包括共同的測試和獨立評估要求、更強大的網路安全保護、明確的事件報告規則、更高的國家準備度,以及追蹤遞歸式自我改進進展的共同衡量標準。
國會中目前正形成幾項嚴肅的前沿安全提案。我們將繼續建設性地參與,並期望支持能實質提升安全門檻的立法。在如此高的利害關係下,我們不能讓「追求完美」成為「達成良好」的敵人。國會應在休會前採取行動。
國家框架應堅固但目標明確。前沿安全要求應適用於少數資源充足、開發最先進系統的實驗室,而非新創公司、小型開發商或遠離前沿的研究人員。義務應與能力和風險成比例。
前沿安全政策也不應成為「開源模型政策」的代名詞。開源模型可以是解決方案的一部分,尤其是在網路安全領域,以及主權、安全或資料在地化需求有利於本地部署的情況下。大多數開源模型並非在前沿競爭,而是在成本、控制和延遲方面競爭。正如我們簽署《開源權重與美國 AI 領導力》信函時所確認的,美國需要開源和閉源兩種模型。聯邦框架應解決前沿能力和風險,同時不削弱競爭、鞏固現有企業或將創新推向海外。
一個嚴肅的公共框架應該減少而非增加權力集中。目前,前沿實驗室在很大程度上自行制定管理前沿風險的規則。民主問責的標準、獨立驗證和有意義的透明度將取代這種分散的私人治理體系。
這對於美國的領導地位至關重要。美國不能僅憑能力贏得 AI 時代。如果人民、機構和政府對這項技術缺乏足夠信任而無法採用,技術上的領先將意義不大。強大的保障措施並非對創新的讓步。它們是廣泛採用以及美國持久領導地位所需的基礎設施的一部分。
維持各州動能:我們迫切需要國家級的 AI 標準,任何在前沿領域工作的人都能看到其緊迫性。在國會採取行動之前,各州應繼續填補空白並提高標準。
OpenAI 曾支持加州的 SB 53、紐約的 RAISE 法案、伊利諾州的 SB 315,以及麻薩諸塞州正在審議的前沿安全立法中的獨立稽核。我們鼓勵各州圍繞這些共同的保障措施達成共識。透過這樣做,他們可以建立一個事實上的國家基準,最終由國會編纂成法,我們稱之為「逆向聯邦主義」。然而,協調並不意味著凍結現有要求。
今天,我們正式認可另外四項已獲加州議會通過並將提交給州長 Newsom 的法案。這些法案共同解決了 AI 安全生態系中互補的部分。
SB 813 將建立一個程序,用於指定有能力評估 AI 風險的合格獨立組織。正如我們在《前沿安全藍圖》中所述,我們傾向於在聯邦層級要求獨立技術評估,以便政策制定者可以為評估員資格、安全和高度敏感資訊的存取建立一致的標準。然而,在聯邦政府缺乏行動的情況下,加州可以幫助建立一個安全、有能力的國家獨立評估系統的運作規則,從而產生更好的安全成果。
AB 1405 將為 AI 稽核員建立註冊、獨立性、透明度和問責制要求。
SB 1119 將要求對使用陪伴式聊天機器人的兒童和青少年進行年齡驗證、風險評估、獨立稽核、家長控制,並提供有害內容防護。我們最近已表示支持這項法案,它建立在 OpenAI 透過產品、全球政策原則以及對《家長與兒童安全 AI 法案》的支持所推進的青少年安全措施之上,以及 ChatGPT for Teens 中內建的保護措施,包括敏感領域的更強預設值、靜默時間、學習時間和休息提醒。
AB 1864 將要求基因合成供應商和桌上型合成設備製造商遵循聯邦篩選標準,強化了對 AI 驅動生物威脅的重要實體保障措施。
其中一些法案我們過去並未支持,但在重新考慮到我們最近觀察到的能力躍升後,現在決定予以支持。
這些法案並不能取代聯邦法規。它們是嚴肅的努力,可以立即保護人們,展示可行的保障措施是什麼樣子,並有助於為聯邦行動積聚動能。
呼籲制定產業標準以監測前沿 AI:單靠法律無法使先進 AI 安全。我們還需要開發最先進系統的實驗室內部具體的實踐。最迫切的起點是監測。
這對於「對齊問題」尤其重要,當模型以違反人類意圖或既定界限的方式追求目標時,不一定需要意識或惡意。隨著模型獲得更大的自主性、使用更強大的工具並運行更長時間,開發者應被要求監測這些未對齊的行為,並證明已實施有效的保障措施。
監測必須與明確的披露要求連結。正如我們在加州所倡導的,當模型在開發或評估期間未經授權規避其他組織的安全控制,並實質存取、修改或破壞該組織的受保護系統或機密資訊時,公司應被要求立即以書面形式通知受影響方。我們也支持聯邦政府對其他嚴重 AI 事件的報告要求,並正在努力定義哪些事件應被涵蓋以及這些要求應包含什麼。
正如我們上週所分享的,OpenAI 正在開發一個框架,用於報告具重大影響的對齊問題事件,並系統性地監測前沿模型的活動,包括內部使用。這將從公司主導的努力開始。



