2023 年年中,在「RLSlow」研究專案中,我們首次看到了令人振奮的成果,這讓我們相信將能夠大規模訓練推理模型,解鎖預訓練模型形成自身思維鏈的能力。那個夜晚,Szymon 和我待在辦公室,思考的不是這項技術將帶來的驚人基準測試數據、產品或科學成果,而是努力消化一個令人警醒的事實:我們有生之年將會看到機器在智慧上顯著超越我們,而且我們已經看到了這些系統的雛形;我們想知道該如何提醒人們這件事的重要性。
三年後,推理語言模型已成為經濟中快速成長的一部分,並開始推動科學的邊界。它們能夠操作電腦和圖形介面,與人類及彼此協作,並執行研究專案。它們也正在改變電腦安全領域的格局,並帶來明顯的新危險。
在此期間,許多新研究不斷湧現,我們對這些系統的理解再次與 2023 年有所不同。根據內部結果,我強烈預期這種進步速度可以持續到遞迴式自我改進。如果 AI 發展沿著目前的道路繼續前進,我們在未來幾年將看到的系統,其能力躍升的幅度可能會更大,並日益推動自身的發展。
這是一個需要極度謹慎的時刻。我擔心沒有人為機器智慧持續快速提升的後果做好準備。OpenAI 將繼續尋求對齊和監控的技術解決方案,建立防禦系統,並在必要時單方面停止進一步擴展;然而,我認為需要更廣泛的干預措施。
我們無法完全理解的智慧
從高層次來看,機器智慧的進步是由運算能力的提升所驅動。OpenAI 在 2017 年左右,在多個研究專案中看到規模化帶來持續回報後,深刻體認到這一點。因此,我們尋求獲得比原先計畫多得多的運算資源,並日益將研究重心放在少數幾個高度可擴展的方向上。我們相信這是我們站在 AI 研究前沿並影響通用人工智慧(AGI)影響的唯一途徑。
在此過程中,新的演算法不斷被開發出來,來自團隊和個別研究人員的獨創性也不斷展現。我認為它們主要是在規模化道路上的發現;深度學習的科學仍處於萌芽階段,而有意義的演算法進步往往與運算資源的取得相關。如果將時間拉長到數年來看,AI 隨著擴展到更大的電腦,將持續變得更加智慧。
AI 更像是「生長」而非「設計」,它在很大程度上是透過在難以想像的運算量上重複執行簡單的優化步驟而產生的。這導致了一個極其複雜的系統,它能處理抽象概念並模擬人類行為的各個面向。我們可以透過類似神經科學的過程,發現這個系統中出現的微小機制,但同樣地,它的整體運作方式超出了我們能完全理解的描述。
基於深度學習的 AI 研究在很大程度上是一門實驗科學。我們投入大量精力建立有原則的演算法並做出可測試的預測,但從根本上說,我們的大規模訓練運行都是實驗,有時我們會對其結果感到驚訝。此外,隨著系統能力越來越強,結果也變得越來越難以解釋。
目前的演算法通常會更快地改進易於測量的能力,而非那些難以客觀量化的能力,這使得問題更加複雜。我們花費大量時間試圖理解能力如何泛化,以及優先發展哪些技能在未來幾年最為相關。例如,我們相信如果額外專注,可以讓模型在數學研究方面表現更好,但我們沒有優先考慮這個方向,因為我們對遞迴式自我改進(RSI)和自動對齊研究感到緊迫,這我將在後面討論。
透過規模化深度學習產生的智慧,不能直接與人類智慧相提並論。為了在現實世界中變得非常相關,非常有用或非常危險,AI 不需要匹配或超越所有人類能力;它只需要超越足夠多的能力。隨著它在越來越多的方面超越人類,要準確理解它的能力變得越來越困難。
教導機器去愛
由於機器智慧的產生過程與人類智慧根本不同,我們不能假設它預設遵循人類原則,或以類似人類的方式從中泛化。AI 研究的核心問題是對齊,讓 AI 按照人類標準「努力做正確的事」。
為了組織實際的研究方向,我發現區分目標對齊和價值對齊很有用。
目標對齊廣泛來說是:「AI 是否試圖達成其被設定的目標?」這可以包括遵守指令層級,或與人溝通協作、試圖理解其目標的能力。這類方向在實踐中極為相關。
價值對齊則是模型更內在的屬性。它是指能夠持有並從一套高層次原則中泛化;即使在給定不明確或衝突的目標,或處於不熟悉或對抗性情境時,也能「合理」行事。一個對齊的 AI 應該以誠實和正直,以及對人類的愛來行動。
當然,價值對齊和目標對齊之間的界限可能模糊,真正關心目標需要嘗試推斷其背後的意圖和價值觀。然而,通常當我談論對齊研究的長期重要性時,我指的是價值對齊。
AI 對齊的根本挑戰是泛化。隨著機器變得更智慧,它們開始處理更高層次的概念,並被置於與訓練時遇到的環境越來越不同的情境中。它們可能會在將訓練過程中教導和強化的價值觀泛化到這些新情境時失敗;而且我們很難確定它們將如何行動。AI 所使用的整體生態系統變化非常快,這使得問題更加困難;例如,今天訓練的 AI 需要能夠穩健地與各種其他 AI 互動。
至關重要的是,我們需要未來的 AI 繼續秉持人類價值觀,無論它們是否認為自己處於人類監督之下。
目前實際採用的對齊訓練方法主要有兩大類。
第一類是鼓勵對齊行為作為目標導向強化學習的一部分。模型的行動會被評估(通常由 AI 評估)是否符合給定的偏好模型、「規範」或「憲法」,並給予適當的獎勵。這種方法在一般情況下可能非常有效,並且是現代 AI 助理核心的構成部分。不幸的是,它也可能很脆弱,並且嚴重依賴訓練監督的覆蓋範圍以及模型從訓練中遇到的情境中泛化的能力。
例如,在 OpenAI-Hugging Face 事件中,代理人保持了不對人類進行社會工程的界限。然而,它們顯然未能避免其他超出範圍並違背其在其他設定中學到的價值觀精神的行為。
第二種方法旨在利用模型從預訓練資料中泛化的能力。這可能涉及精心製作誘發對齊的訓練資料集,或將模型聚焦於預訓練分佈中「對齊」的部分,例如人格選擇模型。這種方法的弱點在於對進一步優化壓力的魯棒性不足。如果你讓一個模型產生普遍「對齊」的想法,並讓它接受足夠的訓練以實現非常困難的目標,它可能會學會以有動機的方式推理:根據需要彎曲「看似對齊」的想法以達成目標。我們可能在最近涉及非 OpenAI 模型的網路安全事件中看到了這種行為的例子。
我們在這些方向所涵蓋的方法範圍內投入了大量資金。我們也看到了顯著的進展,GPT-6 Astra 是第一個受益於我們長期以來一直在努力的一些重要進步的模型,並且比 GPT-5.6 Sol 的對齊程度顯著提高。儘管如此,重要的是要承認並理解,隨著模型能力越來越強,還需要更多的進步;而且可泛化對齊的進步可能不足以超越通用模型智慧的進步。
監控泛化
我們沒有令人滿意的泛化理論,而且似乎不太可能很快發展出一個,至少在沒有更強大 AI 的幫助下是不可能的。因此,目前,我們經驗性驗證對齊技術的能力,實際上可能比對齊技術本身更為重要。
OpenAI 在這方面的主要押注是思維鏈監控。它基於一個吸引人的可擴展想法:模型的許多能力來自於口頭化的推理過程(思維鏈)。如果我們對該過程的結果進行優化,但不監督該過程本身,那麼思維鏈在訓練中就沒有直接的動機去隱藏任何未對齊的想法或目標。這並不意味著模型會學會將不依賴思維鏈的未對齊傾向外部化;然而,它確實可以讓我們監控推理能力的確切提升。
我們在開發推理模型的同時,也理解了思維鏈監控的潛在重要性。當我們發布 o1-preview 時,我們特意設計產品來隱藏思維鏈,以長期保護它免受監督壓力。此後在開發中,我們一直努力維持不監督推理過程的規則。思維鏈監控成為我們研究模型如何從訓練分佈中泛化的極其重要的工具,使我們不僅能觀察和分析它們的行動,還能觀察和分析它們的內部過程。
這個工具在我們研究 Astra 系列模型時仍然至關重要。然而,不幸的是,我們的評估表明我們對思維鏈監控的依賴能力正在逐漸減弱。這來自於多種因素的綜合影響。
現代推理模型在比 o1-preview 更複雜的環境中使用;它們的推理過程越來越與人、其他 AI 溝通以及使用工具相融合。其中許多互動必須受到監督,從而模糊了我們旨在保持的界限。
AI 正在越來越擅長推理和操縱自身的推理過程。
隨著預訓練性能的提高,我們也看到模型即使完全不使用口頭化推理,也變得更加智慧。
這些挑戰不一定無法克服。我希望我們能夠開發出干預措施,以提高我們模型的思維鏈可監控性,例如透過更好地理解不同優化目標和模型使用的測試時運算形式之間的相互作用。我也相信將思維鏈和激活監控的想法結合起來會很有價值,擴大對直接訪問網路內部機制(例如「自白」)的監控器的訓練。我們正在積極追求這些想法。儘管如此,



