眾所周知,允許大型語言模型(LLM)生成逐步推理路徑,即所謂的思維鏈(Chain-of-Thought, CoT),能提升其在複雜任務上的表現。當模型解決困難的數學方程式、編寫軟體或回答多跳式事實問題時,將問題分解為可管理的邏輯步驟非常有效。

然而,這種方法對於簡單的單跳式事實問題的效用仍不明確。例如,考慮一個查詢:「瑪麗·英格爾·彭寧頓是哪一年被選入國家發明家名人堂?」LLM 要嘛將事實儲存在其參數記憶中(直接編碼在其權重中),要嘛沒有;這不需要複雜的算術或邏輯推導。那麼,推理路徑為何會有幫助呢?

在我們的研究《思考即回憶:推理如何解鎖大型語言模型中的參數知識》中,我們探討了這種現象。我們證明,允許模型生成推理路徑,能解鎖原本難以觸及的正確答案。為了理解在沒有複雜推理步驟的情況下,推理為何能幫助參數知識的回憶,我們進行了一系列假設驅動的對照實驗。我們的發現揭示了兩種互補的驅動機制:計算緩衝效應和事實啟動效應。

探測知識邊界

我們首先使用 pass@k 指標來衡量參數回憶能力的邊界。pass@k 不僅檢查模型生成的一個答案,而是檢查多個生成嘗試中是否存在正確的事實。透過評估模型輸出分佈中成功推理路徑的存在,同時對其確切排名不那麼敏感,pass@k 幫助我們估計推理對於事實回憶的潛力,而不僅僅是觀察模型目前的最佳答案行為。

為了評估推理的影響,同時控制參數知識,我們專注於推理型 LLM(R-LLM),其中推理可以啟用或禁用,並比較這兩種模式下的 pass@k。我們使用了 Gemini-2.5(Flash 和 Pro)以及 Qwen3-32B 模型,並採用了兩個具有挑戰性的閉卷問答資料集:SimpleQA Verified 和 EntityQuestions。

結果出奇地一致。當推理啟用時,模型能成功回憶起在推理關閉時幾乎無法恢復的答案。重要的是,這種改進並非僅僅因為模型正在分解複雜問題。這是因為我們特意專注於主要包含簡單、單跳式問題的資料集。

這些結果引出了一個問題:如果這種效應並非來自於逐步推理,那麼是哪些推理模式讓模型能夠檢索到正確答案呢?

機制一:計算緩衝

我們的第一個假設集中在生成機制上。我們採用了長期存在的假設,即生成額外的 token 相當於提供額外的正向傳播,從而延長了計算時間,並在 R-LLM 的參數知識回憶新情境中進行了測試。具體來說,我們假設模型隱式地將這些推理 token 作為計算緩衝區,以執行潛在處理,而與實際生成的語義內容無關。

為了驗證這一點,我們設計了一個實驗,移除了推理路徑中所有有意義的內容。我們攔截了模型的推理過程,並將其生成的路徑替換為一個無意義的字串「讓我想想」,重複直到其長度與原始推理路徑匹配。然後,我們讓模型在這種虛擬文本的條件下預測最終答案。

值得注意的是,在這種無意義路徑的條件下,模型回憶正確答案的能力比完全關閉推理的基準線顯著提高。這提供了強有力的證據,表明僅僅給予模型更多的計算空間,就能幫助它完善內部狀態並獲取難以觸及的事實。

然而,這種計算緩衝效應有其局限性。將虛擬文本推到更長的長度最終會產生遞減的回報,而且它永遠無法完全匹配模型自然推理路徑的表現。這意味著,雖然額外的計算有幫助,但思考的實際內容仍然很重要。

機制二:事實啟動

當我們分析為簡單事實問題生成的自然推理路徑時,我們注意到一個常見模式。模型並非在寫出邏輯證明;它們正在浮現相關事實。在人類認知中,有一個稱為「擴散激活」(spreading activation)的概念,即處理特定概念會啟動語義記憶中相關的概念,使其更容易被檢索。

我們假設語言模型也表現出類似的生成式自我檢索機制,我們稱之為「事實啟動」(factual priming)。透過生成與問題主題相關的事實,模型建立了一個上下文橋樑,有助於檢索正確答案。

為了驗證這些假設,我們從模型的推理路徑中提取了具體的事實,並應用嚴格的過濾,去除任何填充文字、搜尋計畫或對最終目標答案的明確提及。然後,我們分離出回憶事實的影響,並證明在短列表的回憶事實條件下,可以恢復大部分推理的增益,甚至在推理關閉時也有幫助。

例如,如果被問及尼泊爾第十位國王的名字,推理模型可能會先列出前九位國王。回憶前九位國王就像一次語義熱身,啟動網路以成功回憶第十位國王。這些事實本身就是墊腳石。

幻覺陷阱

雖然生成式自我檢索是一種強大的機制,但它也帶來了根本性的風險。由於模型本身會生成這些中間事實,它們可能會產生幻覺。因此,我們檢查這些推理階段的錯誤如何影響最終答案。為了找出答案,我們建立了一個大規模的審計管道,使用啟用搜尋功能的驗證器,獨立檢查數十萬條推理路徑中生成的每個中間事實的正確性。

審計結果揭示了一個明顯的模式。如果推理路徑中包含哪怕一個幻覺的中間事實,模型得出正確最終答案的可能性就會顯著降低。這表明,儘管有效,事實啟動機制可能很脆弱。

建構更可靠的模型

理解這些機制為提高模型可靠性提供了實用的途徑。由於事實啟動是有效的,而幻覺的中間事實會降低性能,我們可以利用這兩項洞察來提高模型準確性。為了評估這些洞察的潛力,我們使用了一種測試時選擇策略,為單一問題生成多個推理軌跡,只保留那些包含可驗證、無幻覺事實的軌跡。優先考慮這些軌跡能顯著提高準確性。在實踐中,這種優先排序可以在訓練期間透過過程獎勵來實施,以鼓勵事實支持的中間步驟。

結論

我們的發現強調,語言模型中的推理服務於比任務分解或數學邏輯更廣泛的目的。它是一種揭示模型內部記憶並擴展其參數知識邊界的基本機制。這些洞察為未來的研究開闢了令人興奮的方向。知道事實準確的推理路徑能產生更好的答案,表明訓練方法可以進一步優化。透過利用專門鼓勵事實支持中間步驟的過程獎勵,我們或許能夠訓練出本質上更可靠、更不容易產生幻覺的模型。我們期待看到研究社群如何繼續探索推理、記憶和檢索的交集。

致謝

這項研究由 Zorik Gekhman、Roee Aharoni、Eran Ofek、Mor Geva、Roi Reichart 和 Jonathan Herzig 進行。我們感謝 Eyal Ben-David 和 Avinatan Hassidim 對這項工作的審閱及其寶貴的建議。