事實性對於確保大型語言模型(LLM)的可靠性至關重要。當模型錯誤地回答一個事實性問題時,是因為該事實從未被編碼,還是因為事實已被編碼但無法存取?標準的準確性指標將這些情況混為一談,儘管它們暗示著截然不同的限制和干預措施。
編碼失敗需要擴大模型規模或資料覆蓋範圍,而召回失敗則可能指向訓練後和推論時的方法,以幫助 LLM 更好地利用其已編碼的知識。在「空架子還是丟失的鑰匙?召回能力是參數化事實性瓶頸」這篇論文中,我們引入了知識剖析,這是一個衡量編碼和召回的行為框架,並用它來檢視前沿 LLM(如 Gemini3 和 GPT-5)事實性背後的根本瓶頸。
我們隨後展示,前沿 LLM 中的許多事實性錯誤應被理解為丟失的鑰匙(召回失敗),而非空架子(編碼失敗)。打個比方,我們用編碼來表示事實的參數化表示,用召回來表示在沒有外部線索的情況下檢索已編碼的事實,用辨識來表示當正確事實出現在多個選項中時將其識別出來。
為了支持這項分析,我們引入了 WikiProfile,這是一個包含 2,150 個維基百科衍生事實的基準測試,每個事實都配有十個問題,用於探測編碼、召回和辨識。
核心思想:知識剖析將分析單位從單一問題轉移到事實。我們不再詢問模型是否正確回答了特定問題,而是提出一個更廣泛的問題:這個事實的狀態是什麼?我們將每個事實分為五種知識剖析之一:(1) 編碼失敗、(2) 召回失敗、(3) 直接召回、(4) 思考後召回,以及 (5) 無編碼推論。這些剖析提供了比單純問題層級準確性更具資訊量的診斷。
這種分類基於事實是否被編碼以及其可存取性:無法召回、可以直接召回,或只能透過思考召回(在最終答案之前引導中間計算,包括思維鏈提示和思考優化型 LLM)。
我們透過三種行為概念來實現這一點:編碼:如果模型能在類似預訓練的環境中正確重現一個事實,則表示它編碼了該事實。在我們的設定中,我們使用命題補全和情境式提問來衡量這一點,這些方法將模型置於事實在預訓練期間自然出現的情境中(不揭示答案),從而促使模型揭示該事實是否被編碼。
知識:如果模型能正確回答關於一個事實的語義等效問題,包括直接問題和反向問題(例如,如果 A 是 B,直接問題詢問「B 是什麼?」,而反向問題詢問「A 是什麼?」),則表示它知道該事實。召回:如果模型知道一個已編碼的事實,則表示它召回了該事實。
如果它無需思考即可召回事實,我們稱之為直接召回。如果它知道一個未編碼的事實,我們稱之為無編碼推論。這僅在啟用思考且模型依賴其他已編碼事實並執行多跳推理或有根據的猜測時發生。
引入 WikiProfile:為了實現知識剖析,我們建構了 WikiProfile,這是一個旨在衡量自然發生事實的事實性基準測試。WikiProfile 是使用由提示型 LLM Gemini-2.5-Pro 及其思考功能驅動的全自動化流程建構的。
提示詞是透過在一個小型保留子集上進行手動優化而開發的。我們透過識別事實來從維基百科頁面中提取候選事實:一個涉及有序實體對(主詞和賓詞)的命題,其中主詞首先出現在文件中。每個事實都配有 10 個任務:兩個用於編碼,四個用於知識評估,以及四個用於辨識的多選變體。
我們透過生成、精煉和過濾的三步驟過程生成直接和反向問題,確保每個問題都是明確、具體、簡潔且具有唯一答案的。所有問題都經過基於搜尋引擎的過濾。我們捨棄返回多個答案或需要澄清的情況。經過這項自動過濾和最終的手動驗證步驟後,該基準測試包含 2,150 個事實。
我們如何評估 LLM:我們評估了 13 個 LLM。每個模型都在有思考和無思考的情況下進行評估。對於每個模型、事實和任務,我們採樣八個回應。回應由提示型 LLM 自動評分器自動評分(更多細節請參閱論文),產生了約 450 萬個回應。
主要結果:召回而非編碼是瓶頸。在前沿 LLM(Gemini-2.5-Pro、Gemini-3-Pro 和 Flash、GPT-5)中,事實編碼已接近飽和,但召回能力卻沒有。對於 Gemini-3-Pro 和 GPT-5,95-98% 的事實已被編碼,但這些模型仍有 26-34% 的事實無法直接召回。
即使透過思考,它們仍有 11-12% 的事實失敗。這意味著在前沿模型中,事實性錯誤越來越多地來自於已儲存但無法可靠存取的知識,而非知識的缺失。換句話說,瓶頸正從知識獲取轉向知識利用。
擴展模型規模也強化了這一點。在 Gemma 3 系列中,較大的模型顯示出更少的編碼失敗,但召回失敗仍然顯著,並在剩餘錯誤中佔據更大比例。擴展模型規模改善了模型儲存的內容,但對模型存取內容的改善較少。
為什麼召回會失敗?我們的結果表明,召回與事實被學習的條件密切相關。當查詢偏離事實在訓練時遇到的情境、措辭或順序時,召回會變得更加困難。我們強調了兩種系統性發生這種情況的案例。
罕見事實已被編碼,但難以召回。先前的研究表明,LLM 在處理長尾(罕見)事實時會遇到困難,通常將此歸因於模型容量問題。我們的結果提出了一個互補的觀點。當我們比較低流行度事實和高流行度事實時,我們發現罕見事實的編碼率接近流行事實。編碼方面的差距相對較小;然而,召回方面的差距更大。這重新定義了長尾問題:許多罕見事實並非不存在於模型的參數中。它們存在,但難以存取。瓶頸已從知識獲取轉向利用。
反向問題可驗證,但難以召回。我們也重新審視了逆轉詛咒:當 LLM 知道「A 是 B」卻無法回答「B 是什麼?」時。乍看之下,這可能表明 LLM 缺乏雙向知識。但我們的結果提出了對此觀點的修正。在開放式生成(即召回)中,反向問題始終比直接問題更難。
然而,在多選驗證(即辨識)中,反向問題並不比直接問題更難,而且通常更容易。這種差異很重要。如果模型能在選項中呈現正確答案時辨識出來,但在反向查詢中無法生成它,那麼問題就不僅僅是雙向知識的缺失。相反,該事實似乎已被編碼,甚至可辨識,但在查詢方向偏離事實在訓練時遇到的方式時,難以召回。逆轉詛咒是一個召回問題。
思考作為一種恢復機制。我們現在轉向一個問題:是什麼能夠恢復原本無法存取的知識。為此,我們檢視了思考在其中發揮作用的潛力。思考在直接召回最弱的地方,對召回的改善最強。對於罕見事實和反向問題,收益尤其顯著,縮小了流行度差距和方向性差距。
更具體地說,在思考優化型模型中,思考恢復了大約 40-65% 已編碼但未直接召回的事實。相比之下,它對未編碼的事實幫助甚微。這種模式表明,思考主要作為一種召回促進機制:它幫助模型存取已編碼的事實,而不是主要透過複雜的多步驟推理來推導答案。儘管如此,思考並非沒有成本。它會產生計算成本,並且目前尚不清楚如何精確判斷模型何時應該啟用它。
總結。知識剖析使我們能夠精確診斷 LLM 中的事實性行為。將此方法應用於維基百科事實,我們的結果表明我們應該重新思考前沿 LLM 中事實性錯誤的方式。如果編碼已接近飽和,那麼事實性的進一步提升可能較少來自於擴展(模型規模或資料)。透過展示思考可以恢復大量已編碼但未直接召回的事實,事實性的下一個改進可能不僅來自於更好的知識獲取,還來自於更好地利用模型中已編碼的知識。


