作者們用一個簡單的例子來說明這個差距。如果某人的杯子在他們不注意時被移到櫃子裡,一個純粹的物理世界模型會認為場景是正確的。但它仍然會預測錯誤的下一步行動。只有一個同時追蹤該人對杯子位置信念的模型,才能解釋他們實際會怎麼做。
一個只追蹤物體的世界模型,因為忽略了該人所知,所以會對相同的場景預測出錯誤的行動。
他們在GitHub上發布的框架稱為「心智世界建模」(Mental World Modeling, MWM),它透過信念、注意力、目標、意圖、情感、規範和社會關係等心智變數,擴展了經典的世界模型。目標代理人只看到以自我為中心的局部視圖,而世界模型則掌握完整的狀態。
每個行動都分為一個物理載體,例如說話、指點或抓取,以及一個心智負載,例如安慰、欺騙或拒絕。同樣將杯子滑過桌面的手勢,可能是一種道歉、一種欺騙,或是一種關懷的行為。只有世界模型才能掌握區分這些行為的變數。
作者們明確表示,他們不聲稱模擬意識。心智狀態是從行為和情境中推斷出的假設,而非測量結果。基於此框架建構的系統應當代表不確定性,並保持其假設的透明度。
為了驗證這個理論,研究人員建構了MENTIS,這是一個無需額外訓練的模組化流程。它將整個過程分為六個步驟。首先,解析場景並渲染自我視角。然後,將行動選項分解為物理和心智組成部分,並平行模擬產生的狀態。
每個分支隨後會根據三個標準進行評分:物理合理性、心智一致性和社會適當性。之後,該流程會做出確定性決策。每個階段都會寫入機器可讀的中間結果,因此錯誤可以追溯到特定的步驟。
為了評估,作者們建立了Menti-Bench,這是一個包含448個決策場景的資料集:320個文字描述、100個圖片故事和28個聲音影片片段。每個場景包含六個回應選項和一個由人類創建的參考解決方案,該方案不僅記錄了正確的行動,還記錄了其潛在的心智和物理狀態。其中78%的場景涉及至少兩個角色。
研究團隊測試了八個大型語言模型,包括OpenAI的五個模型(其中有GPT-5.6-Sol和GPT-4.1)以及Anthropic的三個模型(Claude Fable 5、Claude Opus 4.8、Claude Haiku 4.5)。作者們使用F1分數作為準確性指標,結合了所選行動的精確率和召回率。
在所有模型中,隨著每個建模層的增加,分數都會攀升。直接回答的分數為63.3。自我一致性(模型對同一個問題回答六次並選擇最常見的回應)將分數推高到77.9。完整的MWM流程達到了87.9。在相同協議下,人類的分數為98.5。
這些提升不能簡單地透過多次採樣直接回答來複製。使用MWM的最弱模型(GPT-4.1,84.9分)擊敗了使用直接回答加自我一致性的最強模型(GPT-5.6-Sol,83.6分)。額外測試證實了該框架的核心假設。如果沒有心智通道,模型平均下降12.1分。如果沒有物理通道,則下降16.5分。當兩個轉換獨立預測而非耦合時,會損失6.4分。
心智建模的影響力最大,正好符合理論預測。在人際互動場景中,F1分數提高了26.4分。在以物體為中心的場景中,增益僅為14.0分。較弱的基礎模型從這種明確的結構中受益更多,而非較強的模型。MWM與直接回答之間的差距,對於GPT-4.1是28分,但對於GPT-5.6-Sol則只有21分。
為了找出與人類表現之間剩餘差距的來源,作者們用人類參考解決方案替換了個別的流程階段。最大的單一增益來自於完美的狀態轉換(+3.5分),其次是完美的初始狀態(+2.8分)和完美的觀察(+1.7分)。當所有中間步驟都被參考解決方案替換時,該流程達到了97分。
大約80%的剩餘差距可以追溯到中間階段的預測錯誤,主要發生在轉換模擬中。根據作者的說法,未來的改進應該從這裡開始。挑戰不在於描述當前狀態;而在於模擬耦合的物理-心智世界如何變化。
世界模型是繼純語言模型之後的一大賭注。最近卸任Google Deepmind營運主管的Demis Hassabis曾表示,他將大部分研究時間投入到這個主題上,並預期這些系統將迎來一個「ChatGPT時刻」。投資者正向Odyssey等新創公司投入數億資金。
但究竟什麼才算是世界模型,目前仍有爭議。北京大學領導的一個國際團隊最近提出了一個更狹隘的定義,將Sora等文字轉影片模型排除在外,因為它們缺乏與真實世界的反饋迴路。Yann LeCun多年來一直主張生成式方法是死胡同,轉而支持抽象表示。這篇新論文將Sora、Genie和JEPA歸為同一類,並批評它們都存在相同的遺漏。
心智狀態的問題又回到了語言模型一直難以解決的研究領域。Meta的FAIR實驗室以及華盛頓大學和卡內基美隆大學的一個團隊已經表明,模型在要求嚴格的「心智理論」(Theory of Mind)測試中表現不佳,而且在追蹤世界狀態方面的表現甚至比歸因信念更差。
MWM框架透過預處理流程從外部應用這些狀態。然而,在模型內部,類似的東西也正在自行形成。Anthropic發現Claude內部有一個「內部暫存區」,其中包含類似單詞的思想,這些思想從未被輸出,但如果沒有它們,多步驟推理就會崩潰。



