大型語言模型 (LLM) 能高精度預測人類大腦對語言的反應。然而,這些模型的運作原理基本上是不可讀的,它們是由大量學習參數組成的集合,而非科學家能直接理解的理論。
生成式因果測試 (Generative Causal Testing, GCT) 是微軟研究院與加州大學柏克萊分校、加州大學舊金山分校和哥倫比亞大學合作開發的成果。它能將這些大腦預測模型提煉成簡潔的口頭解釋,說明每個皮層區域對什麼做出反應,例如「食物準備」或「地點名稱」。
GCT 隨後形成一個閉環:LLM 會編寫旨在激活特定大腦區域的新故事,受試者在掃描儀中聆聽這些故事,如果解釋正確,該區域就會活躍起來。
在實驗中,GCT 確認了已知的大腦選擇性,區分了長期以來被認為可互換的相鄰空間處理區域,並揭示了前額葉中針對對話、時鐘時間和測量等特定概念的微小「微區域」。
過去十年來,LLM 已成為我們預測人類大腦如何回應語言最準確的工具。將一個人聽到 fMRI 掃描儀中的故事輸入 LLM,模型的內部表徵能以卓越的準確性預測各個皮層區域的活動。然而,這種成功伴隨著一個問題:沒有人能讀懂這些模型。
它們是數百萬個難以理解的參數,無法直接轉化為可解釋的內容。一個預測大腦活動的模型告訴我們某個區域對語言有反應,但無法說明它實際捕捉到的是什麼,無論是食物、地點、數字還是其他完全不同的東西。隨著黑箱模型的普及,預測與理解之間的鴻溝已成為計算神經科學的核心問題之一。
在《Nature Neuroscience》期刊上發表的一篇新論文中,微軟研究院的科學家與加州大學柏克萊分校、加州大學舊金山分校和哥倫比亞大學的科學家合作,引入了一個框架來克服這場可解釋性危機:生成式因果測試 (GCT)。GCT 將大腦預測模型提煉成簡潔、可讀的解釋,說明每個皮層區域對什麼做出反應,然後驗證這些主張。
LLM 會編寫旨在激活特定大腦區域的新故事,受試者在掃描儀中聆聽這些故事,如果解釋正確,目標區域就會活躍起來。其結果是一種將難以解釋的預測模型轉化為科學貨幣的方法:簡潔的假設,可以在後續實驗中得到確認或駁斥。
GCT 包含兩個步驟:解釋,然後驗證。為了生成解釋,該方法從單一體素或區域的預測模型開始,識別出最能驅動其預測反應的短語。然後,LLM 將這些詞彙總結成一個簡潔的口頭解釋,通常是一個單一的短語,例如「食物準備」或「地點名稱」。
關鍵的第二階段形成了閉環。為了建立對解釋的信任,GCT 使用 LLM 編寫新故事,其中每個段落都經過精心建構,以根據其解釋來驅動大腦區域。三名受試者回到掃描儀中閱讀這些合成故事。
如果一個區域對其「驅動」段落的活動顯著高於基準文本,那麼該解釋就通過了真正的因果測試,而不僅僅是相關性測試。在所有三名受試者中,核心方法都經受住了考驗:合成故事可靠地驅動了目標區域高於基準線,證實了 GCT 的簡短解釋確實捕捉到了皮層的真實反應。
當底層的大腦預測模型越強大時,這些解釋也越值得信賴(模型越穩定,其解釋在掃描儀中得到確認的可靠性就越高)。在已知選擇性的區域上驗證了該方法後,研究人員將 GCT 應用於更困難的問題。
GCT 也證明其足夠敏銳,足以解決長期存在的模糊之處。三個參與空間處理的相鄰區域,壓後皮層 (RSC)、海馬旁區 (PPA) 和枕葉空間區 (OPA),經常被視為功能相似。起初,為一個區域編寫的故事也會激活其他區域。
但透過生成差異化刺激(旨在激活一個區域同時保持其鄰近區域安靜的故事),GCT 將這三個區域區分開來。例如,RSC 對於像東京或康乃狄克州這樣的專有名詞地點名稱反應更強烈,而不是一般地點。這是一種原始預測模型本身無法提供的細緻入微、針對特定區域的理論。
除了已知區域之外,作者還發現了新的前額葉「微區域」。透過掃描候選位置網格並僅保留最穩定的區域,GCT 揭示了這些先前未繪製的區域,它們針對非常特定的概念進行調整:一個選擇性地針對人與人之間的對話(例如「說」或「告訴」等詞彙),一個針對時鐘時間的提及(「一點鐘」),以及一個針對數字測量(「50 英尺」)。這些是以前沒有人尋找過的區別;它們之所以浮現,是因為該方法能夠提出假設並立即進行測試。
GCT 的意義遠超神經科學領域。研究人員日益面臨同樣的困境:模型預測精準卻無法解釋任何東西。GCT 表明,資料驅動模型不一定是探究的終點;它可以被提煉成可讀、可實驗驗證的理論,並且該理論可以透過根據需求生成新實驗來與現實進行檢驗。
對於神經科學而言,GCT 指向了一種更快速、更富含假設的皮層繪製方式,其中 AI 系統提出大腦區域可能編碼的內容,而閉環實驗在單一研究中確認或駁斥它。這種生成與驗證的理念可以擴展到其他領域,在這些領域中,強大的預測模型已超越我們的理解能力。更廣泛的啟示是充滿希望的:科學中黑箱模型的興起不一定意味著人類可讀理論的退卻。透過正確的框架,兩者可以共同進步。



