大型語言模型(LLM)學習語言所需的數據量遠遠超過兒童。理解箇中原因,不僅能幫助我們開發更高效的模型,也能揭示更多關於心智發展的奧秘。

據我們所知,人類相互交談的歷史至少有十萬年。在這漫長的時間裡,世界上只有一種存在能夠完美流利地學習人類語言:那就是人類兒童。現在,這個數字變成了二。

距離 ChatGPT 發布僅短短四年,我們許多人已習以為常地能與手機或電腦進行自然對話。Claude、DeepSeek 和 OpenAI 的 GPT 模型等大型語言模型,其流暢度和靈活性足以令人信服地偽裝成人類。然而,若窺探其運算幕後,便會發現一個問題:教導電腦使用人類語言,仍需要龐大到不合常理的數據量。

一個大型語言模型所處理的詞彙量,可能比一個人掌握母語過程中經歷的詞彙量多出十萬倍,也遠超過兒童在一歲生日時(通常是他們開始掌握語言的時期)所聽到的詞彙量。

史丹佛大學認知科學家 Michael C. Frank 談到大型語言模型時表示:「最近的進展令人驚嘆。」但他補充:「我們仍然需要焚燒整片森林,並蒐羅所有人類知識的總和,才能重現這個在我們客廳裡一年內就能實現的里程碑。」

兒童與機器之間這巨大的鴻溝被稱為「數據效率鴻溝」。這為認知科學家提出了一個引人入勝的問題,也為 AI 模型設計者帶來了挑戰:為何兒童仍能超越有史以來最精密的語言機器?

尋找答案對 AI 研究和認知科學都至關重要。過去十年來,語言模型主要透過擴大規模來提升效能。Meta 兩年前發布的開源大型語言模型 Llama 3.1,在預訓練階段處理了 15 兆個 token(類似於詞彙的語言片段),這是模型在針對特定任務(例如聊天機器人)進行微調之前的主要訓練步驟。

喬治城大學認知科學家兼語言學家 Ethan Gotlieb Wilcox 表示,前沿模型可能正在使用十倍於此的數據進行預訓練。然而,網路上的訓練數據量是有限的,最終,或許早在 2030 年代,唾手可得的數據來源可能會枯竭。

兒童證明了以更少的數據學習更多內容是可能的,而且是少得多。一個在語言豐富家庭中長大的青少年,可能聽過大約一億個詞彙。如果加上識字能力,到 20 歲時,這個詞彙量可能會增加到三億個。

這種規模上的差異只能透過類比來大致說明。Wilcox 表示:「Claude 所見的語言量,相當於一個城市在一代人中會經歷的總和。」如果將用於訓練現代大型語言模型的所有詞彙列印出來,堆疊起來的高度將會超過國際太空站。而人類青少年的一億個詞彙,堆疊起來僅約 20 公尺。而且,我們人類甚至可以用遠少於此的數據來學習。

透過逆向工程兒童的學習方式,科學家們希望能創造出數據效率更高的 AI 模型。這對於從有效訓練 AI 處理影片,到為少數語言社群開發聊天機器人等各方面都將有所助益。在機器模型中測試關於人類學習的假設,也能解決關於語言和兒童心智發展的長期疑問。我們是否天生就具備語言本能?或者,兒童是否原則上也能純粹從經驗中學習語言?我們處理語言的方式是生物學上的特點,還是至少部分反映了語言使用和學習的普遍限制?

核心要素。我們大多數人只有在成年後嘗試學習新語言時,才會意識到語言的困難。過去完成式、捲舌音和鼻化母音、所有格、片語動詞,以及語法上陽性的桌子和陰性的湯匙,這些對成年語言學習者來說,許多都是語言折磨的工具。然而,學習我們的母語通常是輕而易舉的。幼兒通常在聽過大約一千萬個詞彙,或最多三千萬個詞彙後,就能開始說出符合語法的句子。

Frank 說:「這簡直是奇蹟。」他補充:「如果你用三千萬個詞彙訓練 GPT-2,你會得到一個胡言亂語產生器,而不是一個孩子。」

嬰兒究竟是如何做到這一點,仍然是個謎。研究人員對兒童在不同發展階段學習的內容以及如何使用語言了解很多,但仍有許多未知。或許最持久的問題是,嬰兒為何能夠學習語言。人類語言的語法,將詞彙組合成句子的規則,包含遞迴、巢狀結構,使我們能夠用有限的詞彙和詞素表達幾乎無限的想法。這對嬰兒來說似乎應該是個難題。他們僅在無底的語言海洋淺灘中嬉戲,然而,不知所故,這就足夠了。他們從一滴水中推斷出深淵。

麻省理工學院語言學家 Noam Chomsky 在 1950 年代提出的一種解決方案是,嬰兒天生就具備語法的硬性知識。Chomsky 當時是在回應心理學家 B.F. Skinner 所倡導的對立觀點,即語言習得完全是環境因素。Skinner 認為語言是透過條件反射和強化學習的,就像狗學會坐下或握手以換取獎勵一樣。

Chomsky 則引用「刺激貧乏論」來反駁,這個觀點認為語言,尤其是語法,過於複雜,而兒童接觸語言的環境又過於「貧乏」,無法完全從經驗中學習。加州大學爾灣分校的語言學家兼認知科學家 Richard Futrell 表示:「他的標誌性論點,本質上是說語言不能純粹基於統計來學習。」

相反地,Chomsky 假設語言是建立在一套邏輯規則之上,並主張兒童需要這些規則的先天知識,才能從零碎的言語中推斷出他們語言的語法。

「這簡直是奇蹟……如果你用三千萬個詞彙訓練 GPT-2,你會得到一個胡言亂語產生器,而不是一個孩子。」,Michael C. Frank,史丹佛大學認知科學家

Chomsky 的語言觀點以生成語法之名,在美國語言學界主導了數十年。它對 1950 年代和 60 年代的電腦科學產生了重大影響,當時 AI 正經歷其第一個繁榮時期,語言學與自然語言處理之間的界線在軍事資金的洪流中消弭;五角大廈希望電腦能夠理解英語並翻譯俄語。

儘管簡單類神經網路在辨識和重現統計模式方面取得了早期成功,但美國的 AI 研究人員在很大程度上採用了受 Chomsky 理論影響的基於規則的框架。他們試圖透過將規則明確編碼到程式中來教導電腦語言,想像一下,這更像是語法課,而不是沉浸式體驗。

這種方法是更廣泛的符號 AI 趨勢的一部分,並盛行了數十年。然而,它也未能成功產生能夠大規模處理人類語言的模型。對自然語言處理的興趣在 1970 年代開始的「AI 寒冬」中冷卻下來。

隨後,類神經網路開始捲土重來。但直到 2010 年代,隨著電腦硬體變得便宜且功能強大,以及網路的普及,它們的性能才開始引人注目。到了 2018 年和 2019 年,基於新型架構 Transformer 並在數十億個 token 上訓練的 BERT 和 GPT-2 模型,讓業界人士清楚地看到,從海量數據中學習對語言處理是可行的。

2022 年,隨著 OpenAI 的聊天機器人 ChatGPT 取得突破性成功,這一點對所有人來說都變得顯而易見。

大型語言模型不是大腦。它們是強大的統計學習器,天真的模式學習機器,沒有人類大腦皮層中任何演化而來的生物學特徵。換句話說,它們正是二十年前生成語法學家認為不可能學習語言的那種東西。然而,它們卻能寫出可信的十四行詩並通過語法測試。

加州大學柏克萊分校的發展心理學家 Alison Gopnik 表示:「無論你對 AI 有多麼懷疑,真正讓所有人印象深刻的是:這些模型能夠學習語法。」她說:「我當時不認為這會成真。而且我認為大多數人也不認為你可以僅僅透過觀察大量語言樣本的統計數據就能找出語法。」

但如果從少量語言樣本,例如兒童規模的樣本,中學習呢?是否有可能建立一個兒童規模的模型,而不僅僅是一個胡言亂語產生器?

嬰兒語言。加州大學聖地牙哥分校的語言學家兼數據科學家 Alex Warstadt 回憶起 BERT 和 GPT-2 發布前後的那些年,那是一個令人興奮的時代。早在 2019 年,他仍是紐約大學語言學系的博士生,親眼目睹自己的領域發生變化。語言模型能夠透過處理文本來學習英語這一事實本身,就對當時盛行的 Chomsky 觀點構成了挑戰。

然而,許多語言學家仍然懷疑大型語言模型能否告訴我們任何關於人類如何習得語言的資訊。

Warstadt 表示:「我總是在一個特定問題上遇到阻力,那就是模型的數據集大小。」他指出:「從來沒有人在以人類規模訓練語言模型時,讓我們感到印象深刻。」

但 Warstadt 在大型語言模型中看到了希望:一個科學模型不需完美也能提供資訊,而大型語言模型顯然是人類語言使用的強大模擬。透過將關於兒童如何學習的假設融入模型中,並測量其表現,它們在縮小數據鴻溝方面取得了多大進展,科學家們或許能夠驗證他們的想法?

2022 年 8 月,Warstadt 在 Twitter 上發布了一系列推文,闡述了類神經網路可以成為語言習得有用模型的論點。在與 AI 研究員 Leshem Choshen 進行了一些評論交流後,Warstadt 提出了後來成為 BabyLM 的想法,這是一個由 Warstadt、Choshen 和其他幾位研究人員組織的年度競賽,旨在用小型數據集訓練模型。

那是四年前的事了。從那時起,BabyLM 增加了研討會,並啟發了多個衍生計畫,包括一項針對中文嬰兒模型訓練的競賽。主要活動挑戰研究人員,使用「發展上合理」的語料庫來訓練語言模型,該語料庫僅包含一億個詞彙(針對幼兒規模的軌道則為一千萬個),這些詞彙來自故事書、對話、電影字幕、簡易英文維基百科、普通維基百科以及實際針對兒童的語音轉錄。

喬治城大學的 Wilcox(也是組織者之一)表示,這些模型會根據心理語言學家用於人類的語法基準進行評估。

其中一種任務是向測試對象,無論是人類還是機器,呈現句子,並尋找對不合語法特徵感到困惑或驚訝的跡象。例如,一項測試可能會比較句子「The keys to the cabinet are on the table」和「The keys to the cabinet is on the table」。

Wilcox 說:「當人類看到『is』時,他們會想:什麼?這裡不應該是『is』啊。」對於人類來說,這種驚訝可以透過追蹤眼球運動來測量。對於語言模型,研究人員則使用一種稱為「驚訝度」(surprisal)的測量方法,它評估模型預測一個句子或句子某部分出現的可能性有多低。

這項競賽已經挑戰了一些假設,例如課程學習(curriculum learning)的有效性。課程學習從簡單的訓練數據開始,逐步進展到更複雜的輸入,有點像從嬰兒語開始學習,然後逐漸……