word2vec 究竟學到了什麼,又是如何學習的?回答這個問題,等同於理解在一個極簡卻有趣的語言模型任務中,表徵學習的運作方式。儘管 word2vec 是現代語言模型眾所周知的先驅,但多年來,研究人員一直缺乏一個能定量且預測性地描述其學習過程的理論。

在我們的新論文中,我們終於提出了這樣一個理論。我們證明,在現實且實用的條件下,學習問題可以簡化為非加權最小平方法矩陣分解。我們以閉合形式解出了梯度流動態;最終學到的表徵簡單來說就是主成分分析(PCA)的結果。word2vec 的學習動態。當從微小初始化開始訓練時,word2vec 以離散、循序的步驟學習。

左圖:權重矩陣中秩遞增的學習步驟,每個步驟都降低了損失。右圖:潛在嵌入空間的三個時間切片,顯示嵌入向量如何在每個學習步驟中擴展到維度不斷增加的子空間,直到模型容量飽和。

在詳細闡述這個結果之前,讓我們先說明這個問題的重要性。word2vec 是一種學習詞彙密集向量表徵的知名演算法。這些嵌入向量是透過對比學習演算法訓練的;訓練結束時,任意兩個詞之間的語義關係會透過其對應嵌入向量之間夾角來捕捉。事實上,學到的嵌入向量在幾何上經驗性地展現出驚人的線性結構:潛在空間中的線性子空間通常編碼著可解釋的概念,例如性別、動詞時態或方言。

這種所謂的線性表徵假設最近引起了廣泛關注,因為大型語言模型(LLMs)也展現出這種行為,這使得內部表徵的語義檢查成為可能,並提供了新穎的模型引導技術。在 word2vec 中,正是這些線性方向使得學到的嵌入向量能夠透過向量加法來完成類比(例如:「男人:女人 :: 國王:皇后」)。

這或許不應太令人驚訝:畢竟,word2vec 演算法只是簡單地遍歷文本語料庫,並訓練一個兩層線性網路,利用自我監督的梯度下降來建模自然語言中的統計規律。在這個框架下,很明顯 word2vec 是一個極簡的神經語言模型。因此,理解 word2vec 是理解更複雜語言模型任務中特徵學習的先決條件。

結果。有了這些動機,讓我們來描述主要結果。具體來說,假設我們將所有嵌入向量隨機初始化,並且非常接近原點,使其有效維度為零。然後(在一些溫和的近似條件下),這些嵌入向量會以一系列離散的學習步驟,一次學習一個「概念」(即正交線性子空間)。這就像一頭栽進一個新的數學分支。

一開始,所有術語都混淆不清,函數和泛函有什麼區別?線性算子和矩陣又如何?慢慢地,透過接觸新的感興趣情境,這些詞語在腦海中逐漸分開,它們的真實含義也變得更加清晰。因此,每個新實現的線性概念都有效地增加了嵌入矩陣的秩,為每個詞嵌入提供了更多空間來更好地表達其自身及其含義。

由於這些線性子空間一旦學習完成就不會旋轉,因此它們實際上就是模型學到的特徵。我們的理論允許我們預先以閉合形式計算這些特徵,它們簡單來說就是一個特定目標矩陣的特徵向量,該矩陣僅由可測量的語料庫統計數據和演算法超參數定義。

這些特徵是什麼?答案非常直接:潛在特徵就是以下矩陣的頂部特徵向量:其中 $i$ 和 $j$ 是詞彙表中的詞索引,$P(i,j)$ 是詞 $i$ 和詞 $j$ 的共現機率,$P(i)$ 是詞 $i$ 的單詞機率(即 $P(i,j)$ 的邊際機率)。

根據維基百科的統計數據構建並對角化這個矩陣後,會發現第一個特徵向量選擇與名人傳記相關的詞彙,第二個特徵向量選擇與政府和市政管理相關的詞彙,第三個與地理和製圖描述符相關,依此類推。關鍵在於:在訓練過程中,word2vec 找到了一系列 $M^{\star}$ 的最佳低秩近似。

這實際上等同於對 $M^{\star}$ 執行 PCA。以下圖表說明了這種行為。學習動態比較顯示了離散、循序的學習步驟。左圖的關鍵經驗觀察是,word2vec(加上我們的溫和近似)以一系列本質上離散的步驟學習。每個步驟都增加了嵌入的有效秩,導致損失逐步下降。

右圖顯示了潛在嵌入空間的三個時間切片,展示了嵌入如何在每個學習步驟中沿著新的正交方向擴展。此外,透過檢查與這些奇異方向最密切相關的詞彙,我們觀察到每個離散的「知識片段」都對應一個可解釋的主題級概念。這些學習動態可以閉合形式求解,我們看到理論與數值實驗之間有極佳的吻合。

這些溫和的近似條件是什麼?它們是:1) 目標函數在原點附近的四次近似;2) 演算法超參數的特定約束;3) 足夠小的初始嵌入權重;以及 4) 極小的梯度下降步長。幸運的是,這些條件並不過於嚴苛,事實上它們與原始 word2vec 論文中描述的設定非常相似。

重要的是,這些近似條件都不涉及數據分佈!事實上,這個理論的一個巨大優勢在於它不作任何分佈假設。因此,該理論精確地預測了根據語料庫統計數據和演算法超參數所學習到的特徵。這特別有用,因為在不依賴分佈的設定中,學習動態的細緻描述非常罕見且難以獲得;據我們所知,這是第一個針對實用自然語言任務的此類描述。

至於我們所做的近似,我們透過實驗證明,我們的理論結果仍然忠實地描述了原始的 word2vec。作為我們的近似設定與真實 word2vec 之間一致性的粗略指標,我們可以比較標準類比完成基準測試的經驗分數:word2vec 達到 68% 的準確度,我們研究的近似模型達到 66%,而標準的經典替代方案(稱為 PPMI)僅為 51%。請查閱我們的論文以查看詳細比較圖表。

為了展示這個結果的實用性,我們應用我們的理論來研究抽象線性表徵的出現(對應於二元概念,例如男性/女性或過去/未來)。我們發現,在學習過程中,word2vec 以一系列帶有雜訊的學習步驟構建這些線性表徵,其幾何形狀可以透過尖峰隨機矩陣模型很好地描述。在訓練早期,語義訊號佔主導地位;然而,在訓練後期,雜訊可能開始佔主導地位,導致模型解析線性表徵的能力下降。更多細節請參閱我們的論文。

總而言之,這項結果提供了在一個極簡卻相關的自然語言任務中,特徵學習的首批完整閉合形式理論之一。從這個意義上說,我們相信我們的工作是為獲得描述實用機器學習演算法性能的現實分析解決方案這一更廣泛專案邁出的重要一步。了解更多關於我們的工作:完整論文連結 本文最初發表於 Dhruva Karkada 的部落格。