模型擅長預測哪些詞元,又不擅長哪些?這個問題對於混合模型尤其引人入勝,這是一種開始挑戰標準 Transformer 架構的語言模型,我們也一直在透過 Olmo Hybrid 進行研究。
混合模型在標準基準測試上可以媲美甚至超越 Transformer,但這些表面數字並未揭示混合模型相較於 Transformer 的具體優勢。為了闡明這些詞元層級的行為,我們最近進行了實驗,直接比較了我們最強大的 7B Transformer 模型 Olmo 3 和混合模型 Olmo Hybrid。
具體來說,我們細緻地比較了模型在不同類型詞元(即作為大型語言模型輸入的資訊單位)預測上的差異。由於 Olmo 3 和 Olmo Hybrid 在架構之外的建構方式盡可能相似,在資料、詞元分析器和訓練配方上都緊密匹配,它們預測上的任何差異主要反映了架構本身。從詞元層級觀察這些差異,使我們能夠深入了解混合模型相較於 Transformer 的具體優勢。
我們的結果顯示,混合模型的優勢在許多詞元上是真實存在的,但並非所有詞元。Olmo Hybrid 在承載意義的詞元上表現最強,例如名詞、動詞和形容詞,以及只能透過理解上下文來預測的詞元,例如代名詞所指涉的對象。然而,混合模型的優勢在僅僅重複輸入中已出現內容的詞元上幾乎消失,這些詞元是從前面逐字複製的單詞或短語,答案就在那裡可以直接查找。這正是 Transformer 的優勢所在。
語言模型由一堆重複的層組成,每一層都利用周圍的詞元來精煉其對每個詞元的表示。Transformer 在每一層都使用注意力機制。模型可以同時直接利用所有較早的詞元,權衡每個詞元與當前預測的相關性。
這使得注意力機制擅長精確回憶特定的較早詞元,即使該詞元在輸入中出現得很早。但問題是,每個詞元都與所有較早的詞元進行比較,因此隨著輸入的增長,注意力機制的成本會急劇上升。此外,雖然注意力在回憶和聚合資訊方面很強,但它在表示隨時間順序演變的資訊方面也存在困難。
混合模型保留了幾個注意力層,但將其餘層替換為遞迴層。與注意力層不同,遞迴層從左到右讀取詞元並帶有固定大小的記憶體,它會將每個新詞元摺疊到記憶體中,因此無論輸入多長,處理每個詞元的成本都保持不變。
該記憶體是壓縮且有損的,因此遞迴層無法像注意力機制那樣回溯以獲取精確的較早詞元。但它非常適合追蹤模型讀取詞元時發生的任何變化,為注意力機制提供了互補的優勢。為了分離注意力層和遞迴層的優勢和劣勢區域,我們向 Olmo 3 和 Olmo Hybrid 提供了文本段落:文章、維基百科條目、書籍和科學論文,以及 Python、HTML 和 LaTeX 等結構化文本。
我們根據每個模型在給定樣本中預測每個詞元的能力來評分。兩個模型都看到了相同的較早詞元,並為每個可能的下一個詞元分配了機率。我們記錄了每個模型為實際跟隨的詞元分配的機率。然後,我們透過計算損失差距(即兩個模型之間的損失差異)來逐詞元總結兩個模型之間的差異。正差距表示混合模型更好地預測了實際的下一個詞元。負差距表示 Transformer 表現更好。
為了找出損失差距可能集中的地方,我們進行了幾項分析。首先,我們將每個詞元分類並計算這些類別內的平均損失差距。由於原始平均值可能會受到其他因素的影響,例如類別的稀有性或詞元在文本樣本中重複的頻率,我們透過回歸分析重新檢查了每個模式,該分析在保持其他因素不變的情況下估計了類別自身的影響。
我們發現 Olmo Hybrid 在大多數詞元類型上的損失都低於 Olmo 3,儘管程度不同。在散文中,最明顯的區別在於實詞(承載意義的名詞、動詞和形容詞)和虛詞(如「the」、「of」和「is」)之間。混合模型比 Transformer 更好地預測實詞,損失差距約為 0.04,而虛詞上的差距接近 0.02。
特別是,在副詞和形容詞等實詞類別上,混合模型的優勢尤其明顯,儘管一些虛詞類別如存在句(例如「there」)也顯示出混合模型的巨大優勢。簡而言之,混合模型在表達句子主題的詞語上優勢最大,而在任何模型幾乎都可以從語法中猜到的語法詞語上優勢最小。
相比之下,我們發現了一些特定情境,其中混合模型相較於 Transformer 的優勢消失了。第一個是閉合括號,而不是開放括號,這種模式在語言、程式碼和標記中的括號之間是穩健的。為什麼?眾所周知,注意力機制足以表示括號匹配,這表明單獨的注意力機制足以預測閉合括號。
混合模型優勢幾乎消失的第二個地方是當下一個詞元只是重複了文章中已有的內容時。我們透過尋找重複的 N-gram 來發現這些情況:即詞元序列的完成詞元在同一文章中逐字出現過。重複序列越長,混合模型的領先優勢越小,直到接近零。
最後,受這些發現的啟發,我們探索使用特定類型詞元的過濾損失作為評估,以更好地比較預訓練實驗中不同的架構。我們使用了我們早期 Olmo Hybrid 工作中的三個 1B 參數模型:一個 Transformer、一個混合模型和一個完全沒有注意力機制的純遞迴模型。
在非重複的具意義詞元上,混合模型和純遞迴模型超越了 Transformer,其中混合模型表現最佳。在重複詞元上,純遞迴模型(沒有注意力機制來回溯複製)落後於混合模型和 Transformer。
因此,這些過濾後的詞元損失揭示了架構之間不同的細緻差異,包括複製能力和實詞上的差異,這些差異在訓練早期以其他方式是不可見的。
這項工作帶來了兩個教訓。首先,單一的總體損失,模型在所有詞元上的平均誤差,對於比較 Transformer 和混合架構來說過於粗糙。僅對測試特定模型能力的詞元進行損失評分,可以揭示關鍵差異。
其次,特別是對於混合模型,我們發現了在開放類詞元上具有特定優勢的證據,這可能與遞迴神經網路層的狀態追蹤能力有關。作為下一步,我們將把這些發現應用於我們正在進行的混合模型工作。
我們相信,最好的混合架構將來自於逐詞元理解模型每個組件的優勢。我們希望像這樣的研究能幫助整個 AI 社群增進這種理解。我們鼓勵您閱讀我們的完整報告,探索 Olmo 3,嘗試 Olmo Hybrid,並深入研究其相關的開放人工製品。



