麻省理工科技評論的「未來展望」系列深入探討各行各業、趨勢和技術,為您揭示未來。早在2017年夏天,Google的AI研究人員發表了一篇名為「Attention Is All You Need」的論文,其中描述了一種新型類神經網路,Transformer。

它在處理長序列資料,尤其是文字方面表現出色。九年過去,Transformer已成為市場上所有主要大型語言模型的核心引擎。AI新創公司Subquadratic的共同創辦人兼執行長Justin Dangel表示:「整個AI產業都建立在Transformer之上,它們是電腦科學史上最重要的創新之一,並改變了世界。」

然而,Transformer架構也開始顯現其局限性。許多近期LLM的進展,例如推理模型的開發以及同時處理大量輸入的能力,並非該核心技術的直接延伸,而是修補其根本缺陷的權宜之計。

越來越多的科學家和工程師正在思考下一步會是什麼。LLM不會消失,但其建構方式正處於變革之中。(麻省理工科技評論在今年的「AI十大關鍵技術」榜單中,將這未來一代的模型稱為LLMs+。)

一股新創浪潮正湧現,希望突破這項蓬勃發展技術的界限。其中一些無疑會失敗,但他們擁有無限的機會,且比當今領先的公司有更少的損失。

首先,我們來看看問題所在。Transformer的關鍵優勢在於一種稱為「密集注意力」(dense attention)的機制,它將一段文字的意義編碼成一系列數字。

這個過程涉及透過一種乘法形式,將文字中的每個詞(或詞的一部分,稱為詞元token)與其他所有詞進行比較。密集注意力能夠以驚人的準確度捕捉文字的意義。然而,隨著文字長度增加,處理所需的計算量會迅速累積。一份一萬字的檔案可能需要Transformer執行五千萬次乘法運算。這就是LLM消耗如此多運算資源的主要原因。

這些成本非常龐大。根據OpenAI總裁Greg Brockman的說法,該公司今年預計將在運算上花費500億美元。國際能源總署預測,到2030年,資料中心消耗的總電量將翻倍。

此外,Transformer難以應對許多最新模型設計的任務。由於它們逐字處理文字的方式,Transformer不擅長同時追蹤大量資訊(換句話說,它們的上下文視窗不能太大)。

然而,如果LLM要執行更困難的任務,它們就需要處理更多的資料:一整個文件庫、一個完整的程式碼庫,或者在代理(agent)的情況下,來自其他LLM的輸出。至於推理模型,它們透過為自己寫筆記(一種稱為「思維鏈」的草稿)然後再讀回這些筆記來運作,這再次增加了需要處理的資料量。

隨著LLM變得越來越大、越來越好,Transformer已成為一個瓶頸。這項技術的關鍵優勢如今卻成了限制。

以下是解決Transformer問題的四個新想法,這些創新可能徹底改變LLM,使其更快、更高效,甚至(或許)更智慧。

01:重新思考注意力機制

讓LLM更快、更便宜的一個顯而易見的方法是直接解決問題,改變注意力機制的工作方式。將密集注意力替換為一種稱為「稀疏注意力」(sparse attention)的機制,它只對文字區塊中的部分詞語配對進行計算,而非全部,這可以大幅減少LLM所需的運算量。

多年來,研究人員提出了許多稀疏注意力機制。問題是,沒有一個在捕捉語義方面能與密集注意力相媲美。但這種情況可能已經改變。位於邁阿密的新創公司Subquadratic聲稱,他們發明了第一個稀疏注意力機制,其在搜尋和程式碼編寫等少數任務上,能與頂級主流LLM匹敵。這是一個巨大的主張(業界仍有人對此持懷疑態度)。

Subquadratic表示,其模型SubQ的運作方式是即時判斷給定文字中哪些詞是重要的,哪些則否。該公司還聲稱已有數千人註冊了其候補名單,並計畫很快讓該模型廣泛可用。

同時,位於舊金山的新創公司Manifest AI正從另一個角度解決這個問題。它沒有改變注意力機制的工作方式,而是用其他東西取而代之。該公司開發了一種稱為「能力保留」(power retention)的機制,它只儲存特定任務最相關的資訊,並確保LLM需要追蹤的資料量不會暴增。

注意力機制迫使LLM追蹤其上下文視窗中的所有內容。稀疏注意力模型(例如SubQ)會捨棄許多個別詞語,但仍保留其所見內容的粗略概況。

相比之下,能力保留的運作方式是為模型提供其上下文視窗的滾動摘要。隨著新資訊的加入,較不相關的資訊會被捨棄。保留的基本原理已經存在十年了。Manifest AI聲稱,他們更新了這些技術,首次建構出能夠與基於Transformer的LLM抗衡的模型。

該公司表示,只需最少的重新訓練,就可以將Transformer模型改編為能力保留模型。為了證明這一點,它將現有的開源程式碼LLM StarCoder,轉變為使用能力保留的版本,稱為PowerCoder。

它還發布了一個名為Brumby的模型,聲稱其性能可與阿里巴巴流行的開源模型Qwen的某些版本匹敵。

Manifest AI希望其能力保留技術能成為LLM處理大量資料任務的首選解決方案。Manifest AI的共同創辦人兼技術長Carles Gelada在去年發布公司技術的影片中聲稱,這項技術有許多實用應用,從分析數小時長的影片到建構能持續工作數週的代理(agent)皆可。

02:讓模型更小、更靈活

Liquid AI是麻省理工學院在麻州劍橋成立的新創公司,它沒有完全改變或放棄Transformer,而是將其與自己的技術,液態神經網路(liquid neural networks)結合,共同創辦人兼執行長Ramin Hasani稱之為LFM(液態基礎模型)。

Liquid AI的模型比大多數LLM小得多,且能耗更低。該公司為包括Mercedes在內的汽車製造商建構模型,這些模型可在車輛內部的小型晶片上運行。

其最新模型甚至可以在僅需50美元的低功耗業餘電腦Raspberry Pi上運行。對於年收入低於1000萬美元的任何組織,其模型均可免費使用。Hasani表示,這些模型已證明廣受歡迎:該公司已累積近3400萬次下載。

液態神經網路的靈感來自蠕蟲的大腦。它們是比Transformer更早出現的另一種類神經網路,卷積網路(convolutional networks)的延伸。

其關鍵創新在於一種機制,能讓模型根據新資訊調整其行為,從而邊學邊用。這在Transformer中是不可能實現的:一旦模型訓練完成,其行為就固定了。Liquid AI的第一批模型相當基礎,但已能操控無人機或駕駛車輛。

透過LFM,該公司正試圖擴展其技術,以與主流LLM競爭。其新模型性能可與體積大四倍的競爭對手匹敵,包括阿里巴巴的Qwen和Google的開源LLM Gemma的某些版本。

典型的LLM是由堆疊在一起的Transformer組成。Liquid AI最近的LFM是混合模型,由20%的Transformer和80%的液態神經網路構成。

這個比例是由Liquid AI開發的另一個AI系統所發現的,該系統用於協助設計其所有模型。Hasani表示:「這是我們公司目前的核心技術。」這個設計師AI會篩選液態、卷積等各種不同類神經網路以及Transformer的組合,並提出將不同網路結合在一起,以達到性能和效率最佳平衡的設計。

Hasani認為Transformer只是一個開始:「你知道,我們的大腦是一個通用人工智慧(AGI)系統,它僅以20瓦的功率運作。這怎麼可能?我們還有很大的創新空間。」

03:一次性生成所有文字

幾乎所有LLM都是逐字產生輸出。這很合理,因為人類就是這樣說話和寫作的。但對於電腦來說,這效率非常低。

對LLM而言,一次性生成所有文字,一次性吐出整個句子或段落,會更快、更便宜。這就是位於加州帕羅奧圖的新創公司Inception所採用的方法,他們使用一種稱為「擴散」(diffusion)的技術來建構LLM。

擴散模型更廣為人知的是驅動大多數圖像和影片生成模型的技術。擴散模型經過訓練,能將隨機的像素網格,就像老舊電視上的雪花,轉化為圖像。它們透過同時處理所有像素來實現這一點,判斷哪些需要改變才能讓雪花看起來更像高畫質照片。

事實證明,這個過程也適用於文字。Inception已訓練其LLM,將隨機的詞語字串轉化為有意義的句子。擴散LLM仍然使用Transformer來編碼語義,但透過一次性生成整個文字區塊,它們讓Transformer以更少的資源完成更多工作。

Inception的共同創辦人兼執行長Stefano Ermon表示:「你仍然使用一個大型Transformer模型,但你可以同時預測許多詞元。這就是為什麼這些模型比當今大多數人正在建構的模型快得多且更具成本效益。」

挑戰在於如何將為圖像生成設計的技術應用於文字。Ermon說,對於圖像,如果你需要將藍色像素改為紅色,你可以逐步過渡到中間顏色。但這不適用於文字:「當你有『cat』和『dog』時,實際上沒有什麼中間狀態。」

Ermon同時也是史丹佛大學的研究員。2024年,他與兩位史丹佛大學的同事找出了讓擴散模型適用於文字的數學方法。他們訓練了一個擴散模型,其性能與OpenAI在2019年建構的LLM GPT-2相當,但速度快了10倍。這足以讓Ermon創辦一家公司。

如今,他將目光投向了頂級聯賽。Inception聲稱其最新模型Mercury 2的性能與OpenAI於2023年發布的某些GPT-4模型相當,但速度再次快了10倍。Ermon表示:「我們對這種方法非常看好,因為它是能夠擴展的。」

他補充說,唯一重要的是速度和成本:「最終,衡量標準將是每美元的智慧。」Inception並非唯一一家押注擴散技術的公司。Google也在嘗試這種方法,並建構了一個名為Diffusion Gemma的原型LLM。但Ermon並不擔心競爭。他說:「我認為這是一種驗證。這就是未來。」

04:超越語言的限制

位於帕羅奧圖的另一家新創公司Pathway,或許是這批新公司中最極端的一家。它希望將LLM從語言的限制中解放出來。

該公司建構了一種名為Dragon Hatchling的LLM(以Terry Pratchett小說《魔法的顏色》中,只要你努力思考就能具現化的龍命名)。其迄今為止最突出的成果是,在一項讓LLM與超過25萬個極難數獨謎題對抗的基準測試中獲得高分。Dragon Hatchling解決了超過97%的謎題;而來自頂級實驗室的幾個領先LLM卻一個也未能解決。

Pathway想要表達的重點是,儘管現有LLM在語言方面表現出色,但它們在非語言邏輯推理方面仍有巨大進步空間。