過去幾年,許多人對我們現在所稱的人工智慧有了初步認識,但實際上,這主要集中在大型語言模型(LLM)上。然而,LLM已不再是唯一吸引高期望、巨額融資以及大量研究與產品開發的AI類別。
過去一年,我們看到許多關於「世界模型」類別的新發表,未來幾個月和幾年內,這個領域預計將有更多進展。
世界模型旨在為能夠模擬物理世界,或至少是其有用近似值的AI系統奠定基礎,這與處理語言的模型有所不同,或是在其基礎上進一步發展。
為了探討這個概念的獨特之處和重要性,Ars採訪了三位在世界模型及相關技術領域工作的專家:麻省理工學院的Vincent Sitzmann、Runway的Anastasis Germanidis以及World Labs的Ben Mildenhall。
從這些對話中我們了解到,LLM作為產品是從介面(聊天)開始,然後才尋找應用場景;而目前世界模型領域的主要參與者則似乎反其道而行。他們從機器人、研究和資產生成等特定應用場景出發,但最終的介面、系統和工具將會是什麼樣子,目前尚不明確。
正如您將看到的,LLM和世界模型在架構以及人們預期它們如何隨時間改進方面有許多相似之處。然而,對某些人來說,它們被視為解決LLM局限性的一個潛在方案,儘管對世界模型的研究早於這種當代敘事。
前Meta首席AI科學家Yann LeCun今年稍早告訴《Wired》雜誌:「認為可以將LLM的能力擴展到具備人類水平智慧的想法,完全是胡說八道。」LeCun的觀點在一些AI和LLM從業者看來有些反主流,但他實際上代表了該領域相當一部分人的看法。
另一位值得關注的是電腦視覺先驅、世界模型新創公司World Labs的共同創辦人李飛飛(Fei-Fei Li)。她去年底在一篇Substack文章中寫道:「如今,大型語言模型(LLM)等領先的AI技術已開始改變我們獲取和處理抽象知識的方式。
然而,它們仍然是黑暗中的文字匠;能言善道卻缺乏經驗,知識淵博卻不接地氣。」她認為,空間智慧將徹底改變我們創造和互動真實與虛擬世界的方式,革新故事敘述、創意、機器人技術、科學發現等等,這將是AI的下一個前沿。
LeCun和李飛飛的事業都建立在這些理念之上,因此他們會發表這些言論並不令人意外。然而,即使是一些主要仍在研究LLM的知名人物,也表達了類似的看法。
Hugging Face(一個託管各種LLM儲存庫的平台)執行長Clem Delangue表示:「我認為我們正處於LLM泡沫之中,而且這個泡沫可能在明年破裂。」
Delangue在一次會議上補充道:「但當談到將AI應用於生物學、化學、圖像、音訊和視訊時,『LLM』只是AI的一個子集。我認為我們正處於這個領域的開端,未來幾年將會看到更多發展。」
僅在過去幾個月,世界模型已從一個研究課題(當然,它仍然是)發展成為新商業專案和巨額融資的基礎。以下是一些關鍵範例:
去年八月,Google DeepMind發表了Genie 3,這是一個在視訊生成模型基礎上建立即時互動性的模型。
去年十一月,World Labs推出了Marble,這是一個模型和工具集,允許使用者根據文字、圖像、視訊或其他資產的輸入,生成可匯出為3D資產的沉浸式環境。
僅僅一個月後,視訊生成和電影製作AI公司Runway也加入了戰局,宣布推出GWM-1,這是一組基於Runway過去在視訊模型方面工作的三個專業世界模型。
更近期,Yann LeCun創立了Advanced Machine Intelligence (AMI) 公司,該公司堅信AI系統的真正未來在於能夠與物理世界互動(或至少模擬它)的模型,而不僅僅是處理語言。
這些以及類似的努力都獲得了大量資金。據報導,World Labs和AMI分別在二月和三月各籌集了約10億美元,Runway也在二月籌集了3.15億美元。
圍繞世界模型的一些活動,至少部分是為了表面上建立通用人工智慧(AGI)或超級智慧的基礎,但大多數從事這方面工作的人都在談論實際應用:訓練、測試和驅動機器人;為遊戲開發和電影製作生成3D資產;科學模擬和建模等等。
然而,需要注意的是,「世界模型」是一個涵蓋性術語,經常在沒有明確定義的情況下被廣泛使用。
Vincent Sitzmann在一次關於世界模型研究和概念的長時間對話中告訴我:「這絕對是一個被過度使用的術語。」
Sitzmann是麻省理工學院的助理教授,曾發表關於神經渲染、視覺計算和機器人技術的研究。他領導著麻省理工學院電腦科學與人工智慧實驗室(CSAIL)的場景表示組。
當被要求給出定義時,他簡單地將世界模型描述為任何接收互動,並「根據該互動,使你能夠模擬在某個環境中接下來會發生什麼」的模型。
Runway在去年十二月宣布其GWM-1系列模型時,將世界模型定義為「一個建立環境內部表示並利用它來模擬該環境中未來事件的AI系統」。Runway進一步補充說:「通用世界模型的目標是表示和模擬廣泛的情境和互動,就像在現實世界中遇到的那樣。」
我也採訪了World Labs的共同創辦人Ben Mildenhall,他曾是Google的電腦視覺和物理研究員,也是神經輻射場(NeRF)的共同創作者。NeRF是一種從2D圖像構建可導航3D場景的方法,其格式可微分,因此在機器學習環境中非常有用。
他說:「區分它與LLM的關鍵在於它展現了空間和,或許找不到更好的詞來形容,連續理解的程度。」「與LLM互動的一個非常顯著的特點是它們是回合制的。」這意味著使用者輸入一些文字,然後暫停,接著收到一段文字回覆。相比之下,他認為世界模型是一個同步的即時系統。
他表示:「定義世界模型的一個特點是你在與空間世界互動時所擁有的自由度,你不會經歷這種A然後B、A然後B、A然後B的線性中介旅程。」當使用者或代理人利用世界模型時,他們「實際上能夠像與某種世界互動一樣,採取連續的行動」,並且「同時發生著平行的事情」。
Mildenhall的共同創辦人李飛飛曾撰文指出,她認為定義世界模型有三個標準:世界模型「能夠生成具有感知、幾何和物理一致性的世界」、「本質上是多模態的」,以及「能夠根據輸入動作輸出下一個狀態」。
「世界模型」這個詞本身並不新鮮;它長期以來一直出現在強化學習和機器人技術中,用來描述預測環境動態的模型。然而,將這個概念擴展到基於大量視覺和多模態數據訓練的通用生成系統,這是新的嘗試。巨額融資也是相對較新的現象。
事實上,存在許多不同的方法和定義。Mildenhall說:「問Runway、問我們、問任何人,我們都會給你一個稍微不同的術語。」
此外,重要的是要意識到「世界模型」正逐漸成為一個品牌術語,而不僅僅是技術術語。它被用作一個行銷標籤,涵蓋從動作條件式視訊生成到3D資產創建,再到機器人策略評估的任何事物。儘管人們堅信一個基礎模型應該能夠解決許多這些問題,但各公司在使用這個術語的同時,正以不同的方法解決不同的技術問題。
Sitzmann說:「今天,當大多數人說『世界模型』時,他們指的是生成像素,例如,根據動作生成逼真的視訊。」
過去幾年,我們看到視訊生成模型越來越受歡迎。例如,Runway作為一家製作視訊模型及相關工具的公司,在電影製作人、廣告商和其他創意領域中建立了聲譽。現在,該公司的重點已轉移,明確表示打算將業務擴展到這些領域之外,專注於GWM-1等世界模型,並著眼於未來幾年在機器人技術及其他領域的應用。
這可能看起來像是一個突兀的橫向轉變,但如果你考慮這些世界模型是如何開發的,這是一個自然的下一步。在許多情況下,它們是先前在視訊模型上所做工作的直接延伸。
Runway的技術長Anastasis Germanidis在去年十二月與我談論GWM-1時表示:「我們開始意識到除了短片生成任務之外還有更多可能,是在我們發布攝影機控制功能時,你可以指揮攝影機在場景中移動的方式。」「這開始感覺更像是一個電玩遊戲,你在探索這個世界並四處移動。這感覺不像我只是在製作一個視訊,而更像我在探索一個由這個模型持續渲染的環境。」

