即使是不熟練的玩家,也能透過轉動搖桿、輕扣扳機和按下幾個按鈕,在 3D 電玩遊戲環境中靈活穿梭。一家英國新創公司認為,這些簡單的動作序列蘊藏著豐富的資訊,可用於訓練新的人工智慧模型。

AI 產業中越來越多人相信,大型語言模型(LLM)最終將受限於其無法在物理世界中導航的能力。僅憑文字訓練的 LLM,可能不擅長駕駛自動駕駛車輛、操控機械手臂,或執行任何需要精細與精準度的動作。為彌補這項不足,包括李飛飛(Fei-Fei Li)和楊立昆(Yann LeCun)在內的一群知名研究人員,正將精力集中於另一類 AI:世界模型(world models)。

為了精通真實世界的物理學,世界模型需要結合視覺和動作數據進行訓練。在能夠靈巧地操控機械手臂之前,模型可能需要透過工廠現場的影片片段進行訓練,並輔以關於物體應如何牢固抓握、以何種扭矩進行操作等資訊。然而,與依賴大量文本訓練的 LLM 不同,世界模型實驗室目前沒有類似的資料庫可用。

「對於世界模型,你需要因果關係」薩里大學(University of Surrey)專攻 AI 的副教授 Xiatian Zhu 表示。「在網路上,我們很少有這種類型的數據。」

Worldmodeldata 是一家由楊立昆提供諮詢的英國新創公司,旨在解決這個問題。他們將電玩遊戲工作室收集到的控制器輸入及其他數據(這些數據是大量存在的「廢棄產品」)打包成世界模型的訓練資料集。一些公司,如 General Intuition 和 Niantic,已經從自己的平台收集電玩遊戲數據來建立模型。

但 Worldmodeldata 將自己定位為一個經紀商,負責策劃和組織數據,讓實驗室無需與眾多遊戲工作室單獨簽訂協議。

Worldmodeldata 執行長 Rhea Loucas 告訴 WIRED:「有數百萬款優秀遊戲,它們越來越接近真實世界。我們為何不利用電玩遊戲中廣闊、豐富、多樣的經驗來教導 AI 呢?」

儘管這項假設尚未完全驗證,但研究人員普遍認為,世界模型的性能將隨著訓練資料集的大小而提升,類似於 LLM 的情況。這意味著缺乏合適的訓練數據是進步的最大瓶頸之一。

一些實驗室曾嘗試透過在測試環境中為人類和機器人安裝感測器來手動生成數據。但這種方法僅產生少量數據,且無法涵蓋模型在實際應用中可能遇到的邊緣情境。

「你可以付錢請人示範拾取和放置任務。但單純的重複無法捕捉機器將要運作的世界的混亂狀態」創投公司 Khosla Ventures 的合夥人 Nicole Fraenkel 說道,該公司曾投資 General Intuition。

Worldmodeldata 的理論是,從電玩遊戲環境中收集的數據,3D 空間的視覺呈現與玩家所採取的動作相結合,不僅數量充足,而且多樣化程度足以捕捉所有重要的邊緣案例。

Fraenkel 表示:「邊緣案例才是真正需要處理好的部分。汽車、飛機、無人機、工廠堆高機或自主四足機器人的錯誤成本非常高。」

Worldmodeldata 表示,他們已從多家熱門電玩遊戲工作室獲得了近 100 萬小時的數據授權,儘管 Loucas 拒絕透露這些工作室的名稱。未來,這家新創公司也計畫為個別玩家創造獲得報酬的途徑。