從 Atari 到圍棋再到 StarCraft,遊戲一直是推動 AI 實現重大突破的動力。現在,我們正與遊戲開發商合作,原型化新的遊戲體驗,以拓展遊戲和 AI 的疆界。
自 DeepMind 於 2010 年成立以來,遊戲中受限卻豐富的世界在理解智慧方面發揮了關鍵作用。它們推動了我們一些最大的 AI 突破,從精通 Atari 遊戲到協助解決蛋白質結構預測問題,它們至今仍是我們工作的核心。
遊戲是 Google DeepMind 的核心精神。Google DeepMind 的創辦人之一 Demis Hassabis 本身就是一位前遊戲開發者,我們團隊中的許多人也是如此。我們共同擁有數十年遊戲開發的實務經驗,並對遊戲製作工藝懷有深厚敬意。
我們一直明確表示,利用遊戲進行 AI 研究需要與遊戲開發者建立深度合作夥伴關係,就像我們今年稍早公布的與 Fenris Creations 和 EVE Universe 的重大新研究合作夥伴關係,以及我們與 Hello Games、Coffee Stain Studios、Foulball Hangover 等知名工作室共同完成的工作。
我們的旅程始於一個小團隊,他們訓練一個深度神經網路,直接從原始像素玩 Atari 2600 遊戲。Deep Q-Network (DQN) 無需任何針對特定遊戲的工程設計,就學會了玩 49 種不同的遊戲,從 Pong 到 Breakout 再到 Space Invaders。2015 年發表在《自然》雜誌上關於 DQN 的論文,催生了深度強化學習的現代紀元。
從那時起,我們嘗試精通更複雜的遊戲,每個里程碑都產生了更強大且通用的系統。AlphaGo 在 2016 年擊敗了圍棋世界冠軍李世乭,許多專家認為這項壯舉還需要十年才能實現。AlphaGo Zero 透過完全從自我對弈中學習,無需任何人類數據,超越了所有先前的版本。
AlphaZero 將這種方法推廣到用單一演算法精通西洋棋、將棋和圍棋,而 MuZero 甚至在不知道規則的情況下學會了玩遊戲。2019 年,AlphaStar 在 StarCraft II 中達到了宗師級別,駕馭了即時複雜性和不完美資訊。
對於每款遊戲,AI 都豐富了遊戲體驗。AlphaGo 著名的第 37 手是如此出人意料的一步,以至於專業評論員最初認為這是一個錯誤,顛覆了數百年來的圍棋傳統智慧,並激勵專家探索新的策略。AlphaZero 也類似地激發了西洋棋中全新的玩法。
至關重要的是,在遊戲中成功的探索精神對其他 AI 系統產生了深遠影響:AlphaFold 將這些基礎應用於協助解決長達五十年的蛋白質結構預測重大挑戰,這項突破獲得了 2024 年諾貝爾化學獎的認可。
我們早期的工作證明,只要有明確的目標和足夠的訓練,AI 就能精通任何遊戲。但現實世界並沒有分數和規則手冊,這讓我們提出了一個根本不同的問題:AI 能否像人類一樣理解並與任何遊戲世界互動?
這就是 SIMA(我們的可擴展可指令多世界代理程式)背後的挑戰。SIMA 不是為了優化高分,而是一個通用型代理程式,它能「看見」玩家在螢幕上所見,理解自然語言指令,並透過一般鍵盤和滑鼠控制進行操作,無需 API 或原始碼存取。
由我們的尖端 AI 模型 Gemini 提供支援,SIMA 2 作為一個互動式夥伴,能夠進行即時推理和對話。它在複雜的 3D 研究環境和視訊遊戲(包括 No Man's Sky、Valheim、Hydroneer 等)中實現了類人玩法。
對於遊戲開發者來說,一個真正通用的遊戲代理程式將釋放與現有遊戲協同運作的 AI 能力,無需修改遊戲程式碼。這可以為全新的遊戲玩法提供動力,從真正理解遊戲世界的 AI 夥伴,到能以腳本系統無法實現的方式適應和回應的非玩家角色 (NPC)。
一個通用的遊戲代理程式還可以改變遊戲的製作方式。在開發過程中,當遊戲隨著每次提交而改變時,此類代理程式可以實現真正強健的品質保證測試。發布後,當引入新內容或玩家行為不可預測時,它們可以即時適應,泛化到新情境而無需重新編寫腳本。為了安全且負責任地開發 SIMA 代理程式,我們與知名遊戲工作室合作,並正在建立一個不斷擴大的遊戲組合用於 AI 研究。
這使我們能夠用日益複雜的任務來挑戰我們的代理程式,這些任務有朝一日可能會轉化為解決現實世界中的問題。
遊戲工作室帶來精湛工藝、非凡的遊戲世界以及對玩家的深入了解。我們則帶來尖端 AI,從 Gemini 到生成式互動環境和具身代理程式的研究,研究專業知識,以及我們團隊獨特的遊戲開發背景和多年為互動環境建立 AI 的經驗。我們共同專注於發現突破性體驗,沒有 AI 就不可能實現的前所未見的遊戲玩法。
這不是關於技術,而是關於有趣的體驗。因此,我們與合作夥伴採取「展示而非說明」的方法。我們的團隊與遊戲開發者攜手合作,探索新想法並建立可玩原型,以找到樂趣。
我們與 Fenris Creations(EVE Universe 背後的獨立工作室)的最新研究合作夥伴關係,代表了我們在遊戲 AI 研究歷史上的新篇章。Fenris Creations 花費了二十多年時間,建立起遊戲中最非凡的持久世界之一。
EVE Online 於 2003 年推出,是一款大型多人線上太空模擬遊戲,數千名玩家共享一個持續演進了 20 多年的單一宇宙。其玩家驅動的經濟具有真實的供需動態和橫跨數千個星系的貿易網路。其景觀,由聯盟、衝突和外交塑造,由人類互動驅動。
對於 AI 研究來說,這是一個黃金機會。這是一個活生生、不斷演進的世界,它需要我們認為對尖端 AI 至關重要的能力:持續學習:在不斷變化的世界中,在不忘記先前所學的情況下獲取新技能。記憶:跨越遠超當今模型上下文視窗的時間尺度累積和檢索知識。長期規劃:進行數週、數月甚至數年的推理。複雜的多代理程式動態:大規模地駕馭合作、競爭、談判、經濟和湧現的社會行為。
這些挑戰是我們更廣泛研究計畫的核心,旨在建立從經驗中持續學習的系統,且學習速度隨時間加速。我們相信這些尖端能力可以在未來釋放新的遊戲體驗。我們的研究合作夥伴關係延伸到 Fenris Creations 不斷擴大的宇宙中,為 AI 開發提供了獨特的環境。
EVE Online 提供大規模單一分片持久宇宙,而 EVE Vanguard 則以第一人稱視角進行遊戲,為更廣泛的持久世界帶來地面級別、快節奏的戰術決策。這創造了研究代理程式在多個抽象層次上運作的機會,從即時反應戰術到橫跨星系的策略。
此外,EVE Frontier 憑藉其可程式化的「智慧組件」及其開放、可擴展的架構,提供了一個開放式環境,其中世界的規則本身可以改變,這要求代理程式能夠適應全新遊戲機制。在 Google DeepMind 和 Fenris Creations 的工作坊期間,我們團隊分享可玩原型、回饋並討論新遊戲體驗想法的「展示而非說明」環節。
我們的合作已經為玩家帶來了真實價值:Aura 指導系統使用 Gemini 根據真實的新手幫助問題和答案,提供玩家生成的知識,以幫助新手飛行員。我們的長期研究計畫始於 EVE Online 的離線實例,這是一個與真實玩家隔離的安全沙盒。然後,它透過 EVE Frontier 作為一個空間,研究人類與代理程式如何能在持久且開放式世界中共存。
只有當能力成熟時,我們才會考慮將它們引入 EVE Online 和 EVE Vanguard,目的是豐富人類的遊戲體驗。
遊戲一直是智慧的鏡子。隨著它們變得越來越複雜、越來越持久、越來越開放,我們為駕馭它們而建立的 AI 系統也隨之發展。我們的最終目標始終如一:AI 作為催化劑,而非替代品。我們的長期抱負是釋放突破性的遊戲體驗,讓遊戲更易於上手且更個人化,並且,正如我們從 AlphaGo 到 AlphaFold 所見,將我們在遊戲中學到的知識應用於現實世界的問題並推進科學發現。
我們感謝所有在這段旅程中與我們合作的遊戲夥伴,以及 Fenris Creations 加入我們開啟這新篇章。我們迫不及待地想分享我們的發現。我們要感謝 Google DeepMind 的許多團隊多年來在遊戲中安全且負責任地推進 AI 研究方面所做的貢獻。
特別感謝所有與我們合作的遊戲開發者:Coffee Stain (Valheim, Satisfactory, Goat Simulator 3)、Fenris Creations (EVE Online, EVE Vanguard, EVE Frontier)、Foulball Hangover (Hydroneer)、Hello Games (No Man's Sky)、Keen Software House (Space Engineers)、RubberbandGames (Wobbly Life)、Strange Loop Games (Eco)、Thunderful Games (ASKA, The Gunk, Steamworld Build)、Digixart (Road 96) 和 Tuxedo Labs & Saber Interactive (Teardown)。



