在 OpenAI 的 GPT-3 開啟基礎模型時代之前,各公司必須從零開始建構專用的自然語言處理模型,並針對大量特定任務數據進行訓練。如今,大多數組織都從 OpenAI 的 GPT 系列、Claude 或 Llama 等通用模型著手,然後透過微調或提示詞來解決其特定需求。
General Intuition 的執行長 Pim de Witte 認為,具身 AI 也將遵循類似的模式。他主張,業界不應為了建構專用機器人模型而收集龐大的真實世界數據集,而應專注於更高品質的數據集,以產生能夠將運動和互動直覺轉移到多種環境的基礎模型。
de Witte 在最近一集 Equity 節目中告訴 TechCrunch:「目前許多公司正在進行大量專門工作,專注於個別的具身、個別的環境和個別的機器人。」
他認為,隨著 General Intuition 等公司開發和部署的通用模型出現,這些工作中的大部分將很快變得多餘。
他說:「模型本身的通用性就是產品。它具備對空間和時間的基本推理能力,這將是人們停止收集數十萬或數百萬小時真實世界數據的原因。因為現實是,你只需要幾分鐘的數據。」
General Intuition 在訓練了數百萬小時的電玩遊戲數據後,建構了自己的基礎模型,這些數據包括人類在控制器上按下了哪些按鈕以及何時按下。de Witte 和 General Intuition 的主要投資者 Vinod Khosla 都認為,動作數據是開發類似人類空間時間推理直覺的關鍵。
這家新創公司上個月憑藉這一論點,成功募資 3.2 億美元,估值達到 23 億美元。該公司已證明其現有模型既能玩數小時的電玩遊戲,也能驅動一隻四足機器人,後者僅在八分鐘的真實世界機器人數據上進行微調後便能實現。
de Witte 表示:「機器人僅憑前置鏡頭,沒有其他感測器,就能在辦公室內有動態物體和行人經過的情況下進行零樣本學習,這讓我們非常驚訝。我認為這預示著未來的發展。」
General Intuition 的最終目標不是自己製造機器人,而是成為實體 AI 的基礎模型,為其他機器人公司提供在其機器上建構的基礎。或者,正如 de Witte 所說:「我們不會建立一家自駕車公司。我們將讓下一個人建立自駕車公司變得容易十倍。」

