在一個自動駕駛計程車無需駕駛員就能穿梭於城市街道,送貨無人機自主飛行將訂單送達客戶家中的世界裡,通用型機器人協助人類在工作場所甚至家中執行各種任務的想法,似乎不再遙不可及。
然而,這個未來取決於開發由現代人工智慧驅動、日益自主的機器人。這項雄心勃勃的願景激勵了許多研究人員轉型為新創公司創辦人,同時也吸引了數十億美元的投資。
波士頓動力(Boston Dynamics)軟體副總裁 Matt Malchano 表示:「大約 15 年前我剛開始時,我領導的專案團隊專注於自主性,但當時的目標只是讓機器人從 A 點導航到 B 點。」他補充說:「而現在,當我們思考自主性時,我們想到的是一個巨大的任務空間,以及我們能想像機器人獨立完成的各種事情。」
過去,很難想像如何實際創造出像《傑森一家》中的管家 Rosie 或《星際大戰》中的 C-3PO 等各種通用型自主機器人。尤其當時機器人實驗室和公司仍在努力解決自主導航,甚至步行機器人的自我平衡問題。1979 年,名為 Stanford Cart 的實驗性自主載具,需要五小時才能成功穿越 20 公尺的障礙物房間。而第一個能自行行走且不失平衡的雙足機器人,則是在 1996 年才開發出來。
Malchano 告訴 Ars,機器人自主性一直是一個「移動的目標」,其目標是讓機器人能夠完成越來越多人類已經能做到的事情,理想情況下無需人類直接監督。國際標準組織將機器人自主性定義為「根據當前狀態和感測,無需人類干預即可執行預定任務的能力」。
Malchano 表示,近來人工智慧的進展,例如 2010 年代的強化學習和 2020 年代在海量數據上訓練的大型基礎模型,已經「解鎖」了「想像一個機器人能夠執行一系列活動並真正理解任務的世界」的能力,這非常令人興奮。現在,許多研究實驗室和公司正競相開發通用型機器人,使其能夠在更複雜、不可預測的環境中獨立處理各種任務。
儘管大量投資資金湧入人形機器人領域,但這類機器人的外觀和功能不一定會是人形。然而,無論其形式如何,它們都可能代表著超越數百萬台已在工廠和倉庫等相對受控環境中執行特定任務的工業機器人和服務機器人的一大步。
加州大學柏克萊分校電腦科學家兼 AI 與機器人公司 Physical Intelligence 共同創辦人 Sergey Levine 表示:「在生產線上,機器人應該執行特定的動作,如果你能可靠且重複地完成該動作,那就是工廠級的基礎自主性。」他補充說:「然而,下一個層次,也就是目前處於技術前沿,像是一個正在進入現實世界的研究課題,是機器人能夠在非結構化環境中可靠地完成任務。」
Ars 採訪了機器人研究人員和創辦人,探討了人工智慧如何大幅提升對機器人技術的興趣、開發通用型機器人的挑戰、安全對於機器人工作者而言為何是成敗關鍵、外科手術機器人為何仍具有有限的自主性,以及何時能期待機器人助手進入人們的家中。
Levine 的新創公司 Physical Intelligence 致力於實現實用的機器人智慧,以賦能多種在開放世界環境中自主運行的機器人。Levine 告訴 Ars:「我不認為會出現一個終極機器人,像是一個什麼都能做的超級先進人形機器人。」他認為:「我認為會是一個通用的 AI 模型,能夠驅動許多適合其工作的不同類型機器人。」
Levine 舉例說,一個懸掛在天花板上的小型機器手臂可能更適合紐約市的狹小公寓,而一個移動重物的「龐大巨型機器人」則在農場上更為實用。他說:「我確信我們也會有出色的人形機器人,但也會有其他形式的機器人。將會是任何最適合該任務的機器人。」
然而,Levine 表示,開發能夠在開放世界中更獨立運行的自主機器人,涉及「技術複雜性的階梯式變化」。他描述這類機器人需要處理複雜的環境感知、具備強大的運動技能,以及克服基本錯誤和處理人類指令的能力。此外,這類機器人還需要學習如何將其行為泛化,以應對新情況。
Levine 表示,許多研究人員正透過結合人工智慧技術來實現這一目標,其中包括強化學習和大型預訓練模型。強化學習涉及透過試錯法訓練機器人執行特定任務,無論是使用實體機器人與現實世界互動,還是透過電腦模擬。同時,在海量數據上預訓練的基礎模型,例如在圖像和文本上訓練的視覺語言模型,可以提供一些基本的先驗世界知識,幫助機器人在各種情況下做出更適當的反應並避免不必要的錯誤。
Levine 解釋說:「強化學習就像你練習網球揮拍很多次之後,就能變得非常擅長一樣。」他補充道:「但要達到那個程度,你首先需要具備一種基本的常識才能開始。」
Levine 表示,人工智慧技術的結合以及可獲取訓練數據的逐步擴展,例如人類遠端操作機器人來展示如何執行特定任務,使得訓練機器人在各種條件下可靠地執行多種任務取得了「令人鼓舞」的進展。他說:「讓現代機器學習系統發揮作用的關鍵是獲得足夠的數據臨界量,這樣我們才能看到泛化能力。」
然而,在收集足夠且正確的數據以訓練機器人執行實體任務方面,仍然存在一個廣泛認可的數據鴻溝。更昂貴且耗時的方法包括人類穿戴遠端操作設備,直接引導機器人在訓練中的物理動作,或在實驗室或其他環境中對機器人進行大量實驗。基於物理學的手動編碼模擬可以在虛擬環境中更便宜地訓練機器人,但可能無法捕捉許多現實世界的複雜性和不確定性。
機器人研究人員也一直在開發世界模型,以幫助機器人預測其在物理世界中行動的後果並據此規劃。這類 AI 模型的一些實作主要透過視覺數據進行訓練,以學習物理環境的運作方式,有些公司甚至僱用零工工人佩戴頭戴式攝影機執行家務或其他任務,以收集第一人稱視角的影片作為訓練數據。
這種機器人訓練方法比用機器人進行真實世界實驗更便宜,但世界模型的開發仍然計算成本高昂,並且可能難以準確複製真實世界的物理互動。
目前,通用型機器人仍處於發展階段。Levine 指出,目前的訓練方法,例如強化學習,可以讓機器人在非常特定的條件下,非常擅長且穩定地執行特定任務,但在不同條件下,這些機器人可能會在相同的任務上表現不佳。同時,來自遠端操作和其他方法的日益多樣化數據,可以訓練機器人學習「多樣化的任務,但無法達到 99.99% 的穩健性水平」。
他說:「你可能擁有一種在所有方面都還不錯但稱不上驚豔的東西,或者一種在某一方面極其出色的東西。」他補充:「我們真正想要的是在所有方面都極其出色的東西,而這仍然是研究的前沿。」
幸運的是,世界無需等待通用型機器人能力的發展,就能找到機器人的實際應用。許多公司數十年來一直在開發和銷售專業的工業和服務機器人,而新創公司和老牌機器人公司都已將最新水平的機器人自主性應用於處理日益增多的任務。
其中最著名的競爭者之一是 Boston Dynamics,該公司最初於 1992 年從麻省理工學院的一個實驗室分拆出來。這家機器人公司以其四足和雙足機器人的病毒式影片演示而聞名,最近的例子包括其 Atlas 人形機器人在 2026 年世界盃期間學習各種足球動作。
然而,Boston Dynamics 的四足機器人 Spot 多年來一直在對對人類更危險的設施進行自主檢查,包括由電力和天然氣公用事業公司 National Grid 運營的麻薩諸塞州變電站,以及加州高速公路下方的涵洞管道。
Malchano 表示,這種機器人自主性「實際上是關於機器人能夠在環境中導航並獨立執行動作,拍攝照片並測量該環境的能力」。

