AI 代理這種自動化軟體系統的部署近期呈現爆炸性成長。麻省理工史隆管理學院與波士頓顧問集團在 2025 年 11 月發布的報告指出,35% 受訪企業已部署 AI 代理,另有 44% 計劃近期導入。

為了解這些日益普及工具的基礎與潛在影響,《麻省理工新聞》採訪了電機工程與電腦科學系(EECS)副教授兼電腦科學與人工智慧實驗室(CSAIL)成員 Phillip Isola。他主要研究 AI 代理所具備的智慧,以及驅動 AI 代理系統的底層模型與機制。

問:什麼是 AI 代理?它與 ChatGPT 和 Claude 等生成式 AI 模型有何不同?

答:AI 代理是指能在現實世界中採取行動的人工智慧。這些行動可以是實體操作,例如機器人操控,也可以是數位行動,例如預訂航班。相較之下,我們認為生成式 AI 主要是創造故事、詩歌、藝術和圖像,而非替我們執行實際動作。

「代理」(agent)這個詞只是一個品牌名稱。它通常指的是協助人們與應用程式、網站或實體世界互動的 AI。我們今天遇到的大多數代理都是數位代理,例如你可以與之討論產品投訴的客服代理。

大多數提供 AI 代理的公司,其底層都使用相同的少數 AI 模型,並賦予它們執行動作和記憶事件的能力。AI 代理的核心是一個基礎的生成式 AI 系統,例如 Claude。然後,公司會為其產品或應用程式,在基礎模型外層加上不同的「包裝」(wrappers)。

這些包裝可能是 AI 代理可以使用的特定工具,而這些工具則取決於應用程式的需求。例如,代理可能可以使用計算機來解決數學問題,或者存取更複雜的硬碟和作業系統,以便記住公司的財務數據和過去的商業談判。

開發 AI 代理面臨的最大挑戰來自於訓練資料的缺乏。如果我想建立一個能上網幫我預訂航班的系統,這看起來很簡單。但我們沒有足夠的資料能精確說明如何執行這些操作,例如滑鼠要移到哪裡、點擊哪個按鈕、如果出錯該怎麼辦,或者如何打電話與人協商機票價格。

訓練這類系統的一種方法是讓 AI 代理造訪航空公司網站,嘗試各種操作,並觀察哪些有效、哪些無效。這些環境很難建模,因此代理通常必須透過試錯來學習。

問:AI 代理有哪些有前景的應用?

答:我認為目前最成功的應用領域是程式碼代理。這是從生成式 AI 演變而來的。人們用程式碼訓練語言模型,然後這些模型就能預測人類會如何解決程式設計問題。

此外,代理可以透過反饋循環來學習,嘗試不同的解決方案並檢查答案是否正確。只要它能檢查答案,AI 代理就能執行這個試錯循環,直到找出一個好的策略。

然而,在自動化決策與單純輔助和告知人類之間,始終存在一個平衡點。分析型 AI 方法,例如那些幫助預測決策可能結果的系統,本質上並非 AI 代理,但對人類決策者來說非常有參考價值。

對於高風險或安全關鍵的案例,例如醫療、安全、高層級商業政策等,AI 技術可能尚未準備好完全自動化這些流程,或者我們甚至可能不樂意讓它這麼做。

問:使用 AI 代理時,我們應該考慮哪些風險?

答:一個主要的風險領域來自於,讓 AI 代理為你執行某些類型的工作通常非常容易。使用程式碼代理時,你可以「隨意編碼」,直接要求代理為你生成程式碼,而無需自己動手做艱鉅的工作。

由於過於方便,人們可能不會投入足夠的精力去驗證代理是否做了正確的事情,這是一個很大的風險。錯誤將會被引入,私人資料將會洩漏,這已經在發生了。

AI 代理並非完美無缺,它們可能會因為訓練不足或不知道該怎麼做而犯錯。但即使它們能力很強,如果人類沒有適當地使用它們,或者給予過於模糊的指令,AI 代理也可能因為人類的錯誤而犯錯。如果人類較少參與思考所有後果,我認為我們可能更容易犯下這些錯誤。

另一個方面是技能退化的風險。目前尚不清楚這種情況會發展到何種程度,但當我們依賴代理來完成作業、程式設計和數學時,我們可能會失去自己執行這些任務的能力。而且,由於技術尚未準備好完全自動化這些流程,我們可能會過早地失去這些能力。

問:AI 代理的未來會如何?

答:我們現在所稱的 AI 代理,指的是大型語言模型利用工具與數位和實體系統互動。一個明顯的限制是,其底層架構是語言模型,並且是透過文字資料訓練的。

為了打造更強大的 AI 代理,我們可能需要對影片、物理力、時間序列、雷達掃描及其他模態進行建模。我們可能需要具備根本上不同架構的模型,能夠處理連續資料、高維度資料、隨機資料等等。

但另一方面,或許一個極其出色的程式碼模型可以充當「操縱者」,與感測器、致動器和網路 API 進行介面連接?也許,一旦你擁有一個理解數學、語言和程式碼的超級智慧推理系統,你可以給它一個攝影機和鍵盤,它就能在空間領域中自行判斷該怎麼做。

下一波 AI 浪潮會是配備感測器、致動器和工具的 Claude,還是從頭開始以全新方式建構的東西?這正是許多 AI 領域人士目前正在努力解決的大問題。