研究人員指出,核心問題已不再是模型如何產生更好的答案,而是它如何可靠地將意圖轉化為已完成的工作。目標正從被動的問答轉向委派的任務執行。
在聊天機器人時代,模型主要以快速生成文字為主。它們將語言模式和事實儲存在參數中,然後一次性、逐個詞元地寫出答案,遵循最可能的延續,而不會檢查中間步驟或搜尋解決方案。
由 OpenAI 的 o1 和 Deepseek-R1 開啟的「思考型 LLM」時代,在回答問題的當下投入更多運算資源。這些模型能產生長串的思考鏈、檢查中間步驟,並透過強化學習來搜尋和自我修正。只有經證實正確的解決方案才會獲得獎勵。研究人員將此框架為從快速、直覺的「系統一」思維,轉變為緩慢、審慎的「系統二」推理,借用了心理學家 Daniel Kahneman 的理論。
第一代代理能夠呼叫 API、編寫程式碼和瀏覽網路,但它們仍然很脆弱。研究人員指出了四個結構性瓶頸:代理只能零碎地感知其環境、工具呼叫不會留下持久狀態、意外行為會導致它們崩潰,而且它們很少能完成任務。
在 OpenClaw 時代,環境本身變得持久化。檔案、會話、日誌、瀏覽器、權限和技能都能在整個工作流程中持續存在。該論文引用了 OpenHands 和 SWE-agent,這兩者都將代理嵌入到受控的開發環境中。
這篇論文的核心論點是,結合工作空間與技能才能實現真正的效能飛躍。工作空間提供狀態、儲存和結果,而技能則將操作知識打包成可重複使用的套件。Anthropic 的 Agent Skills 已將這種模式正式化,以包含 SKILL.md 檔案的資料夾形式呈現,其中包含指令、腳本和資源。
根據研究人員的說法,技能既不是提示詞,也不是傳統工具。它們介於模型的推理和工作空間執行之間,讓組織能夠以模組化、可測試、可攜帶的形式捕捉專業知識。但作者也警告說,可重複使用的程序可能會過時、過度適應特定工作流程,或成為攻擊媒介。
這項轉變也改變了這些系統的訓練和評估方式。聊天機器人從指令-回應對中學習,並根據答案的準確性進行評分。而基於工作空間的系統則從狀態-行動-觀察的軌跡中學習。研究人員認為,成功不再是關於合理的回答,而是關於任務的完成:系統是否能將目標環境帶到一個可驗證的最終狀態。
像 SWE-bench、OSWorld 和 WebArena 這樣的基準測試,要求可重現的起始狀態、可執行的工具、軌跡日誌和最終狀態檢查。GPT-4 最初僅完成了 WebArena 任務的 14%,這顯示了真實的網路環境與靜態問答情境之間的巨大差距。
持久性工作空間也擴大了攻擊面。代理持有憑證、本地檔案、身份代幣和通訊管道。像 OpenClaw PRISM 和 ClawGuard 這樣的專案正試圖建立權限、來源追蹤和稽核日誌作為執行時的安全保障。作者認為,資料主權同樣重要,因為工作空間代理會觀察敏感的儲存庫、內部文件和中間結果,這些都可能在日後成為記憶、技能或訓練資料。
作者承認工作空間與技能的結合並非完整的解決方案。技能可能會過度擬合,而工作空間則會充滿過時的檔案和損壞的產物。研究人員認為,可靠的部署需要技能生命週期管理、工作空間衛生、權限控制、沙盒化、回溯功能以及基於軌跡的評估。他們警告說,缺乏治理的重複使用只會產生新的故障模式。
Meta、Stanford 和 University of Illinois Urbana-Champaign 最近的一項調查從不同角度提出了相關論點:自主系統的效能較少取決於基礎模型本身,而更多取決於其周圍的軟體層。這個「套件」包含了工具、沙盒執行環境和驗證機制。
根據 Vercel 最近的一項評估,這項論點中關於「技能」的部分在實踐中變得複雜。評估發現,程式編寫代理有 56% 的時間甚至沒有呼叫提供的技能系統,而嵌入在 AGENTS.md 檔案中的壓縮文件索引卻達到了 100% 的成功率。技能系統的最高成功率為 79%。被動、始終存在的上下文勝過了主動的技能檢索,這使得平衡傾向於工作空間。



