AI 代理常因其指令或技能是手動修改且無法保證改進而失敗。SkillOpt 將技能編輯轉化為訓練過程,在不改變模型權重的情況下,使代理行為更加可靠。

SkillOpt 將代理技能文件視為凍結目標模型之外的可訓練參數,將技能編寫從單次提示轉變為受控的優化過程。

在六個基準測試、七個目標模型和三種執行模式中,SkillOpt 在所有 52 個評估單元中均表現最佳或並列最佳,在不更新模型權重的情況下提升了性能。

SkillOpt 透過有界文字編輯、驗證門控、拒絕編輯回饋以及慢速/元更新,保持技能的精簡和可審計性,避免了不受控制的提示詞漂移。

優化後的技能可以在不同模型規模、代理框架和相關任務之間遷移,這表明它們捕捉的是可重複使用的工作流程知識,而非針對特定基準測試的指令。

大型語言模型(LLM)越來越多地被部署為代理,用於收集證據、呼叫工具和執行多步驟任務。對於這些代理來說,困難的問題不再是它們能否呼叫工具,而是它們能否可靠且一致地完成任務。目前,代理技能通常來自三個來源:專家手動編寫、前沿模型單次生成,或代理在執行後鬆散地修改。這些方法都沒有深度學習優化器的行為。它們缺乏步長控制、獨立驗證以及任何失敗修訂的記憶。

因此,技能往往會隨著每次重寫而變得更長並漂移,而看似完全合理的修訂卻可能悄悄地降低實際任務性能。這種不受控制的技能演變已成為代理原型走向可靠、生產級部署的主要障礙。

在我們最近的論文《SkillOpt: Executive Strategy for Self-Evolving Agent Skills》中,我們將問題從「如何寫出更好的提示詞?」轉變為「如何訓練技能?」。SkillOpt 將技能文件視為獨立於凍結目標模型之外的可訓練參數,帶來了訓練式的優化循環、在 52 個評估單元中持續的性能提升,以及精簡、可讀、可審計且可遷移的技能文件。

圖 1. 一個凍結的目標模型執行任務,同時一個獨立的優化器模型從軌跡回饋中訓練技能層,透過驗證門控導出可重複使用的技能文件 best_skill.md。

SkillOpt 的運作方式

影片 1. SkillOpt 的優化循環,從軌跡收集到導出的技能文件。

SkillOpt 將技能編輯組織為文字空間中的前向,反向,更新循環。在前向傳播中,凍結的目標模型使用當前技能執行一批訓練任務;批次大小控制每次更新接收的證據量。在反向傳播中,一個獨立的優化器模型以反思小批次讀取結果軌跡,從成功的軌跡中提煉出要保留的模式,並從失敗中糾正模式。

在更新步驟中,優化器提出小的增、刪、替換編輯;候選編輯會被合併、去重、排名,並由文字學習率(每一步的編輯預算)進行裁剪。每個候選技能都必須通過嚴格的驗證門控:只有當它在獨立驗證集上的得分嚴格高於當前技能時,才會被採納。被拒絕的編輯不會被丟棄;它們會進入一個拒絕編輯緩衝區,作為同一週期中後續優化器呼叫的負面回饋。

以較慢的頻率,週期性的慢速/元更新會整合單個批次無法揭示的更長遠的經驗教訓(圖 2)。有界編輯、驗證門控和最佳版本選擇共同使技能優化可控且可審計,從而使技能收斂而非漂移。

圖 2. SkillOpt 管線:軌跡收集、小批次反思、有界文字更新、驗證門控和週期性慢速/元更新共同約束技能訓練。

在基準測試、模型和執行模式中持續獲得提升

我們在六個基準測試(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench 和 ALFWorld)、七個從前沿規模的 GPT-5.5 到小型開源 Qwen3.5-4B 的目標模型,以及三種執行模式(直接聊天、Codex 和 Claude Code)中評估了 SkillOpt。

將每個組合計為一個評估單元,與人類編寫的技能、單次 LLM 技能、Trace2Skill、TextGrad、GEPA 和 EvoSkill 相比,SkillOpt 在所有 52 個單元中均取得了最佳或並列最佳的結果。這些性能提升對於不更新模型權重的方法來說是異常巨大的。

使用 GPT-5.5 進行直接聊天時,SkillOpt 將六個基準測試的平均分數從 58.8 提高到 82.3,絕對提升了 23.5 點,比每個單元中選擇單個最佳競爭方法的預言機高出 5.4 點。最大的提升出現在程序性基準測試上:SpreadsheetBench 從 41.8 上升到 80.7,OfficeQA 從 33.1 上升到 72.1,LiveMathematicianBench 從 37.6 上升到 66.9。

相同的介面也適用於代理循環,使 GPT-5.5 在 Codex 內部提升了 24.8 點,在 Claude Code 內部提升了 19.1 點,均優於無技能基準線。

小型模型加上技能文件

接近下一個模型層級 SkillOpt 還縮小了小型或開源模型與前沿模型之間的差距,無需改變任何權重,也無需在推論時增加任何額外的模型呼叫。優化後,GPT-5.4-mini 的六個基準測試平均分數(64.3)超過了較大 GPT-5.4 的無技能基準線(59.7),而 GPT-5.4-nano(57.4)則超過了 GPT-5.2 的無技能基準線(51.3)。

Qwen3.5-4B,一個 40 億參數的開源模型,也超越了 GPT-5.2 的無技能基準線。過去需要更大模型才能實現的收益,現在可以透過一個優化後的技能文件來近似達成。

可遷移的技能:訓練一次,隨處重複使用

優化後的技能文件捕捉的是可重複使用的任務解決程序,而非過度擬合單一模型、基準測試或執行環境的指令。這就是為什麼相同的技能在跨模型規模、代理框架和相關任務遷移時仍能提升性能。在我們的遷移實驗中,技能在跨模型規模、跨執行框架和遷移到附近的數學基準測試時,繼續帶來了收益。

最明顯的例子是跨框架遷移:一個在 Codex 內部訓練的試算表技能,在沒有進一步優化的情況下放入 Claude Code,將無技能基準線從 22.1 提升到 81.8(+59.7),略高於直接在 Claude Code 內部訓練所達到的 80.4。

由於這兩個框架暴露了不同的工具介面,這表明 SkillOpt 學習的是通用工作流程邏輯,而不僅僅是特定於框架的配方。

精簡、可讀,且由極少數被接受的編輯構成

部署後的成品 best_skill.md 既不是不透明的參數塊,也不是不斷增長的日誌。在六個案例研究中,最終技能的平均長度約為 920 個 token,而且由於驗證門控拒絕了大多數提案,最終文件中只接受了一到四個編輯。OfficeQA 的 39.0 點提升來自於單個被接受的編輯。

學習到的規則讀起來就像一位經驗豐富的從業者的建議。組件消融實驗證實了這些控制措施的作用:移除拒絕編輯緩衝區會降低所有三個消融基準測試的分數,而同時移除元技能和慢速更新會使 SpreadsheetBench 從 77.5 降至 55.0。

代理時代的新適應層 SkillOpt 指出了一條輕量級的領域適應代理路徑:團隊可以訓練一個小型、可版本控制、可審計的自然語言技能層,只要存在自動評估或可靠的驗證器,而不是微調權重、硬編碼任務邏輯或手動調整提示詞。

透過將學習率、排程、驗證集、拒絕樣本和慢速更新引入代理技能,SkillOpt 表明訓練不必僅限於模型權重。模型之外的程序性知識也可以被優化。

當這個過程受到控制、驗證和記錄時,自然語言技能就成為前沿模型能力與實際工作負載之間穩定、可遷移且可逆的適配器。閱讀完整論文,造訪專案頁面 aka.ms/skillopt (在新分頁開啟),或探索 SkillOpt GitHub 儲存庫 github.com/microsoft/SkillOpt (在新分頁開啟)。

建立代理工作流程的團隊可以使用 SkillOpt 作為基礎,針對自己的任務和驗證器訓練可重複使用的技能。另請參閱我們的配套專案 SkillLens。