返回文章 縱觀歷史,指引工具一直協助著人類。史前文明便懂得利用太陽和月亮來橫越陸地與汪洋。隨著時間推移,無數的旅程促成了地圖的製作,以便更好地規劃路線,並縮短重複旅程的時間。數百年後,指南針的引入讓航海者能更精確地探索未知目的地。而現今,GPS 導航應用程式指引著我們的每一次旅程。
在當今的代理式 AI 世界中,AI 代理程式無疑具有實現 AI 規模化應用的潛力,足以徹底改變我們所知的各行各業。然而,要實現這一潛力,需要一個智慧的指引,即「代理邏輯」,它能提升代理程式的品質、成本效益,並進而建立終端使用者的信任。企業工作流程與使用案例 許多研究指出 AI 試點專案的失敗率極高,同時也有其他研究強調 AI 必須在企業工作流程的核心運作,才能實現規模化應用。
[1][2] 為了更好地理解這種現象及相關論斷,需要對企業工作流程進行一些分析。這些工作流程具有以下特點: A. 動態且執行時間長 B. 擁有大量的 API、資料庫和服務 C. 經常受到業務政策和/或法規的限制 鑑於上述特點,代理程式若要有效運作,自然需要擴展模型上下文,而最先進的尖端大型語言模型確實具備此能力,但代價是什麼?
是增加幻覺,還是權杖消耗?此外,大型語言模型能否配備一個智慧指引(如同 GPS),以在工作流程核心實現代理式 AI 執行,從而產生更理想的結果?我們透過為 IBM 產品設計和建構配備相關代理邏輯的代理程式,並充分考慮上述特點,來驗證這些假設。
這些產品涉及關鍵任務工作負載的企業軟體交付生命週期中,主題專家所面臨的一些最具挑戰性的任務,包括: 理解以舊有程式碼(Cobol / PL/1)編寫的應用程式 加速開發人員的測試生成 主動回應事件並實現應用程式韌性的「左移」 自動化關鍵環境的合規性現代化 在詳細探討這些領域之前,讓我們先定義代理邏輯的特點。
代理邏輯是軟體原語,例如知識圖譜、演算法、程式分析函式庫等,它們在代理層(代理程式框架內)運作,能夠有意識地引導大型語言模型朝向企業工作流程的方向,從而減少上下文空間。如此一來,它們極有可能以更具成本效益的方式,驅動更高效能的結果。現在,讓我們探討代理邏輯如何在上述四個領域中實現這些成果。
理解以舊有程式碼(Cobol / PL/1)編寫的應用程式,程式分析。[3] IBM watsonx Code assistant for Z (WCA4Z) 用於透過 AI 和自動化加速大型主機應用程式開發與現代化,它配備了一個 App Insights 代理程式,專門用於應用程式理解,這是運行關鍵任務工作負載的 IBM 大型主機企業客戶主要關注的領域之一。
該代理程式利用對應用程式的深度靜態分析,並將預先索引的表示形式儲存在一個包含數百個相互關聯且語義複雜的資料庫綱要中,使代理程式能夠檢索精確、結構化且已有的資訊;從而提高答案準確性、減少權杖使用量,並最大程度地減少與語言模型(此處為 Mistral Medium 250B)的來回互動。
當這種方法應用於多個關鍵任務舊有系統(多達 100 萬行程式碼和 1000 個程式)時,其應用程式理解效能略優於僅使用尖端大型語言模型的基準方法,且權杖消耗量約低 30 倍。利用 Aster 加速開發人員的測試生成,程式分析。[4], [5] Aster 是 IBM 專有的程式分析及資料前處理與後處理函式庫,用於基於代理程式的單元測試、整合測試、API 測試和變更測試生成;根據對多個開發者社群的分析,它比各種開源工具或開發者手寫測試獲得更高的開發者評價。
基於後者以及與類似開源工具(整合測試)和零樣本大型語言模型及程式碼代理程式(單元測試)相比,在行、分支和方法覆蓋率基準測試中表現更優異(所有測試均在開源應用程式上進行),我們已在 75 個以上的 Java IBM CIO 應用程式(多達 560 個類別和 67K+ 行程式碼)上,使用 Devstral 24B 模型以預生產模式運行 Aster。
迄今為止的穩定狀態結果顯示,行、分支和方法覆蓋率提高了 20% 至 45%,同時在這些應用程式的子集上,與最先進的程式碼代理程式相比,效能更優越,且權杖消耗量大幅降低(高達 15 倍)。這些結果的原因在於,程式分析輸出(用於提示和「聚焦」大型語言模型)結合用於增強覆蓋率和修復運行時與編譯錯誤的子代理程式,能夠以顯著降低成本的方式實現更高效能的結果。
主動回應事件並實現應用程式韌性的「左移」,知識圖譜、程式分析函式庫和調查(可觀測性)驅動的協調。[6],[7] 雖然如前述第一和第二點所述,大型語言模型在應用程式相關使用案例的上下文「僅限於」應用程式原始碼,但對於已部署基礎設施上的應用程式運行時管理,底層的 IT 完整堆疊便會發揮作用。
在此,我們定義了一個知識圖譜 (KG),它包含實體(微服務、資料庫/中介軟體服務、MELT 等),並結合了領域專家的內嵌(「部落」)知識。透過這樣的圖譜,並將大型語言模型限制在局部有界推理以處理非確定性結果,我們採用了一種可觀測性驅動的方法,以實現跨 IT 堆疊和底層應用程式原始碼(如果相關)的上下文空間縮減,用於事件根本原因分析(及其他使用案例)。
透過這種方法,利用等效的 Instana 資料模型,我們看到專有的 Instana「I3」(智慧事件調查 [8])代理程式在 ITBench [9] 測量下,比使用 GPT-5.1 的 ReAct 代理程式提升了高達 4.0 倍的效能。使用 Gemini 3 Flash 時,ReAct 代理程式的效能提升至比 I3 代理程式低 17% 以內,但消耗了 1.6 倍的權杖。
我們已將此方法擴展到原始碼,開發了用於程式碼分析(利用程式依賴圖)和錯誤修復(利用推論擴展)的代理程式,同樣在 ITBench 上進行了測試,結果顯示原始碼分析和錯誤修復代理程式(Gemini 2.5 Flash)在尋找問題微服務(3.0 倍)和錯誤修復(1.6 倍)方面,均優於最先進的程式碼代理程式,同時分別消耗了 3.7 倍和 5.9 倍的權杖。
這個多代理程式系統在 IBM Think 大會上作為新發布的 IBM Concert Platform 的一部分,用於「左移」IT 營運,並正在 IBM CIO 內部進行試點。[10]自動化關鍵環境的 IT 合規性現代化,演算法與自適應規劃和協調。
[11] 企業面臨日益複雜和分散的合規性要求,迫使團隊花費大量時間手動建立控制措施、評估和補救計畫。由於缺乏集中式知識,且修復措施是手動編寫的,這會引入錯誤和安全漏洞的風險。由於合規性工作複雜且涉及多個步驟,它需要跨專業代理程式進行協調的政策驅動自動化,而非手動操作或簡單的 AI 提示詞。
我們的多代理程式系統透過演算法將複雜任務分解為協調的步驟,利用自適應規劃、動態分解和工作流程排序,並結合持續回饋,迭代地識別修復措施並擴展評估,從而實現合規性自動化。與使用固定規劃策略的先前代理程式(Claude 4 Sonnet)相比,其效能提高了 1.3 至 2.0 倍,這同樣在 ITBench 上進行了測量。
這種方法將合規性轉變為一個持續引導的自我修正過程,並顯著改善結果,尤其是在複雜情境中,將成功率從個位數提升至高達 80% 以上(Claude 4 Sonnet)。這個多代理程式系統和超過 16K 的數位化控制映射作為 IBM Sovereign Core 的一部分在 IBM Think 大會上發布,並與監控、漂移檢測整合,提供自動化證據生成,確保稽核證據安全地保留在客戶控制之下。
[12]此外,我們已將類似方法應用於兩個案例研究:一個是醫療保健領域的可配置通用代理程式和運行時 (CUGA),另一個是與 IBM 全球房地產合作的實體資產基於狀態維護。案例研究一:可配置通用代理程式 (CUGA) 醫療保健基準,演算法策略執行。
[13] 以下健康保險客戶服務的例子,簡潔地說明了為何代理式系統在受監管環境中優於僅使用大型語言模型的對話式模型。CUGA(可配置通用代理程式)的策略系統實施了代理程式治理的「策略即程式碼」,它在運行時獨立於模型提示詞且無需微調即可執行。我們的實驗顯示,該代理程式的策略系統彌補了任務正確性上的巨大差距,在所有模型系列(Claude Opus – 4.5、GPT OSS 120B 和 GPT – 4.1)中強制執行結構化工作流程、安全意圖處理、可靠的工具使用和受控的輸出格式,準確性提升範圍從 15% 到 26%。
權限透過最小權限揭露、明確的合規規則和人工升級路徑來執行。智慧行動被提出,而權限則由策略和監督機制行使。推理是自主的;決策權受到限制。CUGA 也是 IBM Think Sovereign Core 發布的關鍵組成部分。案例研究二:IBM 全球房地產的實體資產基於狀態維護,有向無環圖。
[14],[15] 企業維護系統收集大量的資產數據,但無法有效整合,這要求專家手動拼湊零散的訊號,並在沒有統一、基於證據的洞察下做出決策。我們最近推出的 Maximo Condition Insights [16] 代理程式分析數千個資產和地點(感測器、工單、故障模式和事件分析)的大規模資產數據,利用結構化證據和驗證循環,可靠地識別問題、優先處理行動,並以一致、可追溯的洞察支援決策。
我們已在 IBM 全球房地產 (GRE) 內部試點了這個代理程式(使用 GPT OSS 120B),將資產分析時間從 15-20 分鐘縮短到 15-30 秒(提升 97%),並將資產審查覆蓋率從約 1% 提高到約 30%,涵蓋超過 120 個站點和 6000 個實體資產。
使用 AssetOpsBench,Condition Insights 代理程式將無根據的主張減少了 57%,冗餘度降低了 35%,規則合規性提高了 30%,保持了接近零的矛盾,並平均降低了 77% 的權杖使用量,同時略微提高了診斷特異性。
這個配備有向無環圖的代理程式,提供了結構工程和操作上下文,以減少在單純提示詞下無根據的推理,而約束感知提示詞顯著改善了規則遵守、減少了冗餘度,並降低了整體權杖消耗,同時沒有引入不穩定性。總結與參考資料:數百年來,我們一直受惠於各種指引...



