AI 研究人員和實驗室在評估 AI 模型方面取得了長足進展,涵蓋了從安全性、合規性到奉承和對齊等各個層面。然而,企業和開發者似乎面臨一個新的、更具體的需求:確保他們的 AI 系統能針對其特定產品或服務,如預期般運作。為了簡化這個測試過程,微軟於週二發表了 ASSERT,這是「Adaptive Spec-driven Scoring for Evaluation and Regression Testing」的縮寫。
微軟表示,這個開源框架透過運用 AI,將高階、自然語言描述的目標、政策或預期行為,轉化為全面且可評分的測試,從而讓評估應用程式專屬的 AI 行為變得輕而易舉,並可供進一步調查。ASSERT 接收 AI 模型預期行為和政策的簡潔語言描述,將其轉化為一套結構化的可接受與不可接受行為,接著生成問題情境和測試案例,對目標系統執行測試,並對結果進行評分。
它還能記錄 AI 系統採取的路徑,包括中間動作和工具呼叫,以便開發者檢查故障發生在哪裡。如果開發者希望進一步客製化評估範圍,也可以提供系統上下文、工具和限制。舉例來說,開發者可以指定一個文件研究 AI 代理不應向公司外部人員發送電子郵件,並且應將機密資訊限制給高階主管,同時在考量先前上下文的情況下提供簡潔的摘要。
ASSERT 將利用這些規則生成測試案例,持續檢查系統是否遵循這些規則。微軟表示,當 AI 模型預期行為受到應用程式或產品的上下文、政策和工具影響時,這個框架填補了更廣泛、更通用的評估所無法彌補的空白。微軟負責任 AI 的首席產品長 Sarah Bird 表示:「我們學到的一件事是,評估對於做出良好決策絕對至關重要。
因為如果你不了解 AI 系統的行為,就很難知道它是否符合你組織的標準……我們發現,如果你真的想要一個值得信賴的系統,就應該評估更多應用程式專屬的維度。」Bird 提到,ASSERT 可以在系統建構期間、部署之後,甚至用於持續監控時進行評估。
此次發布正值 AI 產業逐漸但更廣泛的轉變之中。隨著模型能力日益增強,研究人員正專注於可重複的測試和迴歸檢查,例如史丹佛大學的 HELM、MLCommons 的 AILuminate 以及 METR 等評估團隊,都推出了基準測試來衡量模型在不同條件下的行為表現。



