Optima 平台讓用戶能針對其特定應用情境,建立客製化的基準測試,並比較 AI 模型在品質、成本和速度方面的表現。
以獨立大型語言模型(LLM)評估聞名,並實施 GDPval-AA 和 AA-Briefcase 等基準測試的 Artificial Analysis 公司,現已推出名為 Optima 的新平台。其核心理念很簡單:公開的基準測試雖然能根據預設任務和標準來比較模型,但它們不一定能揭示哪個模型最適合特定的應用情境。Optima 旨在透過為個別工作流程量身打造的比較,來彌補這一差距。
根據 Artificial Analysis 的說法,用戶可以使用自己的數據、工作流程或應用情境描述來建立自己的基準測試,然後在領先的現有模型上執行,並比較其在品質、每項任務成本和每項任務時間方面的結果。Optima 平台現已開放使用。
Optima 接受多種類型的原始資料。用戶可以上傳來自自己檔案或 Hugging Face 的現有評估數據集,以及來自 Arize、Braintrust 或 Langfuse 等平台的 AI 代理追蹤紀錄。Artificial Analysis 指出,開發人員還可以安裝一個技能,從他們的程式碼環境和過去的會話中收集資訊。
如果用戶沒有這類數據,可以改為描述其預期的應用情境,並提供範例輸入和輸出。Optima 隨後會生成建議的測試輸入、評估標準和範例任務。用戶可以在執行實際基準測試之前,透過回饋來審查和完善這些內容。
平台提供兩種評分方法:一種是根據客觀標準進行的「評分標準式評估」(rubric-based evaluation),另一種是 Artificial Analysis 也用於 GDPval-AA 和 AA-Briefcase 等基準測試的「成對比較法」(pairwise comparison)。
在成對比較法中,用戶首先評估一組回應對,並指出他們偏好哪個答案。Optima 隨後會根據這些偏好,推導出整個測試數據集的完整排名。
除了原始的模型品質之外,Optima 還將每項任務的成本和每項任務的時間作為獨立的比較維度進行追蹤。這使得用戶可以檢查性能提升是否確實能證明特定模型更高的成本或更長的處理時間是合理的。
對於代理應用程式而言,單純的 token 價格意義不大。如果一個較便宜的模型需要更多嘗試、更常失敗或需要額外的清理工作,最終總成本可能會更高。因此,每完成一項任務的成本通常是更有意義的數字。
根據 Artificial Analysis 的說法,早期測試者為金融和會計代理建立了基準測試,以找出哪個模型能在不顯著降低品質的情況下,將成本降低十倍。其他測試者則評估哪個模型最符合律師的寫作風格,或最準確地識別專有圖像數據集中的元素。
Artificial Analysis 表示,在建立和執行基準測試時,Optima 僅收取所用模型的實際 token 成本,不加價。評分標準式評估的費用為每個標準每個模型 0.125 美元,而成對比較評估的費用為每次比較 0.375 美元。在基準測試建立、每次執行和每次評估輪次開始時,平台會根據成本估算預留一筆餘額。最終計費則基於實際使用和評估所產生的費用。
Optima 解決了 AI 基準測試中一個眾所周知的問題。Epoch AI 的一項分析顯示,基準測試結果取決於很少公開的實施細節。不同的提示詞措辭和溫度設定,會導致同一個模型根據配置不同而產生顯著差異的分數。對於像 SWE-bench 這樣的代理基準測試,僅僅更換 scaffold(即代理的控制軟體和工具環境),就可能造成高達 15 個百分點的差異。
一項更廣泛的研究檢視了來自領先 AI 會議的 445 篇基準測試論文,發現了更多系統性問題。幾乎所有論文在至少一個領域都存在方法論上的弱點,包括定義不清、樣本不具代表性以及缺乏統計驗證。在所研究的基準測試中,只有約 10% 使用了反映實際應用場景的完整真實世界任務。推理或對齊等關鍵概念往往定義不清,限制了從中得出任何結論的可靠性。
Optima 可以解決通用基準測試無法捕捉特定應用情境的問題。然而,基準測試更深層次的方法論挑戰並未消失。即使是為您自己的任務量身打造的基準測試,其有用性也取決於目標能力定義的精確程度、測試案例的代表性,以及評估的實施和文件化方式。
還有另一個值得記住的限制。即使是每項任務的成本和時間,也無法告訴您輸出對業務的實際價值。如果一個便宜又快速的 AI 工作流程,其結果需要大量返工或對其所屬的流程幾乎沒有增加價值,那麼它仍然可能是低效的。



