降低靜態大型語言模型基準測試成本當史丹佛大學的 CRFM 於 2022 年發布 HELM 時,該論文的模型成本核算顯示,OpenAI 的 code-cushman-001 的 API 成本為 85 美元,而 AI21 的 J1-Jumbo (178B) 則高達 10,926 美元;對於開源模型,GPU 時數從 540 到 4,200 小時不等,其中 BLOOM (176B) 和 OPT (175B) 位於高端。Perlitz 等人 (2023) 重申了 HELM 更大的成本模式,而 IBM Research 指出,讓 Granite-13B 執行 HELM 「可能消耗多達 1,000 個 GPU 時數」。HELM 涵蓋 30 個模型和 42 個情境,報告的總成本和 GPU 運算量約為 100,000 美元。Perlitz 等人對 EleutherAI 的 Pythia 檢查點進行分析,發現了另一個令人震驚的觀察:開發人員在模型開發過程中需要重複支付評估費用。Pythia 發布了 16 個模型(涵蓋 8 種尺寸)的 154 個檢查點,如果每個模型檢查點單獨計算,則總計 2,464 個檢查點,以便社群研究訓練動態。在所有這些檢查點上運行 LM Evaluation Harness,將評估變成了訓練的倍增器:Perlitz 等人 (2024) 指出,評估成本「在評估檢查點時甚至可能超過預訓練的成本」。對於小型模型,評估成為整個開發週期中主要的運算項目。當我們擴展推論時運算時,我們也擴展了評估成本。Perlitz 等人隨後詢問 HELM 中有多少內容真正影響了排名。結果令人驚訝:運算量減少 100 到 200 倍,幾乎保留了相同的排序,而更大的減少對於論文分層分析下的粗略分組仍然有用。Flash-HELM 將這一發現轉化為由粗到精的程序:首先運行廉價評估,然後僅對頂級候選者投入高解析度運算。HELM 的大部分運算都是在確認該領域可以更便宜地推斷出的排名。其他研究從不同角度達到了相同的結論。tinyBenchmarks 使用項目反應理論將 MMLU 從 14,000 個項目壓縮到 100 個錨點項目,誤差約為 2%。Open LLM Leaderboard 從 29,000 個範例縮減到 180 個。Anchor Points 顯示,在 GLUE 上,僅需 1 到 30 個範例即可對 87 個語言模型/提示詞對進行排名,其他研究也隨之跟進,將資料集大小減少了 90%。靜態基準測試有一個可以利用的弱點:模型差異通常集中在項目的一小部分,因此排名可以在積極的抽樣下保持不變。一旦基準測試從靜態預測轉向代理模型,這個技巧就大大減弱了。## 代理模型評估更為複雜Holistic Agent Leaderboard (Kapoor 等人,ICLR 2026) 提供了一份非常詳盡的代理模型評估公開報告。HAL 在九個基準測試中運行標準化的代理模型工具,涵蓋程式編寫、網路導航、科學任務和客戶服務,並採用共享框架和集中式成本追蹤。其主要成本為:在 9 個模型和 9 個基準測試中執行 21,730 次運行,花費 40,000 美元。截至 2026 年 4 月,該排行榜已增長到 26,597 次運行。Ndzomga 的獨立重現也得出幾乎相同的數字:242 次代理模型運行花費 46,000 美元。在這些總數背後,單次基準測試運行的成本在 HAL 任務中可能相差四個數量級,在某些單獨的基準測試中也可能相差三個數量級。圖 1。每條長條顯示了單一基準測試中 HAL 配置的最低到最高成本。突出顯示的長條跨越了每運行 1,000 美元的門檻。「運行」是指跨所有任務的單次完整代理模型評估。基準測試內的差異反映了模型 × 框架 × 權杖預算的乘積。來源:HAL 即時排行榜,2026 年 4 月。這些數字背後是一個殘酷的定價事實。Claude Opus 4.1 對每百萬輸入權杖收費 15 美元,每百萬輸出權杖收費 75 美元。Gemini 2.0 Flash 的收費為 0.10 美元和 0.40 美元,僅輸入權杖就相差兩個數量級。代理模型基準測試很少單獨評估「模型」。它們評估的是模型 × 框架 × 權杖預算的乘積,而微小的框架選擇可能使成本增加 10 倍。更糟的是,更高的花費不一定能可靠地帶來更好的結果。在 Online Mind2Web 上,使用 Claude Sonnet 4 進行 Browser-Use 花費 1,577 美元,準確度為 40%。使用 GPT-5 Medium 進行 SeeAct 花費 171 美元,準確度達到 42%。HAL 論文指出「儘管準確度僅相差兩個百分點,成本卻有 9 倍的差異」。在 GAIA 上,使用 o3 Medium 的 HAL Generalist 花費 2,828 美元,準確度為 28.5%,而另一個代理模型則以 1,686 美元達到 57.6% 的準確度。CLEAR 在 300 個企業任務中對 6 個最先進的代理模型進行研究,發現「準確度最佳的配置成本比具有可比實際性能的 Pareto 效率替代方案高 4.4 到 10.8 倍」。靜態時代的工具本應有所幫助,但其效果有限。Ndzomga 的中等難度篩選器,選擇歷史通過率在 30% 到 70% 之間的任務,在框架和時間變化下實現了 2 到 3.5 倍的成本降低,同時保持了排名忠實度。這很有用,但遠不及靜態基準測試可實現的 100 到 200 倍的收益。當每個項目都是一個具有自身變異性的多輪執行時,單個問題不可避免的長軌跡就成為了昂貴的對象。## 有些評估本身就是訓練有些基準測試完全脫離了 API 成本框架,因為它們的評估協議是從頭開始訓練模型。The Well 提供了一個非常有趣的例子。它捆綁了 16 個科學機器學習資料集,涵蓋生物系統、流體動力學、磁流體動力學、超新星爆炸、黏彈性不穩定性和活性物質,總計 15 TB。根據論文中主要的 16 個資料集網格,該協議幾乎沒有節省空間:每個基準模型在單個 H100 上訓練 12 小時,每個(模型、資料集)對嘗試五種學習率,並在四種架構和 16 個資料集上重複。這種主要的網格全面測試消耗 3,840 H100 時數,根據以下轉換假設,約為 9,600 美元。單個新架構仍需約 960 H100 時數,約為 2,400 美元。訓練一個神經算子可能需要單次 12 小時的 H100 運行,而跨基準測試評估它則需要 80 次這樣的訓練。這種不對稱性正是 The Well 的重要之處。在機器學習的這一領域,評估運算量大約比訓練運算量高出兩個數量級,顛覆了舊的深度學習思維模式。同樣的模式在科學機器學習領域中反覆出現。PDEBench 涵蓋 11 個偏微分方程族,並報告了跨資料集和模型族的每週期計時表,但乾淨的每架構美元數字取決於所選的訓練協議和硬體。MLE-Bench (OpenAI) 介於代理模型和訓練機制之間。每個代理模型嘗試 75 個 Kaggle 競賽中的一個,在單個 A10 GPU 上運行 24 小時,訓練實際的機器學習管線。論文明確指出:「我們主要實驗設置的單次運行,每個競賽嘗試 24 小時,需要 24 小時 × 75 個競賽 = 1,800 GPU 時數的運算」,此外 o1-preview 每個種子消耗 1.275 億輸入權杖和 1,500 萬輸出權杖。以每 A10 時數 1.50 美元計算,僅 GPU 成本就為 2,700 美元;加上 o1-preview API 使用費,單次種子運行約為 5,500 美元。因此,三個種子 × 六個模型在任何額外評分或重試開銷之前,將接近 100,000 美元。METR 的 RE-Bench 將七個研究工程環境中的每個環境限制在 1 到 6 個 H100 上運行 8 小時。因此,單次全面測試需要 56 到 336 H100 時數,這還不包括重複嘗試、多個種子或多個代理模型;人類基準線,有 71 次專家嘗試,進一步提高了隱含預算。由於基準測試為代理模型和人類提供相同的實際運算時間,實時訓練過程設定了成本下限。權杖預算不再從上方限制它。ResearchGym (ICLR 2026) 讓代理模型運行實際的機器學習研究。五個測試任務(39 個子任務)來自 ACL、ICLR 和 ICML 論文,包括 ACL Highlights、ICML Spotlight、ICLR Spotlight 和 ICLR Oral 類別,並隱藏了提議的方法。代理模型必須提出假設、訓練模型並擊敗原始作者的基準線。預算很緊張:每個任務 10 美元的 API 費用加上單個 GPU 在 24 GB 下運行 12 到 24 小時。一次完整測試(5 個任務 × 24 小時 × 3 個種子)每個代理模型消耗約 360 GPU 時數。在 PaperBench 中,成本情況變得嚴峻。必須從頭開始複製二十篇 ICML 2024 Spotlight 或 Oral 論文,並根據包含 8,316 個葉節點標準的評分標準樹進行評分。每次運行使用 A10 GPU 12 小時,每篇論文的計算很直接:每次 o1 IterativeAgent 運行 API 費用 400 美元,乘以 20 篇論文,每次評估約 8,000 美元。使用 o3-mini 評審進行評分,每篇論文 66 美元,或整個基準測試 1,320 美元。使用 o1 作為評審,評分費用將推高至每篇論文約 830 美元。PaperBench Code-Dev 故意取消執行。這一選擇將運行成本減半至約 4,000 美元,並將評分費用降至每篇論文 10 美元(降低 85%)。OpenAI 建立了這個變體,因為許多團隊無法負擔完整的基準測試。歷史先例是 NAS-Bench-101,其表格化建構需要超過 100 TPU 年的訓練。如果沒有那一次性投資,每次 NAS 演算法比較將花費每運行 1 到 100+ GPU 時數,這將
以上為 AI 自動翻譯導讀。原文版權歸 Hugging Face Blog 所有, 建議透過「閱讀原文」前往原始網站,以取得最完整資訊並支持原作者。