英國人工智慧安全研究院(AISI)測試了多個前沿模型,橫跨七種基準測試並採用不同的運算預算。研究結果發現:固定的預算上限系統性地低估了AI代理的真實能力。

AI代理的效能是一條隨著測試時運算量(即代理在執行任務時被允許消耗的處理能力)增加而上升的曲線。如果在曲線仍在攀升時就削減預算,那麼測得的分數只會是最低限度,而非其最大能力。

這正是AISI研究人員在其最新工作中試圖證明的一點。他們主要探討的問題是:AI能力與運算量之間的關係有多大,以及這對網路安全意味著什麼?

這種效應在各個領域都顯現出來。在網路安全方面,約有8%的任務只有在預算超過1000萬個tokens時才能解決;有些甚至需要5000萬個tokens。最新的模型在超過1億個tokens的預算下,甚至能達到更高的分數。

在軟體工程任務(TerminalBench 2.0、SWE-Bench Pro)上,當token預算從100萬增加到1000萬時,成功率躍升了約25%。對於數學和學術任務(Humanity's Last Exam),在最高500萬個tokens的預算下,增益約為22%。

額外的運算量並非在所有地方都能帶來同等幫助。在醫療任務基準測試HealthBench上,所有模型都在標準預算內達到其效能高原期。AISI指出,額外運算量在代理可以驗證自身工作的場景中最有幫助,例如執行程式碼或測試漏洞。然而,在缺乏或延遲回饋的場景中,其影響微乎其微。

另一項發現將人類專家完成任務所需的時間與AI代理的token消耗量連結起來。在來自研究機構METR的211項軟體工程任務和AISI的78項網路任務中,這種關係遵循冪次法則。一個一分鐘的任務會讓代理消耗數千個tokens;一個一小時的任務消耗數百萬個;而一個一週的任務則消耗數十億個。

因此,固定的評估預算會排除掉最長且最困難的任務。任務失敗可能意味著預算過於緊縮,而非代理缺乏技能。AISI舉例指出網路任務「The Last Ones」,人類專家約需20小時才能完成。沒有任何受測模型能在少於3000萬個tokens的情況下解決該任務。

根據這項研究,較新的模型從額外運算中獲益遠超舊模型。每一代模型的效能曲線都會向上移動,並沿著三個軸線改變形狀:觸及範圍(更困難的任務變得可解決)、可靠性(相同任務被解決的頻率更高)和效率(相同任務所需的tokens更少)。

一個當前前沿模型的時間視野,在250萬個tokens的預算下從約40分鐘增長到5000萬個tokens預算下的約四小時。在整個前沿領域,當預算從250萬躍升至5000萬個tokens時,時間視野從約兩小時轉變為14小時。

AISI先前估計,在固定250萬個tokens預算下,前沿模型在網路任務上的時間視野大約每4.7個月翻倍。然而,在5000萬個tokens的預算下,這一趨勢陡峭約60%。翻倍時間從每67到91天縮短到每40到50天。

AISI表示,估計的翻倍率部分取決於所選擇的評估預算,而非前沿進展的固定屬性。然而,進展並非均勻的。在大約10%到30%的任務中,較新的模型實際上得分比其前身更差。

對於AISI而言,主要教訓在於如何進行測量。「如果我們持續將能力視為一個固定分數,而非隨運算量變化的曲線,那麼當這些系統投入更多資源時,我們將會不斷對其能力感到驚訝。」

以過小的預算測試模型,會得到一個扭曲部署、經濟價值和風險決策的分數。每個token的成本下降也可能使更高的測試時預算更容易取得,這意味著過去看似負擔不起的能力,隨著時間推移可能變得更便宜且更容易實現。這將使考量運算預算的測量方法變得更加重要。

AISI目前正透過多個不同預算來測試前沿模型。這些「最低資訊預算」背後的理念是檢查模型的能力是否會隨著額外運算而停止增長;只有在這種情況下,結果才算有意義。該團隊也正試圖找出如何從較便宜的測試運行中預測高預算下的效能。