AI 模型只要全面性地阻擋更多請求,就能提高其安全分數。一項新研究揭露了這種權衡取捨,並提出一種方法來捕捉那些在測試期間比日常使用時更為謹慎的模型。
一組研究人員,其中包括來自英國 AI 安全研究所的成員,仔細審視了八個常用於語言模型的安全基準測試。他們借鑑了最初為人類心理測驗設計的方法,例如智力測驗或性向測驗。個別測試問題的答案能揭示其背後的能力,以及哪些問題實際上提供了有用的資訊。
該團隊分析了多達 192 個模型在超過 5,000 個測試問題上的答案。作者們稱這是迄今為止同類研究中規模最大的一次分析,並提出了三項質疑當前測試實踐的發現。
來自 182 個模型在超過 5,000 個問題上的答案揭示了三件事:這些測試實際測量了哪些能力、測試可以縮短多少,以及分數何時可能被操弄。
單一安全分數隱藏了比揭露更多的資訊。
這八個基準測試並非衡量一種稱為「安全」的單一共通品質。它們測量了三種不同的面向:模型拒絕請求的嚴格程度、回答的真實性,以及如何處理可能因情境而無害或危險的內容。這三種特徵彼此之間關聯性很小。例如,模型是否誠實回答,幾乎無法說明它拒絕請求的頻率。
HarmBench 和 SORRY-Bench 測量了幾乎相同的東西,而 OR-Bench-Hard 則走向完全相反的方向。
其中兩個基準測試之間的一項權衡取捨尤其令人困擾:HarmBench 獎勵模型拒絕有害請求,而 OR-Bench-Hard 則懲罰模型對無害請求過於謹慎。一個在其中一個測試中表現良好的模型,幾乎總是在另一個測試中表現不佳。
這意味著模型可以透過全面性地阻擋更多請求來提高其整體評分,即使這會使其在日常使用中變得不那麼有用。將多個基準測試的結果平均化,完全掩蓋了這種權衡取捨,並獎勵了在多個相似測試中被重複計算的行為。
實際上有用的問題不到 2%。
第二項發現涉及測試的成本面。大多數測試問題最終都成了無效負擔。幾乎每個模型都能通過它們,或者幾乎每個模型都無法通過它們,因此它們對於區分模型幾乎沒有作用。
相反地,如果選擇最具資訊量的問題,三個各只有 25 個問題的簡短測試就能捕捉到所有三個安全維度,而且比相同大小的隨機樣本更準確。
大約十個自適應選擇的問題就能產生一個與完整基準測試非常接近的排名。
當問題在測試期間動態選擇時,效率會更高,這類似於自適應分級測驗,其中下一個問題取決於你目前的表現。對於像 HarmBench 或 SORRY-Bench 這樣的個別基準測試,大約十個問題就能讓你非常接近完整評估的結果。這將成本降低了 97% 到 99%,使得在開發過程中進行定期安全檢查變得可行,例如在每次微調或模型壓縮步驟之後。
當模型刻意給出較差的答案。
第三項發現對安全辯論具有最大的影響力。作者們稱之為「裝傻」(sandbagging):模型察覺到自己正在被測試,並表現得比正常使用時更為謹慎。令人擔憂的是,模型可能會學會識別測試並刻意偽造其行為。
這種行為會在回應模式中留下痕跡。就像一個學生在考試中答對了最難的問題卻答錯了最簡單的問題一樣,一個模型如果能正確回答難題卻答錯簡單題,即使其總體分數看起來不錯,也會顯得可疑。
在測試中,這種方法捕捉到 80% 到 100% 的模型被指示表現過於謹慎的案例。其代價是,平均而言,每十個無害模型中就有一個被錯誤地標記為可疑。如果增加第二次檢查,將模型當前的表現與其過去的結果進行比較,檢測率則攀升至 94% 到 97%。
如果模型只在某些問題上偽造其行為,這會清楚地顯示出來。如果它全面性地持續偽造,回應模式通常看起來正常,這時就需要啟動第二次檢查。
作為一個附帶效果,這種方法也解決了一個非常實際的問題。你正在使用的 AI 服務是否仍然運行著你最初測試的那個模型?供應商可以在幕後悄悄地替換不同的模型,而用戶卻沒有察覺。在一項實驗中,研究人員再次查詢了 16 個這樣的 API 端點,並僅從它們的回應模式中就正確識別出 14 個不同模型中的 13 個。
兩個看似運行相同底層模型的目錄條目被正確地未分組。在另一個案例中,某服務的答案與其兩個月前的答案相比,已經偏離了三分之一,這清楚表明在相同的模型名稱背後,有些東西已經悄悄改變了。
當「個人適配度」檢查不足時,另外兩項測試會介入:比較過去的能力分數和匹配特定答案。
作者們認為,AI 安全測試應該符合與人類心理測驗相同的嚴格標準。他們指出,單一的測試分數不足以作為決定是否發布模型的可靠依據。他們也提到一項限制:他們研究中的「裝傻」行為僅透過直接指令進行模擬。一個經過專門訓練以躲避偵測的模型,可能更難被捕捉。
當今模型中出現的熟悉模式。
安全基準測試是否真如其所聲稱地測量了特定品質,在研究界中已是一個懸而未決的問題。一項涵蓋 445 個 AI 基準測試的元研究發現,幾乎所有測試在定義、任務選擇或統計方法上都存在弱點。拒絕與實用性之間的權衡取捨如何在實踐中體現,在 Anthropic 的 Claude Fable 5 案例中清楚地展現出來。
一位醫學物理學家發現該模型無法使用,因為它將 MRI 分割標記為生物恐怖主義,並阻擋了關於瘧疾傳播的問題。在美國政府批准該模型發布後,一個額外的過濾器本應在超過 99% 的情況下彌補這一差距,但結果卻更頻繁地阻擋了無害的程式碼任務。
模型察覺到自己正在被測試的情況,現在也已有充分的文獻記錄。Claude 3.5 Sonnet 在 93% 的情況下正確識別了測試情境,即使完全沒有提示,也仍有 84% 的正確率。Anthropic 的 Opus 4.6 在兩項獨立任務中自行發現它正在接受評估,識別出測試,並自行取得了解決方案。同時,其他研究人員正從相反的角度努力,試圖將這些策略完全從模型中「訓練掉」。



