2026 年 8 月 27 日 責任與安全 William Isaac、Sol Messing 和 Kristian Lum 透過加密安全環境建立專有模型基準的信任。想像一位學生即將參加一場重要的考試,如果他們不小心提前偷看了試題,那麼即使考取滿分,這個成就也會因為預先知情而變得毫無意義。
為了真正衡量他們的知識水平,學生必須在考試前完全無法看到試題。這正是業界在評估先進 AI 模型時所面臨的挑戰。如果模型已經看過測試問題,這個問題被稱為基準測試污染(benchmark contamination),那麼測試結果的可信度將大打折扣。
今天,我們推出全球首個針對專有前沿 AI 模型的雙盲評估方法。此方法將外部評估限制在一個加密的「盒子」中,確保模型無法在測試前利用這些評估問題來優化其性能。我們正與新加坡 AI 安全研究所(Singapore AI Safety Institute)、OpenMined、AVERI 和 MLCommons 合作,在保護隱私的環境中,使用機密基準測試 Gemini Flash Lite 模型,以提高評估的完整性。
在 Google,我們在模型開發和部署的整個過程中,使用廣泛的評估方法來評估我們的 AI 系統,但我們不單獨依賴內部測試。為了識別潛在的盲點,我們與多元的外部合作夥伴合作,包括專業研究實驗室、公民社會組織和國家 AI 安全與保障機構(AISIs),利用他們獨特的專業知識對我們的模型進行壓力測試。
隨著 AI 模型的能力日益增強,確保模型沒有提前看到測試問題或提示詞至關重要,因為這可能會扭曲結果。政策制定者、研究人員和企業需要相信 AI 基準測試能準確反映模型的真實能力和安全性,但如果模型能夠提前「偷看」評估問題,這將人為地誇大分數並破壞這種信任。
儘管零日誌協議和嚴格的合約保障措施長期以來一直確保外部測試提示詞的機密性,但整合技術和加密安全措施標誌著安全模型評估邁出了重要一步。這就是雙盲評估的運作方式。



