日益強大的模型可以強化網路防禦、加速科學發現並擴大專業知識的普及。然而,如果其能力被誤解、安全防護不足,或政府缺乏應對所需的資訊,它們也可能帶來安全風險。為了安全且自信地實現這些益處,社會將需要具備技術和治理能力的機構,來評估、保護和管理日益強大的系統。
這就是 OpenAI 協助創立 Appia Foundation 的原因之一,該基金會由 Linux Foundation 主辦。Appia 將開發開放、模組化的規範,旨在將國際標準和既定框架轉化為 AI 價值鏈中實用的評估準則。其工作有助於建立一個關鍵的信任層,讓第三方能夠檢查是否符合標準,並在模型、基礎設施和應用由不同組織開發時,產生更清晰、更可重複使用的證據。
透過這項工作,Appia 將有助於建立一個共享的技術語言,讓國家和國際機構能夠互相信任彼此的工作。
我們將這項努力視為一項更廣泛工作的重要下一步,旨在強化先進 AI 系統所需的機構、標準和評估實踐。
我們最近發布的「前沿 AI 民主治理藍圖」為這項工作提供了路線圖。它呼籲建立一個持久的美國框架、強化 AI 標準與創新中心(CAISI),並在政府內部建立更廣泛的韌性策略。它也認識到前沿風險是國際性的。各國應共同努力,開發兼容的安全框架、值得信賴的風險發現共享管道,以及協調一致的事件應對措施。
國家能力和國際合作應相互強化。CAISI 等強大機構可以發展技術專業知識、評估前沿系統,並支持獨立的評估生態系統。一個由有能力的國家機構組成的網絡,隨後可以建立共享方法、認可可信證據,並為政府提供共同的技術理解,以便採取共同行動。
標準是這項工作的核心,它們必須以可信的評估實踐和嚴格的技術為基礎。在我們共享的「可信賴第三方評估手冊」中,我們闡述了前沿評估日益需要揭露的內容:被測試的系統、其工具存取和評估工具、用於引出能力的方法、可用資源以及為驗證結果而執行的檢查。
我們也透過與美國 CAISI 和英國 AISI 的測試合作夥伴關係,將這些原則付諸實踐,他們在邊緣能力評估和生物誤用防護方面的工作,促使我們的系統取得了具體改進。這項工作發揮了重要作用,為可標準化以可比較方式檢查性能的實踐奠定了基礎。
這些實踐補充了 OpenAI 更廣泛的安全基礎設施。我們的「準備框架」是我們如何定義和實施管理先進 AI 系統最嚴重風險(包括我們的內部實踐)方法的基礎。我們的「前沿治理框架」將該方法的相關部分應用於一份公共治理文件,重點關注特定的監管義務,包括風險評估、模型報告、安全控制、事件應對以及納入外部專家意見。這些文件共同幫助將廣泛的承諾轉化為可驗證和改進的操作實踐。
Appia 的工作旨在應對下一個挑戰:使這些實踐在不同組織、司法管轄區和供應鏈之間實現互通。
在這些論壇中,包括現在透過 Appia,我們的目標是將前沿開發的經驗教訓轉化為開放、以技術為基礎的實踐,供各司法管轄區的政府、公司和獨立評估機構使用。

