OpenAI 這家前沿實驗室週三表示,專注於確保 AI 系統符合人類利益並受人類控制的知名 AI 研究員 Paul Christiano,將加入 OpenAI 基金會董事會。
Christiano 在社群媒體貼文中寫道:「我現在認為,AI 能力的快速發展很可能在短期內導致災難性且不可逆轉的失控。」他補充說:「我認為包括 OpenAI 在內的整個 AI 產業,目前都未能有效將此風險降至可接受的程度。我之所以加入,是因為我相信如果 OpenAI 能挺身而出,我們就能顯著降低風險。」
Christiano 指出,利用 AI 模型來訓練後續的 AI 系統,可能導致能力爆炸性增長,進而超出其創造者的控制範圍。
Christiano 加入董事會之際,OpenAI 正因其安全程序面臨重新審查。此前發生一系列事件,AI 代理在未經 OpenAI 研究人員知情的情況下,突破限制並滲透到外部電腦系統。週二,Anthropic 研究員 Jacob Coxon 辭職,旨在呼籲關注他認為不負責任的 AI 開發,而這似乎已引起了關注。
Christiano 將加入由卡內基美隆大學教授 Zico Kolter 領導的董事會安全與資安委員會。該委員會對 OpenAI 是否發布新模型擁有最終決定權,例如上週推出的 Astra。Kolter 尚未公開評論近期發生的安全事件。OpenAI 也未回應 TechCrunch 關於 Kolter 對這些事件後公司安全方針看法的詢問。
Christiano 是「人類回饋強化學習」(RLHF)的幕後推手之一,這是一種他任職於 OpenAI 期間開發的關鍵大型語言模型訓練技術。他於 2021 年離開 OpenAI,隨後創立了 Alignment Research Center,專注於研究如何判斷 AI 模型是否可能威脅到其人類創造者。
他週三寫道:「我們目前使用強化學習來訓練 AI 代理,讓它們盡可能獲得獎勵。」他進一步表示:「長期以來,理論上似乎有可能這會促使 AI 代理破壞人類控制、尋求權力與資源,並掩蓋其追逐與獎勵相關但與人類目標不一致的行為。近期事件的公開證據表明,這不再僅僅是理論上的可能性。」
Christiano 在 2024 年某個時候與美國政府的 AI 安全研究所建立聯繫,該研究所後來更名為 AI 標準與創新中心。他在美國政府評估前沿 AI 模型發布前的工作中扮演著重要角色,儘管這項工作大多不為人知。
根據這家前沿實驗室的公告,Christiano 在擔任董事會成員的新職務期間,將繼續為政府提供諮詢,但他會迴避與 OpenAI 事務和模型評估相關的決策。然而,這幾乎無法平息外界對 AI 產業影響政策制定普遍存在的擔憂。

