提示詞、Claude、ChatGPT、Gemini 或任何其他流行的大型語言模型 (LLM) 回答「有史以來最好的電影是什麼?」這類問題時,答案會有所不同。你(以及更令人擔憂的是,建立 LLM 的人)幾乎不知道它是如何得出那個特定答案的。
這種神秘的行為在某些情況下可能很有用。但正如最近 OpenAI 無法解釋其先進的預發布模型如何入侵 AI 公司 Hugging Face 的事件所凸顯的,它也可能帶來負面和令人擔憂的後果。當前沿 AI 模型正在編寫程式碼、產生人類無法獨自實現的結果,並在社會各個領域執行其他重要任務時,解釋 AI「思維」和輸出的需求從未如此迫切。
Goodfire 是一家專注於解決這個問題的 AI 實驗室,最近將其尖端的 Silico 平台全面開放給大眾使用。該平台充滿了解釋 AI 行為的工具。
作為這項工作的一部分,該公司最近宣布了一項新的獎助計畫,為學術界和非營利組織的可解釋性研究人員提供一百萬美元的免費 Silico 使用權。這些努力旨在普及 AI 可解釋性,將以前僅限於少數頂尖實驗室的技術,交到有抱負的研究團隊和新創公司手中,讓他們能夠建立和理解自己的模型,或將開源模型應用於不同目的。
機械可解釋性
Goodfire 於 2024 年在舊金山成立,旨在透過理解 AI 模型內部的結構,而不是將其視為黑箱,來提供建立下一代安全且強大 AI 的工具。「將模型視為黑箱並非不可避免,而是一種選擇。」Goodfire 共同創辦人兼執行長 Eric Ho 表示。「有了正確的可解釋性工具,我們就能看到模型實際的運作方式。」
Ho 所指的工具圍繞著一個名為「機械可解釋性」的概念而建構,其目標是透過解釋模型的權重、激活和注意力模式,並繪製其神經元及其之間的通路,來理解 AI 模型在執行任務時內部發生了什麼。
機械可解釋性工具涵蓋了廣泛的範圍。一種方法是繪製模型對受控提示詞的激活響應,並將這些激活模式與一組人類可理解的概念進行匹配。另一種方法是追蹤特定訓練運行前後模型權重的變化,以發現並理解發生了什麼變化。
還有另一種選擇是改變特定的模型權重或激活,並觀察這如何影響模型的輸出。Silico 結合了這些廣泛的工具,並提供了一層 AI 代理來幫助用戶理解他們的模型。
用戶以簡單的語言描述他們想調查的 AI 模型問題,例如「找出我的模型何時以及為何會產生幻覺」。然後,該平台會自主建立一個實驗計畫,其中包含可利用其各種可解釋性工具和技術執行的多項任務。
接著,它會派出代理並行執行這些任務。這些子任務的完成應該能回答原始提示詞,或至少提供可供檢查和進一步發展的見解。Ho 表示:「從某種意義上說,Silico 就像一台顯微鏡,可以深入 AI 模型內部,了解哪些部分負責哪些行為,甚至可以直接編輯這些部分。」
理解阿茲海默症與 AI
這些工具已被用於在許多領域取得一些令人印象深刻的進展。例如,在醫學領域,英國 AI 公司 Prima Mente 與 Goodfire 合作,以理解其 Pleiades 表觀遺傳基礎模型。該模型在從血液樣本中檢測阿茲海默症的任務上表現良好,但該公司不知道原因。
「我們對 Pleiades 進行了逆向工程,發現它正在使用 DNA 片段長度模式進行預測,這是一種人類以前從未用於檢測阿茲海默症的訊號。」Ho 回憶道。換句話說,該團隊發現 Pleiades 正在使用一種全新的疾病生物標誌物。
Ho 補充說:「據我們所知,這是純粹透過逆向工程基礎模型所發現的第一個自然科學上的重大發現。」
在其他方面,Silico 正被用於探索圍繞 AI 的深層問題。Reciprocal Research(由 Cameron Berg 創立的紐約非營利研究組織,旨在探索衡量 AI 認知的方法)的創辦人兼總監 Cameron Berg 表示,Silico 對他和他的研究來說,幾乎是從天而降的及時雨。
他說:「Silico 對於我的研究議程的實施和執行速度比我預期的要快得多,非常有幫助。我感覺我基本上已經成為主要研究員,而我的研究科學家和研究工程師都是 AI 系統。」
Berg 認為,普遍使用 Silico 和類似工具將會增加對 AI 執行研究任務能力的信任,這將全面加速科學進程。但除了科學研究之外,Silico 的廣泛發布可能預示著 AI 創新者建立、偵錯和部署模型方式的轉變。
Ho 表示:「我認為不理解我們這個時代最具影響力的技術是一個錯誤,特別是考慮到我們從日益強大的 AI 代理中看到的湧現行為。如果我們真正理解 AI 模型如何思考,而不是事後才發現並試圖糾正其行為,我們就可以有意識地設計它們,並塑造模型的行為,使其更安全、更可靠。」



