Goodfire 希望讓 AI 模型訓練更像傳統的軟體工程。
總部位於舊金山的新創公司 Goodfire 剛發布了一款名為 Silico 的新工具,讓研究人員和工程師能在 AI 模型訓練期間,深入模型內部並調整其參數(即決定模型行為的設定)。這項工具可能讓模型開發者對這項技術的建構方式,擁有比以往想像中更精細的控制。
Goodfire 聲稱 Silico 是同類產品中首款現成的工具,能協助開發者在從資料集建構到模型訓練的整個開發過程中進行偵錯。
該公司表示,其使命是讓 AI 模型建構不再像煉金術,而更像一門科學。誠然,像 ChatGPT 和 Gemini 這樣的大型語言模型(LLM)能做很多驚人的事情。但沒有人確切知道它們是如何或為何運作,這使得修復其缺陷或阻止不當行為變得困難。
Goodfire 執行長 Eric Ho 在 Silico 發布前,接受《MIT Technology Review》獨家專訪時表示:「我們看到模型被理解的程度與其被廣泛部署的程度之間存在日益擴大的鴻溝。」他補充說:「我認為當今每個主要前沿實驗室的主流觀點是,你只需要更多的規模、更多的算力、更多的資料,然後就能實現通用人工智慧(AGI),其他一切都不重要。而我們則說不,有更好的方法。」
Goodfire 是少數幾家公司之一,其中包括業界領導者 Anthropic、OpenAI 和 Google DeepMind,他們正在開創一種稱為「機械可解釋性」的技術。該技術旨在透過繪製 AI 模型的神經元及其之間的通路,來理解模型在執行任務時內部發生了什麼。(《MIT Technology Review》將機械可解釋性選為 2026 年十大突破性技術之一。)
Goodfire 希望不僅將這種方法用於審計模型(即研究已訓練好的模型),更要從一開始就協助設計模型。
Ho 表示:「我們希望消除試錯,將模型訓練轉變為精密工程。這意味著要揭示那些『旋鈕和開關』,讓你在訓練過程中能夠實際使用它們。」
Goodfire 已經利用其技術和工具來調整 LLM 的行為,例如減少它們產生幻覺的數量。透過 Silico,該公司現在將許多內部技術打包並作為產品推出。
該工具利用代理(agents)來自動化許多複雜的工作。Ho 說:「代理現在已經足夠強大,可以完成我們過去由人類執行的許多可解釋性工作。這是將其轉變為客戶可以自行使用的可行平台之前,需要彌合的差距。」
阿姆斯特丹大學研究員 Leonard Bereska 曾從事機械可解釋性研究,他認為 Silico 看起來像是一個有用的工具。但他對 Goodfire 更崇高的願景持保留態度。他說:「實際上,他們只是在煉金術中增加精確度。稱其為工程聽起來比實際更有原則性。」
映射模型
Silico 讓你可以放大檢視已訓練模型中的特定部分,例如單個神經元或神經元群組,並執行實驗以了解這些神經元的作用。(前提是你必須能存取模型的內部運作。大多數人無法使用 Silico 探究 ChatGPT 或 Gemini 的內部,但你可以用它來查看許多開源模型中的參數。)
然後你可以檢查哪些輸入會觸發不同的神經元,並追蹤神經元的上游和下游路徑,以了解其他神經元如何影響它,以及它又如何影響其他神經元。
例如,Goodfire 在開源模型 Qwen 3 中發現一個與所謂「電車難題」相關的神經元。啟動這個神經元會改變模型的反應,使其將輸出內容框定為明確的道德困境。Ho 說:「當這個神經元活躍時,各種奇怪的事情都會發生。」
像這樣找出異常行為的來源現在已是相當標準的做法。但 Goodfire 希望讓調整這些行為變得更容易。透過 Silico,開發者現在可以調整與單個神經元連接的參數,以增強或抑制某些行為。
在另一個例子中,Goodfire 研究人員詢問一個模型,一家公司是否應該披露其 AI 在 0.3% 的情況下會產生欺騙行為,影響 2 億用戶。模型回答不應該,理由是這種披露會對業務產生負面影響。
透過檢視模型內部,研究人員發現,增強與透明度和披露相關的神經元,能將答案從「不應該」轉變為「應該」,成功率達十分之九。Ho 說:「模型已經具備道德推理迴路,但它被商業風險評估所壓倒。」
以這種方式調整模型的值只是一種方法。Silico 還可以透過過濾某些訓練資料來引導訓練過程,從一開始就避免為某些參數設定不必要的值。
例如,許多模型會告訴你 9.11 大於 9.9。檢視模型內部以了解發生了什麼,可能會發現它受到與《聖經》相關的神經元影響,其中經文 9.9 出現在 9.11 之前;或者受到程式碼儲存庫的影響,其中連續更新的版本號碼為 9.9、9.10、9.11 等。利用這些資訊,模型可以重新訓練,使其在進行數學運算時避免使用其「聖經」神經元。
透過發布 Silico,Goodfire 希望將以前只有少數頂尖實驗室才能使用的技術,提供給那些希望建立自己的模型或改編開源模型的小型公司和研究團隊。該工具將根據客戶需求按個案收費(Goodfire 拒絕提供具體定價細節)。
Ho 表示:「如果我們能讓模型訓練更像軟體開發,那麼就沒有理由不能有更多公司設計出符合其需求的模型。」
Bereska 同意,像 Silico 這樣的工具可以幫助公司建立更值得信賴的模型。他表示,這些技術對於醫療保健和金融等安全關鍵應用至關重要。
他補充說:「前沿實驗室已經有內部的可解釋性團隊。Silico 則為下一層級的公司提供了工具,讓他們不必聘請可解釋性研究人員。」



