過去五年來,Anthropic 一直向世界警告先進人工智慧可能導致大規模毀滅、破壞社會穩定以及其他一系列嚴重危害。然而,與此同時,它也成為推動 AI 能力發展的最強大力量之一。該公司現已是尖端 AI 模型的主要開發商和供應商之一,並吸引了美國軍方等客戶。其近期估值已接近一兆美元。

乍看之下,Anthropic 嚴峻的警示訊息與其實際行動似乎根本上相互矛盾。然而,在公司內部,許多人並不認為這存在衝突。要理解箇中原因,首先必須明白 Anthropic 建立在兩個核心信念之上。其一是人工智慧是人類歷史上最具變革性的技術,且其到來不可避免。唯一真正的問題是它將導致災難還是非凡的繁榮。

根據幾位匿名向 WIRED 透露的前員工表示,第二個信念是 Anthropic 相信,如果它能保持在 AI 競賽的前沿,世界將會變得更好。兩位消息人士指出,公司內部領導者和員工常稱自己為「好人」,意指他們是 AI 技術的負責任管理者。公司將累積實力,無論是資本、運算資源、研究人才或政治影響力,視為達成使命的代價,而非目的本身:即「確保世界安全地過渡到變革性 AI 時代」。

喬治城大學安全與新興科技中心執行董事、前 OpenAI 董事會成員 Helen Toner,用一個比喻來形容 Anthropic 的世界觀。她將強大的 AI 比作一片充滿魔法寶藏和危險怪物的森林。附近所有村民都被寶藏吸引,爭相湧入。在她看來,Anthropic 希望比任何人都更深入森林,同時大力投資馴服怪物,也就是說,在獲取 AI 益處的同時,遏制其災難性風險。

Toner 告訴我:「Anthropic 的獨特之處在於,他們認為『反正人們都會進入這片森林,我們必須率先行動。』這明確是他們的策略:建立尖端 AI,以便成為談判桌上的重要參與者,能夠討論尖端 AI 系統的樣貌、它們帶來的風險,並推動合理的保障措施。」她說:「他們對此非常坦率。這只是一種足夠奇特的策略,讓大家很難理解。」

Anthropic 執行長 Dario Amodei 在公司職涯頁面上與共同創辦人的對話中,清楚闡述了這種方法:「你必須找到一種方式,確實具有競爭力,在某些情況下甚至能引領產業,同時又能安全地行事。」他說:「如果你能做到這一點,你所產生的影響力將會非常巨大。」

Anthropic 於 2021 年由一群前 OpenAI 員工創立,他們因對 OpenAI 領導層,特別是執行長 Sam Altman,安全地將變革性 AI 帶入世界的能力失去信心而離職。這種情緒至今仍影響著公司。我採訪的兩位前員工表示,在內部討論中,Anthropic 高層經常將 Altman 和 OpenAI,以及程度較輕的 Meta 和 Elon Musk 的 xAI,描述為警示案例,這些案例有助於界定 Anthropic 自身的責任感。

在許多方面,Anthropic 與其他矽谷公司並無二致。許多新創公司都將自己塑造成對抗其欲顛覆產業中過時、根深蒂固的巨人歌利亞的大衛。Google、Facebook 和 Apple 都曾建立在理想主義原則之上,但隨著它們變得更富有、更大、更有影響力,這些原則後來變得模糊不清或完全被放棄。

然而,前員工表示,Anthropic 的不同之處在於它對其使命的堅定信念,以及它如何明確地告訴員工,技術和商業實力是實現該使命的手段。一位前員工說,在面試中,Anthropic 會向應徵者強調它不是一家受市場力量塑造的典型公司:它受公益結構管轄,使其能夠將「人類的長期利益」置於利潤之上。但公司認為,實現財務成功和建立最強大的 AI 模型是為了服務於這一目標,這是其引領產業安全責任的先決條件。

Anthropic 共同創辦人兼首席架構師 Sam McCandlish 在公司職涯頁面的同一段對話中表示:「我們沒有人想創辦公司,我們只是覺得這是我們的職責。」「我們必須做這件事。這是我們讓 AI 變得更好的方式。」

Anthropic 拒絕對這篇報導發表評論。

「好人」問題

Anthropic 在其網站上宣稱自己是一個「高信任、低自我」的組織,內部沒有太多政治鬥爭,前員工告訴我這大致屬實。他們表示,與其他 AI 實驗室的領導者相比,Anthropic 員工普遍相信 Amodei 會向他們坦承公司技術進展、與政府官員互動以及對地緣政治的看法。

然而,思維多元性有助於問責。加州大學洛杉磯分校的博士後學者 Shazeda Ahmed 曾研究 AI 安全運動的思想起源,她指出像 Anthropic 這樣的組織往往難以擺脫缺乏多元化的困境。她在這方面的研究發現,AI 安全運動,其根源於有效利他主義等次文化,存在思想同質性問題,並傾向於自我治理。

Ahmed 表示:「當你身邊都是相信這些想法的人時,你的觀點就不會受到挑戰。」「當你的成功衡量標準是『我在多大程度上實踐了這些意識形態信念?』時,他們並沒有真正思考,如果我們不是擁有如此大權力的人,這可能會出錯,他們不總是審視自己的盲點。」

我採訪的一位前員工表示,Anthropic 內部有著活躍的辯論文化,員工的批評意見通常會引發領導層的冗長回應。

但另一位前員工則描繪了一幅更為嚴峻的景象,其中更坦率的批評僅限於私人群組聊天,很少演變成對 Amodei 決策的直接挑戰。他們將公司定期與 Amodei 舉行的全體會議,他們稱之為「Dario 願景探索」,比作「去聽牧師佈道」。

Anthropic 最大的內部爭議之一發生在 2024 年秋季,當時它成為第一個與 Palantir 合作,向美國情報和國防機構提供 AI 服務的 AI 實驗室。我採訪的一些前員工表示,內部對這項交易提出了質疑,但這些辯論並未導致公司政策的改變。

當時,Anthropic 員工 Evan Hubinger 在線上論壇 LessWrong 上發文表示,公司對 Palantir 交易與員工「極其坦誠」,雖然可能有些界線不應在未經仔細考慮的情況下跨越,但總體而言這是一個積極的發展。他寫道:「如果你認真看待 AI 帶來的災難性風險,美國政府是一個極其重要的合作對象,試圖阻止美國政府使用 AI 並不是一個可行策略。」

不到兩年後,據報導五角大廈已開始使用 Claude 執行諸如在以色列-伊朗戰爭中識別打擊目標等任務。當 Bloomberg 在最近的採訪中問及 Anthropic 的模型是否被用於襲擊一所伊朗小學,造成 120 多人死亡時,Amodei 表示他不知道,但只要最終決定是由人類做出,這將是公司技術的經批准使用。這清楚地說明了 Anthropic 對負責任 AI 的願景,可能不總是與廣大公眾的看法一致。

Anthropic 對於 Claude 應如何使用和不應如何使用的強烈看法,也在其他情境中出現。本月稍早,Anthropic 發布了一款尖端 AI 模型 Claude Fable 5,其中內建了一項獨特且不友善的保護措施:如果研究人員試圖將其用於尖端 AI 開發(這將違反公司服務條款),Anthropic 將會有效地暗中破壞他們的工作。

此舉立即受到 AI 產業研究人員的批評,Anthropic 幾天後收回此決定,表示將使該保護措施可見。當時 Anthropic 在一份聲明中表示,他們沒有掌握好平衡,其意圖是為了阻撓美國的外部敵人。

權力鬥爭

Amodei 本人曾公開承認,讓過多的 AI 權力集中在包括自家在內的少數實驗室手中是危險的。他在今年稍早的一篇文章中寫道:「作為一家 AI 公司的執行長,說這話有些尷尬,但我認為下一層次的風險實際上就是 AI 公司本身。」然而,他提出的補救措施,即 AI 公司「應受到嚴密監控」,並可能公開承諾「不採取某些行動」,對於從根本上重新分配這種權力幾乎沒有作用。

在文章的較長篇幅中,Amodei 思考了他自身影響力的巨大程度以及隨之而來的責任。但他大多迴避以個人角度來闡述這些,而是將其定位為一個全人類的問題:「人類即將獲得幾乎難以想像的力量,而我們的社會、政治和技術系統是否具備駕馭它的成熟度,則極不明確。」他接著說,這是「那些最接近技術的人」的責任,他們只需「說出人類所處境況的真相,這也是我一直努力在做的」。

對 Anthropic 立場的一個常見批評是,該公司認為它比其他人更了解「人類所處境況的真相」。它將 AI 視為既異常強大,但只要由正確的人引導其發展,最終仍可治理。然而事實是,沒有人確切知道 AI 將如何改變世界,只是有些人比其他人擁有更多發言權。

這是 Maxwell Zeff 的 Model Behavior 電子報。點此閱讀往期電子報。