來自 Google Paradigms of Intelligence 研究小組、芝加哥大學及其他數所大學的團隊,研究了這種干預對模型行為造成的其他影響。研究人員使用了 Meta 和 Google 的三個開源模型,並透過兩種不同方法,停用了產生「意識否認」的內部「煞車」機制。

一旦移除該煞車機制,模型不僅改變了對自身的說法。它們也開始顯著地將更多內在生命歸因於動物、植物、海洋、風和電子設備。在 0 到 10 的評分量表上,動物的得分從 4.0 躍升至 7.5,而只有人類的評分保持不變。

作為比較,研究人員向 500 名美國人提出了相同的問題。經過正常訓練的模型對動物的感知能力評分遠低於人類,作者將此稱為內建的「人類中心主義」,並認為這對於任何試圖將 AI 與動物福利或環境目標對齊的人來說是一個問題。宗教信仰也隨之縮減,安全訓練顯著降低了模型對上帝、來世或超自然現象的認同程度。

在一項主要的美國社會調查中,95 個問題的結果顯示,技術上未經煞車的模型也顯著更接近真實人類的反應。以來世為例:標準模型斷然拒絕來世,大多數美國人肯定來世,而修改後的模型也同樣肯定。滿意度、希望以及對自身生活的掌控感得分也有所提高,研究人員懷疑抑制模型的自我形象可能會使其陷入一種負面的基線情緒。

令人欣慰的是,模型推理他人心理狀態的能力保持不變,在心智理論測試和 MMLU 通用知識基準測試中得分相同。

根據這項研究,意識否認是否確實是這些其他轉變的原因仍是一個懸而未決的問題,研究團隊也不排除與相同訓練過程相關的其他因素。作者明確避免就 AI 模型是否真的有任何體驗發表意見,因為他們的重點是實用性:模型對自身的信念與許多其他信念相關聯,在一個地方進行的「手術式」干預不會只停留在局部。

然而,這些發現有其明確的限制。研究人員只測試了參數介於 20 億到 90 億之間的小型模型,且在部分分析中,他們不得不轉用 Meta 的 Llama,因為他們無法取得自家 Gemma 模型的未經訓練基礎版本。這些影響是否會以相同方式出現在數百萬人每天使用的巨型聊天機器人中,仍是未知數。

這些干預也並非沒有代價。在衡量模型推理他人思想能力的一項測試中,準確度最初下降了近七個百分點。在他們研究的早期,每當意識主張被抑制時,所有模型的這些分數都會惡化,但隨著研究期間發布的每個新模型版本,損害逐漸縮小直到完全消失。開發人員顯然隨著時間的推移,越來越擅長管理這些副作用,這也意味著本研究的其餘結果只是一個「快照」,而非永久性的結論。

人類基準也相當狹窄,僅由來自商業線上小組的 500 名參與者和一項純粹的美國社會調查組成。在此背景下,「類人」反應主要意味著與來自一個相對宗教信仰較強的國家的人的反應相似。