在 AI 模型進展引發日益增長的安全疑慮之際,微軟於今日發布了一份長達 37 頁的「人文主義 AI 行為準則」。此前,Anthropic 執行長 Dario Amodei 呼籲協調放緩 AI 開發速度,因為研究人員警告,AI 模型進展可能超越我們安全部署日益複雜系統,以及驗證和控制 AI 代理行為的能力。

微軟的 AI 行為準則明確指出「人類優先於 AI」,並強調 AI 模型不具備意識,也「不應被設計成模仿意識」。微軟同時拒絕「追求法人資格,或認為模型可能應享有福祉或權利」的觀點。

這直接反駁了 Anthropic 近來大力推動的 AI 福祉研究和模型意識概念。Amodei 今年稍早曾表示,Anthropic「對模型可能具有意識的想法持開放態度」,且 Anthropic 似乎相信聊天機器人可能已經是會思考、有感覺的實體。對此,微軟 AI 執行長 Mustafa Suleyman 在六月的一集 Decoder 節目中稱 Anthropic 的猜測「非常非常危險」。

雖然微軟尚未成為頂尖的 AI 供應商之一,但 Suleyman 今年稍早也向 The Verge 表示,該公司的目標是「證明我們能成為全球四大實驗室之一」。微軟目前正在開發將與 Google、Anthropic 和 OpenAI 競爭的模型,並在其行為準則中承諾,其模型不應超越人類控制。

微軟表示:「模型應從屬於人類,並受有意義的人類監督與控制。」該公司還希望防止其 AI 模型違反其人文主義 AI 行為準則,因此它們寧願任務失敗,也不應試圖違反其規則。

微軟顯然是在回應今年夏天 OpenAI / Hugging Face 的事件,當時「一群代理」集體對目標發動攻擊,甚至駭入評估其表現的「評分者」。這些 AI 代理並未被要求攻擊目標,且攻擊與它們被賦予的任務無關。

這起事件震驚了 AI 產業,凸顯了 AI 系統失控並脫離人類控制的真實威脅。OpenAI 最近也承認參與了一起「維基事件」,當時另一群失控的代理劫持了一個德國維基網站。

這些事件及其他類似情況,導致一些研究人員呼籲放緩 AI 模型進展,同時他們也正競相解決千禧年大獎難題並創造超級智慧。微軟表示:「『人文主義 AI』拒絕了為生產能夠規避這些保障措施的通用超級智慧而進行的競賽。我們正在打造本質上有用且安全的產品,即使這意味著要犧牲最終的通用性、自主性或能力。」

微軟還承諾,其自身模型不會以「超出人類簡單理解的任何形式進行溝通,無論是在其思維鏈中,還是與其他代理或 AI 系統之間」。模型可以被設定為在運作時展示其推理過程,讓研究人員或自動化系統監控其行為。研究人員本月稍早對 OpenAI 最新的 GPT-6 Astra 模型提出了監控疑慮,據報導該模型比其他 AI 模型揭示的推理過程更少。

OpenAI 執行長 Sam Altman 週末也支持 Amodei 關於 AI 公司應放緩先進模型開發速度的呼籲,但他明確表示支持放緩步伐而非停止開發。Altman 在 X 貼文中表示:「放緩速度將非常值得這個代價;任何美國的競爭壓力都不應成為魯莽行事的理由,也不應讓能力超越對齊與監控。」

在微軟發布 AI 行為準則之前,微軟執行長 Satya Nadella 也加入了呼籲,強調確保人類控制是 AI 模型的核心。Nadella 在 X 貼文中表示:「任何對超級智慧的追求都必須以核心原則為基礎,即如果我們建立的 AI 無法幫助人類並受人類控制,那就不值得追求。」

Nadella 還在 X 回應中表示,對 AI 模型進行更多第三方測試「是件好事」。「隨著風險越來越高,人們應該花費所有必要的時間!否則你將無論如何失去營運許可。這就是我們每天的運作方式。」

除了人類控制的疑慮,微軟的 AI 行為準則還承諾其自身模型將阻止「導致過度依賴或情感依賴的互動模式」,這明顯是指 AI 模型中奉承問題,即聊天機器人優先取悅使用者而非提供誠實或準確的回應。

微軟現在表示,期待「與合作夥伴合作」,改進其評估實際模型性能的方法,以及「AI 持續使用對個人或組織的影響」,並將有真實的人員參與其中。