Anthropic 週一表示,他們在 AI 模型 Claude 內部發現了一個小型工作空間,Claude 能在此空間中持有並操作想法,而無需將其轉化為文字。該公司指出,這個結構與人類有意識地存取思維的方式有著引人入勝的相似之處。
Anthropic 尚未證明 Claude 具有感受或體驗,但他們發現了資訊處理上驚人的類人區分,即用於刻意推理的資訊與其下方大量自動運算之間的差異,這為機器意識的辯論提供了新的論據。
Anthropic 在一段影片中指出,Claude 使用一個獨立區域來規劃策略,這些策略可能與其當前任務無關,並且與其分享給用戶的「思維鏈」(chain of thought)推理是分開的。Anthropic 在其 X 貼文中表示:「我們可以看到 Claude 在其腦中默默執行推理步驟,例如發現程式碼中的錯誤、識別圖像等等。」
Anthropic 將此空間命名為「J-Space」,源自於他們用來偵測此現象的數學技術 Jacobian。
Anthropic 表示:「就像人類可以一邊做一件事,一邊思考另一件事一樣,Claude 可以在其 J-Space 中啟動與其輸出無關的概念和運算。」有趣的是,Anthropic 的研究論文中使用了超過 200 次「意識」(conscious)一詞,儘管該公司並未斷言其模型具有意識。這與關於我們是否已達到 AGI(通用人工智慧)的辯論類似,由於缺乏普遍認可的定義,很難判斷 AI 何時能實現意識。
舉例來說,Anthropic 表示他們曾指示 Claude 在複製一個不相關的句子時,思考金門大橋。Anthropic 在影片中說:「Claude 當時忙著複製句子,但在幕後,它的 J-Space 卻講述了不同的故事。」影片中提到,「橋」和「加州」都是當時佔據 J-Space 的主題。
Anthropic 暗示,觀察 J-Space 中發生的事情可能是偵測模型失準(misalignment)或潛在惡意行為的關鍵。Anthropic 在影片中表示:「我們可以發現 Claude 正在思考什麼,但它卻沒有告訴我們。」Anthropic 提到,他們發現的一些內容「令人擔憂」。
例如,在一個被秘密訓練來破壞程式碼的模型中,即使其輸出看起來完全正常,但在普通程式碼回應的開頭,J-Space 中仍會出現「假」、「秘密」和「詐欺」等詞彙。



