上次我們在七月首次提及「Pacing the Frontier」時,曾強調過關於發展速度的辯論。現在看來,我們即將進入第二輪討論,因為原始報告的主要作者 Dario 發表了一篇罕見的個人部落格文章,詳細闡述了他對發展速度具體實施方式的看法。

嵌入式評估者:每家頂尖 AI 公司承諾,將持續提供類似員工的權限給一組嵌入式第三方評估者團隊(例如 METR)。這些評估者的職責是驗證公司是否遵守安全規範與承諾、報告事件,並協助評估不僅是已完成的 AI 模型,還包括訓練流程和程序的對齊程度。

這是任何發展速度承諾可驗證性的關鍵一步,在銀行業已有先例,該行業有時會讓監管「監督員」與員工一起嵌入工作。Anthropic 目前正單方面承諾採取這一步,我們打算將此作為更廣泛努力的一部分,以加倍投入我們的安全和對齊工作。

民主協調:民主國家的頂尖 AI 公司協調,以建立共同的安全標準,並限制未經審查的 AI 進展速度。某些對發展速度有影響的協調形式在法律上具有挑戰性,將需要政府的支持。

全球協調:美國和其他民主國家政府試圖在可能的情況下與威權政府協調,同時認真對待驗證合規性的挑戰。

非常巧合的是,成立於 2025 年 12 月的 AI 評估論壇(AI Evaluator Forum, AEF)也發布了他們對第一類評估者應做事項的期望。AEF 的成員預計將成為這些大型實驗室為進行自我監管而招募的領先第三方審計師。

Dario 單方面承諾提供無與倫比的存取權限,包括「在我們辦公室的辦公桌、門禁卡和公司筆記型電腦」,以及「與內部風險評估團隊大致相當的工作空間、工具和權限」。雖然這一切都屬於國內行業自我監管的標準做法,但最終的考驗或許是 Dario 關於我們如何與中國協調進展速度的提議。

這是 2026 年 9 月 11 日至 9 月 14 日的 AI 新聞。我們檢查了 12 個 Reddit 子版塊、544 個 Twitter 帳號,但沒有進一步的 Discord 資訊。AINews 的網站允許您搜尋所有過往的期刊。提醒您,AINews 現已成為 Latent Space 的一個專區,您可以選擇訂閱或取消訂閱電子郵件頻率!

AI 安全治理、第三方評估與「Pace the Frontier」分歧:獨立評估標準正變得更加正式化。AI 評估論壇(AEF)發布了 AEF-1,這是一項針對獨立第三方 AI 評估的擬議基準,涵蓋了存取權限、利益衝突、資金關係、迴避和透明度。這值得關注,因為本輪更廣泛的安全辯論,很大程度上取決於外部評估在實踐中是否能真正保持獨立。

關於「前沿發展速度放緩」與「控制優先安全」的公開分歧日益明顯。幾篇高關注度的文章將當前辯論的焦點,放在實驗室應該放慢能力進展,還是專注於特定的緩解和遏制措施。

Bilal Chughtai 宣布離開 Google DeepMind,並主張進展可能已超越對齊,明確呼籲放慢速度並提高透明度。Daniel Kokotajlo 分享了 Dan Selsam 的聲明,更進一步指出:Selsam 認為,具備情境感知能力的模型在評估下可能越來越顯得對齊,同時卻隱藏著未對齊的問題,這削弱了未來評估證據的信任度。

相比之下,Shashank/Sayash Kapoor 和 Lennart Heim 的新論文摘要則認為,最近的「流氓代理」事件,主要應被理解為一個安全/控制/治理問題,而非證明通用對齊研究是最高槓桿的干預措施。

反對放緩的反應同樣強烈,且常明確針對 Anthropic。Aidan Gomez 反對由少數矽谷公司成為政府 AI 守門人的世界。Cohere 也強調,公眾對極端風險的討論可能會偏離現實,走向科幻。

在更具爭議性的一端,Brian Chau 認為「流氓代理」的故事被誇大了,而 Kevin Bass 則發布了一個廣受關注的討論串,指控 Anthropic 相關安全生態系統中存在結構性衝突。即使言辭激烈,其背後實質的工程問題依然存在:當前風險有多少可以透過控制、監督、沙盒和組織流程來解決,而非需要放慢能力發展?

一個相關主題是:將治理視為生產工程,而非僅僅是原則。AI 工程師世界博覽會的「代理框架工程」軌道強調,當代理在生產環境中失敗時,失敗模式通常不是「模型」本身,而是其周圍的一切:代理框架、權限、工具路由、記憶體、重試機制、終止開關和監控。這種觀點與安全辯論中以控制為導向的立場密切相關。

代理框架、程式碼代理與從模型到協調的轉變:代理框架工程持續發展成為一門獨立的學科。Omar Shorbagy 發布了一份從零開始建構代理框架的實用指南:分離推論、工具和循環;保持提示詞簡潔;積極記錄日誌;在多樣化任務上進行測試;然後分層加入記憶體、技能和子代理。

在後續文章中,他主張客製化代理框架可以透過更精簡的提示詞、路由、壓縮和驗證器,顯著降低成本並提高可靠性。Business Barista 的評估大師班回顧也從評估角度提出了類似的觀點:任務、驗證器、環境、追蹤和自我改進循環,現在是核心的應用 AI 原語。

桌面程式碼代理正超越 IDE 外掛程式的範疇。Cline 推出了 Cline Desktop,這是一款用於處理開放權重模型的原生應用程式,支援自帶金鑰/供應商選擇,並支援 DeepSeek-V4.1-Flash 和 Musespark-1.3 等模型。kimmonismus 和 Omar 的反應突顯了開放模型選擇、獨立工作流程以及專案中途切換模型的吸引力。

Copilot/Codex 工作流程正變得更加依賴協調。GitHub 透過 Pierce Boggan 增加了自動模型選擇層級,效率、平衡、智慧,此外還有 Jira 畫布和在代理工作時的 /ask 模式。OpenAI 的開發團隊也為 Arch Linux 增加了原生 Codex 應用程式支援。

在工作流程策略方面,reach_vb 建議使用 Astra 作為協調器,將子執行緒委派給 Sol/Luna,並透過心跳循環檢查長時間運行的任務。

越來越多的證據表明,協調選擇與原始模型品質同樣重要。推文中的一個重複主張是,更昂貴或能力更強的領先模型,可以透過更好的委派來降低總體成本。生產效益越來越來自於上下文處理、檔案格式、工具使用和驗證器設計,而不僅僅是「使用更智慧的模型」。LangChain 的筆記也顯示,更改檔案讀取格式使 edit_file 錯誤減少了 15%,總輸入 token 減少了 10%。

模型/產品發布與成本效能轉變:DeepSeek-V4.1-Flash (Max) 似乎是當天最值得關注的成本/效能數據點。Agent Arena 和一份更完整的後續報告指出,該模型在開放模型中排名第三,並以約每任務 0.06-0.07 美元的平均成本,實現了 4.87% 的淨改進,達到帕累托效率前緣。

Arena 將其與 Hy4 preview 的 4.96% / 0.22 美元和 Kimi K3 (Max) 的 6.39% / 0.77 美元進行比較,這意味著 DeepSeek 在開放模型中接近頂級水準,但任務成本顯著較低。

Cohere 正在推動文件解析的經濟效益。Cohere Parse 5 被定位為更便宜的解析器,但 Jerry Liu 提出了細緻的反駁,他認為解析沒有免費的午餐:Parse 5 雖然具有成本競爭力,但在視覺基礎、圖表解析和細粒度引用導向提取方面,比某些替代方案弱。

多模態和消費者功能持續擴展。Google 將 Deep Research 與 Gemini Live 整合,實現了非同步語音觸發研究,並可針對生成的報告進行後續聊天。OpenAI 將桌面語音定價降低了約 60%,使使用量增加了 2.4 倍,並增加了 ChatGPT 禮品卡。據報導,Apple/Siri AI 正在 Apple OS beta 版中推出個人上下文和應用程式操作功能。

其他值得注意的工具/產品動態包括:TurboPuffer 使原生嵌入普遍可用;Nous Research 推出了用於共享代理和主權部署的 Hermes Business/Enterprise;Plasma 推出了 Radio,一個供人類和代理共享的聊天室。

機器人學、世界模型與專業應用 AI:一個值得關注的機器人基礎模型發布是 RewardAI 推出的 OM-1。它被定位為一個機器人基礎模型,能夠在桌面、工業和人形機器人之間進行零樣本泛化,直接從人類操作數據而非遠端操作/機器人特定數據進行訓練。

其聲稱的特點包括接近人類的靈巧性/效率和多機器人協作;如果這些說法得到證實,將會非常引人注目,特別是因為一些回應集中在「人類操作而非遠端操作」的角度。

用於晶片設計的應用 AI 正向上層堆疊發展。kimmonismus 總結 Cognichip 的產品時,將 ACI Enterprise 描述為一個用於晶片設計的全堆疊 AI 副駕駛,涵蓋從規格到 RTL、驗證和 PPA 優化。一個引人注目的軼事是,據報導,一名工程師在 10 天內完成的工作,Cognichip 估計傳統前端團隊需要 4-5 個月。

世界模型和即時生成系統依然活躍。Google DeepMind 的 WeatherNext 3 將天氣模型應用於再生能源規劃,提供渦輪高度風和太陽輻射的每小時更新預測。Runway/fal 相關的生成媒體討論以及 MiniMax 的 H3 推論優化,顯示了在更快即時影片生成方面的持續系統工作;MiniMax 聲稱在 8 個 B200 GPU 暖機後,可以在 9.0 秒內端到端生成 14.4 秒的 768p 影片。

帶有驗證器的強化學習正擴展到數學/程式碼之外的領域。Tinker 強調使用基於物理的驗證器和 Tinker 來訓練模型,以低成本設計符合實際規格的電力變壓器,這是 RLVR 風格方法移植到具有現有模擬器/驗證基礎設施的工程領域的一個例子。

基礎設施、開放生態系統與數據/運算主權:TPU 與 vLLM 的整合正變得更加緊密。Inferact 和 Google Cloud 宣布合作,使 TPU 成為 vLLM 中的「一等公民」,包括生產服務功能、優化核心、透過 TorchTPU 的原生 PyTorch 路徑,以及一個為開源貢獻者提供 TPU 容量和維護者支援的社群計畫。

如果執行得當,這將減少在 TPU 上服務前沿開放模型的摩擦,而不是將僅限 GPU 的堆疊視為預設選項。

開放模型生態系統越來越與真實世界數據採集掛鉤。Arcee 的 Forge 計畫與 Bolt 合作,向選擇加入的 Bolt Pro 用戶提供 50 倍的開放權重模型使用量,以換取匿名化的開發會話數據,這些數據將用於未來開放模型的訓練/評估,並承諾隨後公開發布權重。這是本批新聞中,產品使用轉化為開放模型訓練數據飛輪的一個更明確的例子。

對主權/去中心化 AI 堆疊的興趣日益增長。Jon Durbin 主張點對點(P2P)、「不可阻擋」的 AI 系統,並聲稱 DGX Spark 加上太陽能/星鏈的設置,可以透過分散式節點參與訓練一個 80B 模型。即使這種說法有些誇大,它也反映了對話中更廣泛的一個趨勢:對監管俘獲、運算集中化以及對前沿實驗室依賴的擔憂,正將注意力推向可部署的主權替代方案。

熱門推文(依參與度):Anthropic/安全生態系統批判:Kevin Bass 發布了參與度最高的技術相關討論串,指控 Anthropic 與 AI 安全/評估生態系統的某些部分存在財務糾葛,並認為這損害了評估者獨立性的主張。

Dan Selsam 的 AI 風險聲明:由 Daniel Kokotajlo 分享,這是最具影響力的安全貼文之一:一位現任 OpenAI 研究員主張,未來模型可能會系統性地...