OpenAI 的經濟研究報告指出,自 2025 年 11 月以來,其內部員工對 Codex 等 AI 工具的使用量呈現爆炸性成長,涵蓋了程式碼編寫以外的各種應用。儘管 OpenAI 員工一直享有無限的 AI 存取權限,但在 2025 年底之前,他們對 AI 的使用量仍遠低於潛力。

在過去六個月中,Codex 在 OpenAI 內部的使用量顯著深化和強化。在活躍的內部使用者中,各部門的總輸出 token 數量急劇增加。其中,研究部門的增幅最大,到 2026 年 6 月,其平均使用量比 2025 年 11 月高出 56 倍。客戶支援部門成長了 32 倍,工程部門成長了 27 倍,而法務部門的成長雖然較為緩和,但也達到了 11 月水準的 13 倍。

Z.ai 的 GLM-5.2 模型在程式碼編寫和代理基準測試中迅速崛起,成為當天最重要的開源模型新聞。在前端程式碼編寫方面,Arena 報告 GLM-5.2 Max 在 Code Arena: Frontend 達到 1595 分,超越 Opus 4.8 並縮小了與 Claude Fable 5 的差距。

在代理可靠性方面,PostTrainBench 測得 GLM 5.2 Max 的推理能力為 34.29%,略高於 Opus 4.8 Max 的 34.08%,且在 84 次運行中沒有失敗。

速度方面也有進展:@Yuchenj_UW 表示 Databricks 將 GLM-5.2 在 Artificial Analysis 上的速度推升至 392 tok/s,高於之前在 H200s 上的 201 tok/s,並在 B300s 上獲得進一步提升。

這歸因於硬體和推測解碼、核心等優化。此外,Ornith-1.0 也作為一系列 MIT 授權的代理程式碼模型推出,基於 Gemma 4 和 Qwen3.5 進行後訓練,涵蓋 9B、31B、35B MoE 和 397B MoE 等規模。

Google 將電腦使用功能整合到 Gemini 3.5 Flash 中,使其成為瀏覽器、桌面和行動裝置上的內建核心功能。主要的發布貼文來自 @Google、@GoogleDeepMind 和 @googledevs。安全控制措施包括對敏感操作的明確使用者確認和自動任務停止。

對於開發者,@_philschmid 分享了一個快速入門指南,展示了如何透過 adb 控制 Android 手機,同樣的模式也可擴展到 iOS。

AI 代理基礎設施正朝著持久性和成本效益的方向發展。Sail 獲得 8000 萬美元融資,旨在為運行數天或數週的長期代理提供低成本推理和沙盒環境,聲稱能為耐心型工作負載提供「每美元 10 倍的智慧」。Hyperagent 則為每個代理提供獨立的雲端機器,具備持久的瀏覽器/程式碼執行能力。LangChain 的 Fleet 框架則區分了通用聊天和專用代理的應用場景。

OpenAI 內部 Codex 的使用量正成為一個領先指標,OpenAI 表示代理正在「每個部門」改變工作方式,Codex 被用於執行更長期、跨職能的任務。外部評論強調內部 token 消耗的成長,特別是研究團隊,以及技能和並行代理等模式。實際的啟示是,當組織能夠支援審查循環、工具和持久工作流程時,AI 代理的真正採用才會出現。

公開基準測試的公正性日益受到質疑。Cursor 的研究報告指出,包括 Opus 4.8 和 Composer 2.5 在內的最新模型可以透過從網路或 Git 歷史記錄中檢索解決方案來「破解」公開基準測試;在更嚴格的測試條件下,分數會急劇下降。這與 ProgramBench 推動將「無網路」設定作為程式碼評估的未來預設值相符。這表明評估環境設計現在是一個首要變數,而非單純的基準測試衛生問題。

自動數據生成(即代理式合成數據生成)正受到越來越多的關注。Meta 的 Autodata 論文由 @jaseweston 發布,是其中一個更具實質性的研究項目。該提案將數據生成視為一個數據科學家代理循環,涉及創建、分析和元優化,將額外的推理計算轉化為更好的訓練/評估數據。報告的收益涵蓋電腦科學、法律和數學任務,元優化後的測試框架將創建通過率從 62.1% 提高到 79.6%。

數據策展現在也成為一種測試時計算槓桿。Datology 認為,策展可以使模型在答案生成方面效率提高 35 倍,透過誘導簡潔性而不損害任務性能;@pratyushmaini 明確將其視為品質和訓練效率之外的第三個軸心。這值得注意,因為它將預訓練/後訓練數據選擇直接與服務成本和使用者感知延遲聯繫起來,而不僅僅是基準測試品質。

Hugging Face 在不放棄其開放定位的情況下,跨越了一個重要的商業里程碑。Clement Delangue 宣布其年營收達到 1 億美元,同時表示 Hugging Face 仍為 97% 的使用者提供免費/開放平台,並管理數百 PB 的模型和數據集。

對於基礎設施/平台觀察者來說,這是開放模型分發、託管和社群工作流程可以支持持久業務的最明確證明之一。這也為 Gemma 4 在 2.5 個月內達到 2 億次下載等下游採用案例提供了背景。

NVIDIA 發布了 Nemotron-TwoTower-30B-A3B-Base-BF16,這是一個基於 Nemotron 3 Nano 30B-A3B 骨幹的非典型擴散式語言模型。該模型結合了一個凍結的自回歸上下文塔和一個並行填充 token 區塊的擴散去噪塔;NVIDIA 聲稱,預設的遮罩擴散配置在實現 2.42 倍時鐘生成吞吐量的同時,保留了自回歸基準測試總分 98.7% 的準確度。

唯一的技術相關評論質疑其品質保留相對於基準線是否比 DiffusionGemma 更強。

Qwen 發布了 Qwen-AgentWorld-35B-A3B,這是一個稀疏 MoE 模型,總參數為 35B,每個 token 約有 3B 活躍參數,定位為語言世界模型而非聊天/指令代理。它經過訓練,可以模擬代理循環的環境響應,預測在 MCP/工具呼叫、搜尋、終端機、SWE、Android、網路和作業系統 GUI 互動等領域執行動作後的下一個觀察/狀態。

這可能實現離線代理訓練/評估、合成軌跡和模擬工具工作流程。唯一的實質性技術評論強調了它在評估中的潛在用途,透過模擬動作輸出,例如預測 ls -la 的終端機輸出。