我們在 Unsupervised Learning 播客中提到了「程式編寫代理模型正在突破限制」的論點,相關討論已於今日上線。有些產品發布是獨立的,有些則隨著時間推移逐步推出。Claude 和 Codex 在過去一週都有重大進展,其中 Claude 在聲量上持續領先,這趨勢已維持一段時間。
Codex
今日 Codex 的重大更新是「Codex for Work」,這基本上是一個推廣頁面,將 Codex 定位為知識工作(不限於程式編寫)的工具,延續了上週將 Codex 轉變為潛在 OpenAI「超級應用程式」的趨勢。這不僅僅是頁面更新;最新的 Codex 現在擁有 42% 更快的 CUA、響應式瀏覽器、/chronicle、/goal(「我們對 Ralph 迴圈的看法」),並且在引導流程中鼓勵用戶連結 Microsoft/Google/Salesforce 套件。
此外,該代理模型現在具備類似 Cowork 的規劃使用者介面,並顯示了 MS Office 檔案的應用程式內檔案編輯器。
簡而言之,正如 Tibo 所說,「Codex 現已開放給非程式設計師使用」,Greg 則表示「Codex 適用於所有人,可用於任何電腦上的任務」,而 Sam 則鼓勵「嘗試將其用於非程式編寫的電腦工作」。你應該明白其意圖了。
「動態使用者介面」是一個有趣的選擇,團隊明確拒絕了類似 Claude Cowork 的切換模式,而是選擇讓代理模型引導使用者介面體驗。
Claude
在資安漏洞日益增加以及圍繞 Mythos 的元神話背景下,Anthropic 推出了 Claude Security,這是一款程式碼審查工具。
然而,本週更大的新聞可能是其對 Blender、Autodesk、Adobe Creative Cloud、Ableton、Splice、Canva Affinity 等創意工具的支援。
***
AI Twitter 回顧
OpenAI 的 GPT-5.5、Codex 擴展與網路能力評估
GPT-5.5 現已可靠地躋身長期網路任務的頂尖行列:英國 AI 安全研究所報告指出,GPT-5.5 成為第二個能端到端完成其多步驟網路攻擊模擬的模型。多個後續貼文強調,GPT-5.5 在此評估中與 Claude Mythos Preview 大致相當:@scaling01 引用 GPT-5.5 的平均通過率為 71.4%,而 Mythos 為 68.6%;@cryps1s 則指出 GPT-5.5 在 10 次嘗試中解決 TLO 鏈 2 次,而 Mythos 為 3 次。
@polynoamial 強調,在超過 1 億個推論預算代幣後,性能仍在持續提升,顯示尚未出現明顯飽和。這實質上改變了 Anthropic 在攻擊性網路自動化方面擁有獨特領先地位的早期說法。OpenAI 也藉此時機發布了產品端的安全更新:ChatGPT 的進階帳戶安全,增加了防網路釣魚登入和強化恢復功能。
Codex 正從程式編寫拓展至一般電腦工作:OpenAI 發布了重要的 Codex 更新,明確將其定位為「適用於所有人,可用於任何電腦上的任務」。主要公告強調了基於角色的引導流程、應用程式連接以及涵蓋文件、投影片、試算表、研究和規劃的工作流程。
@ajambrosino 將此次更新總結為動態任務專用使用者介面、電腦/瀏覽器使用速度提升 20%、更好的投影片/試算表處理以及更流暢的交接;而 @AriX 則指出,更新後電腦使用速度提升了 42%。Sam Altman 也為此次發布助陣,表示「Codex 今天有重大升級!
試試將其用於非程式編寫的電腦工作。」更廣泛的趨勢是:OpenAI 正在將「電腦使用代理模型」的使用者體驗產品化,而不僅僅是模型能力。
基準測試的差異雖是漸進式的,但具有經濟意義:Artificial Analysis 報告指出,GPT-5.5 Pro 在 CritPt 上略微超越 GPT-5.4 Pro,成為新的最先進模型 (SOTA)。但有趣之處不在於原始分數,而是在該前沿科學評估中,它以約 60% 更低的成本和代幣使用量實現了這一提升。
這與更廣泛的討論相符,即 GPT-5.5 系列的重點不在於戲劇性的智慧斷裂,而在於高價值工作流程中更強的可靠性和更高的效率。
開源模型動態:Qwen3.6、Tencent Hy3-preview、Grok 4.3 和 Ling 2.6 1T
Qwen3.6 27B 似乎是當日最重要的開源模型發布:Artificial Analysis 將 Qwen3.6 27B 評為 150B 參數以下開源模型的最新領導者,其智慧指數得分為 46,超越了 Gemma 4 31B 和先前的 Qwen 版本。
主要細節包括:Apache 2.0 授權、262K 上下文長度、原生多模態輸入,以及足夠小巧可在單一 H100 上運行的 BF16 權重。其配套的 35B A3B MoE 模型得分為 43,使其成為約 3B 活躍參數範圍內最強大的開源模型。
權衡之處在於其按輸出代幣計價的推論成本較高:AA 估計 Qwen3.6 27B 在該套件上使用了約 1.44 億個輸出代幣,運行成本約為 Gemma 4 31B 的 21 倍。儘管如此,就單位尺寸能力而言,這仍是一個顯著的進步。
騰訊的 Hy3-preview 具有競爭力但非領先:Artificial Analysis 將 Hy3-preview 描述為一個總參數 295B / 活躍參數 21B 的 MoE 模型,具有 256K 的上下文長度,並採用受限商業使用的社群授權。
它在 AA 的智慧指數上得分為 42,落後於 Qwen3.6 27B、DeepSeek V4 Flash 和 GLM-5.1 等近期開源模型。最有趣的亮點是 CritPt,它與 GLM-5.1 均達到 4.6%,表明其科學推理能力相對於整體排名而言表現較好。
xAI 的 Grok 4.3 在代理模型基準測試中顯著提升,同時成本更低:Artificial Analysis 測得 Grok 4.3 在智慧指數上得分為 53,較 Grok 4.20 v2 提升了四分,在 GDPval-AA 上大幅躍升至 1500 Elo。
AA 還報告稱,其輸入價格約降低 40%,輸出價格降低 60%。儘管該版本在 GDPval-AA 上仍大幅落後於 GPT-5.5,但這看起來是系統和後訓練方面的實質性改進,而非小幅修訂。
螞蟻集團的 Ling 2.6 1T 旨在追求成本效益而非前沿地位:Artificial Analysis 將 Ling 2.6 1T 定位為一個 1 兆參數的非推理模型,得分為 34,具有不錯的 GPQA/HLE 數據,且基準測試運行成本顯著低廉,約為 95 美元。但其可靠性是個問題:AA 報告稱其在 AA-Omniscience 上的幻覺率高達 92%。
DeepSeek 多模態/視覺工作、圖形使用者介面代理模型與訓練規模推測
DeepSeek 的多模態方向似乎與電腦使用代理模型緊密結合:@nrehiew_ 強調 DeepSeek 透過讓模型在推理過程中直接輸出邊界框和點座標,將視覺能力訓練到 V4-Flash 中,這被解讀為一種面向電腦使用的設計,而非通用的視覺語言模型 (VLM) 工作。第二篇貼文則認為,該論文的「視覺原語」任務直接對應到瀏覽器/電腦使用,而非廣泛的多模態理解。


