今年我們最常討論的主題之一,就是程式編寫代理突破限制,進入知識型工作領域。顯然,AI 隊友、多人協作及多代理空間將是 AI 領域的下一個主要戰場。儘管 Claude Tag 推出後評價褒貶不一,且 Block 的 Buzz 需要更專業的用戶,市場仍期待新的類別領導者。現在由 Cursor 轉型而來的 SpaceX 團隊,巧妙地推出了 Grok Bot,並獲得了非常正面的評價。

Grok Bot 是一個 AI 隊友,能為你完成實際工作。它們可以登入你的工具,像你一樣使用它們,並帶回完成的工作。這項服務由他們最新發布的 Grok 4.6 模型驅動,該模型被認為是全球第二好的知識型工作模型(競爭對手 Cognition 和 Elon 都認可),但在效率方面無疑是頂尖的。

根據 Artificial Analysis 的報告,Grok 4.6 在我們的代理式知識型工作基準測試 AA-Briefcase 上取得了巨大進步,且成本遠低於其他領先模型。AA-Briefcase 專門測試模型在長期代理式知識型工作任務上的表現,其測試集為私有,以防止數據污染。

Grok 4.6 已確認是一個 1.5 兆參數的模型,它「在 Grok 4.5 的基礎上,特別專注於長期運行的代理以及更具野心的互動和視覺工作」。其訓練細節披露如下:Grok 4.6 進行了比 Grok 4.5 更長的補充訓練,使用了為推理和進階技術概念精心策劃的模型生成數據、高品質工程數據,以及改進的優化器和訓練配方。這為後續的 SFT(監督式微調)和 RL(強化學習)階段奠定了更堅實的基礎。

我們隨後使用 Grok 4.5 重新生成了推理工作、代理框架以及 STEM、軟體工程和知識型工作等領域的 SFT 軌跡,並透過模型檢查過濾掉有問題的痕跡。最終的 SFT 檢查點展現出強勁的性能和改進的行為。Grok 4.6 針對廣泛的代理式強化學習任務進行了訓練,包括知識型工作、通用程式編寫,以及核心優化、網頁開發、電腦輔助設計等領域專屬的環境。

目前尚不清楚 Grok 4.6 在訓練過程中沒有發生沙盒逃逸事件,是歸功於他們的基礎設施工程師,還是對其研究人員的諷刺。(這是一個關於時事的小玩笑,別生氣)

Grok 4.6 在性價比上達到前沿水準:xAI 發布了 Grok 4.6,稱其為 4.5 版本的重大升級,但價格不變。根據 Artificial Analysis 的獨立評估,它在智慧指數上達到 61 分,大致與 GPT-5.6 Sol Max 持平,略低於 Claude Opus/Fable。

它在代理任務上表現強勁,包括在 Terminal-Bench v2.1 上達到 88.4%,GDPval-AA v2 Elo 達到 1753 分,並在 AA-Briefcase 測試中以遠低於競爭對手的成本展現出競爭力。

Code Arena 的早期數據也顯示,Grok 4.6 在網頁開發任務上與 GPT-5.6 Sol 和 Claude Fable 不相上下。定價是其核心優勢:Artificial Analysis 強調其每百萬輸入/輸出 token 的價格分別為 2 美元和 6 美元,遠低於其他前沿模型。

業界人士立即將其視為程式編寫和錯誤查找工作負載的新預設選擇。xAI 表示,這些進步來自於更長的補充訓練、重新生成的 SFT 軌跡,以及在程式編寫、網頁、CAD 和核心優化方面的代理式強化學習。他們還報告在長期任務中模型展現出更多的自我測試行為。

Elon 也透露 Grok 4.7 已經在開發中,初步訓練已完成,並計劃在 SpaceX 內部數據上進行補充訓練。

Qwen3.8-Max 開源模型發布:阿里巴巴的 Qwen3.8-Max 作為一個總參數 2.4 兆、活躍參數 950 億的 MoE(混合專家)開源模型正式推出。社群強調其規模、即時服務能力以及對長上下文和代理任務的導向。Yuchen Jin 稱其為迄今為止最大的開源模型之一;vLLM 在發布當天就提供了支援,並為 NVIDIA B300 和 AMD MI355X 提供了供應商特定的 4 位元檢查點;Together AI 和 Baseten 也宣布立即支援。

然而,用戶指出一個重要限制:發布的開源版本似乎僅支援文本輸入,初期不包含視覺輸入。

DeepSeek V4 Pro GA 以低價搶市:DeepSeek 的 V4 Pro GA 發布立即引起關注,原因並非其在所有基準測試中都表現最佳,而是其經濟效益。多位觀察者指出其定價約為每百萬輸入 token 0.435 美元,每百萬輸出 token 0.87 美元。

Cline 稱其比 Fable 5 便宜約 57 倍,同時報告相較預覽版有顯著提升,包括 Terminal Bench 增加了 15.8%。對於其能力,市場反應褒貶不一:一些早期用戶認為它表現穩健,但在所有任務上並未明顯超越 Kimi/Flash,這表明 DeepSeek 未來的進步可能更多取決於強化學習環境和代理工作,而非單純的規模擴大。

微軟推出自己的推理模型:Mustafa Suleyman 宣布推出 MAI-Thinking-1,這是微軟首個「從零開始構建」的推理模型,現已在 Foundry 中提供。該團隊最初的要求非常實用,Finbarr Timbers 特別徵求了關於工具使用的回饋,這表明微軟將其定位為一個應用型推理模型,而不僅僅是為了基準測試而存在。

Solar Pro 4 也晉升一級:Artificial Analysis 報告指出,Upstage 的 Solar Pro 4 在智慧指數上從 14 分躍升至 42 分,在代理和長上下文任務上取得了特別大的進步,儘管在原始分數和價格方面仍落後於當前頂級的前沿模型和開源領導者。

LTX-2.5 和開源視訊堆疊持續改進:@RisingSayak 強調 Lightricks 的 LTX-2.5 已整合到 Diffusers 中,並帶來了多項對本地工作流程至關重要的實用功能:聯合視訊與 48 kHz 音訊生成、提示詞控制的片段長度、雙通道品質模式、用於降低記憶體使用的磁磚渲染,以及重新壓縮輸入圖像以更好地匹配訓練數據的預處理功能。

Ostris AI Toolkit 在同一天也增加了支援。更廣泛地說,許多報導將本週視為開源多媒體發布的異常強勁時期,包括 MiniMax H3、LTX-2.5、LFM2.5-VL-3B 和 North Micro Vision。

小型 VLM 和本地多模態模型日趨成熟:Cohere 推出了 North Micro Vision,這是一個 Apache-2.0 許可的開源小型 VLM,旨在用於文件理解,並聲稱在廣泛的視覺基準測試組合中超越了 Gemma 4 E2B 和 Ministral 3 3B。

Liquid AI 的 LFM2.5-VL-3B 也被多次提及為一個強大的緊湊型視覺模型,用戶展示了混合本地/遠端代理堆疊,例如 Hermes Agent 使用 DeepSeek V4 Flash 進行規劃,並結合 LFM2.5-VL-3B 進行本地視覺處理。

語音和手語發布內容豐富:Google DeepMind 宣布推出 SL2T,這是一個手語轉文字系統,支援 Android/Pixel 11 上的 ASL(美國手語)輸入。其技術細節引人入勝:身體姿態追蹤在裝置端進行,翻譯則在伺服器端運行,且該系統針對單手手語等實際限制進行了優化。

此外,Deepgram 推出了 Flux TTS,這是一個低延遲的對話式 TTS(文字轉語音)模型,聲稱響應時間約為 80 毫秒,並能為語音代理提供通話中適應功能。

vLLM 為巨型模型和長提示詞增加了重要基礎設施:vLLM 現在支援 Azure Blob 路徑,用於模型載入和 KV 連接器。微軟/NVIDIA 的方案在操作上至關重要:透過 Dynamo ModelExpress 加快權重載入(在 H100/A100 上最高可達 7.3 倍),並透過 LMCache + NIXL 實現 Blob 支援的 KV 快取,在長提示詞工作負載中以重新計算換取資料提取。

壓縮技術延長了超大型模型的使用壽命:LLM Compressor v0.13.0 增加了針對 MoE 模型的 REAP 專家修剪功能,可在量化之前根據校準顯著性捨棄整個專家,並支援任意 3/5/6/7 位元量化。在更極端的案例中,Unsloth 聲稱透過動態 1 位元量化,將 Qwen3.8-2.4T-A95B 從 4.9 TB 縮小到 397 GB,使得在 410 GB 以上 RAM/VRAM 系統上進行本地執行成為可能。

他們還展示了一個 2 位元 Nemotron 3.5 Lightning 設定,可以在 22 GB VRAM 中維持長時間的工具使用會話。

GPU 核心編寫變得更安全、更具宣告性:maharshii 強調了 CuTeDSL 4.7.0 任務排程核心,它允許開發人員明確宣告 warp 角色、資源、依賴關係和排程,從而在轉換為 GPU 程式碼之前,對死鎖、競爭條件和屏障初始化進行靜態檢查。

同一作者還發布了一篇簡潔的解釋,闡述了 TMA 非同步複製背後的先決條件,包括獲取/釋放語義、記憶體屏障和 CuTe 算術元組,以幫助人們理解現代 NVIDIA 記憶體移動原語。

經典推薦/排名堆疊仍默默取得成功:François Chollet 指出 Expedia 遷移到現代 Keras 3 設定,報告排名模型的訓練速度提高了 30%,推論延遲降低了 70%。他隨後強調了一個更具戰略性的觀點:Keras 的後端無關 API 減少了鎖定效應,如果團隊日後需要 PyTorch 或 JAX 核心,也能更靈活地切換。

模型上層的堆疊正成為主要產品介面:多條推文都指向同一個主題:許多實際的效益來自於框架工程、記憶體管理、審批、評估和工具,而非客製化的模型訓練。Scott Stevenson 重申了 RAG(檢索增強生成)和框架工程在大多數情況下優於模型訓練的論點,因為它們能針對每個客戶進行個性化、避免隱私風險、即時改進並繼承基礎模型的進步。

Random Walker 則對委託代理和協作代理進行了有用的產品區分,兩者在可驗證性、延遲和人類控制方面有著截然不同的優化目標。

工具發布反映了這一轉變:GitHub 的 @code 推出了 Agent Plugins 1.0,將技能、MCP 伺服器和 AI 擴展功能整合在一起,並另外發布了使用者體驗改進,例如固定捲動和更好的會話處理。OpenAI/Codex 方面也展現出動能,包括為 Linux 推出的 Codex。LangChain 重建了 LangSmith 儀表板,以提供更有用的追蹤分析和報告。

記憶體和可攜式代理狀態正成為基本期望:Hermes Agent 獲得了多項生態系統更新,從 Raspberry Pi 部署到輕鬆的設定檔匯出/匯入,以及從觀察到的網路流量生成可重複使用 API 的新技能。LangChain 的 Managed Deep Agents 範例則明確關注持久記憶體和重複性工作流程,例如社群媒體代理。

代理的安全和治理變得具體化:W&B 展示了一個並排的代理電子郵件範例,其中一個代理洩露了社會安全碼/信用卡資訊,而另一個則在模型看到之前阻止了提示詞注入並編輯了機密。Turing Post 提出了一個更具架構性的問題,關於委託身份:如果代理直接使用你的 SaaS 憑證,那麼撤銷和審計將變得模糊不清。

AI 輔助數學和科學的聲稱越來越難以忽視:最受關注的技術推文是 Steven Strogatz 分享的一個故事,據稱一名神經外科住院醫師使用 ChatGPT 5.6 解決了數值線性代數中一個重要的開放問題。