Meta-Harnesses 的簡短歷史鮮為人知,但大致上是從 Conductor 和 Zed 的 ACP 開始,接著出現了 OpenInspect、Cloudflare 的 Flue,然後是 Vercel 的 Eve 和 HarnessAgent,以及 Heypi。

值得注意的是,本期 podcast 的來賓 Matei Zaharia,Databricks(一家在大型語言模型時代前就非常成功的公司)的技術長,現在正大力押注於 meta-harnesses。他的 Omnigent 是一個開源、可插拔的架構,能將任何程式編碼或知識工作代理人整合到標準化、安全、可靠且可擴展的系統中。

目前尚不清楚 Omnigent 是否具備讓 MCP 成功不可或缺的要素,但在架構層面上,類似這樣的開源架構很可能會勝出,原因僅僅是它目前正被上千家 AI 原生公司獨立地重新發明。

OpenAI 深入硬體領域:OpenAI 宣布推出 Jalapeño,這是他們首款用於大型語言模型推論的客製化 AI 晶片,與 Broadcom 合作打造,旨在用於 ChatGPT、Codex、API 流量和未來的代理人產品。其策略訊息很明確:擁有更多堆疊,晶片、核心、記憶體、網路、排程、部署,以減少運算經濟和產品行為對商用 GPU 供應的依賴。

@gdb 強調了其強大的每瓦效能,而 @kimmonismus 則指出其報告的 9 個月從設計到流片的週期,這對於高效能 ASIC 來說異常快速,據稱是透過 OpenAI 自己的模型加速完成的。社群逆向工程顯示 Jalapeño 看起來類似 TPU:@scaling01 估計其晶片尺寸接近光罩極限,約 216GB HBM3E,頻寬約 7.1–7.4 TB/s,以及約 10 PFLOPS FP4 浮點運算能力。

即使這些數字仍未經官方證實,但這表明超大規模推論晶片已成為頂尖實驗室的必備條件。同一天也重塑了編譯器/執行時環境的格局:Chris Lattner 宣布 Qualcomm 將收購 Modular,而 Modular 表示 Mojo 的開源計畫仍在進行中。這項結合預示著垂直整合推論堆疊的競爭將更加激烈,不再僅限於 NVIDIA/CUDA。

服務和吞吐量仍是活躍的戰線:在基礎設施方面,NVIDIA 表示 NeMo AutoModel 透過 Expert Parallelism、DeepEP 和 TransformerEngine 核心,為 MoE 模型提供了 3.4–3.7 倍更高的訓練吞吐量。

SkyPilot 推出了 Endpoints,用於跨自有叢集的統一推論,而 Modal 聲稱其開源推論設定在延遲方面優於專有供應商。對於本地優化,@jon_durbin 報告透過訓練客製化 DFLASH 草稿/預測模型,實現了 30–50% 的實際解碼增益。

Anthropic 的 Slack 原生代理人模型是重要的使用者介面故事:多條推文都指出 Claude 嵌入 Slack/團隊工作流程的重要性。@karpathy 認為人們低估了它,因為它不只是一個「功能」或 Slack 機器人,而是一個組織層級的協作工具。

@gallabytes 形容從 Claude Code 作為「配對夥伴」到 Tags 作為「管理團隊」的體驗飛躍。@dabit3 更進一步提出:最終,你甚至可能不需要明確標記代理人。

困難之處在於身份、權限和鎖定:Anthropic 在此討論串中詳細說明了其代理人身份模型:Claude 擁有自己的憑證,所有操作都可以在該身份下進行審計,並且可以集中撤銷存取權限。這種設計既受到讚揚也引發擔憂。@KentonVarda 認為明確的每個代理人權限設定無法擴展,並提倡使用基於能力的安全性,提供細粒度、任務範圍的存取權限。

@random_walker 將 Claude Tag 描述為「一個能記住一切並按思維計費的同事」,警告一旦共享代理人深入嵌入組織工作流程,可能會導致隱性知識鎖定、提示詞注入風險和預算不透明。@JubbaOnJeans 也類似地指出寫入操作的歸屬模糊性,以及在清晰的 Slack 類邊界之外未來存取控制的複雜性。

開源/DIY 的回應立竿見影:Hugging Face 在一篇部落格推文中描述了其內部基於 Slack 的程式碼代理人 Moon Bot,強調自託管、客製化工具、可審計的會話和零鎖定。@calebfahlgren 的後續推文列出了涵蓋 GitHub、Athena、分析工具、MongoDB、Elasticsearch 和 HF Buckets 的生產整合。

更大的趨勢是:團隊越來越需要代理人原生的使用者體驗,但許多人寧願擁有協作工具和記憶體層,也不願將組織智慧外包給供應商。

Qwen-AgentWorld 推動代理人的「語言世界模型」:阿里巴巴的 Qwen 推出了 Qwen-AgentWorld,將其定位為一個原生的語言世界模型,在單一模型中模擬了 7 種環境,MCP、搜尋、終端機、SWE、網路、作業系統、Android。

Qwen 聲稱有兩條路徑:一是建立模擬器本身,二是將世界建模作為代理人預訓練。他們開源了 Qwen-AgentWorld-35B-A3B 和 AgentWorldBench,其中包含一個 35B MoE / 3B active、256K 上下文的模型。

一個顯著的結果是:單輪環境預測可以轉移到多輪代理人任務,並在領域內和領域外基準測試中都取得了進步,如這篇後續文章所總結。OpenThoughts-Agent 貢獻了一個嚴謹的開源資料配方:@iScienceLuvr 和 @RichardZ412 強調了 OpenThoughts-Agent,這是一個用於代理人模型的開源策展/訓練流程,具有 100 多種受控消融實驗。

該團隊建立了一個 10 萬個範例的訓練集,並微調了 Qwen3-32B,在七個代理人基準測試中平均準確度達到 44.8%。

這些關鍵發現對實踐者很有用:指令選擇的影響不成比例地大,最強的基準測試教師不等於最好的教師,更長的執行追蹤有幫助,以及來源多樣性勝過大規模的過度重複。記憶體正轉變為一流的系統層:許多高信號討論都集中在記憶體作為代理人尚未解決的問題上。Weaviate 的 Engram GA 將記憶體定義為非同步基礎設施,用於提取、去重、協調和限定記憶體,而不是將所有內容都傾倒到上下文中。

@hwchase17 展示了一個 LangSmith/Context Hub 工作流程,用於「睡眠時間運算」,其中追蹤在離線狀態下進行分析並寫回記憶體。@dair_ai 指出了一篇論文,認為代理人記憶體應被評估為一個完整的資料管理層,儲存、檢索、更新、整合、生命週期,而不是一個僅憑最終任務成功來判斷的黑盒子。這正日益成為代理人差異化的方向。

GLM-5.2 持續主導開源模型討論:多條推文將 GLM-5.2 定位為目前最強的開源權重競爭者。CoreWeave 表示它在 Artificial Analysis 和 Agent Arena 的開源模型排名中名列前茅,而 Baseten 和 Cursor 的可用性顯示其快速的服務/分發採用。

@nutlope 將 GLM 5.2 與 Opus 4.8 在網路任務上進行比較,報告品質相似,約 2 倍的 token 輸出,但速度更快且成本約便宜 3 倍。Arena 也表示 GLM-5.2 Max 在 Code Arena:Frontend 中領先強勁的競爭者。

基準測試的細微差別很重要:GLM-5.2 也出現在 ARC-AGI-2 上。@fchollet 稱其為迄今為止開源模型在 ARC-AGI-2 上最強的結果,而其他人則爭論其 22.8% 相對於西方頂尖模型究竟意味著什麼。更廣泛的啟示並非關於任何單一基準測試,而是關於中國開源模型在程式編碼、代理人和知識工作領域始終「在場」的事實。

商業化和基礎設施加速:Moonshot 的 Kimi API 現已在 AWS Marketplace 上架,透過整合帳單和 EDP 提款簡化了企業採購。同時,中國國內運算仍是一個主要議題:@teortaxesTex 指出有報導稱華為可能展示一個 950 SuperPOD 規模的系統,這意味著大規模生產國內 NPU 叢集。如果屬實,這將實質性地改善中國模型服務生態系統的經濟效益和韌性。

Anthropic 仍處於政策爭議的中心:@kimmonismus 報導了對川普時代 AI 出口管制的第一個重大法律挑戰,Legion 聲稱託管模型存取不等於出口權重或技術資料。同時,備受討論的 Mythos 故事獲得了更多背景資訊:路透社/美聯社在此總結的細節表明,Anthropic 的模型在受限測試中發現了美國敏感系統中的漏洞,儘管一些評論員警告早期的報導可能被誇大了。

蒸餾和存取控制正成為地緣政治問題:@kimmonismus 還報導了 Anthropic 指控與阿里巴巴相關的營運商使用約 25,000 個欺詐帳戶和 2880 萬次 Claude 互動,將頂尖功能蒸餾到 Qwen 級系統中。如果屬實,這將把「對抗性蒸餾」的爭論從謠言升級到更接近執法和國家策略的層面。

人才和新實驗室:這一天也帶來了人才流動和新機構的成立。Arthur Conmy 加入 Anthropic 在對齊方面值得關注。Mirendil AI 以 2 億美元的種子輪融資啟動,其宗旨是加速科學領域的 AI 研發。

在英國,BOLD Lab 和 SOFAIR 獲得了 6000 萬英鎊的種子資金,用於兩個新的國家基礎 AI 實驗室,其中 UCL DARK 併入 BOLD。而在商業方面,彭博社報導 Google DeepMind 的員工流向 Anthropic,凸顯了新創公司的潛力持續吸引頂尖人才。