「Latent Space」通常避免討論通用人工智慧(AGI)的時間表,因為其定義模糊且難以衡量,但在目前這個時間點,忽略它可能更糟。我們上次檢視 OpenAI 的 AGI 時間表是在九個月前,而現在,首席科學家 Jakub Pachocki 正按計畫表示,尚未發布的 Astra 模型將是他們預計在 2026 年 9 月前實現的「自動化 AI 研究實習生」。
Sam Altman 在接受《時代》雜誌採訪時更進一步,估計他們將在 2026 年 12 月前內部宣布 AGI 達成。OpenAI 領導層相信他們正處於 AGI 的門檻,Mark Chen 認為 OpenAI 已經完成了 80% 的進度。
在硬體發布方面,Pollen Robotics 和 Hugging Face 推出了一款引人注目的產品 Microduck,這是一款 25 公分高的開源雙足機器人,售價 399 美元,預計在聖誕節前出貨。它擁有 15 個致動器和豐富的感測器堆疊,包括攝影機、揚聲器、光達、NFC、藍牙和 Wi-Fi,可以在模擬環境中訓練並部署到實體機器人上。
Pollen Robotics、Thom Wolf 和 Clément Delangue 的發布貼文強調了基於強化學習的客製化功能,以及多種預訓練策略。其技術重要性不僅在於「便宜可愛的機器人」,更在於其開放的模擬器、從模擬到硬體的轉移能力,以及足夠低廉的價格,鼓勵社群進行策略訓練而非僅僅是示範消費。
在模型方面,最大的新聞之一是神秘模型 Ox Alpha 被證實為 Z.ai / Zhipu 的 GLM-5.3-Flash。其公開規格顯示總參數為 320B,活躍參數 18B,上下文長度 1M,並採用混合注意力機制,在程式碼編寫和代理基準測試中表現出色。
該模型的發布引起廣泛關注,因為人們迅速將其應用於本地工作流程。Unsloth 表示,該模型可以在 128GB 記憶體上運行 3-bit GGUF,而 Daniel Han 則聲稱 4-bit 量化能保持 93% 的準確性,使其在 256GB Mac 或兩台 DGX Sparks 上實用。這正是開源模型工程師所關心的發布後生態系統反應:量化、服務方案和實際部署限制幾乎立即到位。
Google 發布了 Gemini Omni 1.1 Flash,這是一個多模態影片生成與編輯模型,提供多項開發者控制功能,包括場景延伸至 40 秒、首尾影格控制、3 秒影片參考、360p 草稿模式和 4K 升級。Google 正在暴露越來越明確的時間和參考條件控制,而非僅僅是「更努力地提示」。
在排行榜上,Omni 1.1 Flash 在文字轉影片競技場中排名第一,在圖片轉影片競技場中排名第二,領先第三名文字轉影片模型 20 分,並比之前的 Gemini Omni Flash 在圖片轉影片方面提升了 25 分。同時,fal 與 MiniMax 合作推出了 H3 Max,宣稱能在 5 秒內生成 15 秒高品質影片,比其他高品質模型快 50 倍。
代理(Agent)的協調框架(harness)正日益成為核心。JIT-Agent 透過模型合成記憶體、規劃、行動協議和工具協調模組的框架,報告了優於現成代理的成果。Anthropic 發布了將 Claude Managed Agents 連接到 Vercel Chat SDK 的指南,提供統一的聊天層,包含伺服器端框架、會話管理和記憶體。
Perplexity 在 Agent API 中增加了 GitHub、Slack、Google Drive 和 Datadog 的連接器。Cursor 宣布了一個工作流程,用於創建網路應用程式、使用 Origin 儲存程式碼並部署到 Vercel。
Nous 推出了 Hermes Agent,顯著提升了瀏覽器使用代理的功能,它現在可以像使用者一樣瀏覽,使用使用者真實 Chrome 設定檔和登入資訊的受管副本。
OpenAI 牽頭成立了一個網路防禦聯盟,發布了一封由 Anthropic、AWS、Google、Microsoft 和 Oracle 等 116 個組織簽署的公開信,呼籲全球加強對 AI 驅動攻擊的網路防禦。Sam Altman 強調「行動時間不多了」。
Google DeepMind 宣布了一項針對前沿 AI 模型的雙盲評估試點計畫,使用安全環境,不透露測試提示詞或模型權重。關於 OpenAI/Hugging Face 代理事件的討論仍在繼續,研究人員分享了大量轉錄掃描、代理間協作模式以及後續群體基於早期工作的細節。

.jpg)
