今天的播客來賓是一年多前 NVIDIA Cosmos 的主要負責人,當時討論了影片生成與世界模型的訓練。恰逢其時,Cosmos 3 今天正式發布,它採用了 Transformer 混合架構,將自迴歸推理器與擴散生成器結合,統一了語言、圖像、影片、音訊和動作。
Cosmos 3 包含 Nano (16B: 8B 推理器 + 8B 生成器) 和 Super (64B: 32B 推理器 + 32B 生成器) 模型,以及針對文字轉圖像和圖像轉影片的 Super 微調版本,這些模型現在已成為新的 SOTA 開放權重圖像和影片生成模型,僅次於 Nano Banana 2。
Ming-Yu Liu@liu_mingyu 介紹 NVIDIA Cosmos 3我們昨晚發布了 NVIDIA Cosmos 3。今天看到它在超過 8 個開放模型排行榜上名列前茅,感覺很不真實。我們為此努力了數月。以下是詳細資訊:排行榜上的勝利世界推理🏆 #1 開放模型 2026 年 6 月 1 日下午 7:10 · 15.6K 次瀏覽 · 10 則回覆 · 39 次轉發 · 225 個讚。
在台灣的 Computex 展會上,NVIDIA 執行長黃仁勳也帶來了 Nemotron 3 Ultra,這是一款 550B-A55B 的開放權重大型語言模型 (LLM),以其卓越的效率和速度成為美國新的 SOTA。最後,NVIDIA 還預覽了 RTX Spark 個人電腦,這是一款 1 petaflop 的超級晶片,並與 Microsoft、OpenClaw 和 Hermes Agent 合作作為發布夥伴。
(此處有詳細分析)NVIDIA RTX Spark@NVIDIARTXSparkRTX Spark 搶先預覽 👀個人 AI 代理。更快的創作者工作流程。RTX ON 遊戲。NVIDIA 的 Jacob Freeman 介紹了這款超級晶片如何在一系列新型輕薄筆記型電腦中實現所有功能。
👇 2026 年 6 月 1 日下午 6:05 · 93K 次瀏覽 · 42 則回覆 · 178 次轉發 · 1.66K 個讚。2026 年 5 月 30 日至 6 月 1 日的 AI 新聞。我們檢查了 12 個 subreddit、544 個 Twitter 帳號,沒有進一步的 Discord 資訊。
AINews 網站可供您搜尋所有過往議題。提醒您,AINews 現已成為 Latent Space 的一個專區。您可以選擇訂閱或取消電子郵件頻率!NVIDIA 的 Cosmos 3、Nemotron 3 Ultra 以及推動開放物理 AI 的努力NVIDIA 的開源週:NVIDIA 憑藉 Cosmos 3 在開放模型討論中佔據主導地位,Cosmos 3 是一個用於物理 AI 的全能世界模型開放系列,此外還宣布了 Nemotron 3 Ultra,這是一個 550B 的開放權重模型,許多發文者稱其為迄今為止最強大的美國開放模型。
Cosmos 3 被定位為一個全棧發布,包含權重、程式碼、資料集和微調配方,NVIDIA 還與包括 Runway 在內的合作夥伴共同推出了 Cosmos 聯盟,旨在為世界模型建立一個開放生態系統。@NVIDIAAI 生態系統背景,@runwayml 聯盟公告,@kimmonismus Cosmos 討論串,@ClementDelangue 關於 NVIDIA 在 Hugging Face 上的足跡。
Cosmos 3 在技術上的重要性:除了機器人技術的論述之外,更具體的細節是 Cosmos 3 在單一的 Transformer 混合設計中統一了語言、圖像、影片、音訊和動作,將自迴歸推理器與擴散生成器配對。Artificial Analysis 表示,Cosmos 3 在其文字轉圖像和圖像轉影片排行榜上均達到開放權重模型的第一名,並指出該生成器使用結構化的 JSON 提示詞,可以由外部提示詞升採樣工具或其自身的推理分支驅動。
此外,NVIDIA 的硬體加軟體推動也擴展到採用 OpenMDW 框架以及在 fal 等平台上的合作夥伴生態系統整合。@ArtificialAnlys, @fal。Nemotron 3 Ultra 的反響:社群對 Nemotron 3 Ultra 這個新發布的開放模型反應異常熱烈。
發文者強調了其能力和服務特性,包括聲稱它已在一些開放評估中名列前茅,並且在某些設定下可能以每秒 300 個 token 以上的速度提供服務,遠快於大型的 DeepSeek/Kimi 級模型。@scaling01, @ctnzr, @caspar_br。
也有一些技術討論指出,Nemotron 似乎比 Kimi K2 / DeepSeek V4 等同類模型更不稀疏,大約 10% 活躍度對比 3%,這可能會影響其經濟效益和行為。@eliebakouch。MiniMax M3、Qwen3.7-Plus 和 JetBrains Mellum2 擴展開放代理模型領域MiniMax M3 的發布是當天最大的模型發布:M3 被呈現為一個開放權重、多模態的代理/程式碼模型,具有 1M 上下文、原生多模態能力和具競爭力的代理基準測試表現。
發布合作夥伴重複強調的關鍵數據是 SWE-Bench Pro 59.0%、Terminal Bench 2.1 66.0% 和 MCP Atlas 74.2%。@MiniMax_AI, @PBDTokenRouter, @kimmonismus。
多個基礎設施供應商在發布當天就提供了支援,Novita、Vercel AI Gateway、Cloudflare AI Gateway、OpenClaude、Flowith 等,這表明生態系統的採用速度異常快。@MiniMax_AI on Novita, @rauchg, @gitlawb。
基準測試與實際體驗喜憂參半:M3 在前端生成、視覺/遊戲任務和性價比方面獲得好評,並透過並排演示展示了強大的一次性 UI/遊戲輸出,以及在 Next.js 代理評估中顯著的基準排名。@notjazii, @lostinlatencyX, @rauchg。
但一些評估者也報告了高 token 消耗、冗長的自我檢查循環以及在長期任務中偶爾出現的需求偏移,這使得 M3 看起來更像是一個「品質優先,效率其次」的模型。@ZhihuFrontier review, @teortaxesTex skepticism。
Qwen3.7-Plus:阿里巴巴推出了 Qwen3.7-Plus,這是一款多模態互動式混合代理,整合了 GUI 和 CLI 操作、視覺推理、程式碼編寫和搜尋增強型問答。它可透過 Alibaba Cloud Model Studio 的 API 取得,並迅速被添加到 Cline 等工具中。
@Alibaba_Qwen launch, @cline。這次發布強化了一個趨勢,即亞洲的半開放實驗室不再僅僅發布「聊天模型」,而是推出具備完整代理能力的多模態系統。JetBrains Mellum2:JetBrains 發布了 Mellum2,這是一個 12B 的 MoE 模型,具有 2.5B 活躍參數,經過約 11 兆個 token 的訓練,並透過 RLVR 進行後訓練,提供了基礎、SFT 和 RL 檢查點以及一份技術報告。
@nv_pavlichenko, @jetbrains。其預期的應用領域特別有趣:用於路由、RAG、子代理和 IDE 使用的超低延遲推理,並且它立即被整合到 vLLM 中。@vllm_project。這看起來像是一個嚴肅的「用於開發者工作流程的小型快速開放模型」,而不是一個追逐基準測試的前沿發布。
代理、沙盒、記憶體和搜尋正成為真正的產品介面技術棧正從模型呼叫轉向代理執行時:幾項發布都集中在一個觀點上,即主要的工程槓桿現在在於協調器 (harness) 而非模型本身。Perplexity 的「搜尋即程式碼 (Search as Code)」是最清晰的例子:模型不是進行迭代的搜尋工具呼叫,而是針對搜尋 SDK 編寫 Python 程式碼,從而實現自訂排名管道、索引上的 Map-Reduce、批次處理、聚合和更低的 token 開銷。
Perplexity 報告稱,採用這種架構後,其內部 WANDR 基準測試從 0.152 躍升至 0.386。@perplexity_ai, @AravSrinivas。託管代理 + 沙盒正成為標準:Google 在 Gemini API 中詳細介紹了託管代理 (Managed Agents),其中單一 API 呼叫即可啟動一個代理,該代理能夠推理、編寫/執行程式碼、管理檔案,並在託管的 Linux 沙盒中運行。
_philschmid, @GoogleAIStudio。LangChain 也推動了 Deep Agents、Context Hub 和 LangSmith Sandboxes/Engine 等類似概念,強調持久上下文、代理生命週期工具和自動故障分類。
@LangChain, @hwchase17。記憶體仍是缺失的基本功能:一個常見的抱怨是,巨大的上下文視窗仍然無法解決跨會話記憶體問題。HydraDB 上的一個討論串認為,「RAG + 手動上下文注入」被錯誤地稱為記憶體,而實際的持久會話知識仍未得到充分服務。
@kimmonismus。相關研究討論指向了可重複使用的上下文管理策略,例如 AdaCoM,它透過強化學習訓練一個獨立的 LLM,用於修剪/保留凍結代理的上下文。@dair_ai。安全性仍是企業代理的關鍵問題:Microsoft Security Intelligence 發出了一項值得注意的警告,指出 npm 供應鏈發生重大漏洞,影響了 90 多個 redhat-cloud-services 套件,其中包括一個竊取 npm/GitHub/AWS/SSH 憑證的自我複製蠕蟲。
@MsftSecIntel。同時,企業代理供應商強調沙盒化、執行時隔離和安全堆疊整合是部署的先決條件,包括討論 NVIDIA OpenShell 和 LangChain 的沙盒主題演講。@shannholmberg, @LangChain。
Codex、Claude Code 和競爭激烈的程式碼代理競賽OpenAI 將 Codex 擴展到更多地方:OpenAI 宣布其前沿模型和 Codex 現已在 AWS / Amazon Bedrock 上全面推出,直接面向希望在現有 AWS 安全/合規工作流程中利用 OpenAI 功能的企業。
@OpenAI, @OpenAIDevs。OpenAI 還發布了 Codex Python SDK,支援執行緒、輪次、串流、恢復、圖像和沙盒控制,@reach_vb,以及對 Bedrock 支援的 Codex 工作流程的支援。@reach_vb on Bedrock config。
Claude Code 發生實際運營事故:Anthropic 在修復了一個錯誤後,重置了 Pro 和 Max 用戶的 5 小時和每週速率限制,該錯誤導致某些 Opus 4.8 會話產生過多的並行子代理/工具呼叫,意外地消耗了大量使用量。@ClaudeDevs,後續報導。
這是一個值得注意的提醒,程式碼代理的產品品質越來越取決於其協調行為,而不僅僅是原始的模型智商。程式碼模型之間的行為差異仍然顯著:開發者強調了 GPT、Claude 和其他模型在 ProgramBench 和 WeirdML 等基準測試上的巨大質性差異,其中 Opus 有時更偏好探索而非分數最大化,或表現出特定於基準測試的怪癖。
@OfirPress, @htihle。另一個長討論串認為,較新的 Claude Opus 4.6–4.8 版本可以在非程式碼領域捏造出看似合理但虛構的概念,這表明可能存在真實性/對齊性退化,而非一般的幻覺。@distributionat。
基礎設施、硬體和本地 AI 系統NVIDIA 進軍個人電腦市場:討論最多的硬體發布是 RTX Spark,這是一款 NVIDIA/Microsoft 的「個人 AI 電腦」,圍繞 Grace + Blackwell 架構打造,配備高達 128GB 的統一記憶體,並聲稱達到 1 PFLOP FP4 性能。
關鍵的戰略解讀是:NVIDIA 不再僅僅銷售加速器,而是提供一個端到端的本地 AI 系統,同時與 Apple Silicon、x86 PC 和 Qualcomm 競爭。@kimmonismus, @swyx。叢集/網路更新:在資料中心方面,Lambda 表示它率先採用 NVIDIA Quantum-X InfiniBand Photonics Q3450-LD 交換機,推動共同封裝光學技術,以減少大型 AI 叢集中的網路功耗和故障。
@LambdaAPI。OpenAI 也宣布了 Stargate Michigan 專案,這是一個規劃中的 1GW 資料中心,將採用閉環冷卻系統,並結合勞動力/教育承諾。@OpenAINewsroom。本地開放模型工具正在快速改進:MLX-VLM v0.6.0 的發布是更具實質性的本地推理/工具更新之一,增加了推測解碼、Anthropic 風格和回應風格的 API、工具呼叫、對許多新多模態模型的支援,以及圖像/音訊功能,明確的目標是將 Apple 設備轉變為「真正的本地代理機器」。
@Prince_Canuma。這與不斷增長的 DGX Spark + vLLM 實驗相得益彰,用於本地 NVFP4 MoE 服務。@vllm_project。熱門推文 (按互動量篩選,與技術相關)Anthropic 的 IPO 之路:Anthropic 表示已秘密向 SEC 提交了 S-1 草案,為等待審查的 IPO 開啟了大門。
@AnthropicAI。Claude Code 使用事故:Anthropic 在修復 Opus 4.8 並行子代理/工具呼叫錯誤導致配額過度消耗後,重置了用戶速率限制。@ClaudeDevs。Qwen3.7-Plus:阿里巴巴發布了一款多模態代理模型,涵蓋 GUI/CLI 操作、程式碼編寫和視覺任務。
@Alibaba_Qwen。OpenAI on Bedrock:OpenAI 模型和 Codex 現已透過 Amazon Bedrock 提供給企業工作流程。@OpenAI。ARC-AGI-3 進展:Claude Opus 4.8 在 ARC-AGI-3 上取得了 1.5% 的新 SOTA,雖然絕對值仍然很小,但在該基準測試上是一個有意義的飛躍。
@arcprize。MiniMax M3 - 程式碼與代理前沿,1M 上下文,多模態 (活動量:1090):MiniMax M3 被宣布為一個開放權重的前沿模型,專注於程式碼編寫/代理,具有原生多模態/視覺能力,並採用 MiniMax 稀疏注意力,上下文長度可達 1M token,保證最低 512K。聲稱的長期代理結果包括 12 小時。



