Anthropic 正在看到遞迴式自我改進 (RSI) 的火花,OpenAI 的 ChatGPT 終於在比預期晚了約五個月後,達到 10 億月活躍用戶 (MAU) 並改進了記憶功能。SpaceXAI 則向可能不知道自己將被迫購買其股票的人解釋其 IPO。
這些都比不上取得您的 AIEWF 門票和飯店,以及收聽最新一集與 Andon Labs 的播客!這是 2026 年 6 月 3 日至 6 月 4 日的 AI 新聞。我們檢查了 12 個 Reddit 子版塊、544 個 Twitter 帳號,但沒有進一步檢查 Discord。
AINews 的網站讓您可以搜尋所有過去的內容。提醒您,AINews 現已成為 Latent Space 的一個部分。您可以選擇接收或不接收電子郵件的頻率!
NVIDIA 的 Nemotron 3 Ultra 和 3.5 ASR 發布
Nemotron 3 Ultra 是當天最明確的技術發布:一個完全開源的 550B 混合專家 (MoE) 模型,擁有 55B 活躍參數、1M 上下文,並明確專注於長期運行的代理工作負載。NVIDIA 表示,對於代理任務,它的速度提高了 5 倍,成本降低了 30%,並在 OpenMDW 1.1 許可下發布了權重、合成資料、獎勵檢查點、量化版本和訓練配方 (NVIDIA 發布、NVIDIAAI 開源產物、Pavlo Molchanov 討論串)。
其架構結合了混合 Mamba/注意力機制、LatentMoE 和原生 MTP,並在 NVFP4 下透過 20 兆個 token 進行預訓練,這值得注意,因為它將低精度預訓練推向了新的規模領域 (技術說明、擴展討論)。
對於一個開源發布而言,基準測試和服務部署表現異常強勁。@ArtificialAnlys 使用 NVIDIA 推薦的 NVFP4 推論權重測量其智慧指數為 47.7 (BF16 下為 48.2),使其成為他們測試過最強大的美國開源權重模型,儘管仍落後於 Kimi K2.6。
更有趣的是,他們透過 BlackBox 報告了每秒 400 多個輸出 token,並在回合限制下的 Terminal-Bench 風格評估中,Nemotron 3 Ultra 在任務延遲與效能的帕累托前沿上表現出色 (延遲分析、BlackBox 吞吐量)。
該模型在發布當天就已在整個堆疊中提供:vLLM、Modal、Together、Fireworks、Ollama cloud、Baseten、CoreWeave/W&B、Cline、Prime Intellect 和 Nous Portal。
Nemotron 3.5 ASR 是一個較為低調但實用的配套發布:一個開源的串流自動語音辨識 (ASR) 模型,單一 0.6B 檢查點,支援 40 種語言-地區組合,延遲低於 100 毫秒,基於為語音代理和串流語音工作負載優化的具快取感知能力的 FastConformer / RNN-T 風格設計 (Piotr Zelasko、Together、fal 可用性)。
Anthropic 的遞迴式自我改進框架和內部 AI 程式碼指標
Anthropic 發布了當天討論最多的政策/研究報告,認為目前的系統顯示出遞迴式自我改進 (RSI) 的早期跡象,雖然尚未在研究方向上實現完全自主,但有明確證據表明 AI 正在加速 AI 發展 (Anthropic 貼文)。其主要操作主張具體如下:Anthropic 超過 80% 的合併程式碼現在由 Claude 編寫,典型工程師每季度交付的程式碼量比往年增加 8 倍,而在內部開放式工程任務中,Claude 的成功率在六個月內從約 26% 上升到 76% (程式碼指標、Alex Albert 摘要)。
最引人注目的實證數據是 Anthropic 定期進行的「加速小型模型訓練腳本」測試:Claude Opus 4 平均加速約 3 倍,而 Mythos Preview 據報導實現了約 52 倍的加速 (Anthropic 基準測試聲明、日期修正)。
Anthropic 還表示,在研究人員走錯方向的會話中,Mythos 在 64% 的時間裡提供了比人類更好的「下一步該怎麼做」的研究建議 (研究下一步結果)。他們更廣泛的論點是:自動化問題選擇仍未解決,但自動化大部分實作和迭代已經在發生。
治理角度與生產力主張同樣重要。Anthropic 明確指出「世界最好能有選擇減緩或暫時暫停前沿 AI 發展的選項」,並將驗證和協調機制視為如果 RSI 類動態持續下去,將變得越來越緊迫 (Anthropic 治理聲明、討論、評論)。這是在 @CRSegerie 批評 Anthropic 最近削弱了其負責任擴展政策中關於生物/化學風險的部分門檻之際發布的。
另外,一個由 Altman、Amodei、Hassabis 和 Baker 等人組成的聯盟支持在美國強制實施 DNA 合成篩選和記錄保存,認為 AI 正在侵蝕生物知識障礙 (信件摘要)。
Cloudflare 收購 VoidZero 並強化全端代理工具鏈
最大的開發者平台舉動是 Cloudflare 引入了 VoidZero,該團隊是 Vite、Vitest、Rolldown、Oxc 和 Vite+ 的幕後推手。Cloudflare 和 VoidZero 強調 Vite 仍然是開源、MIT 授權且供應商中立的,Cloudflare 還承諾向一個用於獨立 Vite 生態系統開發的基金捐贈 100 萬美元 (Cloudflare、Vite 聲明、Evan You)。
開發者的策略解讀是,這讓 Cloudflare 對日益代理友善的應用程式堆疊有了更緊密的控制:前端/建構工具、執行環境、儲存、推論、部署原語和安全性都集中在一處。@wesbos 將其描述為 Cloudflare 正在組裝「一個整潔的套件,可以交給 LLM 來建立網站」,這與 Cloudflare 自己在統一平台上推動代理、MCP、沙盒、AI 搜尋、支付和可觀察性的方向是一致的 (Cloudflare 代理文件概述)。
代理、協調器、記憶體和評估基礎設施
幾條推文指出,除了原始模型發布之外,「代理系統」層正在成熟。一個反覆出現的主題是,瓶頸越來越多地在於協調器/編排器,而不僅僅是提示詞工程。一個流行的片段將 Claude 程式碼工作流程總結為「我不再提示 Claude,我寫迴圈」,而 @omarsar0 描述了將動態工作流程逆向工程到他自己的編排器中,用於分支研究、驗證、分類、資料合成和評估生成。共同的想法是:高階控制迴圈,而不是單次提示,正在成為真正的工作單位。
圍繞這些迴圈的工具也得到了改進。LangSmith 沙盒正式發布 (GA),支援 Dockerfile 快照、互動式控制台、TCP 隧道和標準 Linux 工具。Hugging Face 推出了兩個相關概念:用於 Hub 上自訂核心的 Kernels 分發路徑 (公告) 和對將代理追蹤作為一級產物儲存的更強大支援,@ClementDelangue 也呼應了這一點。
@julien_c 發布了 SynthTraces,這是一個最小化的協調器,透過讓開源模型扮演程式碼代理,本地模型模擬使用者,生成了 2,000 多個合成程式碼代理會話追蹤。
評估也轉向了真實世界的代理工作。Arena 推出了代理競技場 / 代理模式,透過數百萬個即時會話測量代理效能,這些會話使用了網路搜尋、檔案系統、Bash 和圖像生成等工具。他們目前的排名將 GPT-5.5 列為第一,其次是 Claude Opus 4.7、GLM-5.1、Gemini 3.1 Pro 和 Kimi-K2.6,其方法論基於任務成功、可控性、恢復能力、使用者好評/抱怨以及工具幻覺,涵蓋 30 萬多個任務、200 萬多次工具呼叫和 4,000 萬行程式碼 (發布、方法論)。
在企業端,Cognition 為 Devin 引入了 AI 生產力保證,如果產品未能產生正向工程價值,最高可涵蓋 1,000 萬美元的使用量,這項保證由一個內部測量系統支持,該系統涵蓋了 258 個企業會話,任務時長最長達 64 小時以上 (保證、技術說明)。
記憶體、多模態和模型/基準測試更新
OpenAI 為美國的 Plus 和 Pro 用戶推出了更強大的 ChatGPT 記憶系統,具有記憶摘要、更多操控控制和 2 倍的記憶容量。該公司將此視為一個從儲存記憶到「夢境」再到當前系統的長期研究歷程 (OpenAI、控制、Christina Kim 解釋)。
相關的開發者端更新包括 Responses 和 Completions API 中的審核分數 (OpenAIDevs),以及一個廣泛分享的全新 Codex iOS 應用程式外掛演示,該外掛支援在瀏覽器中查看和測試應用程式並支援熱重載 (OpenAIDevs 演示)。
其他一些模型/資料發布也值得注意。Gemma 4 12B 作為本地程式碼模型替代品和高度壓縮形式持續受到關注:Unsloth 發布了一個 4.66 GB 的 2 位元 GGUF。@_philschmid 強調了一個關於 Gemma 4 如何在沒有單獨編碼器的情況下處理文字/圖像/音訊的架構解釋器。
在多模態研究方面,@skalskip92 指出 Molmo2 是 CVPR 上一個強大的開源 VLM 候選模型,支援影片指向、追蹤、計數和多圖像推理。對於文件理解,LlamaIndex 的 ParseBench 推出了一個開源基準測試,包含 2,000 多個人工驗證頁面和 167,000 多條測試規則,涵蓋表格、圖表、忠實度、格式和基礎 (基準測試公告)。
熱門推文 (按互動量篩選,與技術相關)
Anthropic 關於 RSI 和內部自動化:Claude 現在編寫 Anthropic 超過 80% 的合併程式碼,工程師交付的程式碼量增加 8 倍,該公司表示 AI 加速 AI 發展正變得可行 (Anthropic)。
OpenAI 記憶升級:為美國的 Plus/Pro 用戶提供更強大的 ChatGPT 記憶系統,具有摘要、操控控制和 2 倍的記憶容量 (OpenAI)。
Cloudflare + VoidZero:Cloudflare 引入 VoidZero 團隊,同時保持 Vite MIT 授權和供應商中立,並為生態系統設立 100 萬美元的開源基金 (Cloudflare、Vite)。
Nemotron 3 Ultra 發布:開源 550B/55B 活躍參數的混合專家模型,用於長期運行的代理,提供完整的配方和異常強勁的速度聲明 (NVIDIA)。
Cursor 畫布 + 上下文探索器:用於應用程式/報告/內部工具的可共享畫布,以及代理上下文消耗情況的互動式分解 (Cursor)。
google/gemma-4-12B · Hugging Face (活動:1610):Google DeepMind 發布了 google/gemma-4-12B,作為 Gemma 4 開源權重系列的一部分,該系列涵蓋 E2B、E4B、12B、26B A4B 和 31B 變體,具有密集型和混合專家 (MoE) 架構、指令微調/預訓練檢查點、多模態輸入、支援 140 多種語言的多語言功能,以及高達 256K token 的上下文視窗。
該貼文強調了原生系統角色支援、可配置的推理/思考模式、函數呼叫/代理使用案例、程式碼改進,以及透過 ggml-org 和 unsloth 的 GGUF 建構進行本地部署。一個熱門評論連結了 Maarten Grootendorst 的視覺指南,特別提到了該模型的「無編碼器架構」。
評論者主要對實際程式碼效能感興趣,其中一人明確表示希望測試 Gemma 4 12B 是否能在程式碼任務上擊敗 Qwen 3.5 9B。評論中沒有提供具體的基準測試結果。
Maarten Grootendorst 連結的技術指南強調了 Gemma 4 12B 的無編碼器架構,將其視為對模型內部結構感興趣的讀者來說一個值得注意的設計點。
幾位評論者將 Gemma 4 12B 定位為介於 E4B 等較小 Gemma 變體和 26B 等較大模型之間的實用尺寸級別,其中一位使用者還指出對其是否能在程式碼任務上超越 Qwen 3.5 9B 感興趣。
一個提出的技術問題是關於該模型明顯的音訊能力,推測如果多模態支援強大,這可能會使 Gemma 4 12B 對於語音/音訊翻譯工作流程有用。
Google 全新 Gemma 4 12B 聲稱接近 26B 效能 – 我們兩者都測試了! (活動:984):一項本地單一 RTX 4090 比較聲稱,Google Gemma 4 26B-A4B 使用 15 GB 顯示記憶體 (VRAM),以每秒 138 token 的速度生成 6.9k token,並在三個 HTML5 Canvas 物理程式碼任務(高爾頓板、雙塊碰撞和混沌三擺)上超越了 Gemma 4 12B,後者使用 9 GB VRAM,以每秒 80 token 的速度生成 8.9k token。
發布者認為,MoE 風格的 26B-A4B 模型儘管總參數更大,但由於只有約 4B 活躍參數,因此速度快了約 1.7 倍,而 12B 仍對 16 GB 筆記型電腦具有吸引力;該測試也用於推廣創辦人的本地 AI 應用程式 atomic.chat。
熱門評論者質疑聲稱的贏家,表示影片似乎顯示 Gemma 4 12B 在場景 2 和 3 中表現更好,其中一人詢問標籤是否顛倒了。另一位評論者要求提供與 Qwen3.6 35B-A3B 可比較的基準測試。
多位評論者質疑該測試結果。

.jpg)
