當我們將 AINews 轉移到 Substack 時,我們承諾每天都會提供 Matt Levine 風格的評論文章,但有時確實沒什麼大事發生,我們也會如實告知。我們正在撰寫關於推論需求和多代理的小型文章,但今天並非發布之日。

NVIDIA Nemotron、Poolside 和 Alec Radford 發布了一些有趣的模型,但目前尚不清楚它們是否能經受時間的考驗。同時,關於 GPT-6 的炒作也已開始浮現。

這是 2026 年 4 月 27 日至 4 月 28 日的 AI 新聞。我們查閱了 12 個 subreddit、544 個 Twitter 帳號,並未進一步查看 Discord。AINews 的網站允許您搜尋所有過往的報導。提醒您,AINews 現已成為 Latent Space 的一個專區。您可以選擇訂閱或取消訂閱電子郵件通知頻率!

推論系統、vLLM 0.20 與 DeepSeek V4 的硬體/核心競爭

vLLM 的最新版本主要圍繞記憶體和 MoE 服務效率:vLLM v0.20.0 推出了 TurboQuant 2-bit KV 快取,將 KV 容量提升 4 倍;在 SM90+ 上重新啟用 FA4 進行 MLA 預填充;引入了新的 vLLM IR 基礎;融合了 RMSNorm,據報導端到端延遲改善了 2.1%;並更新了對 Blackwell 上的 DeepSeek V4 MegaMoE、Jetson Thor、ROCm、Intel XPU 以及更簡便的 GB200/Grace-Blackwell 設定的支援。

同時,SemiAnalysis 強調了 DeepSeek V4 Pro 在 B200/B300/H200/GB200 分散式設定上的早期服務結果,聲稱 B300 在此工作負載下比 H200 快上 8 倍,並指出即將進行的 vLLM 0.20 基準測試將使用 DeepGEMM MegaMoE,該技術將 EP dispatch + EP combine + GEMMs + SwiGLU 融合為單一的巨型核心。

DeepSeek 支援:多篇貼文聚焦於服務權衡:Jeremy Howard 指出 DeepSeek V4 對預填充 (prefill) 的支援,這是許多供應商已放棄的功能;而 Maharshi 則指出動態激活量化 (dynamic activation quantization) 的開銷,認為儘管有校準成本,靜態量化 (static quantization) 在推論速度上通常更具優勢。

此外,人們對替代堆疊可攜性 (alternate stack portability) 的興趣日益濃厚:teortaxesTex 認為 DeepSeek 正透過 TileKernels 在結構上擺脫 CUDA 鎖定,這暗示模型供應商可能會越來越多地針對異構或國內加速器叢集進行優化,而非僅限於 NVIDIA 部署。

開源模型發布:Poolside Laguna XS.2、NVIDIA Nemotron 3 Nano Omni 和 TRELLIS.2

Poolside 發布了其首個公開模型,這是一個異常易於部署的開源程式碼生成模型:@poolsideai 宣布推出 Laguna XS.2,這是一個總參數 33B / 活躍參數 3B 的 MoE 程式碼模型,完全由內部訓練,以 Apache 2.0 授權發布,並宣稱可在單一 GPU 上運行。

Poolside 的更廣泛發布還包括 Laguna M.1 和一個代理框架,強調該公司從頭開始,利用自己的資料、訓練基礎設施、強化學習 (RL) 和推論堆疊進行訓練。社群摘要提供了更多細節:Aymeric Roucher 描述了兩個程式碼模型,225B/23B 活躍參數和 33B/3B 活躍參數,它們採用混合注意力機制、FP8 KV 快取,並聲稱性能接近 Qwen-3.5;Ollama 立即支援了該模型。

NVIDIA 的 Nemotron 3 Nano Omni 是當天最大的基礎設施原生模型發布:@NVIDIAAI 推出了 Nemotron 3 Nano Omni,這是一個開放的 30B / A3B 多模態 MoE 模型,具有 256K 的上下文長度,專為涵蓋文字、圖像、影片、音訊和文件的代理工作負載而設計。

OpenRouter、LM Studio、Ollama、Unsloth、fal、Fireworks、DeepInfra、Together、Baseten、Canonical 等平台均宣布當天即可使用。後續貼文揭示了關鍵規格:Piotr Żelasko 將其描述為 NVIDIA 首個支援語音/音訊理解的 omni 模型,由 Parakeet 編碼器支援,目前僅限英文,在 Open ASR 排行榜上達到 5.95% 的 WER。多個託管服務商表示,其吞吐量比同類開放 omni 模型高出約 9 倍。

其他值得注意的模型/論文發布:Microsoft 的 TRELLIS.2 是一個開源的 4B 圖像到 3D 模型,可生成高達 1536³ PBR 紋理資產,基於原生 3D VAEs 構建,具有 16 倍的空間壓縮。在世界模型方面,World-R1 聲稱現有的影片模型已編碼 3D 結構,並可透過強化學習 (RL) 被「喚醒」,無需架構更改、額外影片訓練資料或增加推論成本。

代理、本地優先工具與生產編排

代理建構者正從展示轉向生產級別的基礎元件:Mistral 推出了 Workflows 的公開預覽版,作為一個編排層,旨在將企業 AI 流程轉變為持久、可觀察、容錯的生產系統。相關貼文也呼應了相同的主題:Sydney Runkle 將持久執行 (durable execution) 視為長期運行代理的關鍵要求,而 threepointone 則描述了關於子代理/代理即工具 (agents-as-tools) 的工作,這些工具具有持久性、串流處理和恢復功能。

本地/離線代理從願景轉變為可信賴的工作流程:Teknium 斷言「完全離線的代理是可能的」,而 Niels Rogge 展示了 Pi + 本地模型用於桌面清理,Google Gemma 也分享了本地程式碼代理的教學。Hugging Face 在本地化方面的推動也體現在採用數字上:Clement Delangue 表示已有 30 萬用戶將硬體規格添加到 Hub 中,以發現哪些模型可以在本地運行。

作為補充,Ammaar 開源了一個情緒程式碼應用程式,使用 MLX 在設備上完整運行 Gemma 4,而 Kimmonismus 則強調了 Sigma,這是一個使用開源模型的私人瀏覽器基於本地代理概念。

Hermes 和相關代理框架正在獲得實際應用:多篇貼文報導 Hermes 在指令遵循或實際工作流程中表現優於 OpenClaw,包括 SecretArjun、somewheresy,以及透過 Telegram 或用於醫學文獻提取部署 Hermes 的用戶。

在研究代理方面,Hugging Face 的 ML Intern 在 Spaces 中引起關注,隨後獲得了原生指標日誌記錄 + Trackio 整合,使其訓練任務變得可觀察而非黑箱操作。

基準測試、評估與值得關注的研究發現

模型基準測試仍然分散,但有幾個信號脫穎而出:Epoch 報告 GPT-5.5 Pro 在 Epoch Capabilities Index 上達到 159 分,並在 FrontierMath 上創下新高,Tiers 1–3 達到 52%,Tier 4 達到 40%,其中包括兩個以前沒有任何模型解決過的 Tier 4 問題。

另外,Greg Kamradt 表示 GPT-5.5 和 Opus 4.7 的 ARC-AGI-3 測試已完成,目前正在分析其失敗模式。

多個新基準測試旨在評估更實際的代理和工程行為:Lysandre 宣布了一項旨在使 Transformer 更適合代理的基準測試,而 VibeBench 則提議由 1,000 名合格的軟體工程師進行主觀測試,以衡量模型在實際工作中的感受。在文件智慧方面,LlamaIndex 的 ParseBench 強調 OCR 基準測試忽略了語義格式,例如刪除線和上標,這些對代理而言會實質性地改變意義。

具有具體工程意義的研究筆記:Rosinality 指出 DeepSpeed 和 OpenRLHF 中存在降低 SFT 性能的錯誤,這對先前的研究產生影響。Arjun Kocher 發布了 DeepSeek-V4 論文中壓縮稀疏注意力 (Compressed Sparse Attention) 的忠實實現。

che_shr_cat 展示了單塊 Transformer 只有在明確的暫存區 (scratchpad) 和反向路由初始化 (inverted routing init) 的情況下才能解決極限數獨,否則性能為零。在優化方面,Keller Jordan 發布了一個輕量級的 Modded-NanoGPT 優化器基準測試,旨在比較 Muon 和 AdamW 等方法在可重現的速通式任務上的表現。

平台經濟、API 定價與閉源模型可靠性考量