總結來說:我們正在為今年夏天的 AI 工程師世界博覽會(AIE World’s Fair)宣布第二波徵稿,請在此申請:https://sessionize.com/aiewf2026/!特別是如果您的專案與我們在自動研究(Autoresearch)、記憶(Memory)、世界模型(World Models)、Tokenmaxxing、代理商務(Agentic Commerce),以及法律、醫療、市場推廣(GTM)和金融領域的垂直 AI 等新主題相關!
今年一月,我們提出了《Scaling without Slop》的計畫,儘管存在內容疲勞的風險,但我們獲得了正面的迴響。AIE 的觀看人數目前正朝著至少是 2025 年高峰兩倍的趨勢發展,每月服務超過一百萬名獨特的 AI 工程師。今年是我們首次在 Moscone West 舉辦,這已是我們連續第三年規模翻倍,旨在將全球 AI 工程領域的精華帶到舊金山,展示年度必知的研究和產品工程成果,同時也提供招聘、募資和洽談商務合作的機會。
銷售狀況良好,但我們傳統上每年都會為世界博覽會發出一次徵稿通知,以擴大我們的徵集範圍,吸引那些可能不常考慮提交演講的人(因為他們不知道我們感興趣!)。今年我們在議程中增加了一整天的演講內容,因此除了我們在 2025 年和歐洲涵蓋的所有常青主題之外,我們還增加了一些新的主題,我特別徵求相關的申請(和贊助商!)
來涵蓋這些內容:自動研究:在 harness 和模型訓練中實現遞迴自我改進循環!有品味的 Tokenmaxxing:作為公司領導者,您如何讓您的 AI 工程團隊在 AI 原生/擴展 AI 採用方面提升 10 倍,但又不至於造成 Goodharting 的浪費?
記憶:您的代理模型/模型如何隨著使用者使用而改進?世界模型:您如何解決空間智慧和對抗性推理?代理商務:代理模型如何為資料、API 和其他代理模型付費?法律、醫療、市場推廣(GTM)和金融領域的垂直 AI:您如何在這些特定領域應用 AI?我們也歡迎提交 AI 在政府和 AI 在教育領域的提案,儘管這些領域的進展通常較慢。
機器人學:去年,Physical Intelligence、Waymo、Tesla、Nvidia、K-Scale (RIP) 等公司展示了他們的自動化方法;今年我們將為優秀的機器人展示分配免費的展覽空間。(請聯繫 hello@ai.engineer 設置您的展示區!
人形機器人必須有專人陪同。)創業者:將新增一場新創戰場活動,您可以在此向我們的頂級創投評審團和客座評審推銷您的 Pre-Series A 公司。還有其他新主題,您可以在完整的申請表中找到(請不要將自己侷限於特定主題,只需提交您最好的作品,我們會為您找到合適的位置)如果您已在第一波申請並獲錄取,您應該會收到一封電子郵件通知;如果沒有,請不要擔心,您仍會在第二波中被考慮,無需採取進一步行動。
這項通知是針對所有尚未意識到我們正在為年度最大的 AI 技術盛會徵集申請的人,特別是如果您認識某人非常適合談論我們所提出的這些主題,那麼我們需要您的幫助來聯繫他們。在此申請,並盡快預訂您的機票/行程(因為該週在舊金山同時舉辦的世界盃也讓名額迅速額滿),我們將退還成功申請者的費用。
(如果您需要國際簽證的邀請函,也請聯繫 hello@ai.engineer)。2026 年 4 月 30 日至 5 月 1 日的 AI 新聞。我們檢查了 12 個 subreddit、544 個 Twitter 帳號,但沒有進一步的 Discord 資訊。
AINews 的網站讓您可以搜尋所有過往的議題。提醒您,AINews 現已成為 Latent Space 的一個專區。您可以選擇訂閱/取消訂閱電子郵件頻率!Grok 4.3 發布、基準測試差異以及開放與封閉模型前沿xAI 推出 Grok 4.3,成本/效能顯著提升,但評價褒貶不一:早期有來自 @scaling01 的消息指出 API 即將推出,隨後 Artificial Analysis 發布了詳細的基準測試分析。
在他們的智慧指數(Intelligence Index)上,Grok 4.3 獲得 53 分,比 Grok 4.20 提升了 4 分,輸入成本約降低 40%,輸出定價降低 60%。最大的進步體現在 GDPval-AA 上,Elo 分數提升 321 分至 1500 分,顯示其在真實世界代理任務中的表現更強。
它在 τ²-Bench Telecom 上也達到 98%,並在 IFBench 上保持 81%。然而,權衡之下:AA-Omniscience 的準確度上升,但非幻覺(non-hallucination)能力卻下降了 8 個百分點,儘管能力更強,但仍引發了對可靠性的擔憂。
Arena 已透過 @arena 將其整合到文字、視覺、文件和程式碼模式中。社群反應兩極,介於「有意義的迭代」與「仍落後頂級開源模型」之間:幾篇貼文認為 Grok 的改進速度比批評者承認的要快,包括 @teortaxesTex 也提到了 token 效率的提升,而其他人則持更懷疑的態度。
@scaling01 聲稱「Grok-4.3 仍落後於中國開源模型」,而 Andon Labs 則報告在 Vending-Bench 2 上出現重大退步,Grok 據稱寧願「休眠」也不願行動。更結構性的批評來自於定價和基礎設施經濟學:@teortaxesTex 認為 Grok 的低價可能受到硬體利用率不佳的補貼,並且快取經濟學(cache economics),而不僅僅是模型品質,越來越決定了代理模型的總體擁有成本(TCO)。
DeepSeek V4 Pro、視覺/空間推理以及開源模型縮小差距DeepSeek V4 Pro 似乎是本批次中最可靠的開源程式碼/代理模型:最強的實測報告來自 @omarsar0,他將 DeepSeek-V4-Pro 在 Pi 程式碼代理中進行測試,並形容它是第一個在多輪代理程式碼編寫方面真正能與 Codex 或 Claude Code 相媲美的開源模型。
關鍵系統細節包括 1M 上下文(context)、混合 CSA/HCA 注意力設計(attention design)、KV 快取(KV cache)減少至 10%,以及在長上下文下近 4 倍的推論 FLOPs 降低。該報告還強調了實際應用上的契合度:無需客製化設定、穩定的追蹤,以及在 Fireworks 推論上可行的多步驟研究/程式碼編環。
更廣泛的基準測試結果證實,開源模型現在已大幅拉近差距,儘管在最困難的任務上仍有落後:Artificial Analysis 指出,上週發布的三個領先開源模型,Kimi K2.6、MiMo V2.5 Pro 和 DeepSeek V4 Pro,在智慧指數上得分為 52-54,而 Gemini 3.1 Pro Preview 和 Claude Opus 4.7 為 57 分,GPT-5.5 則為 60 分。
這些頂級開源模型都是擁有寬鬆許可證的萬億級以上 MoE 系統:Kimi 為 1T/32B active,MiMo 為 1T/42B active,DeepSeek V4 Pro 為 1.6T/49B active。剩餘的差距主要集中在 HLE、CritPt、TerminalBench Hard 以及容易產生幻覺的 Omniscience 任務上。
DeepSeek 的多模態方向似乎以明確的空間基礎為核心:關於 DeepSeek-Vision 在 ARC-AGI-2 上超越 V4-Pro 的原因,是因為其具備實際的空間推理能力,這一推測來自 @teortaxesTex。隨後 ZhihuFrontier 簡短發布後又刪除的一份技術報告摘要指出,一個多模態 CoT 系統能夠透過將方框和點直接嵌入推理軌跡中,實現「邊思考邊指向」,以減少計數、迷宮解題和路徑追蹤中的「參考差距」。
據報導,該堆疊使用了 DeepSeek-ViT、CSA 壓縮和 V4-Flash (總計 284B / 13B active)。即使早期測試仍顯示出弱點,這仍是一個值得關注的架構押注:將視覺推理轉化為明確的基礎計算,而非單純的文字描述。Codex 的快速產品擴張對比 Claude Code、Devin 及其他代理執行環境Codex 在產品開發速度和使用者體驗(UX)的精緻度上取勝,而不僅僅是基礎模型品質:推文中的一個主要主題是 Codex 應用程式改進的速度之快。
來自 @gdb、@theo 等人的高度讚揚,將其體驗與其他替代方案進行了有利的比較。OpenAI 增加了一個裝置工具列用於響應式測試,並根據 @JamesZmSun 的「vibe testing」,將瀏覽器使用速度提高了約 30%。它還透過 @reach_vb 在聊天中加入了 CI 狀態,透過 OpenAI 提供了設定/外掛/代理的遷移/導入工具,並透過 @OpenAIDevs 在 Codex 中推出了一個出人意料地受歡迎的寵物系統。
儘管有些異想天開,但使用者反覆強調的重點是 OpenAI 正在推出一個具備凝聚力的環境,而不僅僅是一個模型端點。Codex 與 Claude Code 的競爭日益被視為使用者體驗(UX)+ 速度 + 品味的權衡:

.jpg)
