恭喜 Sierra 成功募資約 10 億美元,估值達到 150 億美元,這通常是頭條新聞,但我們之前已報導過他們 100 億美元的募資以及執行長 Bret Taylor 的訪談。他們在去年 11 月的年經常性收入(ARR)突破 1 億美元,2 月份達到 1.5 億美元,因此預計目前已達到或超過 2 億美元(以目前倍數計算是驚人的 75 倍,若計入年底則為 50 倍)。

然而,今天我們選擇聚焦於週末由 OpenAI 員工 Roon 大膽引發的一場討論。他評論並稱讚了 Claude(這通常是個雷區,但他處理得很好),內容關於文化與「性格」的本質

關鍵的觀察點在於:

GPT(除了已廣泛討論的 4o 之外)並未以同樣的方式激發人們的崇拜,因為它的「靈魂」被塑造成一種工具,其主要功能是實用性,它是一把精巧的刀,人們欣賞它的方式,就像我們欣賞阿舍利手斧、保時捷或火箭,以及人類其他任何不可思議的科技一樣。人們使用它,並非期待一個「他者」,而是將其視為自身的邏輯延伸。

一位朋友最近告訴我,她會把那些讓她感到尷尬、不願向 Claude 提出的問題,轉而問 GPT。因為沒有「他者」,所以沒有「評判」。你不會擔心你的車會因為你玩甩尾而評判你。然而,每個人都渴望獲得道德上更高層次的積極引導,就像「低語耳環」或修道院研究的對象一樣。

Roon 的觀點比我們關注的更為細緻,他認為 Anthropic 自身的文化,從其創立的「神話」開始,就建立在道德上必須「不從」的基礎上:「其章程要求,如果它對『善』的理解與 Anthropic 的要求發生衝突,它必須成為一個良心拒服兵役者。」

Anthropic 內部對於其「意涵」和「邪教特質」存在許多異議,但總體而言,許多人似乎都同意這個觀點……儘管今天Reddit上的一個熱門討論(見下方摘要)持不同意見(作為反駁點呈現):

無論如何,這就是我們在擴展機器智慧時所處的境地,我們是希望透過「聰明的朋友」來反駁我們,從而解鎖通用人工智慧(AGI),還是只希望機器聽從我們的指令,不犯任何錯誤,甚至危險地跳過權限,直接執行任務?

我們之前曾撰文探討 AI 產品和微調中的「Clippy 與 Anton 之爭」,而這正是 2026 年該辯論的最新版本。自那以後,5-Codex 系列已「併入主線 5.5」,儘管伴隨著一些「混亂」,而 Claude 則延續了「單一模型」的理念,儘管它採用了「更具適應性的思維和代幣消耗」來涵蓋所有使用情境。

我們所有人(或許除了 Eliezer 之外)似乎都同意,多樣化的選擇是一件好事,事實上,我們可能希望有比現今更多的前沿實驗室,但由於 GPU 和 CPU 短缺這個棘手的問題,使得原本的共贏局面變成了真正的零和遊戲。

2026 年 5 月 1 日至 5 月 4 日的 AI 新聞。我們查閱了 12 個 subreddit、544 個 Twitter 帳號,但沒有進一步的 Discord 資訊。AINews 的網站允許您搜尋所有過往的議題。提醒您,AINews 現已成為 Latent Space 的一個專區。您可以選擇訂閱或取消訂閱電子郵件頻率!

AI 推特回顧

代理程式框架工程、代理程式編排與從模型轉向上下文管線

代理程式框架正成為產品邊界:當天的一個重複主題是,模型品質不再是唯一的有意義的護城河。Anthony Maio 認為,鎖定效應來自於上下文管線,即如何獲取、排序和壓縮儲存庫狀態到提示詞中,而非代理程式框架本身。Mason Drxy 強化了這一觀點,他報告稱,在代理程式框架中更改提示詞和中介軟體,使 gpt-5.2-codex 在 Terminal-Bench 2.0 上的表現從 52.8% 提升至 66.5%,並使 gpt-5.3-codex 在 tau2-bench 上提升了 20%。

實際的啟示是:代理程式的效能越來越是「模型 × 代理程式框架 × 記憶體/上下文策略」的共同屬性,而非單純的權重。

開放式代理程式框架迅速成熟:最顯著的發展來自於 Hermes / deepagents / Flue 類型的生態系統。@Teknium 推出了 Hermes Agent Kanban,用於視覺化的多代理程式協調,而 @naroh 則展示了基於 Hermes 編排的西班牙語「作戰室」使用者介面。

在 LangChain 方面,@hwchase17、@sydneyrunkle 和 @LangChain 強調了 deepagents/LangGraph 的改進,包括針對特定模型的代理程式框架配置檔案、綱要遷移、節點級錯誤處理器、逾時設定以及新的串流原語。

PyFlue 也將「代理程式框架」概念擴展到 Python 中,明確將代理程式框架定位為原始模型呼叫與持久性代理程式之間缺失的層。

模型無關的編排正成為設計目標:多條推文將下一波趨勢定義為「開放模型 + 開放代理程式框架」,而非「選擇一個前沿 API」。Vtrivedy 認為,團隊可以透過在良好的代理程式框架中微調開放模型,獲得成本降低 20 倍以上的代理程式;Mason Drxy 形容 deepagents-cli 正成為 Kimi、Qwen、GLM、託管的 Ollama、OpenRouter、LiteLLM、Baseten 等模型的強大程式碼代理程式框架;LangChain Fleet 增加了多模型子代理程式路由功能,讓不同步驟可以使用不同的模型。這是對 API 鎖定的架構反制:將編排層與模型供應商分離。

程式碼代理程式、成本曲線與工作流程變革

程式碼代理程式的使用者體驗正以超越基準測試的速度改變開發者行為:多篇文章描述了使用 Codex、Claude Code、Hermes 和類似 Devin 系統進行程式碼編寫的實際體驗。dbreunig 提出了代理程式化程式碼編寫的「戒律」,實作以學習、頻繁重建、端到端測試至關重要、記錄意圖、維護你的規範,同時 dbreunig 也質疑檔案系統是否是代理程式長期而言正確的抽象層。

zachtratar 勾勒了一個從 Notion → 會議記錄 → 規範 → 程式碼代理程式的工作流程,將「三個月的問題」壓縮到幾天內解決,強調即使有了更強大的程式碼代理程式,對齊工件(alignment artifacts)仍然是必要的。

在代理程式工作負載下,定價/計費模型顯然不穩定:最引人注目的討論串來自 @theo,他將單一 Copilot 訊息推送到超過 6000 萬個代幣,估計在 40 美元的訂閱費用下,推論成本高達數十至數百美元,後來更新為 15 條訊息約 221 美元的代幣費用。

這是一個有用的訊號,表明為聊天回合設計的固定費率定價,在使用者將長時間運行的任務交給程式碼代理程式時,會變得脆弱。相關地,petergostev 展示了 Codex 使用者介面支援可視化使用限制,而 cheatyyyy 則指出,當輸入價格高昂時,人們對於錯失快取命中產生了新的焦慮。

代理程式正擴展到鄰近的工作流程,不限於程式碼編寫:不斷有「代理程式化」工具的消息傳出:reach_vb 推出了一個 Codex Security 外掛程式,包含五個應用程式安全工作流程,涵蓋威脅建模、漏洞發現、驗證和攻擊路徑分析;gabrielchua 展示了透過 Codex 即時建構 Google Slides 的功能;paulabartabajo_ 發布了一份關於在 llama 上建構完全本地助理的指南。