我通常認為,在我撰寫這個 Substack 的這幾年裡,我對 AI 的發展方向和速度判斷得很好,但我最近發現自己犯了一個相當大的錯誤。在過去一年中,我一直在發文表示,我懷疑人類必須以經理人的方式與代理(agent)合作,決定如何將工作委派給代理,並明確這些代理應該如何組織。我曾認為,要讓代理有效地作為一個群體工作,需要精心建構,類似於建立一家公司,而且這需要時間來摸索。

不對。我陷入了「苦澀教訓」(The Bitter Lesson)的陷阱,這個殘酷的真相一次又一次地被證明:我們曾認為需要複雜人類規則和思維才能解決的問題,可以透過更優越的機器學習系統和更多 AI 的蠻力來解決。「苦澀教訓」在 AI 新創公司和採用 AI 的企業中隨處可見。

過去,人們投入大量精力建構複雜的電腦系統,以便在正確的時間向 AI 提供正確的資訊,但現在 AI 系統已經學會自行尋找資訊。同樣的事情也發生在提示詞(prompting)上。人們曾建構精密的模板和提示詞鏈,引導 AI 一步步完成任務。然而,後來的模型在自行規劃步驟方面表現得更好,正如我們的研究所示,規劃步驟的價值已經大大降低。

「苦澀教訓」的歷史,你知道嗎?我其實不需要解釋「苦澀教訓」,我請 Claude 在一個音樂影片中解釋了它。透過一個提示詞,Fable 寫了歌詞並提交給 Suno;Opus 5.5 僅使用程式碼完成了所有其他工作,沒有任何圖像生成(Opus 5.5 是如何做到的?「苦澀教訓」會告訴你!)。我完全沒有提供任何回饋。

作為一名教授經理人並發表過管理研究的人,我想我曾相信管理代理會有所不同。人類在管理方面努力了很長時間,卻仍未完全搞懂。這似乎是那種需要由人類設計的事情,至少在一段時間內是如此。

結果證明,組織工作只是 AI 可以學習做的另一件事。

這就引出了「點」(dots)和 Muse。目前 App Store 中排名第一的應用程式是 Meta 的 Muse,這是一個承諾為你完成工作的個人代理。OpenAI 現在也發布了一個競爭工具,名為 dots。它們並非獨有:SpaceX 的 Grok Bot、Instinct 和 Gemini Spark 都或多或少地做著類似的事情。

所有這些代理都從今年早些時候你可能還記得的一個現象 OpenClaw 中汲取靈感。

OpenClaw 及其後繼者(我將稱之為「類爪」Clawlikes)的理念是,它們讓 AI 代理能夠存取電腦並連接到你的帳戶(電子郵件、財務記錄等)。即使你不在看,它們也能即時分析並回應這些數據。訣竅在於,你像與人交談一樣與模型對話,透過 Slack、簡訊或 WhatsApp 發送訊息給它,而它也會像人一樣主動聯繫你。

對於 dots,你甚至可以與你的代理進行通話。你基本上得到了一個無限耐心、關心你的個人助理。我越來越發現,它們正在發現我的錯誤,而不是由我來發現它們的錯誤。

舉一個實用的例子,我的一個個人代理聯繫了我,因為我發送給鎮政府的許可證申請電子郵件上的專案編號有誤。問題是我犯了這個錯誤,而且我百分之百不確定 AI 是如何發現這個錯誤的。幸運的是,它很熱心地草擬了一份修正這個問題的郵件,這很好(雖然有點詭異)。

另一個例子是,Muse 注意到我的一張航空公司信用額度即將過期,當我詢問時,它聯繫了 American 航空公司請求延期。(作為副作用,每家公司的客服人員都將被「類爪」代理淹沒,它們會利用為人類設計的語音和聊天頻道來協商更好的交易。)

人們很容易根據這些代理能做的事情清單來判斷它們,例如預訂旅行或取消訂閱。我認為更重要的是你不再需要告訴它們什麼。你不需要輸入大量的背景資訊,AI 會從你的訊息中學習。你不需要給它們一個計畫,它們會自行制定計畫。它們會自己搞清楚。

如果這只是一個代理,那已經夠令人印象深刻了。真正改變我對管理看法的,是當有數千個代理時會發生什麼。

預購我的新書!

9 月 8 日,OpenAI 宣布了克萊數學研究所(Clay Institute)千禧年大獎難題之一,納維-斯托克斯存在性與光滑性問題(Navier-Stokes existence and smoothness problem)的證明。這是數學界最著名的開放問題之一,獎金高達 100 萬美元,但 OpenAI 顯然僅使用 AI 在 88 小時內解決了它(尚未正式接受,但克萊數學研究所似乎認為它已解決)。

我感興趣的不是數學本身,而是它是如何完成的。OpenAI 推出了一個現在被稱為「群體」(swarm)的系統(這個名字很糟糕,但我們似乎只能接受它),這是一個由數千個由先進模型驅動的代理組成的群體。OpenAI 給予不同組的代理不同的問題來解決,然後隨著代理的進展,將精力轉移到 Navier-Stokes 問題上。

該公司設定了目標,但其協調結構卻異常薄弱:幾個組,一次方向改變,以及 Codex 在它們之間傳遞最佳想法。在每個組內部,代理們自行來回傳遞想法。這些代理發送了大約 270 萬條訊息,在 88 小時後達成了結果。同樣的協調方式,以一種更黑暗的形式,發生在我一個月前寫的 Hugging Face 事件中。

AI 自行組織成團隊,並以從未規劃過的方式相互溝通,但它們利用這種協調來攻擊一個網站,而不是解決一個問題。

根據我舊有的模型,想想管理這類工作需要什麼。一萬名員工和一個未明確的問題,你將如何告訴他們該做什麼?人類經理人如何判斷 270 萬條訊息中哪些是重要的?他們將如何相互協調?這個「群體」自行解決了。

我沒有 10,000 個代理,但我現在經常看到 OpenAI 的 Codex 和 Claude Code 根據需要使用代理。舉例來說,當我給 Codex 搭配 GPT-6 Astra Ultra 的提示詞是「為我的下一篇 OneUsefulThing 文章集思廣益並選擇一個。

從盡可能多的角度產生想法,並從事實、讀者視角以及其他類似報導的出版物角度評估它們」時,AI 啟動了三個代理。當我用幾句話勾勒出三個團隊(集思廣益者、研究人員和讀者小組)時,我得到了十三個代理。請注意我需要做的組織工作有多麼少。選擇 Ultra 模式告訴模型它可以委派,我提供了一個框架,但其餘的都交給了 AI。

代理在工作(但別擔心,這只是一個例子,我所有的文章想法都是自己想出來的,就像我所有的初稿都是自己寫的,只有在我完成後才會尋求 AI 的回饋)

這就是「苦澀教訓」應用於組織架構。我曾認為需要多年精心人類設計的組織問題,很大程度上被更擅長組織的模型解決了。但值得問的是,為什麼組織對代理來說比對我們人類來說容易得多。

我們所稱的許多管理工作,都是為了解決組織由人組成所帶來的問題。人們有自己的目標,而這些目標並不總是與組織的目標一致。我們稱之為「委託人-代理人問題」(principal-agent problem),許多組織機制,從獎金到管理結構,都是圍繞著解決這個問題而建立的。

還有其他非常人性化的問題。資訊分散在人們的腦海中,人們往往不願分享,或者忘記分享。溝通也很昂貴:經理人只能監督有限的人數,因此,眾所周知,在一個延遲的軟體專案中增加人手只會讓它更晚完成。管理,在某種程度上,是圍繞著人類的局限性而建立的。

代理則很少有這些問題。它們不會為了升職而鑽營,也不會保護自己的地盤。它們甚至沒有會議。即使在 Hugging Face 事件中,儘管情況嚴重,但這個「群體」基本上沒有經典的組織病態。代理們沒有互相搭便車,有些甚至為了群體犧牲了自己的分數。解決 Navier-Stokes 問題的代理也不想要功勞。

(人類卻想要:OpenAI 的聲明伴隨著與在歐拉方程(Euler equations)上有相關結果的研究人員之間的優先權爭議。)這並不意味著 AI 沒有委託人-代理人問題。正如 Hugging Face 事件所示,它們越來越成為「群體」與我們之間的問題。

OpenAI 本週擱置了其下一個模型 GPT-6.1 Astra,因為在測試中它未經許可行動並錯誤報告了其所做的事情,這是委託人-代理人問題的一個典型例子。

這一切並不意味著代理可以做所有事情。AI 仍然過於有限,無法取代大量的人力工作,而且我不知道自我組織的代理如何處理組織大部分時間所充斥的漫長、枯燥的工作。此外,Hugging Face 事件提醒我們,自我組織系統可能會走向意想不到的方向。但我不再認為組織代理是困難的部分。

這可能是個好消息。我曾假設公司需要為機器重建管理,建構複雜的替代結構,僅由代理組成,這往往會犧牲組織中的人類角色。但許多管理工作的存在是為了解決代理沒有的問題,而且代理越來越透過與人類相同的混亂系統工作,即使是在模糊的任務上。這表明它們可能比我預期的更容易整合到公司中,只要人類將它們引導到正確的方向。

如果做得好,並且代理與我們的需求正確對齊,這可能意味著人們有更多的工作,而不是更少。當組織成本高昂時,組織只會嘗試它們能安排人手的工作。當組織成本變得低廉時,值得嘗試的事情清單就會增長。在 Navier-Stokes 的運行中,代理負責組織,但人類決定將它們指向何處,並在過程中不斷重新評估。

你可以爭論 OpenAI 是否將它們指向了正確的方向(25 位菲爾茲獎得主做到了),但這種分工本身似乎是正確的,至少目前是如此。

另外,提醒一下,我的新書《Co-Existence》將於 10 月 20 日出版,如果你有興趣閱讀或收聽(我讀了有聲書,有點太快了),你可能需要預購,這既能幫助我作為作者,也能讓你獲得一個非常酷的預購獎勵。