「AI 工程師世界博覽會」普通票僅剩最後四天!這是全球 AI 工程師、創辦人、領導者和研究人員最大規模的聚會。與會者將獲得價值超過 5000 美元的贊助商抵用金,演講內容也精彩可期。歡迎加入我們!

AI 擴展的爭論總是圍繞著「我們如何獲得更多 GPU?」這個問題,但更好的問題可能是:我們如何充分利用現有的 GPU。像 xAI 這樣的頂尖實驗室,其模型浮點運算利用率(MFU)可能低於 10%,這只是冰山一角,暗示了真正問題的所在。

作為參考,過去的頂尖規模訓練運行 MFU 已經遠高於 10%。GPT-3 約為 21%,Gopher 約為 32%,Megatron-Turing NLG 約為 30%,而 PaLM 則達到約 46%。我們的受訪者 Anjney 表示,目前業界最佳的 MFU 接近 60-70%。

這不一定是 xAI 特別無能(顯然他們擁有許多才華洋溢的人),而是 GPU 軍備競賽中的優先順序可能顛倒了。雖然 GPU 存取是瓶頸,但單純增加資本支出(CapEx)並不會自動轉化為更好的模型,因為頂尖 AI 越來越是一個系統性問題。

這牽涉到排程、利用率、網路、核心、框架、資料管線、平行處理、叢集可靠性,以及決定理論浮點運算(FLOPs)能否轉化為實際訓練進度的數千個微小決策。從建立 Discord 的開發者平台,到投資 Anthropic、Mistral、Black Forest Labs 和 Periodic Labs 等頂尖 AI 公司,再到現在建立 AMP 的獨立算力網格,Anjney Midha 多年來一直密切關注 AI 擴展的真正瓶頸。

在本集中,Anjney 與 Swyx 在 Periodic Labs 深入探討了為何 AI 競賽不僅僅是購買更多 GPU,為何 95% 的利用率在 Google 會被視為故障,以及為何下一代 AI 基礎設施必須更加協調、高效且負責任。我們深入探討了 AMP 的願景,即建立一個讓浮點運算像百萬瓦電力一樣流動的算力網格。

我們也討論了全端 AI 實驗室與橫向資源池之間的差異,為何 AI 數據中心需要社區支持,以及算力市場如何演變成更接近獨立系統營運商的模式。Anjney 還解釋了為何 DeepMind 未發表的研究所指出的市場失靈,為何生命週期預測仍然是他十四年來思考過最重要的 AI 應用之一,以及為何「輸出最大化」(output maxing)可能成為頂尖系統的新學科。

我們還討論了 Anthropic 的文化,為何在編碼模型中「機會偏愛有準備的頭腦」,Claude 如何在編碼方面取得突破,為何過早投入過多資本可能使 AI 實驗室變得脆弱,Periodic Labs 試圖在科學和超導體方面做什麼,為何優秀的研究人員可以成為優秀的 CEO,以及為何矽谷既充滿傳教士精神又極度功利。

Anjney Midha 提到,在 Google,通常會衡量兩種利用率。一種是節點分配,另一種是 MFU。節點利用率通常是指數據中心中被使用的卡片百分比,如果沒有達到 95%,那絕對是不可接受的。

他指出,在 Google,95% 的節點利用率會被視為故障,所以 96% 的節點利用率應該是標準。然而,大多數單租戶叢集並未達到這個水準。至於 MFU,他認為目前業界最佳水準約在 60% 到 70% 之間。

Anjney 認為這根本上是一個領導力問題,也是一個協調問題。出資者和部署者是否真正協調一致?理論上他們是,但在實踐中,從資本到管理叢集,再到衡量輸出的供應鏈中,參與者之間存在太多層級的距離。

他用弧度比喻來解釋,如果兩條線在起點只差幾度,隨著距離拉長,它們會大幅發散。他認為許多叢集實施和基礎設施,以及許多頂尖實驗室和團隊,都面臨這種情況。他們以一個好的初衷啟動計畫,但為了快速擴展,而不是迭代式地進行,導致浪費在規模擴大時迅速累積。

Anjney 強調,答案其實很簡單,就是進行迭代式啟動。如果你花時間與半導體產業或 DSN 產業的資深人士交流,你會發現這並不是什麼新鮮事,AI 不應該成為藉口。雖然我們確實擁有許多新的能力,但這不代表可以拋棄常識。

他認為,AI 擴展非但沒有改變常識的重要性,反而應該更加重視基礎設施中的常識價值。因為現在的誤差範圍更小,浪費的成本更高。而且浪費的成本不僅僅是經濟上的。

Anjney 提到,他過去是投資人,現在經營一家名為 AMP 的 AI 基礎設施公司。他認為,我們可以說這次在能力方面確實不同,我們確實獲得了前所未有的能力。但這不代表在所有方面都可以說這次不同,尤其是在基礎設施方面。

他喜歡駭客思維和創業家思維,這對新創公司來說很棒。但他提醒,Facebook 創辦人 Mark Zuckerberg 曾從「快速行動,打破常規」(Move fast, break things)轉變為「快速行動,搭配穩定基礎設施」(Move fast with stable infrastructure)。現在,我們需要「快速行動,搭配負責任的基礎設施」。

人們會開始質疑其影響。在史丹佛大學的課程中,General Matter 的創辦人 Scott Nolan 談到了能源瓶頸,他提出一個絕妙的想法:如果每小時的邊際運算單位經濟效益是 4 美元,那麼當你在新社區建立數據中心時,為何不收取 4.50 美元,然後將這額外的 50 美分直接回饋給當地社區作為現金?

Anjney 表示,作為運算服務的客戶,他會很樂意支付這額外的 50 美分。因為如果這意味著數據中心所在社區的公共利益如此明確,他會覺得這個運算服務更加可靠。據他了解,今年美國高達 20% 的數據中心面臨風險。

這些風險來自於社區反彈,即無法獲得社區支持來建立數據中心。Anjney 認為這個數字可能有些誇大,但確實存在。社區不僅關心工作機會,還關心電網、許可證等周邊問題。

他想像,如果有一個新的 AI 協議,說「如果我們在你的社區建立數據中心,我們實際上會降低你的電費」,那情況就不同了。社區會覺得「好,這是一個協議,我覺得自己是夥伴」。但現在情況並非如此。

Anjney 警告,未來監管機構介入時,那些以 AI 進步之名「快速行動,打破常規」的人最好有所準備。AMP 絕不會這樣採購算力,他們盡可能與有長期記錄的合作夥伴合作。其中許多人並非 AI 供應商。

他認為「新興雲端服務商」(neoclouds)這個概念很多是行銷話術。美國有很多優秀、可靠、值得信賴的數據中心供應商,他們已經存在了 20 多年。這些人知道如何營運區域網路(LAN)、電力和命令列介面(shell),他們有信用紀錄,經歷過網路的榮枯循環。

Anjney 稱讚這些人是穩定的基礎設施合作夥伴和思考者。他認為目前在算力層面存在很多短期思維,這最終會付出代價。