AI 推論速度的競爭日益激烈,Cerebras 憑藉其專用晶片在五月的首次公開募股中受到市場歡迎。然而,法國新創公司 Kog 卻認為,傳統 GPU 仍有大量潛力可供挖掘。
這家新創公司在五月登上 Hacker News 頭版,展示了一項技術預覽,旨在證明「在企業現有的標準資料中心 GPU 上,實現極快的單一請求解碼是可能的」。他們在演示中使用了 AMD MI300X 和 Nvidia H200 等 GPU。
雖然有些人對於這項技術未能延伸到筆記型電腦 GPU 感到失望,但其他人則看到了其潛力。由於推論速度和成本已成為關鍵瓶頸,Kog 承諾透過軟體優化,在現有硬體上釋放新功能,吸引了眾多關注者。執行長 Gaël Delalleau 告訴 TechCrunch:「我們獲得了 200 個實質的業務潛在客戶。」
根據早期回饋,這位獨自創業的創辦人預計軟體工程將是首個應用案例。資深的 Claude Code 用戶深知,有時他們必須等待數小時才能獲得結果。Anthropic 本身也明白速度的價值,並為 Claude 的快速模式收取更高的費用。
Kog 希望能鎖定那些因延遲而卻步的客戶,這些客戶通常依賴 AI 工作流程來完成專業任務。Delalleau 表示,該公司還有設計合作夥伴,讓用戶可以透過提示詞生成遊戲和應用程式,而 Kog 推論引擎 (KIE) 帶來的更快結果將意味著更高的收入。
該公司意識到這個市場尚未完全成熟。Kog 在觀察需求時發現,其潛在客戶尚未準備好微調小型模型。「這就是為什麼自推出以來,我們一直全力專注於加速開發大型模型,以滿足我們所看到的需求。」
這使得 Kog 必須實現巨大的飛躍,才能兌現其「LLM 推論速度快 30 倍」的承諾。他們的演示展示了每秒 3,000 個請求代幣 (TPS) 的驚人速度,但這是使用一個專門構建的、僅約 20 億參數的小型模型 Laneformer 2B,該模型現已開源。
Delalleau 反駁了懷疑論者,他堅信同樣的方法也能很好地應用於大型語言模型 (LLM),儘管 LLM 的大小可能對推論晶片構成挑戰。他說:「GPU 擁有光明的未來。」對 Kog 的執行長而言,認為 GPU 不適合解碼的觀念已成為一種誤解;新型 GPU 擁有越來越多的記憶體頻寬,只待被釋放。
Kog 並非唯一認為軟體優化能讓 GPU 發揮超出其標示性能的公司。同樣來自法國的 ZML 也發布了與硬體無關的軟體,繞過 Nvidia 的 CUDA 以支援不同晶片上的快速推論。但 Delalleau 表示,Kog 更像是史丹佛大學 Hazy Research 實驗室,專注於更深層次的 GPU 加速。
Delalleau 本人並非研究人員,他的第一家新創公司 Stribe(TechCrunch50 2009 年校友)與他的新公司毫無關聯,除了他的前共同創辦人 Kamel Zeroual 轉型為創投,其公司 Varsity VC 共同領投了 Kog 的種子輪融資。然而,這家新創公司深層次的專注源於他獨特的背景。
他在法國巴黎綜合理工學院學習固態物理,之後從事攻擊性網路安全工作,也就是俗稱的白帽駭客。Delalleau 表示,這塑造了他現在鼓勵團隊採用的思維模式。在科學方面,「這種思維模式是理解物理定律和 GPU 的定律,以便充分利用它們。」
至於駭客技術,這位 DEFCON CTF 錦標賽的四屆決賽選手表示,這教會了他「在非常低的層次上進行逆向工程,深入到組合語言和二進位碼,以理解其運作方式,並嘗試將其用於實現一個原本並非為此設計的目標。」
這種方法的缺點是它非常實作且耗時。「對於每一款新 GPU,我們都會投入數週甚至數月的時間,深入研究細節並對該硬體進行 GPU 工程研究。」目前團隊有 11 人,這限制了 Kog 在可預見的未來能夠處理的晶片數量。
從長遠來看,Kog 希望將其方法融入基於代理的管線中,使其能夠支援更多晶片和模型。隨著歐洲尋求在這兩個方面建立自己的能力,這可能會為這家新創公司帶來主權方面的順風,該公司已經得到 Scaleway 的支持,並獲得法國 Bpifrance 和 French Tech 2030 計畫的資助。
不過,目前 Kog 需要向世界證明其方法適用於 LLM。這也將是獲得更多資金的關鍵。Delalleau 表示:「一旦我們在九月實現第一個主要模型 10 倍的速度,我認為那時我們就能開始展示客戶吸引力,並從那裡籌集我們的 A 輪融資。」



