OpenAI 已與 AMD、Broadcom、Intel、Microsoft 和 NVIDIA 合作,開發了一種名為 MRC(Multipath Reliable Connection)的新網路協定。

MRC 旨在使大型 AI 超級電腦中 GPU 之間的資料傳輸更快、更可預測且更具韌性,這是訓練大型 AI 模型的一項關鍵要求。MRC 不再透過單一網路路徑傳輸每個資料包,而是將資料包同時分散到數百條路徑上,從而減少網路核心的擁塞。

當網路路徑、連結或交換器發生故障時,MRC 可以在微秒級別檢測到問題並繞過它。根據 OpenAI 的說法,傳統網路架構在故障後可能需要數秒甚至數十秒才能穩定下來。

這有助於訓練作業在網路故障和維護事件中持續進行,而這些事件在過去可能會中斷或停滯訓練。OpenAI 表示,MRC 的多平面網路設計僅需兩層乙太網路交換器即可連接超過 100,000 個 GPU,而傳統 800 Gb/s 網路則需要三到四層。這降低了功耗、元件數量和整體網路成本。

MRC 同時將資料包分散到多條路徑上,減少可能減慢同步 AI 訓練的擁塞。

MRC 已部署在 OpenAI 所有用於訓練前沿模型的大型 NVIDIA GB200 超級電腦上,包括其位於德州阿比林的 Oracle Cloud Infrastructure 站點,以及 Microsoft 的 Fairwater 超級電腦。

在訓練 ChatGPT 和 Codex 的一個近期前沿模型期間,OpenAI 表示他們必須重啟四個第一層交換器。有了 MRC,該公司無需與叢集中執行訓練任務的團隊協調重啟作業。

MRC 規範已於今日透過 Open Compute Project (OCP) 發布,並附有一份相關研究論文。除了 OpenAI,AMD、Broadcom、Intel、Microsoft 和 Nvidia 也為其開發做出了貢獻。