對於語音 AI 而言,延遲是一個關鍵參數。儘管開發者在模型品質上取得了巨大進展,但使用者體驗仍常受限於回應時間。Hugging Face 與 Cerebras 正在改變這種現況。

今天,我們展示了當開放、模組化的語音 AI 架構與業界領先的推論速度結合時,所能實現的可能性。其成果是語音到語音的體驗變得更加自然,對話不再需要等待 AI 回應,而是像人際互動一樣流暢。

這個展示是建立在一個即時的語音到語音(speech-to-speech)管線上。系統的每個部分都是模組化、開放且可替換的,讓開發者能輕鬆地為不同的助理、機器人、產品或研究專案調整此堆疊。

這創造了一個完全開放的語音到語音循環:語音輸入 -> 透過 Nvidia 的 Parakeet 進行語音辨識 -> 在 Cerebras 上進行 Gemma 4 VLM 推論 -> 透過 Alibaba 的 Qwen3TTS 進行文字轉語音 -> 語音回應。

此架構匯集了開源 AI 生態系統的優勢:Cerebras 提供快速推論,Google DeepMind 的 Gemma 4 31B 作為語言模型,以及 Qwen 用於文字轉語音。開發者可以檢查、修改和擴展每一層。

目前,一些生產系統雖然能達到合理的平均延遲,但在 P95(第 95 百分位數)時仍會出現令人沮喪的數秒延遲。當工具呼叫或多模態步驟需要多個回合時,這些延遲會變得更加明顯。

Cerebras 協助解決了堆疊中最重要的瓶頸之一:語言模型的回應時間。透過顯著加快並穩定推論速度,Cerebras 讓 Hugging Face 管線的其餘部分得以發揮最佳效能。這種穩定性在長尾效應(long tail)中尤其重要。許多系統可以提供可接受的平均回應時間,但偶爾的慢回應仍然會讓對話感覺不可靠。

同樣的 Hugging Face 語音到語音管線已經為 Reachy Mini 機器人提供動力,目前已有超過 9,000 台機器人投入使用。對於機器人、語音助理和具身 AI 而言,回應速度不只是一種表面上的改進,更是讓互動感覺生動的關鍵。

因此,採用 Cerebras 的動機不僅僅是降低成本。它帶來的是低延遲、可預測的效能,以及大規模創造自然即時體驗的能力。這次合作反映了雙方共同的信念:AI 的未來將是開放且高效的。開源模型、開放基礎設施和突破性的推論速度共同為下一代對話式 AI 奠定了基礎。我們邀請開發者探索此展示、實驗程式碼,並協助塑造即時語音 AI 的未來。