AI 生成語音模型的市場潛力巨大。創意應用需要 AI 語音模型更具表現力,而企業則希望利用它們自動化客戶支援和銷售營運,這要求語音模型更具可控性。
總部位於帕羅奧圖的 Fish Audio,希望透過其超過 15,000 種自然語言控制庫,滿足所有這些應用需求。這家新創公司自去年推出以來,目前已有超過 800 萬人使用其開源或託管版本的模型,並創造了 2100 萬美元的年經常性收入。
為了延續這股發展動能,該新創公司週二宣布已完成 5000 萬美元的種子輪募資,由 Coreline Ventures 和 Capital Today 領投。參與本輪投資的還有 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 和 HF0。
Fish Audio 最初是前 NVIDIA 研究員 Shijia Liao 的一個小型專案。他對市面上缺乏表現力的合成語音感到不滿,於是利用單一 GPU 訓練了一個語音生成模型並將其開源。目前,GitHub 上的 Fish Speech 儲存庫已獲得超過 31,000 顆星,並被獨立開發者、電玩遊戲設計師和創作者廣泛使用。
該公司在過去一年中推出了五個模型:四個語音生成模型和一個語音轉文字模型。其中三個語音生成模型已開源,但其最新的 S2.1 Pro 模型僅透過付費 API 提供。
Fish Audio 提供適合創作者和團隊的付費月租方案,可解鎖一定時數的語音生成服務,並包含語音複製功能。該公司也提供企業版的 API 和平台,並表示 HeyGen、Sanas 和 Plaud 等組織已在使用其服務。
Cao 表示:「每家企業都有不同的應用場景和偏好。例如,像 HeyGen 這樣利用我們的語音來驅動 AI 虛擬人像的公司,追求語音的真實感;遊戲工作室則希望角色的語音更具表現力;而像 LiveKit 這樣的語音代理公司,則需要聽起來更自然、低延遲且足以應對通話的語音。」
該新創公司建立語音庫的方式之一,是請用戶提交自己的語音來訓練模型,若語音被採用則會給予報酬。然而,幾個月前這項做法引發了一些問題,部分創作者聲稱他們的語音在未經同意的情況下被上傳到 Fish Audio。儘管該公司設有 DMCA 內容下架流程來處理這些疑慮,但實際下架時間卻相當漫長。
Fish Audio 的執行長兼共同創辦人 Rissa Cao 告訴 TechCrunch,公司現已將下架流程自動化。創作者只需提交簡短的語音樣本或合約,即可證明上傳的語音屬於他們,其語音將在不到 3 分鐘內從該新創公司的平台上移除。
然而,這仍無法阻止任何人未經藝術家同意就上傳其語音。在藝術家發現之前,他們的語音將繼續在平台上被使用,直到他們提出下架申請為止。
Coreline Ventures 的合夥人 Oskue Honda 表示,社群驅動的模型只有在創作者信任平台的情況下才能發揮作用。他說:「以社群為中心的方法,只有在創作者信任平台時才能成為持久的優勢。這意味著同意、透明度和歸屬權必須內建於產品中,而非事後才考慮。
我認為業界需要朝向驗證語音所有權、明確的授權條款、簡易的舉報和下架流程,以及最終讓創作者在語音被授權或商業使用時能從中獲利的收益分享模式發展。」
Cao 提到,當該新創公司僅以開源專案形式提供產品並針對創作者時,營運效率良好且不需資金。但為了開發更先進的模型,並隨著投資者興趣增加而希望服務企業客戶,這促使他們尋求外部資金。
展望未來,Fish Audio 計劃今年發布一個音訊理解模型,同時也在開發語音轉語音模型。
語音生成市場競爭激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前身為 Podcastle)和 Krisp 等公司都在爭奪創作者和企業客戶。
359 Capital 的合夥人 Rico Mallozzi 表示,為開發者提供精細控制,以及具成本效益的模型訓練,將有助於 Fish Audio 與大型 AI 實驗室更好地競爭。Mallozzi 在電話中告訴 TechCrunch:「我認為他們以現有團隊所能建立的尖端模型,相較於其他資金雄厚的 AI 實驗室或公司,表現令人驚嘆。這展現了他們在縮小人工語音與真人語音之間差距的技術敏銳度。」

