2026 年 8 月 12 日,Google DeepMind 手語團隊推出手語轉文字(SL2T)模型,這是一個突破性的模型,為聾人及聽障使用者帶來全新的手語功能。過去數十年來,AI 處理口語的能力突飛猛進,實現了自動翻譯、語音輸入和對話介面,讓聽人使用者感到輕鬆不費力。然而,這場科技革命卻尚未觸及全球 200 多種手語,以及估計 7,000 萬使用手語的聾人及聽障人士。

今天,我們推出一個大規模多語言手語轉文字(SL2T)翻譯模型,這在品質和通用性方面都取得了突破。藉由它,我們首次將手語 AI 從實驗室帶入消費性產品:SL2T 將在 Pixel 11 上的 Gboard 和 Live Transcribe 中提供手語輸入功能,初期支援美國手語(ASL)轉換為英文。未來將有更多裝置支援,並陸續增加其他手語。

如同聽人使用者可以透過語音輸入取代打字,這項功能讓聾人使用者能夠在任何通常需要打字的地方,直接對手機比劃手語。你可以用手語搜尋網路、撰寫訊息或文件,並請 Gemini 解決問題或執行任務。在 Live Transcribe 中,你可以在對話中直接比劃手語回應,而無需來回打字。根據我們的測試者表示,使用 ASL 比劃手語比用英文打字更快、更自然、也更令人愉悅。

由 SL2T 驅動的手語轉文字功能,讓使用者可以在任何通常需要打字的地方,直接對手機比劃手語。

手語為何重要

手語是全球聾人社群的主要語言,也是聾人文化認同的基石。聾人在手語、口語、閱讀和寫作能力方面存在巨大差異,因此支援所有模式的無障礙存取至關重要。聾人可以像聽人從口語處理中受益一樣,從手語處理中獲益,此外,這項技術也為彌合聾人與聽人社群之間的溝通鴻溝開啟了新的可能性。

儘管這項技術具有積極的社會影響潛力,但手語 AI 的進展一直緩慢,這不僅因為為手語建構 AI 帶來複雜的挑戰,也因為人們對手語本身的運作方式存在普遍的誤解。

與口語轉錄相比,手語翻譯面臨兩個核心挑戰。首先,口語轉錄是將聲音依序映射到相同語言的文字,而手語是獨立的自然語言,擁有自己獨特的語法和詞彙。因此,它需要真正的機器翻譯,而不是手語到單詞的序列轉換過程。其次,模型必須學習「看見」並理解肢體動作。手語透過手、手臂、軀幹、頭部和臉部的同時動作來傳達意義。在高影格率下準確追蹤這些動作是一項困難且運算需求高的電腦視覺任務。

鑑於此背景,不難理解為何一些早期手語技術的嘗試,例如手語手套,存在根本性的局限性:手語並非簡單的「手上英文」。它們需要對細微的全身動作進行複雜的視覺感知,以及全面的語言翻譯。SL2T 的設計旨在同時實現這兩點。

SL2T 將手語輸入視為手語者身體上的點,並將其翻譯成串流文字輸出。此範例來自 FLEURS-ASL 基準測試。

SL2T 的運作方式

我們透過結合以使用者為中心、文化敏感的方法與大規模數據擴展來建構 SL2T。該模型在超過 50 種手語的 10 萬多小時數據上進行訓練,其中約四分之一的數據為 ASL。在多樣化的語言、方言和熟練程度數據上共同訓練,使模型能夠學習共享的底層結構,在我們的實驗中表現優於單一語言模型。

為了保護使用者隱私,SL2T 將手語視為一系列姿勢地標點的位置,而非原始的攝影機畫面。一個裝置上的模型(MediaPipe Holistic)會追蹤手語者身體上的點的位置,只有這些幾何座標會傳送到伺服器進行翻譯,原始影片則會立即被捨棄。

SL2T 將此座標序列直接翻譯成文字,繞過了先前手語翻譯工作中廣泛使用的「詞彙標註」(glosses)等中間註釋。詞彙標註無法捕捉手語豐富的非線性特徵,例如非手部標記和空間結構。直接從地標進行翻譯消除了人為的詞彙限制,並使翻譯品質能夠直接隨數據量擴展。

根據 FLEURS-ASL(sd-test)等評估 ASL 到英文翻譯品質的關鍵基準測試,SL2T 是迄今為止能力最強的手語翻譯模型。SL2T 取得了驚人的 70 BLEURT 零樣本分數,遠高於先前報導的任何分數。然而,僅僅優化學術基準測試並不能保證在實際應用中的可用性,因此我們努力解決實際問題,例如最小化串流延遲、防止非手語輸入產生幻覺、確保對 10% 左撇子手語者的公平性,以及改進單手手語的表現,這在另一隻手拿著智慧型手機時會用到。

以下是 FLEURS-ASL 基準測試的範例。SL2T 能準確地將複雜的 ASL 翻譯成流暢的英文。但在罕見手語、快速指拼("prey" → "grey")、被動語態、分類詞描述(省略「爪子」)以及缺乏上下文的時態("kicked off" → "start")方面,仍偶爾存在錯誤。

與社群共同建構

我們深信應與聾人社群共同建構,而非僅為其服務。聾人的視角貫穿了這個專案的每個階段,從聾人 Google 員工 Sam Sepah 的概念發想,到與聾人合作夥伴進行數據收集,在聾人使用者研究中進行評估,以及與聾人專家共同評估這項技術的影響。

為了指導負責任的實際部署,我們成立了 AI 手語諮詢委員會(AISLAC),匯集了許多全球聾人組織和主題專家。透過這種參與式治理模式,受我們技術影響最深的社群直接影響我們的開發優先順序。我們為 Gboard 和 Live Transcribe 中發布的 SL2T 1.0 共同撰寫了一份聯合影響報告,透明地詳細說明了該技術的功能和當前限制,我們計劃在所有主要手語發布中繼續採用這種協作方式。

展望未來

SL2T 建立在學術界和業界數十年來的基礎研究之上,但將 ASL 輸入帶到使用者手機上僅僅是個開始。Google 的使命是整理全球資訊,並使其普遍可存取且實用。實現普遍可存取性意味著要達到與口語和書面語完全平等的地位。我們的團隊正在努力將這項技術擴展到其他手語、手語生成以及前沿 AI 功能。我們期待負責任地分享我們的進展,以使手語存取在數位領域成為標準。

你可以在 Pixel 11 上率先體驗 Gboard 和 Live Transcribe 中的 SL2T 功能,更多裝置即將推出,且無需額外費用。

致謝

這項工作由 Google DeepMind 和 Android 團隊共同完成。開發 SL2T 模型的核心團隊成員包括:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting、Andy Zhang 和 Chris Dyer。

將模型整合到 Gboard 和 Live Transcribe 的 Android 團隊成員包括:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su 和 Sharlene Yuan。

我們感謝 Anelia Angelova、Abhishek Bapna、Sara Basson、Glenn Cameron、Scott Crowell、Trevor Cohn、Noah Fiedel、Zoubin Ghahramani、Raia Hadsell、Tom Hudson、Alexander Hauerslev Jensen、Kazuya Kawakami、Peike Li、Liam McCafferty、Caroline Pantofaru、Abhinav Parashar、Christopher Patnoe、Laura Rimell、Sagar Savla、Sam Sepah、Thad Starner、Dave Uthus 和 Biao Zhang 的額外支援。

同時,也衷心感謝所有參與我們模型早期測試的人員。