8 月 12 日,谷歌旗下 AI 研究機構 DeepMind 正式對外發布 SL2T 手語翻譯模型。該模型將集成到 Gboard 輸入法與 Live Transcribe 實時轉錄應用,首批實現美國手語向英文文本轉換,Pixel 11 手機用戶可以免費使用這項無障礙功能。
SL2T 依託規模龐大的多語種手語數據集完成訓練,素材覆蓋 50 余種手語,總影片時長超 10 萬小時,其中美國手語素材占四分之一。

通過多手語、不同熟練度樣本的聯合訓練,模型翻譯表現優於單語種方案。和簡單的手勢詞彙替換不同,SL2T 採用完整機器翻譯邏輯,充分適配手語獨立的語法體系,直接輸出通順文本。
隱私層面,該模型不會上傳攝影機原始畫面。藉助端側 MediaPipe Holistic 技術,手機提取人體姿態特徵坐標,僅把坐標資訊上傳伺服器,原始影片捕獲後便立刻刪除。
在 FLEURSASL 測試基準中,它取得 70 BLEURT 的零樣本翻譯成績,但面對生僻手語表達、高速手指拼寫仍會出現識別偏差。官方已經針對單手手勢、左撇子使用者做了適配優化,降低流式翻譯延遲。
產品研發全程吸納聽障社群的意見,組建聾人組織與專家構成的諮詢委員會,社群深度參與數據採集、效果評估環節。現階段 SL2T 僅支持美國手語,DeepMind 後續計劃擴充手語語種,還將探索手語生成的反向翻譯能力,進一步完善無障礙交互體驗。






