谷歌旗下DeepMind發佈全新多語言手語轉文本模型SL2T,並將其搭載至Pixel11手機系統,首次推動手語AI進入普通消費電子產品。該模型率先接入Gboard鍵盤和Live Transcribe,用戶通過前置攝像頭完成手語動作,即可進行消息編輯、網頁檢索及與Gemini對話,替代傳統鍵盤輸入。
SL2T基於超過50種手語、累計10萬小時手語素材訓練,其中約四分之一來自美國手語數據集。跨語種聯合訓練幫助模型學習不同手語之間的共通動作邏輯,並在FLEURS-ASL評測中刷新手語轉寫模型紀錄。與依賴固定詞彙標籤的傳統方案不同,SL2T可直接解析人體動作生成文本,同時處理面部表情、肢體空間位置和脣部動作等非手部語義信息。
隱私方面,手機端MediaPipe Holistic實時追蹤手部、面部和軀幹共130處關鍵點,僅向外傳輸動作座標,原始視頻會即時刪除,不上傳雲端。目前該功能僅支持美國手語轉英文,谷歌計劃後續擴展更多手語及安卓機型。
DeepMind此前於2025年5月開源手語互譯模型SignGemma,爲SL2T落地提供算法基礎。此外,其WaveNet、Euphonia及Live Transcribe等無障礙技術也積累了語音、視覺多模態經驗。隨着谷歌、科大訊飛、華爲和蘋果持續佈局,AI無障礙交互正從科研驗證加速走向消費級產品。
