DeepMind 发布手语转文本模型 SL2T,Pixel 手机首次支持手语输入
谷歌旗下 DeepMind 推出多语言手语转文本模型 SL2T,并将其集成至 Pixel 11 手机系统。这是手语 AI 技术首次进入主流消费电子产品。该功能目前已接入 Gboard 键盘和 Live Transcribe 应用,用户通过前置摄像头进行手语表达,即可完成消息编辑、网页搜索及与 Gemini 助手的交互,无需使用传统键盘输入。
SL2T 的训练数据涵盖超过 50 种手语、累计 10 万小时素材,其中约四分之一来自美国手语数据集。通过跨语种联合训练,模型能够捕捉不同手语之间的共性动作规律,并在 FLEURS-ASL 评测中创下新的手语转写准确率纪录。与依赖固定词汇标签的传统方案不同,SL2T 可直接解析人体动作生成文本,同时整合面部表情、肢体空间位置和唇部动作等非手部语义信息。
在隐私保护方面,手机端采用 MediaPipe Holistic 技术实时追踪手部、面部和躯干共 130 处关键点,仅向外传输动作坐标数据,原始视频即时删除,不上传云端。目前该功能仅支持美国手语转英文,谷歌表示后续将扩展至更多手语种类及安卓机型。
DeepMind 于 2025 年 5 月开源的手语互译模型 SignGemma 为 SL2T 的落地提供了算法基础。此前,该团队在 WaveNet 语音合成、Euphonia 辅助沟通及 Live Transcribe 实时字幕等无障碍技术领域已积累多年多模态研发经验。随着谷歌、科大讯飞、华为和苹果等企业持续投入,AI 无障碍交互正从实验室研究加速迈向消费级产品。