⚡ 猫叔的AI资讯雷达
研究模型产业

谷歌将手语输入带到 Pixel 11,首发支持美式手语

DeepMind 的 SL2T 模型进入 Gboard 与实时转写,让 Pixel 11 用户可直接用美式手语输入英文。

从实验指标走向手机输入法

Google DeepMind 推出多语言手语转文字模型 SL2T,并将其用于 Pixel 11 的 Gboard 手语听写和 Live Transcribe 双向交流功能。首发版本支持把美式手语翻译成英文,用户在写消息、搜索网页或向 Gemini 发出请求时,可以直接对着手机打手语。谷歌表示,后续将扩展到更多设备和语言组合。

系统不会直接把原始摄像头画面上传到服务器,而是先由端侧感知模型提取面部、双手、手臂和躯干的运动坐标,再发送这些坐标完成翻译,从而减少离开手机的可识别视觉信息。模型还针对传统手语数据集容易忽略的真实使用场景进行了优化,包括一只手拿手机时的单手表达、左利手表达,以及不应被误判为语言的无意动作。

DeepMind 表示,SL2T 的研发由聋人员工和外部手语顾问委员会共同参与。相关训练工作覆盖 50 多种手语,但首发产品目前只有“美式手语转英文”这一种组合。这个区别很重要:手语是拥有独立语法的自然语言,并不是把周围口语逐词替换成动作,因此扩展新语言远不只是更换一套词汇。

为何重要

手语识别研究已经持续多年,但真正成为可靠通用输入方式的成果仍然很少。SL2T 被整合进键盘和实时交流工具后,衡量标准将不再只是实验室准确率,而是聋人用户能否在日常生活中持续依赖它。首发范围仍然有限,只覆盖一代手机和单一翻译方向;不过,它为多模态 AI 找到了一个清晰、具体的消费级场景,也提出了一套更重视隐私的摄像头助手架构,其他厂商今后很难绕开这一标准。

信源