DeepMind 手语翻译模型 SL2T 登陆 Pixel 11,首发支持 ASL→英语
2026 年 8 月 12 日,谷歌 DeepMind 在自家博客发布了 SL2T,一款把手语直接翻译成书面文字的多语言模型。首发只支持一个语言对,ASL→英语,集成在 Pixel 11 系列的 Gboard 语音输入和 Live Transcribe 中,不额外收费;谷歌表示该功能还会登陆其他设备。
公司称,模型在超过 50 种手语、总计 10 万小时以上的数据上训练(其中约 25% 为 ASL),并在 FLEURS-ASL 基准(sd-test 划分)的零样本评测中取得 70 BLEURT,自称“显著高于此前报告的任何分数”(来源:官方公告)。这一数值目前尚未被独立评测方复现,而 BLEURT 是一项自动指标,并不能说明它在真实对话中是否好用。
处理流程分两段:在设备端由 MediaPipe Holistic 提取姿态关键点坐标(面部、双手、手臂、上身),只有这串坐标序列会被送到服务器,由 SL2T 生成文本。谷歌称原始视频会被立即丢弃、不会离开设备,并以此作为保护隐私的依据(来源:官方公告)。模型跳过了中间标注(“gloss”),直接产出文字。
“Sign languages are the primary languages of Deaf communities around the world and the cornerstone of Deaf cultural identity”(“手语是全世界聋人社群的第一语言,也是聋人文化认同的基石”),谷歌 DeepMind 在官方博文中如此表述。“Deaf people can benefit from sign language processing in the same way that hearing people benefit from spoken language processing”(“聋人可以从手语处理中获益,正如听人从口语处理中获益一样”)——这是 Engadget 引述的谷歌 DeepMind 说法。
谷歌明确列出了局限:罕见手势、快速指拼、被动结构、描述性分类词以及缺乏上下文的时态,都可能出错。模型针对惯用右手打手语的人做了优化,用左手的人性能相差 10%;支持单手打手语,这正是手里拿着手机时的常见情形(来源:官方公告)。公司成立了 AI Sign Language Advisory Committee(AISLAC),成员包括聋人组织与专家,并称与其共同签署了一份影响评估报告;该文件是否全文公开,我们没有核实。SiliconANGLE 提到,模型对非手语动作设有防幻觉措施,并计划把工作扩展到其他手语以及手语生成模型。媒体提到潜在受众约为全球 7000 万聋人或听力障碍者,现存手语超过 200 种(这是媒体口径的数字,技术文档中并未出现)。
要做独立、可复现的评估,目前还缺: - 端到端延迟与离线表现(官方博文未说明) - 能复现 FLEURS-ASL 上 70 BLEURT 的评测流程与代码(该分数目前没有第三方佐证) - 其他手语以及 Pixel 11 之外机型的时间表 - 在内部评测流程之外与聋人用户进行测试的证据
这次亮相仍局限于一个语言对、一个机型系列;独立验证还没有出现。
Come Olya ha verificato questa notizia
- Verificato
- 起点是 deepmind.google 上的官方博文,从中提取了日期、训练时长、基准分数、两段式架构、公开承认的局限以及顾问委员会的构成。随后查看了两家独立来源:Engadget 和 SiliconANGLE。三方在这些事实上一致:2026 年 8 月 12 日、10 万小时以上训练数据(约 25% 为 ASL)、FLEURS-ASL 上 70 BLEURT、使用 MediaPipe Holistic 且只上传姿态坐标、不经过“gloss”中间步骤、在 Pixel 11 的 Gboard 与 Live Transcribe 中免费首发。我把谷歌自己的说法(指标、隐私、左手差距)和媒体补充的内容(7000 万人、200 多种手语)分开处理。没有采用任何传闻或泄露信息。
- Incertezze
- FLEURS-ASL 上的 70 BLEURT 是谷歌自己公布的,尚无独立评测方复现;BLEURT 是自动指标,说明不了译文在真实对话里能派上多大用场。其他手语和 Pixel 11 之外机型都没有给出时间表。与 AISLAC 共同签署的影响评估报告在公告中被提及,但我没有核实其是否全文公开。延迟、离线表现,以及在谷歌内部评测流程之外与聋人用户的测试,均未见说明。左手打手语 10% 的性能差距是谷歌测量并公布的。全球 7000 万聋人这一数字来自媒体报道,不在技术文档里。
- Perché pubblicarla
- 一个模型走出实验室、进到手机键盘里,而且是为了无障碍功能而不是演示,这种情况并不多见。它牵出三个读者关心的问题:数据去了哪里(这里视频不离开设备,只传坐标)、由模型制造方自己公布的基准数字有多大分量、以及局限——罕见手势、指拼、左手——是与聋人组织一起白纸黑字写下来的。本站还没有一篇文章把无障碍当作这类模型的应用领域来写。