Google DeepMind 推出了一种全新的手语 AI 翻译形式,让聋人和重听用户可以直接对着手机打手语而不是打字。公司称这是无障碍技术领域的一次真正突破。该模型于 2026 年 8 月 12 日发布,名为 SL2T——“sign-language-to-text”(手语转文本)的缩写——这也是此类技术首次走出研究实验室,进入 Gboard 和 Live Transcribe(即时转写) 等日常消费级应用。
Summary
要点速览
- Google DeepMind 发布了 SL2T,这是一款将手语直接转换为书面文本的多语言手语模型。
- 目前,它在 Pixel 11 上的 Gboard 和 Live Transcribe 中支持美国手语(ASL)到英语的转换,且无需额外付费。
- 该模型在超过 50 种手语、超过 100,000 小时的数据上进行训练,并在 FLEURS-ASL 基准上取得了 70 BLEURT 的成绩,远高于以往模型。
- SL2T 跟踪的是姿态关键点而非原始视频,以保护用户隐私,并会立即丢弃摄像头画面。
- 聋人社区成员从一开始就参与塑造了该项目,Google 还成立了 AI 手语顾问委员会(AISLAC)来指导其推广。
Google DeepMind 推出 SL2T:多语言手语 AI 翻译模型
SL2T 是 DeepMind 针对多年来 AI 领域存在的一项空白给出的答案:在过去二十年里,语音输入和自动翻译等口语工具已走向主流,而全球 200 多种手语——估计有 7,000 万聋人和重听人士使用——却在很大程度上被排除在外。DeepMind 将 SL2T 描述为一个“高度多语言化”的系统,旨在通过在翻译质量和语言覆盖范围上的显著跃升来弥补这一差距。
在实际使用中,它带来了一种全新的“语音输入”体验。就像听力正常的用户可以通过说话代替打字一样,SL2T 让聋人用户可以在任何原本需要打字的地方对着手机打手语——搜索网页、撰写消息或文档,或让 Gemini 完成任务。在 Live Transcribe 中,用户可以用手语表达自己在对话中的一方内容,而不必与听力正常的人来回打字。根据 Google 自身测试者的反馈,用 ASL 打手语比用英语打出等价内容更快、更自然。
Pixel 11 上 Gboard 和 Live Transcribe 的 ASL 支持
目前,这项技术支持一个语言对:美国手语翻译成英语。它首先在 Pixel 11 上的 Gboard 和 Live Transcribe 中提供,Google 承诺未来会支持更多设备和额外的手语。值得注意的是,该功能对用户不收取额外费用,被定位为标准无障碍功能,而不是付费增值服务。
多语言手语模型是如何构建的
SL2T 在一个包含超过 100,000 小时、覆盖 50 多种手语的数据集上进行训练,其中大约四分之一的数据是 ASL。与其为每种语言单独构建单语系统,DeepMind 选择在一个模型中同时训练多种语言和不同熟练程度的手语,这有助于模型学习共享结构,从而整体提升性能——在 DeepMind 自身测试中优于单语模型。
这种规模体现在具体指标上。在衡量 ASL 到英语翻译质量的 FLEURS-ASL 基准上,SL2T 在零样本设置下取得了 70 BLEURT 的分数。DeepMind 表示,这一数字显著高于此前同类任务的任何公开结果。这一差距很重要:它表明 SL2T 不只是小幅改进,而是在 AI 将手语视为完整语言(而非一串与单词一一对应的手势)方面实现了质的飞跃。
难点之一在于,手语并不是用手“表演”的口语。它有自己独立的语法、词汇和结构,并通过双手、手臂、躯干、头部和面部的同步运动来传达意义。要实时追踪这一切,是一个极具挑战的计算机视觉问题。这也是早期尝试(如手语手套)遇到困难的原因之一,因为它们把手语当作狭义的手部跟踪任务,而不是完整的语言翻译。
姿态关键点保护手语使用者隐私
SL2T 并不会把原始视频发送到服务器,而是将手语处理为一串姿态关键点坐标。一个名为 MediaPipe Holistic 的端侧模型会跟踪手语使用者身体上的关键点,只有这些几何坐标——而非摄像头画面本身——会被发送用于翻译。原始视频会被立即丢弃,这是 DeepMind 将隐私保护直接内嵌到系统架构中的方式,而不是事后补救。
跳过“词汇注释”,直接提升翻译准确度
SL2T 还打破了早期手语研究中的一种常见做法:它将坐标序列直接翻译成文本,跳过了被称为“gloss(词汇注释)”的逐步中间标注。Gloss 往往无法完整捕捉手语中更丰富、非线性的部分,包括承载真实意义的面部表情和空间构造。通过跳过这一步,SL2T 避免了人为的词汇限制,并让翻译质量可以随着数据规模直接提升。
Google 表示,他们还在基准分数之外,针对实际使用中的问题进行了优化——减少流式延迟、避免在用户并未打手语时产生错误翻译,并特别提升对大约 10% 左撇子手语使用者的识别准确度,以及对一只手拿着手机、另一只手打手语的用户的识别效果。
聋人社区塑造了 SL2T 的开发
DeepMind 将此项目定位为与聋人社区共同打造,而非单纯“为”他们打造。这个想法最初来自聋人 Googler Sam Sepah,聋人合作伙伴贯穿整个过程,参与了数据收集、用户测试以及对技术实际影响的评估。
为了在首发之后继续保持这种结构化参与,Google 成立了AI 手语顾问委员会(AISLAC),汇集全球聋人组织和相关领域专家,共同引导这项技术未来的部署方式。公司还与社区合作伙伴共同撰写了本次首发的联合影响报告,既说明 SL2T 能做什么,也坦陈其当前的局限——Google 表示,未来的手语版本也将延续这种做法。
手语 AI 翻译的下一步是什么
DeepMind 将 ASL 支持视为起点,而非终点。团队表示,他们正在努力将 SL2T 扩展到更多手语,探索手语生成(即将文本转换为手语输出的逆向过程),并在现有模型之上加入更高级的 AI 能力。
更宏大的目标仍然呼应 Google 长期以来“让信息普遍可及”的愿景。要在聋人社区实现这一点,就意味着要让手语在各类数字产品中更接近与口语和书面语的平等地位,而不是只在一台设备上推出一个功能。SL2T 在 ASL 上的早期成果,能否在扩展到几十种拥有各自语法和地域变体的手语时继续保持,将很大程度上决定这一更广阔愿景能多快为超出 Pixel 11 用户范围的更多人所实现。
常见问题
什么是 SL2T,它有什么作用?
SL2T 是 Google DeepMind 的多语言手语转文本模型。它可以将手语直接翻译成书面文本,让聋人用户通过对着手机打手语来输入消息、搜索或交流,而不必使用键盘。
SL2T 目前支持哪些手语?
目前,SL2T 只支持美国手语翻译成英语,并可通过 Pixel 11 上的 Gboard 和 Live Transcribe 使用。未来版本计划支持更多手语。
SL2T 在手语翻译过程中如何保护用户隐私?
SL2T 在设备端运行一个跟踪系统,读取手语使用者身体上的关键点,而不是将原始视频发送到任何地方。只有这些坐标会被用于翻译,摄像头画面本身会被立即丢弃。
聋人社区如何参与 SL2T 项目?
聋人个体从最初概念阶段就参与其中,贯穿数据收集、测试和治理全过程。Google 还成立了由聋人组织和专家组成的 AI 手语顾问委员会,以帮助指导这项技术的持续发展方向。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”什么是 SL2T,它有什么作用?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”SL2T 是 Google DeepMind 的多语言手语转文本模型。它可以将手语直接翻译成书面文本,让聋人用户通过对着手机打手语来输入消息、搜索或交流,而不必使用键盘。”}},{“@type”:”Question”,”name”:”SL2T 目前支持哪些手语?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”目前,SL2T 只支持美国手语翻译成英语,并可通过 Pixel 11 上的 Gboard 和 Live Transcribe 使用。未来版本计划支持更多手语。”}},{“@type”:”Question”,”name”:”SL2T 在手语翻译过程中如何保护用户隐私?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”SL2T 在设备端运行一个跟踪系统,读取手语使用者身体上的关键点,而不是将原始视频发送到任何地方。只有这些坐标会被用于翻译,摄像头画面本身会被立即丢弃。”}},{“@type”:”Question”,”name”:”聋人社区如何参与 SL2T 项目?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”聋人个体从最初概念阶段就参与其中,贯穿数据收集、测试和治理全过程。Google 还成立了由聋人组织和专家组成的 AI 手语顾问委员会,以帮助指导这项技术的持续发展方向。”}}]}
本文由人工智能协助生成,并由编辑团队审核。

