Google DeepMind Blog 发布于 08/12 22:01

Putting sign language AI into users’ hands

(翻译)将手语AI交到用户手中

查看原文

资讯摘要

Introducing sign-language-to-text (SL2T), our breakthrough model powering new sign language features for Deaf and hard of hearing users.

AI 摘要

Google DeepMind推出大规模手语转文字模型SL2T,首次将手语AI落地到消费产品。该模型在Gboard和Live Transcribe中支持美国手语到英语的听写,Pixel 11率先上线。SL2T基于超10万小时、50多种手语数据训练,通过姿态关键点处理输入以保护隐私,并宣称在FLEURS-ASL基准上达到零样本BLEURT 70分。

AI 问答

SL2T是什么?

SL2T是一个大规模手语到文本翻译模型,能把手语视频转换为文字,目前率先在Gboard和Live Transcribe中支持美国手语到英语的听写。

SL2T如何保护用户隐私?

SL2T不直接处理原始视频,而是由设备端模型MediaPipe Holistic提取手语者的姿态关键点,仅将这些坐标发送到服务器翻译,原始视频随即丢弃。

SL2T首批在哪些设备上上线?

首批在Pixel 11的Gboard和Live Transcribe中提供美国手语到英语的手语转文字功能,更多设备和语言将陆续支持。

打开原文