SL2T是什么?
SL2T是一个大规模手语到文本翻译模型,能把手语视频转换为文字,目前率先在Gboard和Live Transcribe中支持美国手语到英语的听写。
(翻译)将手语AI交到用户手中
Introducing sign-language-to-text (SL2T), our breakthrough model powering new sign language features for Deaf and hard of hearing users.
Google DeepMind推出大规模手语转文字模型SL2T,首次将手语AI落地到消费产品。该模型在Gboard和Live Transcribe中支持美国手语到英语的听写,Pixel 11率先上线。SL2T基于超10万小时、50多种手语数据训练,通过姿态关键点处理输入以保护隐私,并宣称在FLEURS-ASL基准上达到零样本BLEURT 70分。
SL2T是一个大规模手语到文本翻译模型,能把手语视频转换为文字,目前率先在Gboard和Live Transcribe中支持美国手语到英语的听写。
SL2T不直接处理原始视频,而是由设备端模型MediaPipe Holistic提取手语者的姿态关键点,仅将这些坐标发送到服务器翻译,原始视频随即丢弃。
首批在Pixel 11的Gboard和Live Transcribe中提供美国手语到英语的手语转文字功能,更多设备和语言将陆续支持。