一个人不方便说话,或者听不见声音,要怎么和手机交流?

很多时候,只能打字。

谷歌正在尝试换一种方式:让手机直接“看”手语。

近日,Google DeepMind推出手语转文本模型SL2T,并率先应用在Pixel 11系列手机上。用户对着手机摄像头打手语,系统可以识别动作,再把内容转换成文字。目前,这项功能首先支持美国手语(ASL),并接入Gboard输入法和Live Transcribe实时转写等功能。

这项变化看起来只是多了一种输入方式,但对习惯使用手语的聋人和听障用户来说,意义要具体得多。

发一条消息,不一定非要低头打字;和别人面对面交流时,手机也可以帮忙把手语变成文字。原本需要别人帮忙理解的表达,开始有机会直接通过手机完成。

手语识别并不只是“看手势”。

真正的手语交流里,手指、手臂、身体姿态、动作位置,甚至面部表情都会参与表达。动作看起来相似,放在不同的位置,或者配上不同的表情,意思都可能发生变化。

SL2T要做的,是把这些连续动作理解成完整的一句话,而不是识别几个固定手势,再机械地拼成文字。

隐私也是不少人会关心的问题。

按照谷歌公布的信息,手机会先在设备端提取人体关键点,把动作转成坐标数据,再交给模型处理。也就是说,系统重点分析的是动作信息,而不是直接拿完整视频画面去做翻译。

到了Pixel 11上,这项技术已经不再只停留在实验室里。

用户可以直接通过手语输入内容,部分设备还能借助双屏显示翻译结果。一边打手语,一边让对方看到文字,交流过程会自然很多。

它目前仍有明显限制。首批主要支持美国手语,不同国家和地区使用的手语体系并不一样,同一种手语在真实生活中的表达也更加灵活。口语有口音,手语同样会有个人习惯,识别效果还要经过更多真实场景检验。

这项技术最值得关注的,不是手机又增加了一个新功能,而是人与手机交流的方式正在变多。

有人习惯说话,有人习惯打字,也有人每天用手语表达。

当手机开始学着理解这些不同的表达方式,技术才真正开始照顾到更多人的生活。