谷歌DeepMind发布多语言手语转文本模型SL2T,并将其集成至Pixel 11系统,支持通过前置摄像头识别手语输入,接入Gboard和Live Transcribe,可用于消息编辑、网页检索及与Gemini对话。SL2T基于50余种手语、10万小时素材训练,可解析手部动作、面部表情、空间位置和唇部动作等信息。目前功能仅支持美国手语转英文,原始视频不上传云端,谷歌计划后续扩展更多手语及安卓机型。
谷歌DeepMind发布多语言手语转文本模型SL2T,并将其集成至Pixel 11系统,支持通过前置摄像头识别手语输入,接入Gboard和Live Transcribe,可用于消息编辑、网页检索及与Gemini对话。SL2T基于50余种手语、10万小时素材训练,可解析手部动作、面部表情、空间位置和唇部动作等信息。目前功能仅支持美国手语转英文,原始视频不上传云端,谷歌计划后续扩展更多手语及安卓机型。