谷歌旗下人工智能实验室近日宣布,正式推出一款大规模多语言手语转文本(SL2T)翻译模型,标志着手语人工智能技术首次应用于消费级产品领域。这一突破性成果将率先在谷歌Pixel 11系列智能手机的Gboard键盘和Live Transcribe应用中落地,初期支持美国手语转换,未来计划扩展至更多语种及设备平台。
据统计,全球约有7000万听力障碍人士使用超过200种手语进行日常交流。新功能的推出使这类用户能够通过手势动作实现类似语音输入的便捷文本输入体验。测试数据显示,使用美国手语进行文本转换的效率显著高于传统英语键盘输入,在自然度和用户体验满意度方面也表现更优。
DeepMind团队强调,手语作为独立自然语言体系,具有独特的语法结构和词汇系统,其翻译过程需要真正的机器翻译技术支撑,而非简单的动作-文字对应转换。为应对这一挑战,研发团队构建了能够同步解析手部、面部及躯干多部位运动轨迹的计算机视觉系统,确保对复杂手势表达的精准捕捉。
该模型训练数据覆盖50余种手语的10万小时视频素材,采用创新的姿势特征点提取技术,将用户手势转化为空间坐标信息进行处理。这种设计既避免了原始视频数据的传输风险,又通过摒弃传统"中间注释"环节,实现了对三维空间信息的直接解析,在隐私保护与翻译精度之间取得平衡。目前相关功能已通过技术验证,即将面向特定用户群体开启测试。




京公网安备 11011402013531号