当前位置: 首页 » 资讯 » 科技头条 » 正文

腾讯混元 Hy ASR3.0 预览版发布:从"听清"到"听懂",方言词错率压到 3%

IP属地 中国·北京 编辑:顾青青 Chinaz 时间:2026-08-05 18:21:04

腾讯混元正式推出新一代语音识别模型 Hy ASR3.0 Preview,标志着语音识别技术从"逐字转写"迈入"理解语境"的新阶段。该模型基于最新一代大语言模型 Hy3 构建,融合高精度语音识别与深度语义理解能力,核心目标直指一个质变——让 AI 不再只是听清每个字,而是真正听懂你说的话。

方言覆盖十大片区,长音频场景优势突出

在识别广度上,Hy ASR3.0 Preview 不要求标准普通话,方言识别覆盖粤语、吴语等 10 大方言片区和 20 余个二级小片区。开源评测集数据显示,该模型多语种词错误率(WER)控制在 3% 左右,其中中文普通话 3.34%、英语 2.62%、粤语 3.12%,整体准确度已接近行业天花板。

结合 Hy3 的语言理解能力,模型能够结合上下文语境精准捕捉用户意图,自动消除歧义并智能纠错同音词。在转写难度较高的会议纪要、访谈长音频等场景中,这一"先理解再转写"的思路优势尤为明显——传统逐字听写遇到同音歧义往往束手无策,而 Hy ASR3.0 能根据语义逻辑自动选择正确用词。

MoE 架构打底,千万小时级数据联合训练

技术层面,模型采用兼顾效率与性能的 MoE 架构,基座升级至 Hy3。混元团队自研了无监督语音 Encoder,通过数千万小时级无监督语音数据训练,从复杂音频中提取高质量声学表征——Encoder 负责"听得好",Hy3 负责"理解对"。

在数据策略上,团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级多来源语音数据,并通过多阶段能力注入,使模型具备上下文感知、复杂场景适应和方言识别能力。后训练环节则围绕通用识别、上下文理解和复杂场景鲁棒性构建高质量 SFT 方案,覆盖上下文 Context、专业名词、不同声学环境及多样人群语音,并引入多阶段强化学习针对复杂长尾场景持续优化。

目前,Hy ASR3.0 Preview 已上线腾讯云官网对外开放 API,可广泛应用于智能客服、内容理解和语音搜索等领域。腾讯旗下 AI 助手"元宝"已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错和复杂环境稳定转写等功能且免费开放,WorkBuddy 等产品也在陆续接入中。当语音识别从"听字"进化到"听懂",人与 AI 的交互方式正在被重新定义。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。