腾讯混元正式推出新一代语音识别模型 Hy ASR3.0 Preview,标志着语音识别技术从"逐字转写"迈入"理解语境"的新阶段。该模型基于最新一代大语言模型 Hy3 构建,融合高精度语音识别与深度语义理解能力,核心目标直指一个质变——让 AI 不再只是听清每个字,而是真正听懂你说的话。
方言覆盖十大片区,长音频场景优势突出
在识别广度上,Hy ASR3.0 Preview 不要求标准普通话,方言识别覆盖粤语、吴语等 10 大方言片区和 20 余个二级小片区。开源评测集数据显示,该模型多语种词错误率(WER)控制在 3% 左右,其中中文普通话 3.34%、英语 2.62%、粤语 3.12%,整体准确度已接近行业天花板。
结合 Hy3 的语言理解能力,模型能够结合上下文语境精准捕捉用户意图,自动消除歧义并智能纠错同音词。在转写难度较高的会议纪要、访谈长音频等场景中,这一"先理解再转写"的思路优势尤为明显——传统逐字听写遇到同音歧义往往束手无策,而 Hy ASR3.0 能根据语义逻辑自动选择正确用词。
MoE 架构打底,千万小时级数据联合训练
技术层面,模型采用兼顾效率与性能的 MoE 架构,基座升级至 Hy3。混元团队自研了无监督语音 Encoder,通过数千万小时级无监督语音数据训练,从复杂音频中提取高质量声学表征——Encoder 负责"听得好",Hy3 负责"理解对"。
在数据策略上,团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级多来源语音数据,并通过多阶段能力注入,使模型具备上下文感知、复杂场景适应和方言识别能力。后训练环节则围绕通用识别、上下文理解和复杂场景鲁棒性构建高质量 SFT 方案,覆盖上下文 Context、专业名词、不同声学环境及多样人群语音,并引入多阶段强化学习针对复杂长尾场景持续优化。
目前,Hy ASR3.0 Preview 已上线腾讯云官网对外开放 API,可广泛应用于智能客服、内容理解和语音搜索等领域。腾讯旗下 AI 助手"元宝"已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错和复杂环境稳定转写等功能且免费开放,WorkBuddy 等产品也在陆续接入中。当语音识别从"听字"进化到"听懂",人与 AI 的交互方式正在被重新定义。




京公网安备 11011402013531号