最新消息:关注人工智能 AI赋能新媒体运营

腾讯混元发布Hy ASR 3.0 preview:语音识别不再逐字硬转,而是真的听懂了语境

科技资讯 admin 浏览

腾讯混元发布新一代语音识别模型 Hy ASR3.0preview

腾讯混元今日正式发布新一代语音识别模型 Hy ASR3.0preview。该模型依托最新一代大语言模型 Hy3 的语言理解能力,将高精度语音识别与深度语义理解相结合,在通用识别、上下文感知、多场景鲁棒性和方言覆盖等核心维度上实现全面提升,能够在更复杂的真实输入环境中输出准确、连贯且更贴近用户本意的转写结果。官方表示,该产品已从"逐字转写、单点优化"进化至"理解语境、兼容场景、一键直出"的新阶段。

在评测表现方面,Hy ASR3.0preview 在海外开源评测集上将多个语种的词错误率(WER)控制在 3% 左右:中文普通话为 3.34%,英语为 2.62%,粤语为 3.12%。在腾讯自建评测集中,无论是通用识别、方言识别、上下文理解、专词理解,还是高噪、耳语等复杂声学场景,其词错误率均保持低位,在综合评测集上取得最低错词率。

针对用户实际体验,该版本重点优化了四个方面。其一,通用识别精度提升,在通用语音、方言、中英混说等场景下进一步减少错字、漏字问题,同时缓解长音频中错误累积的痛点。其二,语义理解能力增强,模型结合上下文精准捕捉用户语境,智能纠正同音词、消除语义歧义。其三,专业场景适配优化,支持热词注入增强功能,使模型能够快速识别品牌名、产品名、人名及行业术语,降低业务接入与后期维护成本。