最新消息:关注人工智能 AI赋能新媒体运营

腾讯混元发布HyASR 3.0预览版:语音识别首次实现语境理解

科技资讯 admin 浏览

腾讯混元发布新一代语音识别模型Hy ASR3.0preview

腾讯混元今日正式推出新一代语音识别模型Hy ASR3.0preview。该模型首次将大语言模型Hy3的深度语义理解能力与高精度语音识别进行深度融合,推动语音识别从"逐字转写、单点优化"向"理解语境、兼容场景、一键直出"跨越。

据官方披露,新模型在多项评测中表现突出。在开源评测集上,中文普通话、英语、粤语的词错误率(WER)分别低至3.34%、2.62%、3.12%,整体控制在3%左右。在自建评测集中,模型覆盖通用识别、10余种方言、上下文语义理解、专业术语识别及高噪、耳语等复杂声学场景,WER同样保持行业领先水平。

技术层面,Hy ASR3.0preview的能力升级源于全链路优化。架构上采用兼顾效率与性能的MoE架构,基座升级为Hy3大模型,同时自研无监督语音Encoder,依托数千万小时级语音数据训练,提升声学特征提取能力。预训练阶段实现语音Encoder与大语言模型联合训练,覆盖多方言、多口音、多声学环境的海量数据,通过多阶段能力注入强化方言识别、上下文感知等特性。后训练环节则构建了覆盖20余个方言小片区的SFT数据集,结合多阶段强化学习,针对性解决复杂场景下的误识别、漏识别问题。

目前,Hy ASR3.0preview已上线腾讯云官网对外开放API,可广泛应用于智能客服、内容理解、语音搜索等领域。腾讯旗下AI助手"元宝"已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错、复杂环境稳定转写等功能,相关能力免费开放;WorkBuddy等产品也在陆续接入中。业内认为,此次更新标志着语音识别技术向"更懂用户意图"的方向迈出关键一步,将为多场景语音交互体验带来显著提升。