最新消息:关注人工智能 AI赋能新媒体运营

阿里发布Qwen-Audio-3.0-ASR-Flash,专攻专业场景语音识别

科技资讯 admin 浏览

阿里通义千问发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,主打长音频与行业术语识别

7月31日,阿里通义千问正式发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,核心卖点为"长音频不丢词、行业词不用教"。该模型目前已通过阿里云百炼平台开放调用。

据官方介绍,新模型在五个关键维度实现升级:

长音频上下文记忆:转写时可参考前文语义,数小时会议中的人名、技术概念能够全程保持一致,避免跨片段"断片"问题。

内置多行业词库:医疗场景专业词召回率达95.36%,IT编程领域达91.87%,无需人工配置即可精准识别冷门术语。

分级热词定制:企业专属词汇可即时生效,多数场景召回率突破99%,且不因热词数量增加而误触发。

集成语音润色:单步完成去除口头禅、清理重复内容、处理自我纠正和语义重组,输出可读性接近"ASR+大模型润色"的两步方案效果。

多语言覆盖:一套模型支持30余种语言,七语种平均语义错误率为17.09%,优于Azure、Gemini等同类产品,适用于跨国会议和出海客服等场景。

同期推出的 Qwen-Audio-3.0-ASR-Streaming 面向实时场景,理论出字延迟300毫秒,中文工业场景错字率7.80%,英文11.52%。该系列此前在Artificial Analysis评测中以1.7%错字率获得全球第一,现已应用于会议纪要、实时字幕、教育录播、智能客服等领域。