阿里巴巴发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash
阿里巴巴正式发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点提升 AI 在专业领域的语音识别能力。该模型针对上下文一致性、行业术语识别和热词定制三个核心环节进行优化,并支持语音润色与结构化文本输出。
研究团队从医疗、IT 编程、股票、社会名人等领域持续积累专业词汇,构建了覆盖多行业的高质量词库。内部评测显示,新模型在各行业专业词汇识别率上均有提升,其中医疗场景识别率突破 95.36%。
该系列模型此前在 AI 评测平台 Artificial Analysis 上以 1.7% 的错字率获得全球领先成绩,目前已应用于会议纪要整理、实时字幕生成、教育录播、智能客服等场景。
模型现通过阿里云百炼平台开放调用,提供三个版本:支持最长 5 分钟实时语音识别的 Flash 版、离线文件转写的 Filetrans 版,以及实时语音识别 Streaming 版。