最新消息:关注人工智能 AI赋能新媒体运营

通义千问Qwen-Audio-3.0-TTS开放:首包延迟300ms,支持20种方言

科技资讯 admin 浏览

阿里通义千问发布 Qwen-Audio-3.0-TTS,语音合成进入"会表达"时代

阿里通义千问团队近日正式发布新一代实时语音合成模型 Qwen-Audio-3.0-TTS,推动语音合成技术从"能说话"向"会表达"跨越。该模型 Plus 版本目前已在 Artificial Analysis 旗下 Speech Arena 评测榜单中登顶,综合表现超过 Gemini 3.1 TTS、ElevenLabs v3 等主流产品。

Qwen-Audio-3.0-TTS 模型发布

本次发布包含两个版本:Flash 版面向实时交互场景优化,首包延迟约 300ms,适用于智能助手等低延时需求;Plus 版则侧重高质量生成,在自然度与音色还原度方面表现更优。

该模型在核心能力上实现了四项突破:

一是多语种与方言覆盖能力显著提升。模型支持 16 种语言,Plus 版在全部 16 种语言上的平均说话人相似度达到 82.75;同时支持 20 种中文方言,有效避免"方言特色弱化"问题,输出更贴近母语者自然表达。

二是支持 Free-style 自然语言指令。用户无需掌握专业标注方法,仅通过"温柔客服语气""带货主播风格"等日常描述即可精准控制语音生成风格。

三是细粒度标签控制。模型支持 [gasp]、[angry] 等结构化标签,可精确调控呼吸、笑声等非语言细节,满足游戏、有声书等场景的精细化需求。

四是复杂声学环境下的鲁棒性增强。即使参考音频存在高噪声、高混响等干扰,模型仍能自动过滤杂音并保留目标音色,确保合成质量稳定。

配套方面,官方精品音色库覆盖指令、方言、小语种等多类音色,支持 48K 高清音频输出,单次合成最长支持 3 分钟长文本。目前该模型已在阿里云百炼平台开放接入。

Qwen-Audio-3.0-TTS 技术特性