阿里千问发布语音合成大模型:自然语言指令即可控制语音风格
阿里千问于7月20日正式推出语音合成大模型Qwen-Audio-3.0-TTS,将语音合成的控制权从复杂的参数配置转向自然语言指令,降低了用户使用门槛。
该模型的核心亮点在于Free-style自然语言指令控制。以往,用户若想让AI以特定语气、节奏或风格输出语音,需要调整大量工程参数;而现在,只需用日常语言描述需求,模型即可生成对应风格的语音。
Qwen-Audio-3.0-TTS提供两个版本以适应不同场景。Flash版本面向实时交互场景,首包延迟控制在300毫秒以内,适用于实时问答、语音助手等对响应速度要求较高的应用;Plus版本则侧重音质与表现力,面向有声书、配音、内容创作等需要精细声音质感的任务。
此次发布意味着语音合成技术进一步向普通用户工具化迈进,自然语言成为操控语音的新方式。