Fish Audio 发布 S2.1Pro 语音大模型,瞄准实时对话场景
Fish Audio 在成立周年之际推出其迄今最强大的生产级语音大模型 S2.1Pro。与传统面向脚本旁白的文本转语音(TTS)系统不同,该模型专为实时对话语音场景设计,目前已通过 Fish Audio API 上线,同时提供免费版本供开发与测试使用。
技术层面,S2.1Pro 实现了约 90 毫秒的首帧音频播放延迟,可支持自然流畅的对话轮替。模型覆盖 83 种语言,采用统一的语音识别架构。在语音控制方面,S2.1Pro 突破了预设情绪菜单的限制,用户可直接在文本中嵌入自由格式的括号标签,精准实现耳语、紧张笑声等细粒度指令。
此外,S2.1Pro 原生支持多说话人对话生成,仅需 10 至 30 秒的短参考样本即可完成高质量语音克隆,无需额外微调即可复刻目标语调与说话风格。
S2.1Pro 的推出标志着语音 AI 正从脚本式合成向极低延迟、高拟真度的实时对话模式演进,为全球化智能语音交互提供了更低门槛的基础设施。