最新消息:关注人工智能 AI赋能新媒体运营

字节跳动发布Seed Audio 1.0:音频生成从“会说”迈向“会创作”

科技资讯 admin 浏览

字节跳动推出 Seed Audio 1.0:AI 音频生成进入完整声音场景创作时代

字节跳动近日正式发布音频创作模型 Seed Audio 1.0,标志着 AI 音频生成技术从单一语音合成迈向完整声音场景创作的新阶段。该模型目前已上线火山方舟体验中心,面向创作者开放测试。

传统影视级音频内容生产长期依赖多模型分别生成人声、音效与环境声,再经人工拼接混音,流程冗长且难以保证整体叙事一致性。Seed Audio 1.0 的核心突破在于,它并非简单拼接素材,而是在统一框架下联合建模多种音频要素,端到端生成可服务于叙事的"完整声音作品"。

Seed Audio 1.0 功能示意

据官方介绍,Seed Audio 1.0 具备三大核心能力:

一是精准的时空编排,支持以 100 毫秒精度按时间线控制对白、音效的入场时机,适配视频配音与广告制作;二是稳定的音色演绎,支持零样本生成与长音频延展,在保持角色音色一致性的同时,可自然呈现愤怒、喜悦等不同情绪,同一音色还能演绎多个角色;三是地道的多语种支持,覆盖中文、英语、日语等 20 余种语言,确保声音在不同语种下符合本土表达节奏与重音习惯。

评测数据显示,该模型在九大类常见创作场景中的音频可用率已超过 90%,多语言生成的自然度 MOS 评分普遍达到 4 分以上(优秀水平)。

Seed Audio 1.0 评测数据

从"会说"到"会创作",Seed Audio 1.0 显著降低了高质量音频内容的制作门槛。未来,团队计划进一步融合视频参考等多模态输入,并探索可控翻译技术,持续优化长音频与分轨生成能力,助力创作者将脑海中的声音构想高效转化为可听见的作品。

项目主页:https://seed.bytedance.com/seedaudio1_0

体验入口:火山方舟体验中心 → 登录 → 选择语音模型 → 语音合成 → Doubao-音频生成-1.0