字节跳动发布 Seedance 2.5 视频生成模型:单次生成时长翻倍至 30 秒
字节跳动正式发布 Seedance 2.5 视频生成模型,将单次视频生成时长从 15 秒提升至 30 秒。该模型将陆续上线即梦 AI 与豆包专业版,API 服务也将于近期接入火山方舟,面向影视、广告、教育、工业制造及自动驾驶等多场景开放。
官方介绍,Seedance 2.5 延续了统一的多模态音视频联合生成架构,核心突破在于长叙事能力、多模态参考和编辑能力的全面提升。这意味着 AI 视频生成从"零散片段"迈向"完整叙事"成为可能。
30 秒多镜头叙事,多轮延长保持一致性
官方示例展示了一段歌手登台演出的完整片段:镜头从红色幕布缝隙推进至后台化妆间,女歌手整理耳机、接受工作人员提醒,随后穿过通道与舞伴互动、接过麦克风,最终登上舞台——镜头拉远至体育馆全景,观众、灯牌、荧光棒和欢呼声尽收眼底。模型在 30 秒内完成了铺垫、推进、转折、收尾等多个逻辑关联镜头的组织。
多轮延长能力同样值得关注。模型可在已有视频基础上继续生成 30 秒内容,并保持人物主体、场景、画面风格及声音音效的一致性。官方演示中,小男孩抱着足球跑出地铁车厢、男主追赶并最终抓住小男孩的连续动作衔接自然。
支持 30 张图片、10 段视频参考,群像调度能力升级
Seedance 2.5 支持用户单次输入最多 30 张图片、10 段视频、10 段音频作为参考素材。模型可综合理解不同素材中的构图、场景、风格、人物和道具等元素,并按指令精准用于视频生成。
在多人同框场景中,模型能够同时还原多人形象与声音,保持主体稳定。官方展示的 30 秒音乐会片段采用 16:9 横屏、电影感写实风格,参考素材涵盖钢琴家、大提琴、小提琴、主唱、管弦乐队、合唱团及观众席。当 AI 视频从"特效玩具"进化到能驾驭完整叙事和群像调度,短视频创作的工具形态或将迎来新一轮变革。