最新消息:关注人工智能 AI赋能新媒体运营

FLUX3发布:黑森林实验室推多模态模型,单次生成20秒音视频,性能超Grok与Seedance

科技资讯 admin 浏览

Black Forest Labs发布FLUX3多模态基础模型,统一生成图像、视频与音频

Black Forest Labs近日以Early Access形式推出FLUX3多模态基础模型。该模型采用统一架构,通过联合学习实现图像、视频与音频的同步生成与理解,基于Self-Flow(自监督流匹配)学习框架扩展,在FLUX.1和FLUX.2系列基础上进一步拓展至多模态领域。

原生音频同步输出,视频生成性能领先

FLUX3支持单次生成最长20秒的视频并附带原生音频,涵盖文生视频、图生视频、视频生视频、音视频续写、关键帧转视频、多语言对话及多镜头串联等多种创作模式。在带声音的10秒720p视频人工评测中,FLUX3对比Grok Imagine Video胜率达69%,对比Seedance 2.0和Gemini Omni Flash胜率均为52%。

图像能力全面,拓展至机器人行为预测

图像方面,FLUX3支持多种风格、宽高比和分辨率的图像生成与编辑。此外,Black Forest Labs正与Mimic Robotics合作,探索将FLUX3应用于机器人行为预测模型,将多模态AI能力从数字内容生成延伸至实体机器人领域,目标成为连接数字世界与物理世界的通用多模态引擎。