Black Forest Labs发布FLUX3多模态基础模型,统一生成图像、视频与音频
Black Forest Labs近日以Early Access形式推出FLUX3多模态基础模型。该模型采用统一架构,通过联合学习实现图像、视频与音频的同步生成与理解,基于Self-Flow(自监督流匹配)学习框架扩展,在FLUX.1和FLUX.2系列基础上进一步拓展至多模态领域。
原生音频同步输出,视频生成性能领先
FLUX3支持单次生成最长20秒的视频并附带原生音频,涵盖文生视频、图生视频、视频生视频、音视频续写、关键帧转视频、多语言对话及多镜头串联等多种创作模式。在带声音的10秒720p视频人工评测中,FLUX3对比Grok Imagine Video胜率达69%,对比Seedance 2.0和Gemini Omni Flash胜率均为52%。
图像能力全面,拓展至机器人行为预测
图像方面,FLUX3支持多种风格、宽高比和分辨率的图像生成与编辑。此外,Black Forest Labs正与Mimic Robotics合作,探索将FLUX3应用于机器人行为预测模型,将多模态AI能力从数字内容生成延伸至实体机器人领域,目标成为连接数字世界与物理世界的通用多模态引擎。