最新消息:关注人工智能 AI赋能新媒体运营

Flux3 发布:首个原生音频生成多模态模型,20 秒音画同步一次成型

科技资讯 admin 浏览

德国AI公司Black Forest Labs发布多模态模型Flux3,支持原生音视频同步生成

德国人工智能初创公司Black Forest Labs(黑森林实验室)正式发布多模态基础模型Flux3。该模型基于Self-Flow架构构建,配备专用图像、视频、音频及动作编解码器,实现对物理世界与数字环境的统一理解与生成。

Flux3的核心突破在于原生音视频同步生成能力。作为首个支持该功能的多模态模型,Flux3可一次性生成最长20秒的音视频同步片段。其能力覆盖文本生成视频、图像生成视频、视频转视频、基于关键帧的转场生成,以及多角色对话等场景。这意味着模型不再局限于单一图像或视频任务,而是将"听"与"看"整合至同一技术底座。

Flux3模型示意图

早期测试数据显示,在720p分辨率、10秒片段的设定下,Flux3以93%的胜率优于Luma Ray3.2,对Runway Gen-4.5的胜率优势达77%;即便与Seedance2.0、Gemini Omni Flash等顶尖模型相比,Flux3仍保持微弱领先。

在应用场景拓展方面,Black Forest Labs联合Mimic Robotics开发了面向机器人领域的动作模型Flux-mimic,目前已在奥迪工厂投入生产任务测试,标志着多模态能力从数字屏幕向实体产线的延伸。

发布计划方面,BFL采取分阶段策略:Flux3 Video已率先上线,Flux3 Image及带开源权重的"Flux3 Dev"版本将于近期陆续发布。