最新消息:关注人工智能 AI赋能新媒体运营

德国黑森林实验室Flux3模型上线:原生音频生成,20秒音视频同步输出

科技资讯 admin 浏览

黑森林实验室发布多模态基础模型Flux3

德国AI初创公司黑森林实验室(Black Forest Labs,BFL)正式发布多模态基础模型Flux3。该模型基于Self-Flow架构打造,配备专用的图像、视频、音频及动作编解码器,实现了对物理与数字环境的统一理解与生成。

Flux3模型示意图

性能对标行业顶尖水平

Flux3是首款支持原生音频生成的模型,可一次性输出长达20秒的音视频同步片段,并涵盖文本/图像/视频转视频、基于关键帧的转场及多语言对话等功能。在720p分辨率、10秒片段的早期测试中,Flux3以93%胜率超越Luma Ray 3.2,以77%胜率领先Runway Gen-4.5,并在与Seedance 2.0及Gemini Omni Flash等顶尖模型的对比中保持微弱优势。

拓展机器人领域,采用分阶段发布策略

黑森林实验室联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试,将AI能力从纯数字世界延伸到实体制造场景。BFL采取分阶段推出策略,Flux3 Video现已上线,Flux3 Image与开源权重的"Flux3 Dev"也将在近期陆续发布。