最新消息:关注人工智能 AI赋能新媒体运营

MiniMax 开源新一代通用视频模型 H3

科技资讯 admin 浏览

MiniMax 开源新一代通用视频模型 H3,支持全模态生成与 2K 输出

8 月 3 日,人工智能企业 MiniMax 正式宣布开源其新一代通用视频模型 MiniMax H3。该模型定位为全模态生成系统,能够深度融合并理解文本、图像、视频及音频交织而成的多模态上下文,突破了传统单任务模型的局限。

在生成规格方面,H3 支持 4 至 15 秒时长输出,帧率达 24 FPS,音频采样率为 32 kHz 立体声。用户可选择 21:9、16:9、4:3、1:1 等多种宽高比,默认模式下较短边为 768 像素。通过 H3-Regenerate-2K 方案,模型可输出最高 2K 分辨率的画面。语言支持方面,H3 覆盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、西班牙语、葡萄牙语及俄语共 11 种主流语言。

H3 提供两种核心工作模式。H3-Base-FL2VA 首尾帧模式支持 0 到 2 张图像输入,可完成文生视频、首帧生成、尾帧生成及首尾帧协同生成等任务。H3-Base-Ref2VA 全模态参考模式则支持最多 9 张图像、3 段视频(总时长不超过 15 秒)及 3 段音频的混合输入,文件总数上限为 12 个,满足专业创作者对精细控制的需求。

系统架构上,H3 由三个核心模块组成:H3-Context-IR 负责将多元指令解析为结构化中间表示;H3-Base 生成 768p 基础音视频;H3-Regenerate-2K 则将初始结果与原始上下文回传,实现 2K 超分重构,在保留细节的同时提升视觉保真度。

目前,MiniMax H3 已基于 MiniMax H3 Community License 开源,开发者可通过 Hugging Face 获取完整代码与资源。