MiniMax 发布全模态生成模型 H3,将开源模型权重
人工智能企业 MiniMax 近日推出全新全模态生成模型 MiniMax H3,并承诺将在数日内全面开源模型权重。
该模型支持多模态上下文输入,可同时接收文本、图像、视频及声音的任意组合作为输入,输出带有原生双声道音频的高清视频。用户仅需提供参考视频、图片或音频素材,结合自然语言指令,即可完成复杂视听内容创作。
技术架构方面,MiniMax H3 摒弃了传统多模态模型按任务拆分专家模块的做法,将文生图、文生视频、图生视频及音频处理等任务整合至同一预训练框架,采用 H3-Omni Transformer 架构,使端到端训练吞吐量提升近 30%。同时,通过重构 Tokenizer 的 H3-VAE 架构实现高压缩率,有效降低高分辨率推理成本。
定价与生态层面,MiniMax H3 在 2K 分辨率下的每秒价格不足主流同类模型的三分之一,且在设计初期即兼顾国产芯片兼容性。目前,该模型已在电影片头、游戏 UI 动画、动态海报及广告电商等场景展现应用潜力,文字渲染与品牌信息呈现的准确度亦有显著提升。