MiniMax 发布音乐生成模型 MiniMax-Music3:最长可生成 5 分钟完整歌曲
AI 公司 MiniMax 今日正式推出音乐生成模型 MiniMax-Music3。用户只需输入歌词与音乐风格描述,即可生成最长 5 分钟的完整歌曲,输出格式为 32kHz、16-bit 立体声 WAV 文件。
该模型采用分层自回归架构,由两个规模悬殊的模型协同工作。全局语言模型(Global LLM)参数量达 8B,基于 Qwen3-8B 初始化,负责逐帧预测首个 RVQ 码本,专门建模歌曲的长程语义与整体结构变化。训练时,其嵌入层与输出层先适配音乐语义词元,再与局部模型联合训练。局部语言模型(Local LLM)仅 0.6B 参数,负责预测每帧中其余声学码本,逐步还原细粒度声学细节。大模型掌控结构骨架,小模型填充声音血肉,分工明确。
据官方介绍,该模型能够在长音频中稳定保持音乐主题、节奏、歌声身份及编曲的推进,完整覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏等歌曲结构。目前 MiniMax 已在 GitHub 及 Hugging Face 发布模型页面,并提供生成示例供公众试听。
模型地址:https://huggingface.co/MiniMaxAI/MiniMax-Music3