最新消息:关注人工智能 AI赋能新媒体运营

MiniMax 发布 Music3 音乐模型:支持歌词与描述输入,最长可生成 5 分钟歌曲

科技资讯 admin 浏览

MiniMax 发布音乐生成模型 MiniMax-Music3:最长可生成 5 分钟完整歌曲

AI 公司 MiniMax 今日正式推出音乐生成模型 MiniMax-Music3。用户只需输入歌词与音乐风格描述,即可生成最长 5 分钟的完整歌曲,输出格式为 32kHz、16-bit 立体声 WAV 文件。

该模型采用分层自回归架构,由两个规模悬殊的模型协同工作。全局语言模型(Global LLM)参数量达 8B,基于 Qwen3-8B 初始化,负责逐帧预测首个 RVQ 码本,专门建模歌曲的长程语义与整体结构变化。训练时,其嵌入层与输出层先适配音乐语义词元,再与局部模型联合训练。局部语言模型(Local LLM)仅 0.6B 参数,负责预测每帧中其余声学码本,逐步还原细粒度声学细节。大模型掌控结构骨架,小模型填充声音血肉,分工明确。

据官方介绍,该模型能够在长音频中稳定保持音乐主题、节奏、歌声身份及编曲的推进,完整覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏等歌曲结构。目前 MiniMax 已在 GitHub 及 Hugging Face 发布模型页面,并提供生成示例供公众试听。

模型地址:https://huggingface.co/MiniMaxAI/MiniMax-Music3