8月14日,MiniMax正式推出新一代音乐生成模型MiniMax-Music3。用户只需输入歌词和音乐描述,即可生成最长5分钟的完整歌曲,输出32kHz、16-bit立体声WAV文件,并已在Hugging Face上全面开源权重。

技术架构:8B全局模型管结构,0.6B局部模型填细节
支撑这一能力的是一套分层自回归架构,两个模型各司其职、上下配合。
全局语言模型(Global LLM)参数规模为8B,从Qwen3-8B初始化而来,负责逐帧预测第一个RVQ码本,建模歌曲的长程语义与结构变化——前奏、主歌、副歌、桥段、尾奏等结构一个不落。局部语言模型(Local LLM)参数仅0.6B,负责预测每一帧中其余的声学码本,把细粒度的声学信息一点点补回来。
训练分两阶段进行:先让Global LLM的嵌入层和输出层适配音乐语义词元,再与Local LLM联合建模全部码本。在输出端,模型通过2.4B Flow Matching模块和123M Flow-VAE解码器将语言模型隐状态合成为连续音频,而非从离散Token直接解码,这使得人声发音和乐器质感更加清晰连贯。
精细化控制:从“提示词”到“编曲指令”
Music3.0的核心升级在于对创作意图的理解能力。官方表示,模型专注于音乐创作中最难用简单提示词捕捉的部分:理解创作者表达意图,并在最长5分钟的歌曲中持续贯彻这一意图,以清晰且富有真实质感的方式呈现乐器,让生成的人声更像真实演唱而非机器合成。
为此,MiniMax引入了结构化描述(Structured Captions)框架。用户可以通过三部分信息精确控制生成方向:全局元数据(风格、BPM、调性、音阶、情绪走向)、人声细节(性别、音色、演唱风格、和声、效果)、编曲安排(乐器、段落级乐器演进、律动、贝斯、打击乐、织体、空间效果)。
歌词输入支持明确的段落标签:[Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Bridge]、[Instrumental]、[Solo]、[Outro],让用户能精确指定歌曲结构。
开源与定价:每首歌0.15美元,可自部署
Music3.0已全面开源,模型权重在Hugging Face上可下载,支持自部署,据估算约需22GB显存。
官方API定价为每首歌0.15美元(最长5分钟),并提供速率限制的免费层级。相比之下,Suno v4每首歌约需5个积分(Pro套餐10美元/月含2500积分),且生成时长通常仅2-4分钟。MiniMax-Music3输出的是用户完全拥有的32kHz WAV文件,而Udio等竞品则存在下载限制。
Music3.0的“分层架构+开源策略”精准切入了AI音乐创作的两个核心痛点:长程结构稳定性和创作可控性。当大多数音乐模型仍停留在“提示词抽卡”阶段时,MiniMax用结构化描述将AI音乐生成从“碰运气”变成了“可编排”。而开源权重和0.15美元/首的定价,则让这一能力真正落到了开发者和创作者手中。