- https://www.modelscope.cn/models/MiniMax/MiniMax-Music3
- https://www.minimaxi.com/blog/minimax-music-3-0-cn
MiniMax Music 3 是一种高性能的音乐创作模型,能够生成时长可达五分钟的完整歌曲。该模型基于歌词和详细的音乐描述进行创作,能够生成结构紧凑、富有表现力的歌曲,同时具备稳定的长音频质量。只需提供一个创意想法和可选的歌词,模型即可在一次生成中完成作曲、编曲、演唱与制作,创作出一首完整的歌曲。
从音乐描述、语言模型到声音渲染重新设计了整条生成链路:用细粒度时序描述呈现情绪、配器与演唱的发展,以全局—局部协作的 Hybrid-LM 兼顾长程结构和声学细节,再通过多层 RVQ、Hidden States 融合与 Flow-Matching/Flow-VAE 提升最终声音的保真度。由此带来三项核心升级:更准确地理解创作意图、更完整且富于变化的编曲,以及更清晰、更自然的声音表现。
MiniMax Music 3 模型结合了一个 8 亿参数的全局语言模型,用于构建长期的音乐结构;以及一个 0.6 亿参数的局部语言模型,用于处理帧级的声音细节。该模型还采用了基于流匹配和流变显式估计的连续隐藏状态合成系统。最终,该模型能够生成 32 kHz 采样率、16 位立体声的 WAV 音频文件。

MiniMax Music 3.0 技术解析:开放权重音乐模型如何实现完整歌曲生成
MiniMax 正式推出新一代音乐生成模型 MiniMax Music 3.0。用户只需输入一个创意想法,并根据需要提供歌词,模型便可以在一次生成中完成作曲、编曲、演唱与制作,生成最长约 5 分钟的完整歌曲。
与只追求“生成一段好听音频”的传统方案不同,Music 3.0 更关注创作者意图能否贯穿整首作品:情绪是否持续一致,乐器是否按照结构合理进入和退出,人声是否自然,歌曲是否具有完整而连贯的发展。
MiniMax 官方将 Music 3.0 定义为开放权重、生产级全能音乐模型。其核心技术路线由 Tokenizer、Hybrid-LM 和 Synthesis 三个部分组成,并通过 Structured Caption、Hidden State Fusion、Flow-Matching 和 Flow-VAE 等技术,提升音乐结构、编曲细节与声音质量。
一、Music 3.0 解决了音乐生成中的哪些难题?
音乐生成看似只需要“输入提示词、输出音频”,但真正困难的地方在于如何把抽象的创作要求转化为可持续执行的音乐结构。
- 用户指定的乐器能否贯穿整首歌曲,而不是只在开头出现?
- 歌曲从主歌进入副歌时,情绪是否有自然的铺垫和释放?
- 长达数分钟的生成过程中,节奏、调性和人声是否保持稳定?
- 复杂编曲中,鼓组、贝斯、人声和旋律乐器能否保持清晰分离?
- 生成的人声是否具有自然的发音、换气、连贯性和情感变化?
Music 3.0 的设计目标,正是同时解决这些问题。它不仅要生成一段合理的音乐,还要尽可能实现一套完整、连贯的创作构想。
二、三层技术架构:Tokenizer、Hybrid-LM 与 Synthesis
Music 3.0 的完整生成流程可以概括为三个阶段:
- Tokenizer:将音乐压缩成适合模型理解和预测的多层离散表示。
- Hybrid-LM:同时建模歌曲的全局结构和局部声学细节。
- Synthesis:将语言模型理解到的音乐信息还原为高保真音频。
1. 多层 RVQ:分离音乐结构与声学细节
Music 3.0 使用八层残差向量量化(Residual Vector Quantization,RVQ)表示音乐信息。
- 第一层主要负责音乐的核心语义和结构。
- 第二至第八层逐步补充声学残差和声音细节。
- 第一层使用大小为 16,384 的码本。
- 第二至第八层分别使用大小为 1,024 的码本。
在训练过程中,模型会先单独训练第一层,使其建立稳定的音乐信息骨架,再联合训练全部八层。这样的分层设计,可以避免单层 Token 同时承担过多的结构和音质信息,也有助于降低长歌曲生成时的累计误差。
2. Hybrid-LM:全局结构与局部声学协同建模
为了兼顾长程结构和局部细节,Music 3.0 采用了全局模型与局部模型协同工作的 Hybrid-LM 架构。
- 8B Global LLM:基于 Qwen3.5-8B 初始化,负责逐帧预测音乐语义 Token,并理解整首歌曲的上下文、结构和发展方向。
- 0.6B Local LLM:随机初始化,负责在每一帧内部沿深度轴预测声学 Token,补充局部的音色、演奏和声音细节。
训练过程分为两个阶段。第一阶段主要建立 Global LLM 对音乐语义的预测能力;第二阶段则对 Global LLM 与 Local LLM 进行全参数联合训练。
这种“全局负责方向、局部负责细节”的分工,使模型能够在最长 5 分钟的歌曲中保持结构稳定,同时保留不同段落应有的变化。
3. Hidden State Fusion:从离散预测走向连续声音渲染
传统音乐生成流程通常会将离散声学 Token 直接送入解码器。Music 3.0 则进一步融合 Global LLM 与 Local LLM 的连续 Hidden States,并将其作为声音生成模块的条件输入。
官方公布的声音生成链路为:
LLM 融合特征 → Flow-Matching → VAE Hidden States → Flow-VAE Decoder → 最终音频
其中,2.4B Flow-Matching 模块负责将融合后的语言模型特征映射至 VAE 隐空间;123M Flow-VAE 则负责完成最终的音频解码。
相比只依赖离散 Token,连续 Hidden States 能够保留更多高维声学信息,从而改善人声发音、乐器连贯性和音乐细节表现。
三、Structured Caption:让模型真正理解创作意图
音乐提示词最大的难点,是很多听感描述并不能直接转化为可执行的生成条件。例如,“温暖但克制”“逐渐变得宏大”“像一场现场演出”等表达,对人类音乐制作人来说很直观,但对模型而言却需要更细粒度的结构化描述。
Music 3.0 使用 Structured Caption 对音乐进行细粒度的时序描述。它不仅描述曲风,还会进一步说明:
- 速度、拍号与调性;
- 音乐情绪如何随时间变化;
- 主奏和伴奏乐器何时进入、叠加或退出;
- 鼓组、贝斯和律动基础如何发展;
- 人声的音色、唱法、气声、假声与和声;
- 空间感、混音质感、Delay 和 Autotune 等效果。
这套描述方式将抽象的音乐感受转化为更接近专业编曲语言的生成条件,使模型能够在歌曲发展过程中维持统一的音乐身份,同时保留合理的动态变化。
Prompt Enhancement:降低专业音乐创作门槛
为了让非专业用户也能使用这些复杂的音乐描述,MiniMax 构建了基于模板的 Prompt Enhancement System。
系统可以从专业 Structured Caption 模板库中选择合适的表达,并结合音乐术语与编曲规则,将用户的一句话扩展为逻辑更完整、细节更丰富的结构化提示词。
例如,用户只需输入“做一首温暖、克制的不插电歌曲”,系统就可以进一步补充人声类型、吉他演奏方式、空间感、动态变化和混音方向,使最终结果更接近用户真正想要的作品。
四、更完整、更富于变化的长歌曲编曲
长歌曲生成并不只是把音频“延长”。真正的难点在于让不同段落之间形成合理的发展关系。
Music 3.0 支持使用段落标签描述歌曲结构,包括:
[intro]:前奏[verse]:主歌[pre-chorus]:副歌前段[chorus]:副歌[bridge]:桥段[instrumental]:器乐段[solo]:独奏段[outro]:尾奏
这些标签提供宏观结构,而 Structured Caption 则进一步描述每个时间阶段中的情绪、配器、人声、节奏和空间效果。两者结合后,模型可以更好地理解“哪里应该发生什么变化”。
在模型侧,8B Global LLM 负责维护全曲上下文,0.6B Local LLM 负责补充每个时间帧内的声学细节。这样的协作机制,可以帮助歌曲保持整体方向,同时避免长时间生成中出现段落重复、编曲单一或情绪突然中断。
五、声音品质升级:更清晰的混音与更真实的乐器
Music 3.0 在声音表现方面也进行了系统升级,目标是让混音更加开阔、清晰和平衡,减少传统生成音乐中常见的拥挤与浑浊感。
多层 RVQ 负责保留从核心结构到声学细节的不同层次信息;Hidden State Fusion 则在连续特征层面连接语言模型和声音渲染模块。通过这两种方式,模型可以更准确地响应具体的乐器指令,并呈现滑音、连奏等更接近真实演奏的技法。
- 独奏乐器的触弦、运弓和演奏细节更加清晰;
- 鼓组和贝斯具有更明确的冲击力与层次;
- 复杂电子编曲中的声部分离度更高;
- 低频保持力量感,同时减少对其他声部的遮蔽;
- 人声周围的空间感更加自然。
六、重塑自然人声:减少“机器感”
人声往往是生成音乐中最容易暴露机器感的部分。高频伪影、发音不清、乐句僵硬、不自然的换气,都会影响听众对歌曲情感的感受。
Music 3.0 通过新的声音渲染系统,对音色、唱法、气声、假声、和声以及 Delay、Autotune 等人声效果进行更细致的描述。
结合 Global LLM 与 Local LLM 的连续 Hidden States,Flow-Matching 和 Flow-VAE 可以将这些演唱信息带入最终的音频生成过程,从而改善:
- 歌词发音的准确性;
- 旋律线条的连贯性;
- 主歌与副歌之间的情绪变化;
- 呼吸和停顿的自然程度;
- 多层和声与主唱之间的融合。
理想情况下,生成的人声可以从克制的主歌逐渐过渡到开阔的副歌,也可以根据歌曲风格完成节奏型演唱、持续旋律、气声和声等不同表达。
七、一个适合 Music 3.0 的提示词示例
如果希望获得更稳定的结果,可以参考以下结构编写提示词:
温暖的中文流行抒情歌曲,74 BPM,A♭大调。
情绪从克制怀旧逐渐发展到温暖明亮的副歌。
成熟男中音,细腻但不过度夸张的演唱,
以钢琴、木吉他、古筝和柔和弦乐为主要配器。
主歌保持留白,副歌加入鼓组和宽阔和声,
整体采用自然的现场录音室混音质感。
[Intro]
[Verse]
[Pre-Chorus]
[Chorus]
[Bridge]
[Final Chorus]
[Outro]
这个提示词同时包含了风格、速度、调性、情绪发展、人声特征、配器、混音方向和歌曲结构,通常比单独输入“生成一首温暖的中文歌曲”更容易得到稳定、可控的结果。
八、Music 3.0 对 AI 音乐创作的意义
从技术路线来看,Music 3.0 的重点并不是单一模型规模的提升,而是对音乐生成全链路进行重新设计。
- Tokenizer 负责把音乐拆解为结构与细节;
- Hybrid-LM 负责同时理解长程结构和局部声学;
- Structured Caption 负责把创作者意图转化为可执行描述;
- Hidden State Fusion 负责连接语言理解与连续声音渲染;
- Flow-Matching 与 Flow-VAE 负责还原更高保真的最终音频。
这意味着 AI 音乐正在从“生成一个片段”逐步走向“完成一首作品”。对于音乐人、短视频创作者、游戏开发者、影视制作团队和普通用户来说,未来的重点不再只是能否生成音乐,而是能否更准确地表达创作意图,并在生成过程中保持结构、情绪和声音质量的一致性。
结语
MiniMax Music 3.0 通过多层 RVQ、Hybrid-LM、Structured Caption、Prompt Enhancement、Hidden State Fusion、Flow-Matching 和 Flow-VAE 等技术,试图解决音乐生成中最具挑战的几个问题:长歌曲结构稳定、编曲具有发展、人声更加自然,以及复杂混音中的细节还原。
它所展示的方向非常明确:音乐生成不应只是“听起来像音乐”,而应该更加接近真正的创作流程,让用户可以从一个想法出发,逐步得到一首完整、连贯并具有制作质感的歌曲。
关于模型权重、使用方式和具体开放政策,请以 MiniMax 官方最新发布页面为准。
