MiniMax Music 3.0 是 MiniMax 于 2026 年 8 月开源权重的新一代 AI 音乐生成模型,总参数量约 111 亿。该模型能够根据创意描述和歌词一次性生成包含作曲、编曲、演唱、制作的完整歌曲,最长支持 5 分钟输出,最低仅需 8GB 显存即可实现本地部署。适用于专业歌曲创作、短视频与播客配乐、音乐类产品二次开发等多元场景。
| 基础信息 | 详情 |
|---|---|
| 开发方 | MiniMax |
| 开源时间 | 2026 年 8 月 13 日(API 版于 7 月 16 日先行上线) |
| 总参数量 | 约 111 亿(Global LLM 8B + Local LLM 0.6B + Flow 模块 2.4B + VAE 1.23 亿) |
| 最长生成时长 | 5 分钟完整歌曲 |
| 输出规格 | 32kHz、16-bit 立体声 WAV(API 版返回 44.1kHz MP3) |
| 本地显存需求 | 全精度 24GB+ / CPU 卸载约 22GB / 逐层流式最低 8GB |
| API 价格 | 0.15 美元/次(最长 5 分钟),与 Music 2.6 同价 |
| 许可证 | MiniMax Music 3.0 Community License(无地域限制) |
| 产品定位 | 生产级全能开源音乐生成模型 |
| 适用人群 | 音乐创作者、短视频/播客内容团队、音频应用开发者 |
核心能力与性能表现
API 版本早在 2026 年 7 月 16 日便已上线,8 月 13 日开放的则是模型权重本身。Music 3.0 最突出的突破在于:一次生成即可产出结构完整、带人声演唱的成品歌曲——前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏一应俱全,这在开源音乐模型领域尚属首次。
一次生成完整歌曲
输入一段歌词搭配风格描述,即可获得长达五分钟的成品曲目。模型能够始终守住音乐主题、节奏韵律、歌声身份和编曲推进方向,不会出现唱到副歌就"忘记"主旋律的脱节问题。人声部分更接近真实演唱而非机器合成效果。官方将这一代的核心目标定义为"理解创作者的表达意图,并在五分钟时长内持续贯彻"。
控制方式分为两条通道:
结构化描述(caption):分为全局元数据、人声细节、编曲三段,可精确指定音色类型、唱法风格、气声与假音运用、和声编排,甚至 Auto-Tune 和延迟效果,以及各乐器进出时间点。
歌词结构标签:支持 [Verse]、[Chorus]、[Bridge] 等标记,模型依据标签调整演唱力度与断句方式。
API 还额外提供纯器乐开关(is_instrumental),歌词长度支持 10 到 1000 字符。
双 LLM 分工架构
大模型掌控宏观结构,小模型负责微观音质——这是 Music 3 架构设计的核心取舍。音频先经由 8 层 RVQ(残差向量量化)进行分级表示:第一层仅存储核心语义与结构信息,使用 16384 个大码本;后七层补充声学细节,各使用 1024 个码本。8B 参数的 Global LLM(从 Qwen3-8B 初始化)逐帧预测第一层,把控整首歌的长程结构;0.6B 的 Local LLM 在帧内预测其余七层,将细粒度声音补全。
这一分工直接解决了一个工程难题:5 分钟歌曲按 25 帧/秒计算需生成上万 token,单一模型全包成本过高;分层后 8B 大模型每帧仅需前向一次。最后由 2.4B 的 Flow-Matching 模块和 1.23 亿参数的 Flow-VAE 解码器还原出 32kHz 立体声波形。
本地部署门槛与生态
8GB 显存即可运行,是本次开源最具实用价值的细节。Hugging Face 仓库权重约 57.4GB,全精度推理需 24GB 以上显存,开启 CPU 卸载约需 22GB,采用逐层流式方案最低可压缩至 8GB。官方参考实现采用双 CUDA 显卡分工策略(一张运行 Qwen3 和 RVQ 生成,一张负责 Flow Matching 和波形解码)。推理框架支持 SGLang-Omni、diffusers 以及 ComfyUI 0.33.0 以上版本——ComfyUI 在开源当天即推出了适配工作流。
横向对比:MiniMax Music 3.0 vs Suno v5.5
| 对比维度 | MiniMax Music 3.0 | Suno v5.5 |
|---|---|---|
| 开发方 | MiniMax | Suno |
| 模型定位 | 开源权重音乐基座模型 | 在线音乐生成服务 |
| 权重开源 | 是(Hugging Face/GitHub/ModelScope) | 否,仅在线服务 |
| 使用方式 | 本地部署 + API + ComfyUI | 网页/App 订阅制 |
| 单次价格 | 0.15 美元/次(API,最长 5 分钟) | 按订阅套餐计费 |
| 本地部署 | 支持,最低 8GB 显存 | 不支持 |
| 二次开发 | 支持微调与商业授权改造 | 不支持 |
两条路线服务不同人群。Suno 代表开箱即用的在线体验,适合只想快速出歌的个人用户;Music 3 的核心价值在于权重握在自己手中——可以微调出专属曲风、嵌入自有产品、离线批量生产,且 0.15 美元/次的 API 定价对批量场景极具吸引力。
许可方面有一个值得关注的细节:MiniMax Music 3.0 Community License 没有地域排除条款,而十天前 H3 视频模型的许可排除了美欧英韩地区。对于面向全球市场的团队而言,Music 3 的商业可用确定性更高。
应用场景与适用人群
短视频与播客配乐:批量生成结构完整、可商用的原创歌曲,替代版权音乐采购;纯器乐模式特别适合做背景音乐。
音乐创作辅助:职业创作者可用它快速验证创作动机和编曲想法,caption 级控制能精确到和声编排与效果器参数。
产品集成与二次开发:游戏、社交、教育类 App 可将 Music 3 嵌入自有流程,微调出品牌专属音色和曲风。
适合切换的用户:需要批量原创音乐的内容团队、想微调专属模型的开发者、预算有限但要求商用的独立创作者。
不必跟风的情况:只是偶尔出一两首歌的个人用户,在线服务更省事;追求顶级录音棚音质的专业制作,AI 生成仍需后期精修。
使用指南
最快体验方式:调用 MiniMax 官方 API,0.15 美元/次生成最长 5 分钟歌曲,返回 44.1kHz MP3 格式,限速 120 请求/分钟。
本地部署流程:
从 Hugging Face 或 ModelScope(国内推荐)下载权重
参考 GitHub 仓库的双卡推理脚本
根据显存选择三档方案:24GB+(全精度)/ 22GB(CPU 卸载)/ 8GB(逐层流式)
ComfyUI 工作流:升级至 0.33.0 以上版本,加载官方模板即可将 Music 3 接入现有视频/音频制作流水线。
二次开发路径:diffusers 与 SGLang-Omni 两条工程路线可选,仓库同时提供 Tokenizer、调度器等全部组件。
官方资源
开源许可与已知局限
商用需仔细审阅 Community License 具体条款。该许可证允许使用、复制、修改、合并、发布、分发和再许可,且无地域排除。但商业化部署前建议通读协议原文,确认自身场景下的合规义务。
已知局限:
32kHz 输出规格低于录音室标准(API 版为 44.1kHz),专业发行需后期处理
生成 5 分钟长曲时对提示词的结构描述要求较高,标签使用不当可能导致段落衔接生硬
双卡参考实现意味着单卡用户需要在速度和显存之间自行权衡
文档以英文生态为主,中文提示的细节控制在社区中仍在探索阶段
常见问题
本地部署需要什么显卡?
全精度推理需 24GB 以上显存;开启 CPU 卸载约需 22GB;逐层流式方案最低 8GB 即可运行。官方参考实现为双卡分工(GPU0 跑 Qwen3 和 RVQ 生成,GPU1 跑 Flow Matching 和波形解码),单卡可用但需自行权衡速度与显存。ComfyUI 0.33.0 以上版本提供现成工作流。
可以商用吗?
可以,但需遵守 MiniMax Music 3.0 Community License。许可证允许使用、修改、分发和再许可,且没有 H3 视频模型那种美欧英韩地域排除。商业化部署前建议通读 Hugging Face 模型页的协议原文。
怎么收费?
本地部署权重免费。API 按次计费:0.15 美元/次,最长生成 5 分钟,与 Music 2.6 同价,限速每分钟 120 次请求。对比订阅制在线服务,批量生产场景下按次计费通常更划算。
和 Suno 怎么选?
要开箱即用的创作体验选 Suno 这类在线服务;要权重在手、可微调、可嵌入产品、可离线批量生产选 Music 3。Music 3 还提供 0.15 美元/次的 API,适合构建自动化内容流水线。
能生成多长的歌?
最长 5 分钟。模型按 25 帧/秒、上限 9000 声学帧设计,能完整覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏,并在整首歌中保持主题、节奏和人声身份的一致性。
