据科技媒体MarkTechPost报道,MiniMax于8月13日发布开放权重音乐模型MiniMax-Music3。该模型以带段落标签的歌词和详细音乐描述为输入,可一次生成长达五分钟的完整歌曲,输出为32kHz、16位立体声WAV文件。权重、推理代码以及三条文档化的服务路径已于发布同日开放,目前即可部署使用,而非研究预览。

MiniMax-Music3采用混合架构。训练分词器使用八层残差矢量量化(RVQ),第一层语义码本包含16384个条目,承载核心音乐语义和结构,其余七层声学码本各有1024个条目,编码残差细节。训练时先优化语义层,再联合优化全部八层。模型由8B全局LLM和0.6B局部LLM组成Hybrid-LM,其中全局LLM逐帧预测第一码本并把握长程结构,局部LLM预测帧内其余码本。关于全局LLM的初始化基座,模型卡标注为Qwen3-8B,而MiniMax研究文章称Qwen3.5-8B,确切基座尚未确定。

合成阶段的设计与常见离散token解码方式不同。MiniMax没有直接从离散RVQ token解码,而是将两个LLM的最终隐藏状态融合,以此条件化一个2.4B的flow-matching模块,映射到潜在空间后由继承自MiniMax Speech的123M Flow-VAE解码。推理时完全不加载离散分词器解码器。输入控制方面,歌词自带[Intro]、[Verse]、[Chorus]等段落标签,另设独立的结构化描述,包含全局元数据、人声细节和编曲三部分。MiniMax还提供一个音乐描述改写器agent,可将简短描述离线扩展为上述三段式格式。

运行方面有三条已文档化的路径。SGLang-Omni为参考服务器,需要两个CUDA GPU,GPU0运行Qwen3和RVQ自回归生成,GPU1运行flow matching和DAV解码。diffusers模块化流水线在全精度下占用低于24GB显存,约22GB,使用自动CPU卸载可降至8GB。ComfyUI提供原生Text to Music模板,采用Comfy-Org重打包的FP16/INT8权重。

许可方面,MiniMax-Music3社区许可允许商业使用,但要求在用户界面显著展示“MiniMax-Music3”字样,且相关产品年收入合计超过2000万美元的组织须另行获得MiniMax书面授权。任何托管第三方生成服务的机构还须实施并维护针对侵权输出的防护措施。应用场景覆盖UGC视频背景配乐、自适应游戏与关卡音乐、广告音效与声音品牌、词曲创作小样、基于情绪的播放列表生成,以及受单曲API成本约束的离线批量生成。