
Music generation model by MiniMax. From lyrics and a style description it produces complete songs up to five minutes long with vocals, as 32 kHz stereo audio.
✓ Active✓ Public access⚖ Open weightsAudio
Context window
5K tokenów (prompt)
tokens
Parameters
8B Global LLM + 0.6B Local LLM (+ 2.4B Flow Matching, 123M Flow-VAE)
parameters
Release date
7 August 2026
Access:DownloadAPIHostedDeployment:💻 Local☁ Cloud
Overview
Classification
Audio
Applications
Access & deployment
DownloadAPIHosted
LocalCloud
Weights: Open weights
Key parameters
📏 Context: 5K tokenów (prompt)
🧩 Parameters: 8B Global LLM + 0.6B Local LLM (+ 2.4B Flow Matching, 123M Flow-VAE)
📥 Input: text
Technical specification
Context window
5K tokenów (prompt)
tokens
Parameters
8B Global LLM + 0.6B Local LLM (+ 2.4B Flow Matching, 123M Flow-VAE)
parameters
License
MiniMax-Music3 Community License
Hardware requirements
Inference requires an NVIDIA GPU (CUDA). Supported via SGLang-Omni/SGLang, diffusers and ComfyUI. Non-streaming generation only.
Modalities
⬇ Input
text
⬆ Output
audio
Capabilities and applications
Native model capabilities
Audio generation
Generating audio, including audio synchronized with video.
Category: audio
Music generation
Generating complete music tracks (with vocals and arrangement) from lyrics and a style description.
Category: audio
Application domains
Technical architecture
Core Architecture