>_Reeboot
MiniMax Music 3 : Modèle IA de Génération Musicale Longue

MiniMax Music 3 : Modèle IA de Génération Musicale Longue

Découvrez MiniMax Music 3, un modèle de génération musicale hybride capable de produire des morceaux complets de cinq minutes en stéréo 32 kHz.

L'écosystème de la génération musicale par intelligence artificielle franchit une étape majeure avec l'arrivée de MiniMax Music 3. Ce modèle performant se distingue par sa capacité à générer des morceaux complets d'une durée maximale de cinq minutes, tout en maintenant une cohérence structurelle et une qualité acoustique élevée en stéréo 32 kHz et 16 bits.

L'industrie s'oriente de plus en plus vers des architectures hybrides capables de traiter à la fois la sémantique globale et les détails acoustiques locaux. MiniMax Music 3 illustre parfaitement cette tendance en combinant de grands modèles de langage et des techniques de synthèse avancées comme le Flow Matching.

Architecture hybride et modélisation hiérarchique

Pour réussir à générer de la musique sur des durées aussi longues sans perdre le fil mélodique ou rythmique, MiniMax Music 3 s'appuie sur une architecture de type Hybrid-LM. Cette approche sépare la modélisation de la structure musicale globale de celle des détails acoustiques à l'échelle de la trame.

  • Le Global LLM (8B), initialisé à partir de Qwen3-8B, prédit les premières trames du codebook RVQ (Residual Vector Quantization) image par image. Il gère la progression sémantique et la structure à long terme (intro, couplet, refrain, pont, etc.).
  • Le Local LLM (0.6B) prend le relais pour prédire les codebooks acoustiques restants au sein de chaque trame, restaurant ainsi la finesse et la texture du son.

Plutôt que de décoder uniquement à partir de tokens discrets, le système fusionne les états cachés finaux des deux LLM. Ces représentations continues préservent des informations cruciales pour l'articulation vocale, la continuité temporelle et les textures instrumentales.

Tokenisation et représentation RVQ

Le tokenizer audio du modèle repose sur huit couches de quantification vectorielle résiduelle (RVQ). Le premier codebook (sémantique) capture la structure et la mélodie globale, tandis que les codebooks 2 à 8 (acoustiques) restituent les détails et la coloration du signal.

Contrôle fin et structuration des invites

MiniMax Music 3 accepte deux flux d'entrées complémentaires pour guider la génération : les paroles et la description musicale.

Pour structurer efficacement un morceau, il est recommandé d'utiliser des balises de section explicites directement dans les paroles, telles que [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Solo] et [Outro].

La description musicale peut être enrichie via une légende structurée divisée en trois axes :

  1. Métadonnées globales : genre, sous-genre, tempo (BPM), tonalité, gamme, progression émotionnelle et profil de production.
  2. Détails vocaux : genre de la voix, timbre, style d'interprétation, harmonies et effets vocaux.
  3. Arrangement : instruments principaux et secondaires, évolution instrumentale par section, groove, basse, percussions et effets spatiaux.

Mise en œuvre et service avec SGLang-Omni

MiniMax Music 3 est pleinement intégré dans l'écosystème open source, notamment via SGLang-Omni et la bibliothèque diffusers de Hugging Face. L'inférence requiert impérativement un environnement compatible CUDA et prend en charge la génération non-streaming. Le texte des paroles est limité à 5 000 tokens et la génération audio est plafonnée à 9 000 trames acoustiques.