ComfyUI>Workflows>MiniMax Music 3 ComfyUI | IA complète de texte en chanson

MiniMax Music 3 ComfyUI | IA complète de texte en chanson

Workflow Name: RunComfy/MiniMax-Music-3
Workflow ID: 0000...1498
Utilisez le graphe texte-à-musique MiniMax Music 3 pour transformer des idées en chansons complètes. Vous guidez le genre, l'humeur, le chant, le tempo, la tonalité et les instruments. Ajoutez des paroles balisées pour structurer les sections. Le préréglage rend 60 secondes. Vous pouvez rapidement ébaucher des pistes vocales originales sur RunComfy.

MiniMax Music 3 ComfyUI Workflow

MiniMax Music 3 ComfyUI | Captions and Lyrics to Full Songs
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax Music 3 ComfyUI Examples

Flux de travail texte-à-musique MiniMax Music 3 ComfyUI pour des chansons structurées#

MiniMax Music 3 ComfyUI transforme une légende détaillée et des paroles balisées par section en une chanson complète dans ComfyUI sur RunComfy. Le graphe est préréglé pour générer une piste de 60 secondes par défaut, et le modèle sous-jacent prend en charge des chansons jusqu'à environ cinq minutes. Vous guidez le genre, l'humeur, le chant, l'instrumentation, le tempo, la tonalité et la structure par le texte, le modèle les traitant comme des directions créatives plutôt que des garanties strictes.

Ce flux de travail MiniMax Music 3 ComfyUI est idéal pour les producteurs, les concepteurs sonores et les créateurs qui souhaitent ébaucher des pistes vocales originales ou des concepts de chansons structurés à partir de texte. Il se concentre sur la génération de texte en musique propre et n'inclut pas de modes audio de référence, de reprise, de continuation ou d'édition audio.

Modèles clés dans le flux de travail MiniMax Music 3 ComfyUI#

  • MiniMax Music 3 Diffusion Transformer (DiT). Le générateur principal qui synthétise la chanson dans l'espace audio latent à partir du conditionnement textuel. Utilisez les poids FP16 pour la meilleure qualité ou la variante INT8 ConvRot pour une faible VRAM. FP16 weights et INT8 weights.
  • MiniMax Music 3 Text Encoder. Convertit votre légende et vos paroles en un conditionnement que le générateur comprend, y compris les signaux de timing dérivés de votre durée cible. Text encoder.
  • MiniMax Music 3 DAV (Decoding Audio VAE). Décode l'audio latent de retour à une forme d'onde complète à la fin de l'échantillonnage. VAE.
  • Les ressources du projet et les exemples de prompts sont maintenus par les auteurs ici : MiniMax‑Music3 sur GitHub.

Comment utiliser le flux de travail MiniMax Music 3 ComfyUI#

À un niveau élevé, le flux de travail encode votre légende et vos paroles, crée une chronologie audio latente pour la durée demandée, échantillonne la chanson, la décode en forme d'onde, puis enregistre le résultat. Les principaux contrôles se trouvent sur le nœud Text to Music (MiniMax Music 3) (#37).

Rédaction de légendes et de paroles#

Écrivez la légende en trois sections courtes : Métadonnées globales, Détails vocaux et Arrangement. Décrivez le genre, l'humeur, le tempo, la tonalité, les instruments, le caractère du mix et le style vocal en langage simple. Dans les paroles, utilisez des balises de section comme [Intro], [Verse], [Chorus], [Bridge], [Outro] pour définir la structure ; les balises sont ce qui détermine la forme, tandis que les mots informent principalement l'ambiance et les phonétiques. Gardez la légende concise et concrète pour orienter le style sans surcontraindre la créativité. Pour les pistes instrumentales, indiquez dans la légende que vous ne souhaitez pas de chant.

MiniMaxMusic3TextEncode (#13)#

Ce nœud ingère la légende et les paroles balisées, produisant un conditionnement qui capture le style, l'intention d'arrangement et la présence vocale. Il émet également une valeur temporelle que le graphe utilise pour dimensionner la chronologie audio latente, de sorte que votre réglage max_duration façonne directement la longueur de la chanson. Définissez une graine si vous souhaitez des prises reproductibles ; gardez-la fixe pendant que vous affinez le texte pour itérer sur le même arrangement. L'encodeur est associé à un modèle de texte MiniMax CLIP chargé ailleurs dans le graphe, donc changer d'encodeur est rarement nécessaire.

EmptyMiniMaxMusic3LatentAudio (#15)#

Crée une toile audio latente vide dont la longueur correspond au signal de durée de l'encodeur. Pensez-y comme à la chronologie multitrack vierge que le générateur remplira avec des percussions, de la basse, de l'harmonie, de la mélodie et des voix selon votre texte. Des durées plus longues augmentent les besoins en VRAM et le temps de rendu. Utilisez cela pour passer d'idées courtes à des chansons complètes sans changer aucune autre partie du pipeline.

UNETLoader (#6) et KSampler (#9)#

UNETLoader sélectionne les poids MiniMax Music 3 DiT. KSampler applique le processus de diffusion en utilisant le conditionnement positif de votre texte et un conditionnement négatif vierge fourni par ConditioningZeroOut (#10). Les étapes et le choix de l'échantillonneur affectent le détail et la sensation rythmique, tandis que l'échelle de guidage équilibre l'adhérence au texte contre la liberté générative. Gardez la graine constante pour comparer les légendes équitablement, et changez-la pour explorer de nouvelles alternatives mélodiques et structurelles.

Décodage et contrôle de la VRAM : VAEDecodeAudio (#12), VAEDecodeAudioTiled (#42), ComfySwitchNode (#43)#

Après l'échantillonnage, l'audio latent est décodé en forme d'onde par le DAV. Pour les chansons longues ou les scénarios de faible VRAM, activez le commutateur tiled_decode sur le nœud principal pour acheminer via VAEDecodeAudioTiled, qui traite les tuiles superposées pour réduire l'utilisation de la mémoire. Le décodage par tuiles est légèrement plus lent et peut introduire des artefacts subtils aux limites dans certains cas, donc préférez le décodage standard lorsque les ressources le permettent. Le ComfySwitchNode choisit automatiquement le chemin approprié en fonction de votre bascule.

Sortie : SaveAudioAdvanced (#35)#

L'audio final est enregistré sur le disque dans le format de votre choix tel que MP3 ou WAV. Utilisez ce nœud pour définir des conventions de nommage de fichiers et des paramètres de qualité appropriés pour les brouillons ou le partage. Pour une utilisation en production, envisagez d'exporter un fichier sans perte pour le mixage et le mastering en aval.

Nœuds clés dans le flux de travail MiniMax Music 3 ComfyUI#

MiniMaxMusic3TextEncode (#13)#

Central pour le style et la structure. Ajustez max_duration pour définir la longueur cible et seed pour la reproductibilité. Si les résultats semblent hors-sujet, affinez d'abord les métadonnées globales de la légende, puis ajustez les détails vocaux et l'arrangement pour rééquilibrer l'instrumentation et le caractère du mix.

KSampler (#9)#

Gère le détail, la sensation de timing et la force avec laquelle la chanson suit le texte. Augmentez les étapes pour des textures plus riches au détriment de la vitesse, essayez des échantillonneurs alternatifs pour différents grooves et transitoires, et ajustez l'échelle de guidage pour échanger la précision contre la créativité. Gardez la même graine lors des tests A/B des légendes pour isoler les changements de prompts.

VAEDecodeAudioTiled (#42)#

Utilisez lorsque vous générez des pistes plus longues ou travaillez sur des GPU limités. Il réduit le pic de mémoire en décodant la forme d'onde en tuiles superposées. Activez-le uniquement si nécessaire pour éviter de petits risques de couture et un temps de rendu supplémentaire.

UNETLoader (#6)#

Basculez entre les poids DiT FP16 et INT8 en fonction de la VRAM. FP16 est recommandé pour la plus haute fidélité, tandis que la variante INT8 ConvRot aide à adapter des chansons plus longues sur des cartes plus petites.

SaveAudioAdvanced (#35)#

Contrôle le format d'exportation et la qualité. Choisissez MP3 pour un partage rapide ou WAV pour des stems sans perte et un post-traitement. Définissez des préfixes de nom de fichier clairs pour organiser plusieurs prises.

Extras optionnels#

  • Utilisez des légendes concises et concrètes. Un paragraphe de métadonnées globales solide avec le genre, la sensation BPM, la tonalité, des adjectifs de mix et l'ère de production compte souvent plus qu'une longue prose.
  • Les balises de section dans les paroles déterminent la structure. Gardez les balises simples, évitez l'imbrication et laissez les sections instrumentales respirer en omettant les mots entre les balises.
  • Pour mettre les voix en avant, accentuez le timbre et le placement vocal dans la légende. Pour des sorties instrumentales, dites explicitement pas de chant.
  • Pour plus de variation, changez la graine. Pour un affinage ciblé, gardez la graine fixe et itérez sur le texte.
  • Le modèle traite le tempo, la tonalité et l'instrumentation comme des conseils. Attendez-vous à des écarts créatifs et itérez vers la cible.
  • Ce flux de travail MiniMax Music 3 ComfyUI n'inclut pas de modes audio de référence, de reprise, de continuation ou d'édition audio. Pour des techniques de prompt avancées et des exemples, consultez les ressources officielles du projet : MiniMax‑Music3 sur GitHub et les fichiers du modèle sur Hugging Face.

Remerciements#

Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement ComfyUI pour le modèle de flux de travail MiniMax Music 3 : Texte en musique, MiniMax-AI pour le projet officiel MiniMax Music 3, et Comfy-Org pour les poids du modèle MiniMax Music 3 pour leurs contributions et leur maintenance. Pour des détails autorisés, veuillez vous référer à la documentation et aux dépôts originaux liés ci-dessous.

Ressources#

Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et termes respectifs fournis par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.