ComfyUI>Workflows>MiniMax Clip Vidéo Musical | Pipeline Complet de Vidéo Musicale avec MiniMax H3 et Music 3

MiniMax Clip Vidéo Musical | Pipeline Complet de Vidéo Musicale avec MiniMax H3 et Music 3

Workflow Name: RunComfy/MiniMax-music-video
Workflow ID: 0000...1502
Transformez votre chanson complète en une séquence visuelle connectée par IA. Utilisez MiniMax H3 et MiniMax Music 3 pour faire correspondre les scènes au rythme, aux voix et à l'ambiance. Guidez les prises avec des invites, des images, des références audio ou vidéo. Maintenez la cohérence des personnages et du style. Construisez des clips de performance ou narratifs plus rapidement. Exportez un résultat cinématographique cohérent.

ComfyUI MiniMax music video Workflow

MiniMax Music Video in ComfyUI | Build full pipeline with MiniMax H3 and Music 3
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax music video Examples

Vidéo musicale MiniMax : génération de scène à partir de chanson dans ComfyUI#

Ce workflow transforme une chanson complète en une séquence de prises vidéo conscientes du rythme en utilisant MiniMax H3, avec une création musicale optionnelle alimentée par MiniMax Music 3. Il mélange des invites textuelles, des images de référence et une piste audio maîtresse pour produire des clips cinématographiques qui suivent les voix, le rythme et l'ambiance. Le résultat est une vidéo musicale MiniMax cohérente avec une identité de personnage constante et des transitions de prises naturelles.

Conçu pour les artistes, éditeurs et créateurs, le workflow prend en charge les coupures de performance, les visuels basés sur les paroles et les inserts narratifs. Vous pouvez apporter votre propre piste ou en générer une d'abord, puis assembler une vidéo musicale MiniMax qui maintient la continuité visuelle tout en évoluant avec la structure de la chanson.

Modèles clés dans le workflow vidéo musicale MiniMax de ComfyUI#

  • Modèle de diffusion MiniMax H3. Générateur vidéo principal qui utilise des références et un conditionnement d'invite pour synthétiser des séquences de prises alignées sur l'audio. Les actifs du modèle sont publiés sous le namespace Comfy‑Org sur Hugging Face, y compris le VAE vidéo et l'encodeur de texte. Comfy‑Org/MiniMax‑H3
  • VAE Vidéo MiniMax H3. Décode les cadres latents en images pour prévisualisation et exportation. minimax_h3_video_vae_fp16.safetensors
  • VAE Audio MiniMax H3. Décode le latent audio auxiliaire du modèle si nécessaire. minimax_h3_audio_vae_fp32.safetensors
  • Encodeur de texte MiniMax H3 (variante Qwen3VL 32B emballée pour H3). Fournit une compréhension multimodale des invites pour la génération de vidéo à partir de références. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
  • Modèle de diffusion MiniMax Music 3. Générateur de texte à musique qui crée des chansons complètes à partir d'une légende et d'un plan de paroles ; utilisé ici quand vous voulez créer la piste à l'intérieur de ComfyUI. Comfy‑Org/MiniMax‑Music‑3
  • Encodeur de texte MiniMax Music 3. Encode la légende et les paroles en conditionnement pour la génération musicale. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
  • VAE DAV MiniMax Music 3. Décode les latents audio en la forme d'onde finale. minimax_music3_dav.safetensors

Comment utiliser le workflow vidéo musicale MiniMax de ComfyUI#

Flux global. Le graphique comporte deux parties coopérantes : 1) création musicale optionnelle qui génère une piste maîtresse, et 2) synthèse de vidéo à partir de références qui construit des prises visuellement cohérentes synchronisées avec la chanson. Vous pouvez les exécuter ensemble ou brancher votre propre audio et sauter la création musicale. L'étape finale assemble les cadres et l'audio en une vidéo musicale MiniMax rendue.

1) Création musicale (optionnelle)#

Ce groupe planifie et synthétise une piste avec MiniMax Music 3. Commencez avec M3SongPlanner (#6171) pour rédiger une légende structurée et des paroles ; les deux sont éditables dans les visionneuses de texte sur le canevas avant l'encodage. MiniMaxMusic3TextEncode (#6157) transforme ce plan en conditionnement et fournit la durée cible. Un conteneur audio latent est créé, échantillonné par KSampler (#6162) avec le MiniMax Music 3 UNet (UNETLoader (#6156)), puis décodé à travers le DAV VAE en utilisant soit le décodage standard soit le décodage en mosaïque selon la VRAM. L'audio généré est enregistré et défini comme la piste source du workflow pour la vidéo.

2) Entrées utilisateur#

Fournissez ou générez une chanson maîtresse. Téléchargez une piste externe avec VHS_LoadAudioUpload (#6170), ou utilisez la chanson produite à l'étape 1. Ajoutez une ou plusieurs images de référence pour l'apparence et l'identité en utilisant LoadImage (#6110) ou un chargeur de chemin ; les images sont normalisées par ImageResizeKJv2 (#6090, #6091) pour un conditionnement stable. Définissez votre brief créatif dans (input:prompt) Text Prompt (#138) — cette invite prend en charge les définitions de sujet, les notes de prises, et les indices de timing. Choisissez l'aspect et la durée approximative via Resolution Selector (Size) (#115) et (input:duration) Duration (#132).

3) Patches#

PathchSageAttentionKJ (#142) active une implémentation d'attention optimisée qui peut améliorer le débit et le comportement de la mémoire sur certains GPU. Ce patch fonctionne sur le modèle MiniMax H3 chargé avant l'échantillonnage. Gardez-le activé à moins de rencontrer des problèmes spécifiques à l'appareil.

4) Modèles#

UNETLoader (#127) charge l'épine dorsale MiniMax H3 pour la vidéo à partir de références, et un Turbo LoRA optionnel est appliqué avec LoraLoaderModelOnly (#5959) pour des résultats plus rapides et plus percutants. Les VAEs vidéo et audio (VAELoader (#119), VAELoader (#120)) sont préparés pour le décodage. Ces actifs définissent l'enveloppe de qualité et doivent rester cohérents à travers les prises pour maintenir un look uniforme.

5) Conditionnement#

MiniMaxH3ReferenceToVideo (#136) fusionne votre invite textuelle, les images de référence, la taille cible et la longueur en conditionnement et un latent initial. C'est le pont entre le brief créatif et ce que l'échantillonneur rendra. Vous pouvez alimenter deux images de référence dans ce modèle pour guider la garde-robe, l'identité et la palette. Le groupe calcule également une longueur de prise à partir de la durée demandée afin que les cadres s'alignent musicalement.

6) Échantillonnage#

La pile d'échantillonnage combine BasicScheduler (#124), BasicGuider (#126), et SamplerCustomAdvanced (#125) avec RandomNoise (#129). MiniMaxH3SigmaShift (#5960) se trouve en amont pour biaiser les plages de sigma pour un mouvement vidéo plus net et un alignement audio stable. Ensemble, ils itèrent le latent vers des images qui suivent vos références et le rythme. Pour la reproductibilité, gardez vos graines fixes tout en itérant sur l'invite et les références.

7) Décodage et création de vidéo#

VAEDecode (#122) transforme les latents échantillonnés en cadres et Set_video_1 (#5651) les prépare pour l'exportation. L'assemblage final utilise VHS_VideoCombine (#5645), qui coud les cadres à l'audio source choisi et applique votre taux de trame cible à partir de la valeur src_fps stockée. La sortie est un clip vidéo musical MiniMax prêt à être partagé qui reste synchronisé avec la piste.

8) Référence 2 Vidéo#

Ce groupe est le cœur créatif du pipeline pour construire des séquences de prises contre la chanson maîtresse. Il reçoit le modèle H3 préparé, vos références, et la longueur de prise calculée, puis exécute un passage d'échantillonnage par clip. Utilisez-le pour itérer plusieurs coupures connectées autour du même sujet afin que l'identité, la garde-robe et la palette restent cohérentes. Répétez par section de la chanson pour couvrir les intros, les couplets, les refrains et les ponts avec des visuels assortis.

Nœuds clés dans le workflow vidéo musicale MiniMax de ComfyUI#

MiniMaxH3ReferenceToVideo (#136)#

Crée le conditionnement qui lie l'invite, les références et la géométrie cible à un latent pour l'échantillonnage. Utilisez-le pour diriger l'identité et la direction artistique avec un petit ensemble d'images de haute qualité et des notes de prises claires. Si une prise nécessite une adhérence plus forte à un visage ou une tenue, gardez les références stylistiquement similaires et évitez les recadrages extrêmes. Ajustez la formulation de l'invite avant de changer les paramètres d'échantillonnage, car ce nœud influence le plus fortement qui et ce qui apparaît à l'écran.

MiniMaxH3SigmaShift (#5960)#

Décale les calendriers sigma dans la pile MiniMax H3 pour équilibrer le changement temporel et l'alignement audio. Augmentez le décalage vidéo lorsque vous voulez plus de mouvement et d'évolution visuelle à l'intérieur d'une prise ; augmentez le décalage audio pour favoriser un rythme serré et une sensation de synchronisation labiale. Utilisez des changements modestes et testez sur un court clip avant de valider une scène entière.

SamplerCustomAdvanced (#125)#

Exécute la boucle de débruitage avec le planificateur et le guideur sélectionnés. C'est ici que vous échangez du temps contre de la qualité et de la texture. Pour une idéation rapide, réduisez les étapes et gardez les graines fixes ; pour les finales, donnez-lui plus d'étapes et ajustez la guidance pour affiner les détails sans perdre l'identité. Lorsque les résultats dépassent votre brief, simplifiez d'abord l'invite ou réduisez les références conflictuelles.

VHS_VideoCombine (#5645)#

Assemble les cadres décodés avec l'audio choisi en un seul fichier vidéo. Gardez le taux de trame constant sur tous les clips destinés à être édités ensemble. Si les visuels dérivent contre le rythme, confirmez que la longueur des prises et le fps sont cohérents avec la piste source. Coupez dans votre NLE seulement après que les rendus correspondent au tempo et aux indices lyriques à l'intérieur du workflow.

MiniMaxMusic3TextEncode (#6157)#

Encode la légende et les paroles qui définissent la structure, l'arrangement et le caractère vocal pour MiniMax Music 3. Écrivez les légendes en sections qui couvrent les métadonnées globales, les détails vocaux, et l'arrangement pour que le modèle comprenne l'intention. Utilisez des balises de section de paroles comme [Intro], [Verse], et [Chorus] pour marquer les transitions que le générateur peut suivre. Pour de l'aide sur les invites, voir les recommandations et outils du dépôt officiel. MiniMax‑AI/MiniMax‑Music3

ComfyMathExpression (#131)#

Calcule un nombre de cadres interne à partir de votre durée cible et le cale sur une cadence que la pile temporelle H3 préfère au fps sélectionné. Cela évite une désynchronisation subtile et des saccades. Si vous changez de fps ou de durée, laissez ce nœud recalculer la longueur pour que l'échantillonnage atterrisse sur le rythme.

Extras optionnels#

  • Écrivez des invites avec une structure stable : définitions de sujet, un résumé en une phrase, puis 1 à 3 paragraphes de prises avec des indices de temps. Gardez le temps et la voix cohérents.
  • Utilisez 1 à 2 images de référence nettes par sujet. Préférez un éclairage neutre et un recadrage moyen qui inclut les détails des cheveux et de la tenue pour améliorer la rétention de l'identité.
  • Mappez les scènes à la chanson d'abord. Rendre des clips courts par section (intro, couplet, refrain) et les concaténer ; cela garde la vidéo musicale MiniMax cohérente tout en permettant une variation locale.
  • Gardez la résolution et le taux de trame constants sur tous les clips que vous prévoyez d'éditer ensemble. Changer l'un ou l'autre en cours de projet rend la continuité plus difficile.
  • Sur les machines à faible VRAM, activez le décodage audio en mosaïque pour les longues chansons ; sur une haute VRAM, le décodage standard est généralement un peu plus propre.
  • Pour des rendus fiables, verrouillez les graines à la fois sur l'échantillonneur vidéo et l'échantillonneur musical avant d'exporter les finales.

Remerciements#

Ce workflow met en œuvre et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Innovate Futures @ Benji pour MiniMax Music VideoWorkflow Source pour leurs contributions et maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.

Ressources#

Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.