ComfyUI>Workflows>MiniMax H3 Parler & Chanter Personnage Double | Accélération en 4 étapes

MiniMax H3 Parler & Chanter Personnage Double | Accélération en 4 étapes

Workflow Name: RunComfy/MiniMax-H3-Talking-Singing-Dual-Character-4-step-Acceleration
Workflow ID: 0000...1486
Transformez deux images fixes en une performance de chant et de parole face à face. Vous conduisez le dialogue ou les voix avec un extrait audio. Hailuo H3 maintient les deux identités stables. Le verrouillage audio assure une synchronisation labiale précise. Turbo LoRA fonctionne en quatre étapes. Vous obtenez des duos rapides sans pile de synchronisation labiale séparée.
Avoid using 2X Large or 2XL Plus for this workflow. These machine types may cause the generated video to contain only noise. Use Medium, Large, or X Large instead.

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Workflow

MiniMax H3 Talking & Singing Dual Character | 4-step Acceleration
Vous voulez exécuter ce workflow ?
  • Workflows entièrement opérationnels
  • Aucun nœud ou modèle manquant
  • Aucune configuration manuelle requise
  • Propose des visuels époustouflants

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Examples

MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes#

Ce flux de travail prêt pour RunComfy transforme deux portraits fixes et une courte piste de discours ou de chant en une seule vidéo synchronisée avec les lèvres où les deux personnages partagent la scène. Construit sur MiniMax H3 référence-à-vidéo avec le Turbo LoRA officiel, il offre une génération en peu d'étapes tout en maintenant les deux identités stables et le mouvement de la bouche verrouillé sur votre audio source.

MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes est idéal pour les duos, les dialogues à deux personnes, les bandes-annonces ou les aperçus rapides de performances. Vous apportez deux images et un fichier audio, ajoutez une courte invite, choisissez une taille, et le graphique rend un mp4 avec la bande sonore originale intacte.

Modèles clés dans le flux de travail Comfyui MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes#

  • MiniMax-H3 référence-à-vidéo de Comfy-Org — le modèle génératif qui cartographie vos références et votre texte en un latent audio-visuel pour la synthèse vidéo. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE FP16 — encode et décode les latents vidéo pour que les images puissent être débruitées efficacement et reconstruites avec fidélité. Inclus dans le pack de modèles. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE FP32 — représente l'audio de conduite dans l'espace latent pour que le mouvement des lèvres et le timing soient appris à partir de votre piste. Inclus dans le pack de modèles. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 32B encodeur de texte (variantes AWQ/NVFP emballées pour H3) — interprète votre invite pour définir la scène, le style et l'intention de prise de vue pour la composition à deux personnages. Inclus dans le pack de modèles. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-step LoRA — accélère l'échantillonnage pour que vous puissiez rendre avec aussi peu que quatre étapes de débruitage tout en préservant l'identité et la synchronisation labiale. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora

Comment utiliser le flux de travail Comfyui MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes#

Ce graphique s'écoule de gauche à droite : vous chargez deux images fixes de personnage et un extrait audio, définissez l'invite et la taille, puis le chemin H3 principal fusionne les références et l'audio en un latent AV. Une courte étape de verrouillage audio préserve votre bande sonore originale tout en conduisant le mouvement des lèvres, et l'échantillonneur avec Turbo LoRA effectue le débruitage en peu d'étapes avant l'assemblage final de la vidéo.

  • Téléchargez l'image (Personnage A)
    • Déposez une image fixe claire et de face pour le personnage A dans LoadImage (#227). Favorisez une taille de tête et un éclairage similaires à ceux du personnage B pour une co-présence stable. L'arrière-plan peut être simple ; l'identité et la pose sont prioritaires. Le nœud alimente la pile de références H3 pour que le modèle apprenne qui est le premier locuteur dans la scène partagée.
  • Téléchargez l'image (Personnage B)
    • Fournissez le personnage B dans LoadImage (#137). Conservez le cadrage, l'orientation et l'expression à peu près comparables à ceux du personnage A pour réduire la dérive entre les prises. Cette deuxième référence permet à H3 de synthétiser une prise à deux où les deux individus restent cohérents tout en parlant ou chantant l'un à l'autre.
  • Téléchargez l'audio
    • Ajoutez votre dialogue ou vos voix dans LoadAudio (#171). Utilisez AudioCrop (#177) pour définir les heures de début et de fin afin que la longueur du clip corresponde au segment souhaité. Un audio propre et centré améliore l'articulation des lèvres et réduit les fluctuations de timing.
  • Invite
    • Décrivez la prise de vue dans Input Text (Prompt) (#138). Des phrases courtes et cinématographiques fonctionnent bien, par exemple en décrivant la distance de la caméra, l'arrière-plan et l'ambiance pour les deux personnages. L'invite guide la mise en page et le style sans remplacer les indications d'identité des images fixes et le timing de votre piste.
  • Sélecteur de Résolution (Taille)
    • Choisissez l'aspect et la taille cible dans Resolution Selector (Size) (#115). Le sélecteur sort la largeur et la hauteur déjà alignées sur les multiples adaptés au modèle pour équilibrer le détail et la vitesse. Une note de taille intégrée offre des préréglages 16:9 prêts à l'emploi, vous permettant de choisir un niveau de mégapixels adapté à votre budget GPU.
  • Résultat
    • Les images se décodent et sont multiplexées avec l'audio original dans VHS_VideoCombine (#142) pour produire un mp4. Si votre rendu est légèrement trop long ou trop court, utilisez l'option fournie à cette étape pour ajuster à la longueur de l'audio. Les noms de fichiers et le format sont préconfigurés pour une itération rapide.
  • Cœur (Ne pas modifier)
    • Dans cette zone protégée, MiniMaxH3ReferenceToVideo (#136) fusionne les deux images de référence, l'invite et l'audio rogné en un latent AV commun et une conditionnement positif. VRGDG_MiniMaxH3AudioDrive (#172) verrouille l'audio source pour que la synchronisation labiale suive votre piste tout en passant la bande sonore inchangée. L'UNet est corrigé pour l'efficacité mémoire, et LoraLoaderModelOnly (#234) applique le Turbo 4-step LoRA avant que l'échantillonneur ne débruite et que VAEDecode ne reconstruise les images. Ces internes sont réglés pour la stabilité et la vitesse, vous n'avez donc généralement pas besoin de les ajuster.

Nœuds clés dans le flux de travail Comfyui MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes#

  • MiniMaxH3ReferenceToVideo (#136)
    • Le cœur du graphique qui ingère les deux images fixes de personnage, votre invite, la largeur, la hauteur, et une longueur de clip auto-calculée. Il accepte également l'audio rogné comme référence pour que le timing des phonèmes et les formes de visèmes s'alignent sur la bande sonore. Si vous avez besoin de contrôle plus précis, vous pouvez ajuster directement prompt, width, height, ou remplacer length pour des timings spéciaux.
  • VRGDG_MiniMaxH3AudioDrive (#172)
    • Verrouille le mouvement des lèvres sur l'audio source fourni tout en s'assurant que la vidéo finale utilise cette même piste audio. Utilisez cela lorsque vous voulez un timing exact des paroles ou du dialogue sans aucun changement audio génératif. Alimentez-le avec des voix ou des dialogues propres pour de meilleurs résultats.
  • LoraLoaderModelOnly (#234)
    • Charge le MiniMax-H3 Turbo 4-step LoRA pour que l'échantillonneur puisse converger en très peu d'étapes. Si vous préférez un débruitage plus lent mais potentiellement plus conservateur, vous pouvez réduire l'influence de LoRA ; pour une vitesse maximale, gardez la force par défaut. Référence du modèle : MiniMax-H3 Turbo LoRA.
  • SamplerCustomAdvanced (#125)
    • Effectue le débruitage réel en utilisant le planificateur et l'échantillonneur sélectionnés en amont. Avec le Turbo LoRA actif, vous pouvez rendre rapidement avec un minimum d'étapes ; augmentez les étapes uniquement si vous constatez une instabilité du mouvement. Le contrôle des graines provient de RandomNoise (#129) pour des prises reproductibles.
  • Resolution Selector (Size) (#115)
    • Sort la largeur et la hauteur alignées sur le modèle pour que vous n'ayez pas besoin de jongler avec les multiples ou les mathématiques d'aspect. Utilisez-le pour passer entre les tailles de prévisualisation, intermédiaires et finales tout en gardant la composition cohérente. Les tailles plus grandes augmentent le détail de l'identité mais nécessitent plus de VRAM et de temps.
  • AudioCrop (#177)
    • Coupe l'audio d'entrée au segment exact que vous souhaitez animer. Utilisez ceci pour couper le silence ou isoler un couplet ou un battement de dialogue. Des points d'entrée et de sortie propres aident au timing de l'ouverture/fermeture de la bouche.
  • VHS_VideoCombine (#142)
    • Assemble les images décodées et l'audio en passage dans un mp4 partageable. Utilisez les options intégrées pour aligner la durée sur la bande sonore et définir les conventions de nommage de fichiers. C'est votre étape finale de livraison pour les sorties MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes.

Extras optionnels#

  • Faites correspondre l'échelle du sujet et l'angle du visage sur les deux images pour minimiser la dérive d'identité.
  • Gardez les invites concises et visuelles : distance de la caméra, décor, ambiance et indices d'éclairage.
  • Utilisez des graines de bruit lors de l'itération pour pouvoir changer de manière fiable entre les prises.
  • Si le clip dépasse légèrement, activez la découpe à l'étape de combinaison pour une synchronisation précise des images.
  • Commencez à une résolution de niveau intermédiaire, puis augmentez une fois que le blocage et le timing semblent corrects.

Remerciements#

Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement MiniMax Research pour MiniMax H3, Comfy.org pour le tutoriel ComfyUI MiniMax H3, et Comfy-Org et larryvrh pour les poids du modèle MiniMax-H3 et MiniMax-H3 Turbo LoRA pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation et aux dépôts originaux liés ci-dessous.

Ressources#

Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et responsables.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.