MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes#
Ce flux de travail prêt pour RunComfy transforme deux portraits fixes et une courte piste de discours ou de chant en une seule vidéo synchronisée avec les lèvres où les deux personnages partagent la scène. Construit sur MiniMax H3 référence-à-vidéo avec le Turbo LoRA officiel, il offre une génération en peu d'étapes tout en maintenant les deux identités stables et le mouvement de la bouche verrouillé sur votre audio source.
MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes est idéal pour les duos, les dialogues à deux personnes, les bandes-annonces ou les aperçus rapides de performances. Vous apportez deux images et un fichier audio, ajoutez une courte invite, choisissez une taille, et le graphique rend un mp4 avec la bande sonore originale intacte.
Modèles clés dans le flux de travail Comfyui MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes#
- MiniMax-H3 référence-à-vidéo de Comfy-Org — le modèle génératif qui cartographie vos références et votre texte en un latent audio-visuel pour la synthèse vidéo. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — encode et décode les latents vidéo pour que les images puissent être débruitées efficacement et reconstruites avec fidélité. Inclus dans le pack de modèles. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — représente l'audio de conduite dans l'espace latent pour que le mouvement des lèvres et le timing soient appris à partir de votre piste. Inclus dans le pack de modèles. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B encodeur de texte (variantes AWQ/NVFP emballées pour H3) — interprète votre invite pour définir la scène, le style et l'intention de prise de vue pour la composition à deux personnages. Inclus dans le pack de modèles. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA — accélère l'échantillonnage pour que vous puissiez rendre avec aussi peu que quatre étapes de débruitage tout en préservant l'identité et la synchronisation labiale. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Comment utiliser le flux de travail Comfyui MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes#
Ce graphique s'écoule de gauche à droite : vous chargez deux images fixes de personnage et un extrait audio, définissez l'invite et la taille, puis le chemin H3 principal fusionne les références et l'audio en un latent AV. Une courte étape de verrouillage audio préserve votre bande sonore originale tout en conduisant le mouvement des lèvres, et l'échantillonneur avec Turbo LoRA effectue le débruitage en peu d'étapes avant l'assemblage final de la vidéo.
- Téléchargez l'image (Personnage A)
- Déposez une image fixe claire et de face pour le personnage A dans
LoadImage(#227). Favorisez une taille de tête et un éclairage similaires à ceux du personnage B pour une co-présence stable. L'arrière-plan peut être simple ; l'identité et la pose sont prioritaires. Le nœud alimente la pile de références H3 pour que le modèle apprenne qui est le premier locuteur dans la scène partagée.
- Déposez une image fixe claire et de face pour le personnage A dans
- Téléchargez l'image (Personnage B)
- Fournissez le personnage B dans
LoadImage(#137). Conservez le cadrage, l'orientation et l'expression à peu près comparables à ceux du personnage A pour réduire la dérive entre les prises. Cette deuxième référence permet à H3 de synthétiser une prise à deux où les deux individus restent cohérents tout en parlant ou chantant l'un à l'autre.
- Fournissez le personnage B dans
- Téléchargez l'audio
- Ajoutez votre dialogue ou vos voix dans
LoadAudio(#171). UtilisezAudioCrop(#177) pour définir les heures de début et de fin afin que la longueur du clip corresponde au segment souhaité. Un audio propre et centré améliore l'articulation des lèvres et réduit les fluctuations de timing.
- Ajoutez votre dialogue ou vos voix dans
- Invite
- Décrivez la prise de vue dans
Input Text (Prompt)(#138). Des phrases courtes et cinématographiques fonctionnent bien, par exemple en décrivant la distance de la caméra, l'arrière-plan et l'ambiance pour les deux personnages. L'invite guide la mise en page et le style sans remplacer les indications d'identité des images fixes et le timing de votre piste.
- Décrivez la prise de vue dans
- Sélecteur de Résolution (Taille)
- Choisissez l'aspect et la taille cible dans
Resolution Selector (Size)(#115). Le sélecteur sort la largeur et la hauteur déjà alignées sur les multiples adaptés au modèle pour équilibrer le détail et la vitesse. Une note de taille intégrée offre des préréglages 16:9 prêts à l'emploi, vous permettant de choisir un niveau de mégapixels adapté à votre budget GPU.
- Choisissez l'aspect et la taille cible dans
- Résultat
- Les images se décodent et sont multiplexées avec l'audio original dans
VHS_VideoCombine(#142) pour produire un mp4. Si votre rendu est légèrement trop long ou trop court, utilisez l'option fournie à cette étape pour ajuster à la longueur de l'audio. Les noms de fichiers et le format sont préconfigurés pour une itération rapide.
- Les images se décodent et sont multiplexées avec l'audio original dans
- Cœur (Ne pas modifier)
- Dans cette zone protégée,
MiniMaxH3ReferenceToVideo(#136) fusionne les deux images de référence, l'invite et l'audio rogné en un latent AV commun et une conditionnement positif.VRGDG_MiniMaxH3AudioDrive(#172) verrouille l'audio source pour que la synchronisation labiale suive votre piste tout en passant la bande sonore inchangée. L'UNet est corrigé pour l'efficacité mémoire, etLoraLoaderModelOnly(#234) applique le Turbo 4-step LoRA avant que l'échantillonneur ne débruite et queVAEDecodene reconstruise les images. Ces internes sont réglés pour la stabilité et la vitesse, vous n'avez donc généralement pas besoin de les ajuster.
- Dans cette zone protégée,
Nœuds clés dans le flux de travail Comfyui MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes#
MiniMaxH3ReferenceToVideo(#136)- Le cœur du graphique qui ingère les deux images fixes de personnage, votre invite, la largeur, la hauteur, et une longueur de clip auto-calculée. Il accepte également l'audio rogné comme référence pour que le timing des phonèmes et les formes de visèmes s'alignent sur la bande sonore. Si vous avez besoin de contrôle plus précis, vous pouvez ajuster directement
prompt,width,height, ou remplacerlengthpour des timings spéciaux.
- Le cœur du graphique qui ingère les deux images fixes de personnage, votre invite, la largeur, la hauteur, et une longueur de clip auto-calculée. Il accepte également l'audio rogné comme référence pour que le timing des phonèmes et les formes de visèmes s'alignent sur la bande sonore. Si vous avez besoin de contrôle plus précis, vous pouvez ajuster directement
VRGDG_MiniMaxH3AudioDrive(#172)- Verrouille le mouvement des lèvres sur l'audio source fourni tout en s'assurant que la vidéo finale utilise cette même piste audio. Utilisez cela lorsque vous voulez un timing exact des paroles ou du dialogue sans aucun changement audio génératif. Alimentez-le avec des voix ou des dialogues propres pour de meilleurs résultats.
LoraLoaderModelOnly(#234)- Charge le MiniMax-H3 Turbo 4-step LoRA pour que l'échantillonneur puisse converger en très peu d'étapes. Si vous préférez un débruitage plus lent mais potentiellement plus conservateur, vous pouvez réduire l'influence de LoRA ; pour une vitesse maximale, gardez la force par défaut. Référence du modèle : MiniMax-H3 Turbo LoRA.
SamplerCustomAdvanced(#125)- Effectue le débruitage réel en utilisant le planificateur et l'échantillonneur sélectionnés en amont. Avec le Turbo LoRA actif, vous pouvez rendre rapidement avec un minimum d'étapes ; augmentez les étapes uniquement si vous constatez une instabilité du mouvement. Le contrôle des graines provient de
RandomNoise(#129) pour des prises reproductibles.
- Effectue le débruitage réel en utilisant le planificateur et l'échantillonneur sélectionnés en amont. Avec le Turbo LoRA actif, vous pouvez rendre rapidement avec un minimum d'étapes ; augmentez les étapes uniquement si vous constatez une instabilité du mouvement. Le contrôle des graines provient de
Resolution Selector (Size)(#115)- Sort la largeur et la hauteur alignées sur le modèle pour que vous n'ayez pas besoin de jongler avec les multiples ou les mathématiques d'aspect. Utilisez-le pour passer entre les tailles de prévisualisation, intermédiaires et finales tout en gardant la composition cohérente. Les tailles plus grandes augmentent le détail de l'identité mais nécessitent plus de VRAM et de temps.
AudioCrop(#177)- Coupe l'audio d'entrée au segment exact que vous souhaitez animer. Utilisez ceci pour couper le silence ou isoler un couplet ou un battement de dialogue. Des points d'entrée et de sortie propres aident au timing de l'ouverture/fermeture de la bouche.
VHS_VideoCombine(#142)- Assemble les images décodées et l'audio en passage dans un mp4 partageable. Utilisez les options intégrées pour aligner la durée sur la bande sonore et définir les conventions de nommage de fichiers. C'est votre étape finale de livraison pour les sorties MiniMax H3 ComfyUI Parler et Chanter Personnage Double Accélération en 4 étapes.
Extras optionnels#
- Faites correspondre l'échelle du sujet et l'angle du visage sur les deux images pour minimiser la dérive d'identité.
- Gardez les invites concises et visuelles : distance de la caméra, décor, ambiance et indices d'éclairage.
- Utilisez des graines de bruit lors de l'itération pour pouvoir changer de manière fiable entre les prises.
- Si le clip dépasse légèrement, activez la découpe à l'étape de combinaison pour une synchronisation précise des images.
- Commencez à une résolution de niveau intermédiaire, puis augmentez une fois que le blocage et le timing semblent corrects.
Remerciements#
Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement MiniMax Research pour MiniMax H3, Comfy.org pour le tutoriel ComfyUI MiniMax H3, et Comfy-Org et larryvrh pour les poids du modèle MiniMax-H3 et MiniMax-H3 Turbo LoRA pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation et aux dépôts originaux liés ci-dessous.
Ressources#
- Annonce officielle de MiniMax Research/MiniMax H3
- Docs / Notes de version : Annonce officielle de MiniMax H3
- Tutoriel Comfy.org/MiniMax H3
- GitHub : Comfy-Org/docs
- Docs / Notes de version : Tutoriel Comfy.org MiniMax H3
- Poids des modèles Comfy-Org/MiniMax-H3
- GitHub : Comfy-Org/workflow_templates
- Hugging Face : Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub : Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face : larryvrh/MiniMax-H3-Turbo-Lora
Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et responsables.



