ComfyUI MiniMax H3 Talking Digital Human: portrait et voix en une vidéo d'avatar synchronisée#
Ce flux de travail transforme un seul portrait de face et une courte référence vocale en un clip de haute qualité avec discours synchronisé sur RunComfy. Construit autour de MiniMax H3 référence-à-vidéo-et-audio avec QwenVL ancrage d'image, il préserve l'identité et l'arrière-plan tout en générant la voix parlante à partir de votre échantillon. ComfyUI MiniMax H3 Talking Digital Human est idéal pour les explications de produits, les avatars de présentateurs, les publications sociales et les courtes vidéos de porte-paroles sans besoin de TTS ou de synchronisation labiale séparée.
Vous fournissez une image et un clip vocal. Le flux de travail déduit une description compacte du visage et de la scène, conditionne MiniMax H3 avec cette orientation, et co-génère des images vidéo et l'audio correspondant dans un latent unifié pour que les lèvres et la voix restent alignées. Le résultat est rendu dans un seul fichier vidéo que vous pouvez télécharger et partager.
Modèles clés dans le flux de travail Comfyui ComfyUI MiniMax H3 Talking Digital Human#
- MiniMax H3 Reference-to-Video-and-Audio modèle de diffusion. Générateur principal qui utilise un portrait et un audio optionnel comme références pour produire une tête parlante synchronisée. Hébergé par Comfy-Org pour une utilisation facile dans ComfyUI. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Video VAE. Code et décode la partie vidéo de l'espace latent partagé utilisé par MiniMax H3, aidant à garder l'identité et l'arrière-plan stables. Distribué avec le même package de modèle. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Audio VAE. Code et décode la partie audio du latent partagé pour que le discours soit généré en synchronisation avec le mouvement de la bouche. Disponible également dans le package de modèle. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 4B Instruct. Un modèle vision-langage utilisé pour ancrer les invites dans les détails visuels du portrait téléchargé, ce qui améliore la rétention de l'identité et la cohérence de la scène. Hugging Face: Qwen/Qwen3-VL-4B-Instruct
Comment utiliser le flux de travail Comfyui ComfyUI MiniMax H3 Talking Digital Human#
Ce flux de travail est organisé en quatre zones : une section de téléchargement et d'édition, un assistant de durée, le cœur de génération MiniMax H3, et l'étape de sortie. Travaillez de gauche à droite, en commençant par les entrées multimédia, puis l'orientation des invites, puis lancez la génération et enregistrez la vidéo.
Zone de Téléchargement / Édition : généralement, changez seulement ici; laissez le reste par défaut#
Utilisez LoadImage (#137) pour télécharger un portrait de personnage de face. Un cadrage frontal ou quasi-frontal avec des yeux et une bouche visibles fonctionne mieux pour un mouvement naturel des lèvres. Utilisez LoadAudio (#141) pour télécharger un échantillon vocal propre dont vous souhaitez imiter le timbre; cela peut être quelques secondes de parole avec un bruit de fond minimal. Si nécessaire, coupez l'échantillon vocal avec AudioCrop (#142) en définissant le début et la fin du segment parlé que vous voulez que l'avatar corresponde. Ajoutez toute orientation de style ou de contenu dans Prompt (#138); le flux de travail ajoutera automatiquement des détails ancrés à l'image pour une meilleure cohérence.
Durée de la Vidéo (secondes):#
Définissez une durée cible à l'aide du contrôle numérique en haut du groupe de durée. Un assistant ComfyMathExpression (#131) convertit les secondes en un nombre de cadres valide pour le modèle et l'aligne sur les exigences de l'échantillonneur. Cela maintient le timing stable et évite les coupures en milieu de phonème. Si vous modifiez la durée plus tard, mettez à jour la coupe audio pour que le discours final et le mouvement des lèvres soient alignés.
MiniMax-H3 Open Source - Image Talking Digital Human#
C'est le chemin de génération principal construit autour de MiniMaxH3ReferenceToVideo (#136). Le nœud reçoit votre portrait comme image de référence et votre clip vocal coupé comme audio de référence, plus la largeur, la hauteur et la longueur des sélecteurs. Une description basée sur QwenVL du portrait est jointe à votre texte d'invite écrit pour que le modèle obtienne à la fois un ancrage visuel et vos instructions. Le modèle émet un seul latent qui contient à la fois la vidéo et l'audio, ainsi que le conditionnement utilisé par la pile de l'échantillonneur, c'est pourquoi la synchronisation labiale est robuste sans étape de synchronisation labiale séparée.
Ancrage des Prompts avec QwenVL#
AILab_QwenVL (#152) analyse le portrait téléchargé et renvoie une description concise et factuelle. Le flux de travail concatène cette description avec votre texte d'instruction via JoinStrings (#150, #148, #144), produisant une invite finale qui indique au modèle de garder l'arrière-plan inchangé et d'utiliser votre audio pour la voix parlante. Cet ancrage automatique renforce visiblement la stabilité de l'identité et de l'arrière-plan. Vous pouvez garder votre invite écrite courte et laisser l'ancrage remplir des détails précis sur le visage et la scène.
Résolution / Ratio d'Aspect Vidéo#
Choisissez l'aspect et la résolution cible avec ResolutionSelector (#115). Il émet la largeur et la hauteur qui sont compatibles avec le modèle et votre GPU, que le nœud principal utilise directement. Pour les avatars de portrait, des aspects élevés maintiennent plus de sujet tout en laissant de l'espace pour un mouvement naturel de la tête. Si vous ajustez le ratio d'aspect après les tests, gardez le même cadrage dans votre portrait d'entrée pour des résultats cohérents.
Vidéo Générée de Sortie#
Le chemin de l'échantillonneur débruite le latent joint, puis VAEDecode (#122) le transforme en cadres tandis que VAEDecodeAudio (#121) le transforme en onde sonore. CreateVideo (#130) fusionne les cadres et l'audio en un seul clip à votre cadence choisie, et SaveVideo (#92) écrit le fichier. Le résultat enregistré contient à la fois l'image et la voix synchronisée de la même exécution de génération. Téléchargez et examinez; si le timing semble décalé, ajustez la coupe audio ou la durée et relancez.
Nœuds clés dans le flux de travail Comfyui ComfyUI MiniMax H3 Talking Digital Human#
MiniMaxH3ReferenceToVideo (#136)#
Le cœur du pipeline qui accepte un portrait de référence et un échantillon vocal pour co-générer vidéo et audio. Les contrôles clés sont prompt pour le contenu et le style, width et height pour le cadrage, et length pour la durée en cadres. Utilisez un seul portrait net comme première image de référence et gardez ref_image_size assorti pour que les proportions du visage se transfèrent correctement. Si vous voyez une dérive ou des changements d'arrière-plan, renforcez votre texte d'instruction pour garder explicitement l'arrière-plan inchangé.
ResolutionSelector (#115)#
Définit le ratio d'aspect et le nombre de pixels total, puis émet la largeur et la hauteur alignées sur des multiples compatibles avec le modèle. Choisissez un aspect qui correspond à votre découpe de portrait pour réduire les artefacts de rééchantillonnage. Augmenter la résolution totale peut améliorer les détails mais augmente aussi la VRAM et le temps; testez avec des réglages plus petits avant de monter en échelle. Gardez le cadrage cohérent entre les exécutions pour une identité reproductible.
AudioCrop (#142)#
Coupe la voix de référence téléchargée au segment que vous voulez que l'avatar parle. Définissez le début et la fin à la portion parlée, en laissant une petite marge de silence aux extrémités pour des commencements et fins naturels. Faire correspondre la longueur audio coupée à votre durée vidéo cible aide le générateur à aligner les phonèmes aux formes de bouche. Si les plosives ou les sifflantes semblent incorrectes, essayez un enregistrement plus propre ou raccourcissez la plage coupée.
AILab_QwenVL (#152)#
Génère une description ancrée à l'image qui est automatiquement ajoutée à votre invite. Cela ajoute des détails concrets sur le visage, les cheveux, les vêtements et l'arrière-plan, ce qui aide le modèle à préserver l'identité et la scène. Si la description ancrée contraint trop le style, gardez votre invite écrite minimale et neutre pour que l'ancrage puisse faire son travail. Pour les images multi-personnages, téléchargez une coupe plus serrée pour que la description se concentre sur un seul sujet.
CreateVideo (#130)#
Combine les cadres décodés et l'audio en un seul fichier lisible. Vous pouvez changer fps si vous devez correspondre à une timeline en aval, mais gardez-le cohérent avec la conversion durée-en-cadre précédente. Si vous voyez des saccades sur certaines plateformes, réexportez à une cadence commune pour cette plateforme. Le contrôle bit_depth peut être laissé à son défaut pour la livraison web.
ComfyMathExpression (#131)#
Convertit votre durée en secondes en un nombre de cadres valide pour le générateur et l'aligne sur le pas de l'échantillonneur. Cela empêche les étapes partielles qui peuvent provoquer une dérive de timing. Si vous changez le débit d'images en aval, revoyez la durée pour garder le mouvement des lèvres aligné avec les syllabes. Traitez ce nœud comme la source de vérité du timing pour toute l'exécution.
Extras optionnels#
- Utilisez un portrait propre et uniformément éclairé avec des yeux et une bouche non obstrués pour l'articulation la plus naturelle.
- Enregistrez 5 à 10 secondes de parole claire dans une pièce silencieuse; évitez la musique ou la compression lourde dans le clip de référence.
- Pour des résultats reproductibles, fixez la graine
RandomNoisedansRandomNoise(#129) au lieu de randomiser entre les exécutions. - Si vous avez besoin de sous-titres, ajoutez-les en post-production plutôt que de les intégrer dans l'invite, afin que le modèle se concentre sur le visage et la voix.
- Respectez les droits à l'image et à la voix lors de la création d'un ComfyUI MiniMax H3 Talking Digital Human pour des personnes réelles.
Remerciements#
Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement MiniMax pour le modèle MiniMax H3, Comfy-Org pour les poids du modèle MiniMax-H3, et Comfy.org pour le tutoriel MiniMax H3 pour leurs contributions et leur maintenance. Pour des détails autorisés, veuillez vous référer à la documentation et aux dépôts d'origine liés ci-dessous.
Ressources#
- Annonce officielle MiniMax/MiniMax H3
- Docs / Notes de version: Annonce officielle MiniMax H3
- Poids du modèle Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
- Tutoriel Comfy.org/MiniMax H3
- GitHub: comfy-org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- Docs / Notes de version: Tutoriel Comfy.org MiniMax H3
Note: L'utilisation des modèles référencés, des ensembles de données et du code est soumise aux licences respectives et aux conditions fournies par leurs auteurs et mainteneurs.

