ComfyUI>Workflows>MiniMax H3 Performance Capture : Transfert de mouvement par IA

MiniMax H3 Performance Capture : Transfert de mouvement par IA

Workflow Name: RunComfy/MiniMax-H3-Performance-Capture
Workflow ID: 0000...1528
Transformez votre jeu d'acteur enregistré en une performance de personnage pilotée par H3. Vous conservez les expressions faciales, les mouvements de tête et l'audio original. Les masques faciaux isolent le performeur. La guidance des poses améliore le contrôle. Les images de référence façonnent des loups, des robots ou des extraterrestres. Vous conservez la scène environnante.

ComfyUI MiniMax H3 Performance Capture Workflow

MiniMax H3 Performance Capture | Character-Swap Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Performance Capture Examples

MiniMax H3 Performance Capture pour ComfyUI#

MiniMax H3 Performance Capture transforme votre jeu d'acteur en un nouveau personnage tout en conservant votre audio original. Le flux de travail transfère l'expression faciale, les formes de bouche, la direction des yeux et le mouvement de la tête d'un clip source à une créature cible ou un personnage complet, puis composite le résultat dans la plaque. Basé sur la vidéo conditionnée par référence MiniMax-H3, le masquage facial automatique et la guidance de pose optionnelle, il a été testé sur des échanges créatifs comme un loup, un robot et un extraterrestre tout en préservant la scène et la bande sonore. Workflow par Mickmumpitz.

Ce flux de travail ComfyUI MiniMax H3 Performance Capture est l'édition simple "rendu" : une caméra par défaut, caméra de tête optionnelle et masque manuel, contrôle de pose optionnel, et deux vidéos enregistrées (rendu final avec audio, plus une coupe de comparaison).

Modèles clés dans le flux de travail Comfyui MiniMax H3 Performance Capture#

  • MiniMax-H3 Référence-à-Vidéo diffusion UNet (minimax_h3_ref2va_pruned_int8_convrot). Générateur principal qui fusionne les références, les invites et l'audio en latents vidéo. Fichiers du modèle
  • Qwen3‑VL 32B MiniMax‑H3 encodeur de texte (qwen3vl_32b_minimax_h3_nvfp4_awq). Encode l'invite pour diriger l'identité et le style d'acteur. Fichier du modèle
  • MiniMax‑H3 Vidéo VAE FP16 et Audio VAE FP32. Vidéo VAE décode les latents d'image ; Audio VAE conditionne la synchronisation labiale et le timing de performance. VAEs
  • MiniMax‑H3 Turbo 8‑step 768p LoRA. Accélère l'échantillonnage H3 pour des rendus rapides et de haute qualité. Carte du modèle
  • MiniMax‑H3 Échange de personnage LoRA. Renforce les échanges robustes de tête et de corps pour des looks stylisés ou de créature. Carte du modèle
  • Patch de modèle FUN ControlNet Union 2.0 pour H3. Ajoute une guidance de pose corporelle optionnelle à partir de squelettes. Fichier du modèle
  • Modèle Segment Anything 3.1 Multiplex. Produit des masques automatiques pour la zone à régénérer. Checkpoint
  • DWPose (via ControlNet Aux). Détecte les squelettes du corps et des mains pour la guidance de pose et la logique de recadrage de la tête. Répertoire

Comment utiliser le flux de travail Comfyui MiniMax H3 Performance Capture#

Le flux de travail fonctionne de gauche à droite à travers huit groupes étiquetés. Commencez par charger votre clip de performance et, éventuellement, un masque manuel, un gros plan de caméra de tête et une fiche de personnage. Le pipeline prépare ensuite une plaque et un masque, construit une référence d'acteur à partir de votre visage, guide éventuellement la pose corporelle, rend avec MiniMax H3, et enregistre une coupe de comparaison.

1 CHARGER LES MODÈLES#

Ce groupe charge le MiniMax‑H3 UNet, l'encodeur de texte et les VAEs, puis applique les LoRAs Turbo et Échange de Personnage. UNETLoader (#1001) et CLIPLoader (#1006) fournissent le générateur principal et l'encodeur d'invite. LoraLoaderModelOnly (#1003, #1004) attache les adaptateurs de vitesse et d'échange. BlockSparseAttention (#1009) et MiniMaxH3SigmaShift (#1002) sont câblés pour accélérer l'échantillonnage et équilibrer la guidance audio‑vidéo.

2 VOTRE PRISE#

Utilisez BODY CLIP (your performance + voice) (#1012) pour charger la prise principale avec audio monophonique ou stéréo intégré. Vous pouvez ajouter une CREATURE SHEET via LoadImage (#1016) pour verrouiller l'apparence à travers les prises, et définir l'invite dans PROMPT (the swap, the creature, its acting) (#1018). Les entrées optionnelles incluent un gros plan HEAD‑CAM VHS_LoadVideo (#1013) pour les petits visages dans les plans larges et une vidéo MANUAL MASK VHS_LoadVideo (#1014) si vous souhaitez remplacer le masquage automatique. Les contrôles rapides sont ici : WHAT GETS REPLACED (head / person) (#1017), SEED (#1019), GROW MASK px (#1020), FACE CROP (#1021) et PERSON (#1022). Les nœuds de basculement (NO HEAD‑CAM #1227, NO MANUAL MASK #1228, NO CHARACTER SHEET #1229, NO POSE CONTROL #1230) rendent les configurations courantes d'un clic.

3 PRÉPARER#

WORKING SIZE (draft: 896x512) (#1028) normalise l'entrée à une résolution stable, et length: next 17k+5 up (#1030) limite le déroulement à une longueur de prévisualisation courte et rapide. PREPARE (plate + regenerated area) (#1231) construit une plaque propre, suit ce qui doit être remplacé avec SAM 3 utilisant votre texte de WHAT GETS REPLACED, et, si présent, ingère votre masque manuel. Le résultat est une plaque vidéo plus un ou deux masques prêts pour une régénération contrôlée.

4 ZONE RÉGÉNÉRÉE#

REGENERATED AREA (grow, blocks, hold) (#1233) est la logique de masque qui décide où MiniMax H3 peut peindre. Il étend le masque pour que des fonctionnalités comme des oreilles ou des cornes aient de l'espace, le convertit en blocs temporels pour stabiliser le mouvement, et maintient les changements quelques images pour que les détails ne scintillent pas. Si vous avez fourni un masque manuel, le [MANUAL MASK] composite (#1074 à #1105) le passe à travers tel que dessiné.

5 RÉFÉRENCE D'ACTEUR#

ACTING REFERENCE (your face on grey | head‑cam) (#1232) trouve la personne sélectionnée, recadre une région du visage avec DWPose et produit la vidéo de référence qui porte vos expressions, lignes de regard et rotations de tête. Avec la caméra de tête activée, il construit un écran partagé pour que la direction de la tête suive la caméra large tandis que le mouvement facial fin suit la caméra de tête. La prévisualisation PREVIEW: acting reference (<Video 1>) (#1130) vous permet de confirmer le suivi avant de rendre.

6 CONTRÔLE DE POSE (optionnel)#

Pour les échanges de créatures corps entier, [POSE] DWPose skeleton (#1131) extrait les points clés du corps et des mains de votre plaque. MiniMaxH3FunControlNetApply (#1132) alimente ce mouvement dans H3 en tant que patch pour que les membres et le torse suivent votre performance tandis que le visage reste piloté par référence. Utilisez-le lorsque les bras et les jambes doivent rester cohérents entre les images ; laissez-le désactivé pour les échanges de tête uniquement et pour les animaux à quatre pattes.

7 RENDU#

H3 references + prompt MiniMaxH3ReferenceToVideo (#1134) combine l'invite, la fiche de personnage, la référence d'acteur, l'audio, et la taille de travail pour produire le conditionnement H3 et un latent de départ. H3 RENDER (#1234) injecte ensuite le latent de plaque, applique le masque de régénération pour que seule la zone masquée change, et échantillonne avec le calendrier Turbo. La sortie est un rendu propre et une prévisualisation "régénération montrée" ; SAVE: H3 render 1344x768 + voice (#1150) écrit un MP4 avec votre audio original.

8 VIDÉO DE COMPARAISON#

COMPARISON VIDEO (#1235) empile la plaque, le rendu, la référence d'acteur et (si utilisé) la fiche de créature en une seule image pour révision. SAVE: comparison video + voice (#1158) exporte un MP4 avec la même bande sonore pour que vous puissiez comparer le résultat à votre performance.

Nœuds clés dans le flux de travail Comfyui MiniMax H3 Performance Capture#

BODY CLIP (your performance + voice) (#1012)#

Charge votre jeu d'acteur et audio, qui pilotent la synchronisation labiale et le timing. Gardez le cadrage paysager pour une meilleure composition et assurez-vous que le fichier contient de l'audio. Si le visage est minuscule dans le cadre, ajoutez l'entrée de caméra de tête pour un suivi d'expression plus net.

WHAT GETS REPLACED (head / person) (#1017)#

Ce court texte dirige SAM 3.1 vers la région que H3 régénérera. Utilisez head pour les échanges de tête ou person pour les remplacements de corps entier. Si un casque ou un équipement sur la tête doit disparaître, incluez des mots comme tête, casque ou équipement de caméra ; évitez des mots génériques comme écran, moniteur ou câble à moins que vous n'ayez l'intention de retirer des objets similaires en arrière-plan.

REGENERATED AREA (grow, blocks, hold) (#1233)#

Définit combien de l'image H3 peut repeindre et comment cette zone évolue dans le temps. Augmentez la croissance pour donner de l'espace pour les oreilles, les cornes ou la fourrure ; réduisez-la pour les plans larges pour éviter de s'étendre dans l'arrière-plan. Les étapes de bloc et de maintien stabilisent le mouvement pour que les détails ne scintillent pas entre les images.

ACTING REFERENCE (your face on grey | head‑cam) (#1232)#

Crée la piste de performance que MiniMax H3 imitera. FACE CROP contrôle combien de la tête et du cou sont analysés, et PERSON sélectionne l'acteur lorsque plusieurs personnes sont visibles. Activez la caméra de tête uniquement lorsque le visage du plan large est très petit ; une caméra suit généralement mieux les mouvements de tête.

MiniMaxH3ReferenceToVideo (#1134)#

Le hub qui fusionne l'invite, les références et l'audio pour produire le conditionnement et un latent initial. Gardez la largeur et la hauteur alignées avec la taille de travail et laissez le flux de travail limiter automatiquement la longueur pour les prévisualisations. L'invite inclut déjà une phrase qui indique à H3 comment utiliser la référence d'acteur.

MiniMaxH3FunControlNetApply (#1132)#

Ajoute une guidance de pose corporelle optionnelle à partir de DWPose. Utile pour les créatures corps entier pour que le torse et les membres suivent de manière convaincante tandis que le visage suit la référence d'acteur. Laissez-le désactivé pour les échanges de tête uniquement ou les mouvements à quatre pattes qui ne correspondent pas aux squelettes humains.

H3 RENDER (#1234)#

Applique le masque pour que seule la région sélectionnée change, puis échantillonne la vidéo avec le calendrier Turbo et décode avec VAE en tuiles pour l'efficacité VRAM. Utilisez SEED pour ajuster l'apparence et les micro-mouvements ; changez-le lorsque l'apparence du personnage dérive de la fiche ou de la description.

Extras optionnels#

  • Conseils de tournage pour MiniMax H3 Performance Capture : filmez en paysage, gardez l'exposition stable, incluez un audio de production clair ; si vous avez tourné en HDR sur iPhone, convertissez en SDR avant d'exécuter.
  • Guidance de fiche de personnage : incluez des vues de face et de côté plus quelques petites têtes d'expression ; cela verrouille l'identité à travers les prises mieux que le texte seul.
  • Scènes multi-personnes : définissez PERSON sur l'index correct et décrivez le sujet dans le texte SAM, puis vérifiez l'aperçu du masque avant de rendre.
  • Masque manuel : fournissez une vidéo en noir et blanc qui correspond au timing du clip corporel ; peignez-le légèrement plus grand que la créature prévue pour que H3 ne revienne pas au visage original.
  • Quand activer le contrôle de pose : utilisez-le pour les humanoïdes corps entier ou les créatures avec des bras et des jambes ; désactivez-le pour les échanges de tête uniquement et les quadrupèdes.
  • Notes de performance : l'attention parcimonieuse est activée pour accélérer les rendus et réduire la mémoire ; si la VRAM est serrée, exécutez l'encodeur de texte sur CPU dans CLIPLoader. Les nœuds personnalisés utilisés incluent ComfyUI‑VideoHelperSuite, ComfyUI‑KJNodes, comfyui_controlnet_aux, ComfyUI‑H3‑FaceRefine et ComfyUI‑Mickmumpitz‑Nodes.

Remerciements#

Ce flux de travail implémente et s'appuie sur les travaux et les ressources suivants. Nous remercions chaleureusement Mickmumpitz pour le flux de travail de capture de performance ComfyUI et Comfy-Org pour les modèles MiniMax H3 pour leurs contributions et leur maintenance. Pour des détails autoritatives, veuillez vous référer à la documentation originale et aux répertoires liés ci-dessous.

Ressources#

Note : L'utilisation des modèles, ensembles de données et codes référencés est soumise aux licences et termes respectifs fournis par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.