Wan Animate 2 ComfyUI transfert de mouvement : animation de personnage à partir d'une vidéo de conduite#
Wan Animate 2 ComfyUI transforme un personnage de référence fixe plus une vidéo de pose de conduite en un nouveau clip d'animation intégral. Il est conçu autour de Wan‑Animate‑2, un transformateur de diffusion de bout en bout qui transfère directement le mouvement à partir de cadres bruts, vous n'avez donc pas besoin d'OpenPose ou d'extraction de squelette. Le workflow préserve l'identité du personnage à partir de l'image fixe tout en vous permettant de contrôler l'arrière-plan, le style et la caméra via du texte.
Ce graphique prêt pour RunComfy est idéal pour les créateurs qui souhaitent un transfert de mouvement de style studio à l'intérieur de ComfyUI. Vous fournissez un portrait ou une référence corporelle complète, insérez une courte vidéo de conduite, définissez deux invites concises, et Wan Animate 2 ComfyUI produit une performance de personnage fidèle à l'identité avec un décor propre et dirigé par des invites.
Modèles clés dans le workflow Comfyui Wan Animate 2 ComfyUI#
- Poids de base Wan‑Animate‑2. Le transformateur de diffusion qui effectue le transfert de mouvement conscient de l'identité à partir du clip de conduite tout en générant de nouveaux cadres. Source et poids : Wan‑Animate‑2 GitHub et Comfy‑Org/Wan‑Animate‑2.
- LightX2V I2V 14B 480p distillé LoRA. Un adaptateur léger qui aligne la base Wan‑Video pour une génération image-à-vidéo efficace et un conditionnement de mouvement. Fichier : lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors chez Hugging Face.
- uMT5‑XXL encodeur de texte. Interprète vos invites positives et négatives pour piloter l'apparence du personnage, l'arrière-plan et le style. Fichier : umt5_xxl_fp8_e4m3fn_scaled.safetensors chez Hugging Face.
- CLIP ViT‑H/14 encodeur de vision. Extrait des caractéristiques d'apparence de l'image de référence et des indices complémentaires des cadres de pose pour une guidance robuste de l'identité et du mouvement. Fichier : clip_vision_h.safetensors chez Hugging Face.
- Wan 2.1 VAE. Encode et décode les latents vidéo tout en préservant la texture fine et la fidélité des couleurs. Fichier : Wan2_1_VAE_bf16.safetensors chez Hugging Face.
Comment utiliser le workflow Comfyui Wan Animate 2 ComfyUI#
En un coup d'œil, le workflow route une image de référence et une vidéo de conduite à travers le sous-graphe de Transfert de Mouvement, puis décode les cadres en une vidéo et, éventuellement, coud une comparaison côte à côte. Les groupes ci-dessous décrivent comment chaque partie contribue et ce que vous pouvez modifier.
Modèles#
Ce groupe charge le modèle de base Wan‑Animate‑2, son LoRA, l'encodeur de texte, CLIP‑Vision et VAE. Conservez les choix de modèle par défaut à moins que vous sachiez que vous avez besoin d'alternatives des mêmes dépôts. Le couple UNet et LoRA définit comment le mouvement est interprété et rendu, tandis que le VAE contrôle la fidélité de l'image lors de l'encodage/décodage latent. Si vous échangez des modèles, assurez-vous qu'ils sont compatibles avec les ressources Wan Animate 2 ComfyUI des dépôts liés.
Invite#
Utilisez l'invite positive pour décrire l'apparence du personnage et l'arrière-plan souhaité, et l'invite négative pour exclure doucement les artefacts. Décrivez l'apparence, les matériaux, les vêtements, l'éclairage et le décor ; ne décrivez pas le mouvement ici car le mouvement provient de la vidéo. Garder les invites concises et spécifiques améliore la préservation de l'identité et la cohérence de l'arrière-plan à travers les cadres. L'encodeur de texte convertit votre texte en conditionnement utilisé tout au long de la génération.
Image de Référence#
Chargez un portrait de référence unique et propre ou une image corporelle complète avec le personnage centré en utilisant Load Image (Reference Image) (#189). L'arrière-plan de cette image fixe ne se transfère pas car la scène est générée à partir de votre invite. Le groupe redimensionne la référence pour correspondre à la résolution de travail utilisée en aval afin que les cartes d'attention s'alignent avec les caractéristiques de pose. Des références bien éclairées, nettes et avec une occlusion minimale produisent une identité plus forte.
Vidéo de Référence de Pose#
Importez le clip de conduite avec Load Video (Pose Video) (#240). Les cadres sont passés directement au modèle plutôt que convertis en points clés squelettiques, donc les nuances naturelles comme les déplacements de poids et les mouvements secondaires se transfèrent bien. Le graphique normalise les dimensions spatiales tout en conservant la cadence originale du clip, ce qui signifie que le fps de sortie suit la source. Choisissez des clips dont le cadrage correspond approximativement à la référence (par exemple, corps entier à corps entier) pour éviter les dérives d'échelle.
Fenêtres de Contexte & Cache#
ContextWindowsManual contrôle le contexte temporel, aidant les mouvements plus longs à rester cohérents à travers les fenêtres. Un petit ComfySwitchNode bascule si l'expansion du contexte est utilisée, vous permettant d'échanger de la mémoire pour la stabilité dans les plans prolongés. WanAnimate2Cache gère le cache d'attention sur gpu ou cpu avec une précision réduite, ce qui aide à contrôler les pics de VRAM sur des séquences longues. Pour les GPU serrés, placer le cache sur le cpu est une précaution pratique.
Conditionnement#
WanAnimate2ToVideo (#247) est le cœur de Wan Animate 2 ComfyUI. Il fusionne le conditionnement de texte positif et négatif avec l'image de référence, les caractéristiques CLIP‑Vision et les cadres de pose pour produire une séquence de latents vidéo. Vous pouvez passer le dernier cadre d'un segment précédent à continue_motion pour maintenir la continuité entre les morceaux, et vous pouvez décaler la lecture du clip de conduite avec video_frame_offset lors de l'enchaînement. Le nœud accepte également reference_image_strength et pose_strength pour équilibrer le verrouillage de l'identité par rapport à la fidélité du mouvement.
Échantillonnage#
SamplerCustom débruite les latents vidéo en utilisant le modèle préparé par ModelSamplingSD3, BasicScheduler et une sélection de samplers LCM. Cette étape détermine la vitesse et la stabilité de la texture ; une graine fixe garde l'apparence et le grain cohérents à travers les segments, tandis qu'une graine aléatoire ajoute de la variation. Le résultat est un clip vidéo latent prêt à être décodé.
Supprimer le premier cadre dupliqué#
Lors de l'enchaînement de segments, le premier cadre d'un nouveau segment peut dupliquer le dernier cadre du segment précédent. TrimVideoLatent plus un petit chemin de commutation suppriment automatiquement cette couture. Si vous voyez toujours un hic unique d'un cadre, supprimez la première image du nouveau morceau lors du traitement par lots.
Assemblage et comparaison vidéo#
VAEDecode convertit les latents finaux en images, qui sont regroupées puis envoyées à CreateVideo pour hériter du fps et de l'audio du clip source s'il est présent. SaveVideo écrit l'animation générée sur le disque. Le sous-graphe Video Stitch (ImageStitch à l'intérieur) prend la vidéo générée et la vidéo de conduite originale pour produire une comparaison côte à côte pour des vérifications de qualité rapides, puis enregistre cette vue combinée en tant que fichier séparé.
Extension au-delà d'un seul morceau#
Chaque passage produit un nombre fixe de cadres, donc des plans plus longs sont créés en dupliquant le sous-graphe Motion Transfer (Wan Animate 2) (#261). Connectez continue_motion du passage précédent au passage suivant et alimentez le video_frame_offset précédent pour que la lecture du clip de conduite continue de manière transparente. Connectez la sortie image de chaque passage à BatchImagesNode (#289) pour concaténer les segments avant la création de la vidéo. Un nœud mathématique d'aide en bas à gauche calcule combien de passages vous avez besoin en fonction de la longueur de la vidéo de conduite, et un petit aperçu imprime le nombre.
Nœuds clés dans le workflow Comfyui Wan Animate 2 ComfyUI#
WanAnimate2ToVideo (#247)#
Combine le conditionnement de texte, l'image de référence, les caractéristiques CLIP‑Vision et les cadres de pose pour synthétiser des latents vidéo. Ajustez reference_image_strength pour contrôler à quel point la sortie adhère à l'image fixe, et utilisez pose_strength plus pose_start_percent et pose_end_percent pour fenêtrer ou adoucir le mouvement. length définit les cadres par passage, video_frame_offset avance à travers le clip de conduite lors de l'enchaînement, et continue_motion ancre la continuité temporelle en utilisant le dernier cadre du segment précédent. Pris en charge par l'implémentation et les poids Wan‑Animate‑2 dans les dépôts officiels liés ci-dessus.
ContextWindowsManual (#257) avec ComfySwitchNode (#258)#
Élargit la fenêtre d'attention temporelle pour que les mouvements restent cohérents à travers des séquences plus longues. Activez-le pour des mouvements complexes ou lorsque vous voyez des détails dériver au fil du temps, au prix d'une mémoire supplémentaire. Si vous atteignez les limites de mémoire, désactivez ou réduisez la taille de la fenêtre de contexte et comptez sur la continuité de morceau à morceau.
WanAnimate2Cache (#224)#
Met en cache les clés et valeurs d'attention pour réduire les calculs redondants et lisser l'utilisation de la mémoire. Définissez le device du cache sur cpu lorsque la VRAM est serrée ou sur gpu pour un débit maximal, et conservez le dtype léger pour la stabilité. Cela est particulièrement utile lorsque vous empilez plusieurs passages pour des plans prolongés. Les ressources sont fournies avec la sortie officielle Comfy‑Org/Wan‑Animate‑2.
SamplerCustom (#19) avec KSamplerSelect et BasicScheduler#
Exécute la trajectoire de débruitage sur les latents vidéo. Le sampler LCM est choisi pour des étapes rapides et de haute qualité adaptées à l'itération interactive. Utilisez une graine fixe pour verrouiller la texture et l'ombrage à travers les passages enchaînés ; changez la graine pour explorer des alternatives tout en gardant le mouvement identique.
TrimVideoLatent (#223)#
Supprime le premier cadre dupliqué qui peut apparaître lorsque vous enchaînez des segments, éliminant les coutures visibles. Laissez-le activé lors de la construction de séquences plus longues et désactivez-le pour des clips en un seul passage.
Extras optionnels#
- Gardez le cadrage cohérent entre la référence et la vidéo de conduite. Corps entier à corps entier ou plan moyen à plan moyen fonctionne mieux.
- Parce que Wan Animate 2 ComfyUI lit les cadres bruts pour le mouvement, utilisez des clips de conduite avec des silhouettes claires et un flou de mouvement minimal.
- Décrivez les arrière-plans dans l'invite positive plutôt que de compter sur l'arrière-plan de l'image de référence ; le modèle génère un nouveau décor à partir du texte.
- Le fps de sortie suit le clip d'entrée. Si le mouvement semble trop lent ou trop rapide, rééchantillonnez la vidéo de conduite avant d'exécuter le workflow.
- Pour les GPU avec une mémoire limitée, définissez le device de cache sur cpu dans
WanAnimate2Cacheet préférez les morceaux plus courts que vous pouvez ensuite assembler. - Utilisez la sortie côte à côte du sous-graphe
Video Stitchpour vérifier rapidement la fidélité du mouvement avant de rendre des exécutions plus longues.
Remerciements#
Ce workflow met en œuvre et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Comfy Org pour l'annonce "Wan Animate 2 est maintenant disponible dans ComfyUI" et les modèles, Wan-Video pour le code de base Wan-Animate-2, Comfy-Org pour les poids du modèle Wan-Animate-2 sur Hugging Face, et ComfyUI pour le modèle de workflow "Wan Animate 2 : Transfert de Mouvement" pour leurs contributions et leur maintenance. Pour des détails autorisés, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.
Ressources#
- Comfy Org/Wan Animate 2 est maintenant disponible dans ComfyUI
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/Wan-Animate-2
- Docs / Notes de publication: Wan Animate 2 est maintenant disponible dans ComfyUI
- Wan-Video/Wan-Animate-2
- GitHub: Wan-Video/Wan-Animate-2
- Hugging Face: Wan-AI/Wan2.2-Animate-2-14B
- arXiv: 2608.06009
- Comfy-Org/Wan-Animate-2
- Hugging Face: Comfy-Org/Wan-Animate-2
- arXiv: 2608.06009
- ComfyUI/Wan Animate 2 : Transfert de Mouvement
- Docs / Notes de publication: Wan Animate 2 : Transfert de Mouvement - Workflow ComfyUI
Note : L'utilisation des modèles, ensembles de données et codes référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.



