Wan Dancer : image et musique en vidéo de danse synchronisée au rythme dans ComfyUI#
Ce workflow Wan Dancer transforme une seule image de référence et une piste musicale en une courte vidéo de danse synchronisée au rythme. Il est conçu pour les créateurs qui souhaitent un contrôle direct de l'image et de l'audio sur la chorégraphie, avec des commutateurs simples pour le style de danse et l'amplitude du mouvement. Le pipeline effectue un passage de planification global pour esquisser le mouvement du corps entier et le timing, puis un passage de raffinement local qui affine les détails et lisse le mouvement avant de rendre la vidéo finale.
Parce que Wan Dancer produit une séquence complète en une seule fois, il est idéal pour concevoir des prises de vue de performance de danse, des études rapides d'animation de personnages et des clips sociaux pilotés par la musique. Vous fournissez une image de personnage propre, choisissez un style, réglez l'amplitude, et Wan Dancer aligne le mouvement sur l'audio tout en préservant l'identité.
Modèles clés dans le workflow Comfyui Wan Dancer#
- Wan-Dancer-14B (modèle global). Planifie la chorégraphie à longue portée et la coordination corporelle à partir de l'image et de l'audio, produisant un plan de mouvement cohérent. Voir la fiche du modèle officiel sur Wan-AI/Wan-Dancer-14B et les poids prêts pour Comfy sur Comfy-Org/Wan-Dancer.
- Wan-Dancer-14B (modèle local). Raffine et interpole le mouvement au niveau des images pour ajouter de la précision dans les membres, les mains et le mouvement de la tête tout en restant fidèle au plan global. Les poids sont fournis avec le modèle global dans Comfy-Org/Wan-Dancer.
- UMT5‑XXL encodeur de texte. Interprète des invites textuelles courtes qui décrivent le style de danse et les indices d'apparence ; emballé pour ComfyUI dans Comfy-Org/Wan_2.1_ComfyUI_repackaged.
- CLIP Vision H encodeur. Extrait des caractéristiques visuelles robustes de l'image de référence pour préserver l'identité et les vêtements ; fourni dans le même pack prêt pour Comfy : clip_vision_h.safetensors.
- Wan 2.1 VAE. Gère l'encodage/décodage latent pour les images vidéo avec une couleur et un contraste stables ; une version testée par Comfy est disponible dans Kijai/WanVideo_comfy.
- LightX2V Lightning LoRA optionnel pour I2V. Un adaptateur léger qui peut accélérer et affiner la synthèse du mouvement lorsqu'il est activé, emballé sur Kijai/WanVideo_comfy.
Comment utiliser le workflow Comfyui Wan Dancer#
À un niveau élevé, le graphe effectue deux passages coordonnés. La génération globale esquisse la chorégraphie et produit un aperçu vidéo rapide. La génération locale remplit ensuite les images clés, se réajuste à l'audio et affine les détails pour le rendu final. Vous contrôlez l'apparence et le mouvement à travers des sélecteurs d'invite compacts, plus un petit ensemble de choix de vidéo et de durée.
Paramètres vidéo#
Ce groupe définit la largeur, la hauteur et la longueur de la séquence de sortie pour les deux passages. Les dimensions sont automatiquement ajustées à des multiples compatibles avec le matériel, vous pouvez donc vous concentrer sur le rapport d'aspect et la résolution. Les clips plus longs et les images plus grandes consomment plus de VRAM, utilisez donc ce panneau pour équilibrer la vitesse et la qualité. Ces paramètres alimentent directement le WanDancerVideo global (#647) et le WanDancerVideo local (#668).
Prompt#
Ici, vous choisissez un style de danse et une amplitude de mouvement. Le sélecteur de style inscrit une courte phrase dans les invites textuelles globales et locales, tandis que le sélecteur d'amplitude module l'énergie que le mouvement corporel doit avoir. Le modèle est livré avec des styles comme la danse classique chinoise, le K‑Pop, la danse de rue, la danse latine et la danse à claquettes, et vous pouvez ajouter les vôtres. Les chaînes d'invite originales sont en chinois ; n'hésitez pas à les localiser ou à les enrichir pour s'adapter à votre projet.
Couper l'audio#
Utilisez ce groupe pour raccourcir un fichier musical long pour les aperçus ou pour correspondre à une durée de clip finale spécifique. L'audio est coupé une fois et passé aux étapes globales et locales, en gardant le timing des battements cohérent. Si vous changez la durée finale, le remplissage des images clés en aval et le passage local s'adapteront automatiquement. Pour une itération rapide, raccourcissez l'audio, vérifiez le mouvement, puis restaurez la longueur pour le rendu final.
Modèles communs#
Ce groupe charge des ressources partagées : l'encodeur de texte UMT5-XXL, CLIP Vision H et le Wan 2.1 VAE. Ils fournissent la compréhension des invites, les caractéristiques d'identité de votre image et un décodage stable des images. Aucune action de l'utilisateur n'est généralement nécessaire ici à moins que vous ne remplaciez les encodeurs ou une construction VAE différente.
Modèle global#
Charge les poids globaux Wan-Dancer-14B. Dans ce passage, le workflow encode votre image de référence et l'audio coupé, applique le modèle de chorégraphie global, et produit une vidéo d'aperçu uniquement du mouvement. Cette étape est rapide et excellente pour valider le style et l'amplitude avant de s'engager dans le raffinement.
Génération globale#
Ce bloc convertit l'image de référence et l'audio en un brouillon cohérent de la danse. Les nœuds encodeurs extraient les caractéristiques textuelles et visuelles, WanDancerEncodeAudio (#651) transforme la musique en indices rythmiques, et WanDancerVideo (#647) synthétise la séquence complète. Un planificateur et un échantillonneur débruitent ensuite le latent en images, et un nœud vidéo assemble un aperçu. Si le brouillon semble hors du rythme ou trop statique, ajustez l'amplitude ou essayez un style différent et ré-aperçu.
Commutateur#
Une petite section de contrôle bascule si le modèle doit passer par le chemin Lightning LoRA ou les poids originaux. Laissez Lightning activé pour une itération plus rapide et désactivez-le lorsque vous avez besoin de la reproduction la plus fidèle au point de contrôle de base Wan Dancer. Des commutateurs supplémentaires contrôlent le nombre d'étapes et la valeur de guidage que l'échantillonneur doit utiliser, vous permettant d'échanger la vitesse contre la qualité par étape.
Échantillonneur#
Définit le débruiteur et le calendrier de bruit utilisés pour transformer les plans latents en images. La configuration est partagée entre les passages globaux et locaux pour un look cohérent. Les utilisateurs avancés peuvent expérimenter avec les échantillonneurs, mais le réglage fourni est un défaut solide pour la vidéo Wan Dancer. Si vous voyez des scintillements, un guidage légèrement plus fort couplé à un échantillonneur plus stable peut aider.
Modèle local#
Charge les poids locaux Wan-Dancer-14B et, lorsqu'il est activé, applique le même Lightning LoRA à ce chemin de raffinement. Ce modèle se concentre sur l'interpolation et les détails fins comme les mains, les cheveux, et le mouvement subtil du torse tout en préservant les traits d'identité encodés de votre image. Gardez cette étape activée pour les rendus finaux.
Génération locale (interpolation)#
Le passage local commence par remplir les images clés de l'aperçu global pour couvrir toute la chronologie. WanDancerEncodeAudio (#669) ré-encode la musique pour le nombre d'images local, et WanDancerVideo (#668) produit un mouvement de plus haute fidélité aligné sur l'audio. Les latents raffinés sont décodés en images, puis réassemblés et assemblés dans la vidéo finale avec le son synchronisé. Utilisez cette sortie pour juger du réalisme, du mouvement des mains, et de la finition générale.
Echantillonnage#
Ce groupe de soutien relie le planificateur, le guide et l'échantillonneur utilisés dans le raffinement local. Il garantit que le passage local hérite d'un timing et d'une résolution cohérents des groupes précédents tout en vous permettant d'augmenter la qualité là où cela compte. Si vous changez la durée ou la résolution en amont, ce chemin d'échantillonnage s'adaptera sans rompre l'alignement.
Nœuds clés dans le workflow Comfyui Wan Dancer#
Custom Combo (Dance Style) (#695)#
Sélectionne la catégorie de danse qui est insérée dans les invites textuelles globales et locales. Choisissez un style qui correspond au genre de votre piste pour obtenir les meilleurs résultats, ou ajoutez vos propres entrées à la liste. Si le mouvement semble mal assorti au rythme, essayez un style avec des accents rythmiques plus clairs avant d'ajuster d'autres contrôles.
Custom Combo (Motion Amplitude) (#694)#
Contrôle l'énergie que la chorégraphie doit avoir. Des valeurs plus basses gardent le mouvement contenu pour une musique douce ; des valeurs plus élevées augmentent le déplacement et la vitesse des membres pour des morceaux énergiques. Si vous remarquez une dérive d'identité ou des artefacts dans les poses extrêmes, réduisez l'amplitude d'un cran et ré-aperçu.
WanDancerEncodeAudio (#651)#
Encode la musique coupée en caractéristiques de rythme et d'intensité pour le passage global. Cela aligne les battements à l'intérieur de WanDancerVideo (#647). Pour des intros très douces ou des fondus longs, envisagez de couper à la section avec un battement clair pour aider l'encodeur à se verrouiller rapidement.
WanDancerVideo (#647)#
Synthétise la chorégraphie globale à partir de texte, d'images et de caractéristiques audio à la résolution et à la longueur de séquence choisies. Considérez cela comme un planificateur de mouvement : vérifiez le timing, le style, et la dynamique de pose générale ici avant de passer à autre chose. Si l'aperçu est trop bruyant en chroma, continuez ; la fidélité des couleurs est solidifiée dans le passage local.
WanDancerPadKeyframesList (#670)#
Construit une chronologie des images clés à partir de la sortie globale et les aligne à la durée choisie. Cela garantit que le passage local voit à la fois des ancres visuelles et le segment audio correct. Si vous prolongez la durée, ce nœud remplit les lacunes en douceur pour que le modèle local puisse interpoler correctement.
WanDancerEncodeAudio (#669)#
Ré-encode l'audio pour le budget d'images local après le remplissage des images clés. Cela maintient le mouvement raffiné synchronisé à la phase de la musique. Lorsque vous changez la longueur du clip, exécutez toujours ce nœud pour que le modèle local entende le segment correct.
WanDancerVideo (#668)#
Génère le mouvement raffiné, de haute fidélité, conditionné sur les images clés, les caractéristiques d'image, et l'audio ré-encodé. Utilisez-le pour résoudre les mouvements des mains, des cheveux, les ondulations des vêtements, et les légers mouvements de tête tout en maintenant l'identité. Si de petits tremblements apparaissent, essayez un échantillonneur plus stable ou un peu plus de guidage dans votre débruiteur.
Switch(Model) (#644)#
Bascule entre les poids de base Wan Dancer et le chemin augmenté par Lightning LoRA. Gardez-le activé pour des brouillons rapides ; désactivez-le pour un maximum de fidélité au point de contrôle de base. Pour des matériaux délicats comme des manches fluides ou de longs cheveux, le chemin de base peut mieux préserver les micro-détails.
TrimAudioDuration (#494)#
Raccourcit la piste d'entrée pour les aperçus ou pour imposer une longueur cible. C'est le moyen le plus rapide d'itérer sur le style et l'amplitude sans augmenter l'utilisation de la VRAM. Après avoir aimé le mouvement, restaurez la section complète et rendez le final.
Extras optionnels#
- Wan Dancer traite de nombreuses images par passage et bénéficie d'un GPU puissant. Pour un matériel plus léger, réduisez la résolution ou raccourcissez la durée pendant les aperçus.
- Utilisez un portrait ou une référence en pied propre et bien éclairé avec un minimum d'occlusion ; les arrière-plans chargés peuvent confondre les caractéristiques d'identité.
- Faites correspondre le style de danse au groove de la piste avant d'augmenter l'amplitude du mouvement ; le choix du style a le plus grand impact sur le mouvement crédible.
- Fixez la graine de bruit pour reproduire les résultats sur plusieurs exécutions ; changez-la lorsque vous explorez des chorégraphies alternatives à partir des mêmes entrées.
- Deux sorties sont enregistrées : un aperçu global uniquement du mouvement et le rendu final synchronisé à l'audio. Examinez d'abord l'aperçu pour gagner du temps.
Remerciements#
Ce workflow met en œuvre et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Comfy-Org pour le guide officiel du workflow ComfyUI Wan Dancer, Wan-AI pour le modèle officiel Wan-Dancer-14B, et Comfy-Org pour les fichiers de modèle Wan Dancer pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation et aux dépôts originaux liés ci-dessous.
Ressources#
- Comfy-Org/Guide officiel du workflow ComfyUI Wan Dancer
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- Docs / Notes de version: Guide officiel du workflow ComfyUI Wan Dancer
- Wan-AI/Wan-Dancer-14B modèle officiel
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Comfy-Org/Fichiers de modèle Wan Dancer
- Hugging Face: Comfy-Org/Wan-Dancer
Note : L'utilisation des modèles, ensembles de données, et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

