Wan Dancer: Bild-und-Musik zu rhythmus-synchronisiertem Tanzvideo in ComfyUI#
Dieser Wan Dancer-Workflow verwandelt ein einzelnes Referenzbild und einen Musiktrack in ein kurzes, rhythmus-synchronisiertes Tanzvideo. Es ist für Kreative konzipiert, die direkte Bild-und-Audio-Kontrolle über die Choreographie wünschen, mit einfachen Schaltern für Tanzstil und Bewegungsamplitude. Die Pipeline führt einen globalen Planungsdurchlauf durch, um Ganzkörperbewegung und Timing zu entwerfen, gefolgt von einem lokalen Verfeinerungsdurchlauf, der Details schärft und Bewegungen glättet, bevor das endgültige Video gerendert wird.
Da Wan Dancer eine vollständige Sequenz in einem Rutsch produziert, eignet es sich ideal für die Konzeption von Tanzaufführungsaufnahmen, schnelle Charakteranimationsstudien und musikgetriebene Social-Clips. Sie liefern ein sauberes Charakterbild, wählen einen Stil, legen die Amplitude fest, und Wan Dancer stimmt die Bewegung auf die Audio ab, während die Identität bewahrt wird.
Schlüsselmodelle im ComfyUI Wan Dancer-Workflow#
- Wan-Dancer-14B (Globales Modell). Plant langreichweitige Choreographie und Körperkoordination aus Bild und Audio und produziert einen kohärenten Bewegungsentwurf. Siehe die offizielle Modellkarte bei Wan-AI/Wan-Dancer-14B und die Comfy-bereiten Gewichte bei Comfy-Org/Wan-Dancer.
- Wan-Dancer-14B (Lokales Modell). Verfeinert und interpoliert Bewegungen auf Frame-Ebene, um Präzision bei Gliedmaßen-, Hand- und Kopfbewegungen hinzuzufügen, während der globale Plan eingehalten wird. Gewichte werden zusammen mit dem globalen Modell bei Comfy-Org/Wan-Dancer bereitgestellt.
- UMT5-XXL Text-Encoder. Interpretiert kurze Textaufforderungen, die den Tanzstil und Erscheinungshinweise beschreiben; verpackt für ComfyUI in Comfy-Org/Wan_2.1_ComfyUI_repackaged.
- CLIP Vision H Encoder. Extrahiert robuste visuelle Merkmale aus dem Referenzbild, um Identität und Kleidung zu bewahren; bereitgestellt im gleichen Comfy-bereiten Paket: clip_vision_h.safetensors.
- Wan 2.1 VAE. Handhabt latente Kodierung/Dekodierung für Videoframes mit stabilem Farb- und Kontrast; ein Comfy-getesteter Build ist verfügbar in Kijai/WanVideo_comfy.
- Optionales LightX2V Lightning LoRA für I2V. Ein leichter Adapter, der die Bewegungssynthese beschleunigen und schärfen kann, wenn aktiviert, verpackt bei Kijai/WanVideo_comfy.
Verwendung des ComfyUI Wan Dancer-Workflows#
Auf hoher Ebene führt das Diagramm zwei koordinierte Durchläufe aus. Die globale Generation entwirft die Choreographie und produziert eine schnelle Videovorschau. Die lokale Generation ergänzt dann die Schlüsselbilder, richtet sich neu an der Audio aus und verfeinert Details für das finale Ergebnis. Sie steuern das Aussehen und die Bewegung durch kompakte Aufforderungsselektoren, plus eine kleine Auswahl an Video- und Dauereinstellungen.
Videoeinstellungen#
Diese Gruppe definiert die Ausgabe von Breite, Höhe und Sequenzlänge für beide Durchläufe. Die Dimensionen werden automatisch auf hardwarefreundliche Vielfache angepasst, sodass Sie sich auf das Seitenverhältnis und die Auflösung konzentrieren können. Längere Clips und größere Frames verbrauchen mehr VRAM, verwenden Sie also dieses Panel, um Geschwindigkeit und Qualität auszugleichen. Diese Einstellungen fließen direkt in das globale WanDancerVideo (#647) und das lokale WanDancerVideo (#668) ein.
Aufforderung#
Hier wählen Sie einen Tanzstil und eine Bewegungsamplitude. Der Stilselektor schreibt einen kurzen Satz in die globalen und lokalen Textaufforderungen, während der Amplitudenselektor moduliert, wie energisch die Körperbewegung sein soll. Die Vorlage enthält Stile wie Chinesischer Klassischer Tanz, K-Pop, Straßentanz, Lateinamerikanischer Tanz und Stepptanz, und Sie können Ihre eigenen hinzufügen. Die ursprünglichen Aufforderungstexte sind auf Chinesisch; Sie können sie gerne lokalisieren oder anreichern, um Ihrem Projekt zu entsprechen.
Audio kürzen#
Verwenden Sie diese Gruppe, um eine lange Musikdatei für Vorschauen zu kürzen oder um eine bestimmte endgültige Clipdauer zu erreichen. Die Audio wird einmal gekürzt und an beide globale und lokale Stufen übergeben, um die Schlagzeitanpassung konsistent zu halten. Wenn Sie die endgültige Dauer ändern, passen sich die nachgelagerte Schlüsselbildpolsterung und der lokale Durchlauf automatisch an. Für schnelle Iterationen kürzen Sie die Audio, überprüfen Sie die Bewegung und stellen Sie dann die Länge für das endgültige Rendern wieder her.
Gemeinsame Modelle#
Diese Gruppe lädt gemeinsam genutzte Assets: den UMT5-XXL Text-Encoder, CLIP Vision H und den Wan 2.1 VAE. Sie bieten Aufforderungsverständnis, Identitätsmerkmale aus Ihrem Bild und stabile Dekodierung von Frames. Normalerweise sind hier keine Benutzeraktionen erforderlich, es sei denn, Sie wechseln Encoder oder einen anderen VAE-Build.
Globales Modell#
Lädt die Wan-Dancer-14B globalen Gewichte. In diesem Durchlauf kodiert der Workflow Ihr Referenzbild und die gekürzte Audio, wendet das globale Choreographiemodell an und produziert ein motion-only Vorschauvideo. Diese Phase ist schnell und ideal, um Stil und Amplitude zu validieren, bevor man sich der Verfeinerung widmet.
Globale Generation#
Dieser Block wandelt das Referenzbild und die Audio in einen kohärenten Entwurf des Tanzes um. Die Enkoder-Knoten extrahieren Text- und visuelle Merkmale, WanDancerEncodeAudio (#651) wandelt Musik in Rhythmushinweise um und WanDancerVideo (#647) synthetisiert die vollständige Sequenz. Ein Scheduler und ein Sampler entrauschen dann das Latente zu Bildern und ein Videoknoten montiert eine Vorschau. Wenn der Entwurf off-beat oder zu statisch wirkt, passen Sie die Amplitude an oder probieren Sie einen anderen Stil und re-previewen Sie.
Schalter#
Ein kleiner Steuerabschnitt schaltet, ob das Modell durch den Lightning LoRA-Pfad oder die ursprünglichen Gewichte laufen soll. Lassen Sie Lightning an für schnellere Iterationen und schalten Sie es aus, wenn Sie die treueste Reproduktion zum Basis-Wan Dancer-Checkpoint benötigen. Zusätzliche Schalter steuern, welchen Schrittzähler und Leitwert der Sampler verwenden soll, sodass Sie Geschwindigkeit gegen Qualität pro Phase tauschen können.
Sampler#
Definiert den Entrauscher und den Rauschplan, der verwendet wird, um latente Pläne in Frames zu verwandeln. Die Konfiguration wird zwischen den globalen und lokalen Durchläufen geteilt, um ein konsistentes Aussehen zu gewährleisten. Fortgeschrittene Benutzer können mit Samplern experimentieren, aber die bereitgestellte Einstellung ist ein solider Standard für Wan Dancer-Videos. Wenn Sie Flackern sehen, kann eine etwas stärkere Führung in Kombination mit einem stabileren Sampler helfen.
Lokales Modell#
Lädt die Wan-Dancer-14B lokalen Gewichte und wendet, wenn aktiviert, denselben Lightning LoRA auf diesen Verfeinerungspfad an. Dieses Modell konzentriert sich auf Interpolation und feine Details wie Hände, Haare und subtile Rumpfbewegungen, während die Identitätsmerkmale, die aus Ihrem Bild kodiert wurden, beibehalten werden. Halten Sie diese Phase für endgültige Renderings aktiviert.
Lokale Generation (interpolierend)#
Der lokale Durchlauf beginnt mit der Polsterung von Schlüsselbildern aus der globalen Vorschau, um die gesamte Zeitleiste abzudecken. WanDancerEncodeAudio (#669) kodiert die Musik für die lokale Frameanzahl neu, und WanDancerVideo (#668) produziert hochauflösende Bewegungen, die an die Audio angepasst sind. Die verfeinerten Latenten werden zu Frames dekodiert, dann neu gebatcht und zu einem endgültigen Video mit synchronisiertem Sound zusammengefügt. Verwenden Sie diese Ausgabe, um Realismus, Handbewegungen und das gesamte Finish zu beurteilen.
Sampling#
Diese unterstützende Gruppe verbindet den Scheduler, Guider und Sampler, die in der lokalen Verfeinerung verwendet werden. Sie stellt sicher, dass der lokale Durchlauf konsistente Timing- und Auflösungsdaten von früheren Gruppen erbt, während Sie die Qualität dort steigern können, wo es darauf ankommt. Wenn Sie Dauer oder Auflösung weiter oben ändern, passt sich dieser Sampler-Pfad an, ohne die Ausrichtung zu brechen.
Schlüssel-Knoten im ComfyUI Wan Dancer-Workflow#
Custom Combo (Dance Style) (#695)#
Wählt die Tanzkategorie aus, die sowohl in die globalen als auch in die lokalen Textaufforderungen eingefügt wird. Wählen Sie einen Stil, der zum Genre Ihres Tracks passt, für die besten Ergebnisse, oder fügen Sie eigene Einträge zur Liste hinzu. Wenn die Bewegung nicht zum Beat passt, probieren Sie einen Stil mit klareren rhythmischen Akzenten, bevor Sie andere Steuerungen anpassen.
Custom Combo (Motion Amplitude) (#694)#
Steuert, wie energisch die Choreographie sein soll. Niedrigere Werte halten die Bewegung für sanfte Musik zurück; höhere Werte erhöhen die Reise- und Gliedmaßen-Geschwindigkeit für energische Tracks. Wenn Sie Identitätsdrift oder Artefakte in extremen Posen bemerken, reduzieren Sie die Amplitude um einen Schritt und re-previewen Sie.
WanDancerEncodeAudio (#651)#
Kodiert die gekürzte Musik in Rhythmus- und Intensitätsmerkmale für den globalen Durchlauf. Dies treibt die Schlageinpassung innerhalb von WanDancerVideo (#647) an. Für sehr sanfte Intros oder lange Ausblenden, erwägen Sie das Kürzen auf den Abschnitt mit einem klaren Beat, um dem Enkoder zu helfen, schnell einzurasten.
WanDancerVideo (#647)#
Synthetisiert die globale Choreographie aus Text-, Bild- und Audiomerkmalen bei der gewählten Auflösung und Sequenzlänge. Betrachten Sie dies als einen Bewegungsplaner: Überprüfen Sie das Timing, den Stil und die allgemeinen Posendynamiken hier, bevor Sie fortfahren. Wenn die Vorschau zu chroma-rauschig ist, machen Sie weiter; die Farbtreue wird im lokalen Durchlauf gefestigt.
WanDancerPadKeyframesList (#670)#
Erstellt eine Zeitleiste von Schlüsselbildern aus dem globalen Ausgang und richtet sie auf die gewählte Dauer aus. Dies stellt sicher, dass der lokale Durchlauf sowohl visuelle Anker als auch das richtige Audiosegment sieht. Wenn Sie die Dauer verlängern, füllt dieser Knoten Lücken glatt, sodass das lokale Modell sauber interpolieren kann.
WanDancerEncodeAudio (#669)#
Kodiert die Audio für das lokale Framebudget nach der Schlüsselbildpolsterung neu. Dies hält die verfeinerte Bewegung phasenfest zur Musik. Wenn Sie die Clip-Länge ändern, führen Sie diesen Knoten immer aus, damit das lokale Modell das richtige Segment hört.
WanDancerVideo (#668)#
Erzeugt die verfeinerte, hochauflösende Bewegung, die auf Schlüsselbildern, Bildmerkmalen und neu kodierter Audio basiert. Verwenden Sie es, um Hände, Haare, Kleidungskräuselungen und subtile Kopfdrehungen aufzulösen, während die Identität beibehalten wird. Wenn kleine Zitterbewegungen auftreten, probieren Sie einen stabileren Sampler oder etwas mehr Führung in Ihrem Entrauscher.
Switch(Model) (#644)#
Schaltet zwischen den Basis-Wan Dancer-Gewichten und dem Lightning LoRA-augmented Pfad. Halten Sie es für schnelle Entwürfe aktiviert; deaktivieren Sie es für maximale Treue zum Basis-Checkpoint. Für empfindliches Material wie fließende Ärmel oder langes Haar kann der Basis-Pfad Mikrodetails besser bewahren.
TrimAudioDuration (#494)#
Kürzt den Eingabetrack für Vorschauen oder um eine Ziellänge zu erzwingen. Es ist der schnellste Weg, um Stil und Amplitude zu iterieren, ohne den VRAM-Verbrauch zu erhöhen. Nachdem Ihnen die Bewegung gefällt, stellen Sie den vollständigen Abschnitt wieder her und rendern Sie das Finale.
Optionale Extras#
- Wan Dancer verarbeitet viele Frames pro Durchlauf und profitiert von einer starken GPU. Für leichtere Hardware reduzieren Sie die Auflösung oder verkürzen Sie die Dauer während der Vorschauen.
- Verwenden Sie ein sauberes, gut beleuchtetes Porträt oder eine Ganzkörperreferenz mit minimaler Verdeckung; geschäftige Hintergründe können Identitätsmerkmale verwirren.
- Passen Sie den Tanzstil an den Groove des Tracks an, bevor Sie die Bewegungsamplitude erhöhen; die Stilwahl hat den größten Einfluss auf glaubhafte Bewegungen.
- Fixieren Sie den Rauschseed, um Ergebnisse über Läufe hinweg zu reproduzieren; ändern Sie ihn, wenn Sie alternative Choreographien aus denselben Eingaben erkunden.
- Zwei Ausgaben werden gespeichert: eine motion-only globale Vorschau und das finale audio-synchronisierte Render. Überprüfen Sie zuerst die Vorschau, um Zeit zu sparen.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Comfy-Org für den offiziellen ComfyUI Wan Dancer Workflow-Leitfaden, Wan-AI für das offizielle Wan-Dancer-14B-Modell und Comfy-Org für die Wan Dancer-Modelldateien für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die originale Dokumentation und die unten verlinkten Repositories.
Ressourcen#
- Comfy-Org/Offizieller ComfyUI Wan Dancer Workflow-Leitfaden
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- Docs / Release Notes: Official ComfyUI Wan Dancer Workflow Guide
- Wan-AI/Wan-Dancer-14B offizielles Modell
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Comfy-Org/Wan Dancer Modell-Dateien
- Hugging Face: Comfy-Org/Wan-Dancer
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen der Autoren und Betreuer.


