ComfyUI>Workflow>Wan Dancer | Generatore di Video da Musica a Danza

Wan Dancer | Generatore di Video da Musica a Danza

Workflow Name: RunComfy/Wan-Dancer
Workflow ID: 0000...1463
Questo workflow di animazione guidato dalla musica ti aiuta a trasformare qualsiasi immagine statica in una performance di danza perfettamente sincronizzata con la tua colonna sonora. Puoi regolare l'ampiezza del movimento, la coordinazione del corpo e lo stile di danza per una flessibilità creativa. Basato sui modelli Wan-Dancer-14B, bilancia la struttura globale con un movimento locale dettagliato. Ideale per creatori che realizzano clip per social media, demo di danza o test di animazione concettuale. L'allineamento preciso del ritmo garantisce un movimento naturale ed espressivo in ogni fotogramma.

ComfyUI Wan Dancer Workflow

Wan Dancer in ComfyUI | Music-to-Dance Video Workflow
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI Wan Dancer Examples

Wan Dancer: immagine e musica in video di danza sincronizzato a ritmo in ComfyUI#

Questo workflow di Wan Dancer trasforma un'unica immagine di riferimento e una traccia musicale in un breve video di danza sincronizzato a ritmo. È progettato per i creatori che desiderano un controllo diretto su immagine e audio della coreografia, con semplici interruttori per lo stile di danza e l'ampiezza del movimento. La pipeline esegue un passaggio di pianificazione globale per progettare il movimento del corpo intero e il timing, quindi un passaggio di perfezionamento locale che affina i dettagli e ammorbidisce il movimento prima di renderizzare il video finale.

Poiché Wan Dancer produce una sequenza completa in un colpo solo, è ideale per la progettazione di scene di performance di danza, studi rapidi di animazione di personaggi e clip social guidati dalla musica. Fornisci un'immagine pulita del personaggio, scegli uno stile, imposta l'ampiezza, e Wan Dancer allinea il movimento all'audio preservando l'identità.

Modelli chiave nel workflow di Comfyui Wan Dancer#

  • Wan-Dancer-14B (Modello globale). Pianifica la coreografia a lungo raggio e la coordinazione del corpo da immagine e audio, producendo un progetto di movimento coerente. Vedi la scheda modello ufficiale su Wan-AI/Wan-Dancer-14B e i pesi pronti per Comfy su Comfy-Org/Wan-Dancer.
  • Wan-Dancer-14B (Modello locale). Affina e interpola il movimento a livello di fotogramma per aggiungere precisione nei movimenti di arti, mani e testa rimanendo fedele al piano globale. I pesi sono forniti insieme al modello globale in Comfy-Org/Wan-Dancer.
  • UMT5‑XXL text encoder. Interpreta brevi prompt testuali che descrivono lo stile di danza e i suggerimenti di aspetto; confezionato per ComfyUI in Comfy-Org/Wan_2.1_ComfyUI_repackaged.
  • CLIP Vision H encoder. Estrae caratteristiche visive robuste dall'immagine di riferimento per preservare identità e abbigliamento; fornito nello stesso pacchetto pronto per Comfy: clip_vision_h.safetensors.
  • Wan 2.1 VAE. Gestisce la codifica/decodifica latente per fotogrammi video con colore e contrasto stabili; una build testata da Comfy è disponibile in Kijai/WanVideo_comfy.
  • LightX2V Lightning LoRA opzionale per I2V. Un adattatore leggero che può accelerare e rendere più nitida la sintesi del movimento quando abilitato, confezionato su Kijai/WanVideo_comfy.

Come usare il workflow di Comfyui Wan Dancer#

A un livello alto, il grafico esegue due passaggi coordinati. La Generazione Globale progetta la coreografia e produce un'anteprima video rapida. La Generazione Locale poi riempie i fotogrammi chiave, riallinea all'audio e perfeziona i dettagli per il risultato finale. Controlli l'aspetto e il movimento tramite selettori di prompt compatti, oltre a un piccolo set di scelte video e di durata.

Impostazioni Video#

Questo gruppo definisce larghezza, altezza e lunghezza della sequenza per entrambi i passaggi. Le dimensioni sono automaticamente regolate a multipli compatibili con l'hardware, quindi puoi concentrarti sul rapporto d'aspetto e sulla risoluzione. Clip più lunghe e fotogrammi più grandi consumano più VRAM, quindi usa questo pannello per bilanciare velocità e qualità. Queste impostazioni si alimentano direttamente nel WanDancerVideo globale (#647) e nel WanDancerVideo locale (#668).

Prompt#

Qui scegli uno stile di danza e un'ampiezza del movimento. Il selettore di stile scrive una breve frase nei prompt di testo globali e locali, mentre il selettore di ampiezza modula quanto dovrebbe essere energico il movimento del corpo. Il modello viene fornito con stili come Danza Classica Cinese, K‑Pop, Street Dance, Danza Latina e Tip Tap, e puoi aggiungere i tuoi. Le stringhe di prompt originali sono in cinese; sentiti libero di localizzarle o arricchirle per adattarle al tuo progetto.

Taglia Audio#

Usa questo gruppo per accorciare un file musicale lungo per anteprime o per adattarlo a una durata finale specifica del clip. L'audio viene tagliato una volta e passato a entrambi gli stadi globali e locali, mantenendo costante il timing del beat. Se cambi la durata finale, l'imbottitura dei fotogrammi chiave e il passaggio locale si adatteranno automaticamente. Per iterazioni rapide, accorcia l'audio, verifica il movimento, quindi ripristina la lunghezza per il rendering finale.

Modelli Comuni#

Questo gruppo carica risorse condivise: l'encoder di testo UMT5‑XXL, CLIP Vision H e il Wan 2.1 VAE. Forniscono comprensione dei prompt, caratteristiche di identità dalla tua immagine e decodifica stabile dei fotogrammi. Di solito non è necessaria alcuna azione da parte dell'utente qui a meno che non si cambino gli encoder o una build VAE diversa.

Modello Globale#

Carica i pesi globali di Wan‑Dancer‑14B. In questo passaggio, il workflow codifica la tua immagine di riferimento e l'audio tagliato, applica il modello di coreografia globale e produce un video di anteprima solo movimento. Questo stadio è veloce e ottimo per convalidare stile e ampiezza prima di impegnarsi nel perfezionamento.

Generazione Globale#

Questo blocco converte l'immagine di riferimento e l'audio in un progetto coerente della danza. I nodi encoder estraggono caratteristiche testuali e visive, WanDancerEncodeAudio (#651) trasforma la musica in segnali ritmici, e WanDancerVideo (#647) sintetizza l'intera sequenza. Un pianificatore e un campionatore quindi denoisano il latente in immagini, e un nodo video assembla un'anteprima. Se il progetto sembra fuori tempo o troppo statico, regola l'ampiezza o prova uno stile diverso e riprova l'anteprima.

Interruttore#

Una piccola sezione di controllo attiva o disattiva il percorso del modello attraverso Lightning LoRA o i pesi originali. Lascia Lightning attivo per iterazioni più rapide e spegnilo quando hai bisogno della riproduzione più fedele al checkpoint base di Wan Dancer. Altri interruttori regolano quale conteggio dei passaggi e valore di guida il campionatore dovrebbe utilizzare, permettendoti di scambiare velocità per qualità per stadio.

Campionatore#

Definisce il denoiser e il programma di rumore usati per trasformare i piani latenti in fotogrammi. La configurazione è condivisa tra i passaggi globali e locali per un aspetto coerente. Gli utenti avanzati possono sperimentare con i campionatori, ma l'impostazione fornita è un solido predefinito per i video di Wan Dancer. Se noti sfarfallio, una guida leggermente più forte abbinata a un campionatore più stabile può aiutare.

Modello Locale#

Carica i pesi locali di Wan‑Dancer‑14B e, quando abilitato, applica lo stesso Lightning LoRA a questo percorso di perfezionamento. Questo modello si concentra sull'interpolazione e sui dettagli fini come mani, capelli e movimento sottile del torso mentre preserva i tratti identitari codificati dalla tua immagine. Mantieni questo stadio abilitato per i rendering finali.

Generazione Locale (interpolazione)#

Il passaggio locale inizia riempiendo i fotogrammi chiave dall'anteprima globale per coprire l'intera timeline. WanDancerEncodeAudio (#669) ricodifica la musica per il conteggio dei fotogrammi locali, e WanDancerVideo (#668) produce un movimento di alta fedeltà allineato all'audio. I latenti raffinati vengono decodificati in fotogrammi, quindi riassemblati e assemblati nel video finale con suono sincronizzato. Usa questo output per giudicare il realismo, il movimento delle mani e la lucidatura generale.

Campionamento#

Questo gruppo di supporto unisce il pianificatore, la guida e il campionatore usati nel perfezionamento locale. Garantisce che il passaggio locale erediti un timing e una risoluzione consistenti dai gruppi precedenti lasciandoti spingere la qualità dove conta. Se cambi durata o risoluzione a monte, questo percorso del campionatore si adatterà senza rompere l'allineamento.

Nodi chiave nel workflow di Comfyui Wan Dancer#

Custom Combo (Dance Style) (#695)#

Seleziona la categoria di danza che viene inserita nei prompt di testo sia globali che locali. Scegli uno stile che corrisponda al genere della tua traccia per i migliori risultati, o aggiungi le tue voci all'elenco. Se il movimento sembra non corrispondere al ritmo, prova uno stile con accenti ritmici più chiari prima di regolare altri controlli.

Custom Combo (Motion Amplitude) (#694)#

Controlla quanto dovrebbe essere energica la coreografia. Valori più bassi mantengono il movimento contenuto per musica delicata; valori più alti aumentano la velocità degli arti e la distanza percorsa per tracce energiche. Se noti deriva identitaria o artefatti in pose estreme, riduci l'ampiezza di un passo e riprova l'anteprima.

WanDancerEncodeAudio (#651)#

Codifica la musica tagliata in caratteristiche di ritmo e intensità per il passaggio globale. Questo guida l'allineamento del beat all'interno di WanDancerVideo (#647). Per intro molto morbide o dissolvenze lunghe, considera di tagliare nella sezione con un beat chiaro per aiutare l'encoder a bloccarsi rapidamente.

WanDancerVideo (#647)#

Sintetizza la coreografia globale da testo, immagine e caratteristiche audio alla risoluzione e lunghezza della sequenza scelte. Trattalo come un pianificatore di movimento: verifica il timing, lo stile e le dinamiche generali delle pose qui prima di passare oltre. Se l'anteprima è troppo rumorosa a livello cromatico, continua; la fedeltà del colore viene solidificata nel passaggio locale.

WanDancerPadKeyframesList (#670)#

Costruisce una timeline di fotogrammi chiave dall'output globale e li allinea alla durata scelta. Questo assicura che il passaggio locale veda sia ancore visive che il segmento audio corretto. Se estendi la durata, questo nodo riempie le lacune in modo fluido in modo che il modello locale possa interpolare in modo pulito.

WanDancerEncodeAudio (#669)#

Ricodifica l'audio per il budget di fotogrammi locale dopo il riempimento dei fotogrammi chiave. Questo mantiene il movimento raffinato bloccato in fase con la musica. Quando cambi la lunghezza del clip, esegui sempre questo nodo in modo che il modello locale ascolti il segmento corretto.

WanDancerVideo (#668)#

Genera il movimento raffinato, di alta fedeltà, condizionato su fotogrammi chiave, caratteristiche dell'immagine e audio ricodificato. Usalo per risolvere mani, capelli, increspature degli abiti e lievi movimenti della testa mantenendo l'identità. Se appaiono piccoli tremolii, prova un campionatore più stabile o un tocco in più di guida nel tuo denoiser.

Switch(Model) (#644)#

Attiva o disattiva tra i pesi base di Wan Dancer e il percorso potenziato da Lightning LoRA. Tienilo abilitato per bozze veloci; disabilitalo per la massima adesione al checkpoint base. Per materiali delicati come maniche fluenti o capelli lunghi, il percorso base può preservare meglio i micro-dettagli.

TrimAudioDuration (#494)#

Accorcia la traccia di input per anteprime o per imporre una lunghezza target. È il modo più rapido per iterare su stile e ampiezza senza aumentare l'uso di VRAM. Dopo che ti piace il movimento, ripristina la sezione completa e renderizza il finale.

Extra opzionali#

  • Wan Dancer elabora molti fotogrammi per passaggio e beneficia di una GPU potente. Per hardware più leggero, riduci la risoluzione o accorcia la durata durante le anteprime.
  • Usa un ritratto o riferimento a figura intera pulito e ben illuminato con minima occlusione; sfondi affollati possono confondere le caratteristiche identitarie.
  • Abbina lo stile di danza al groove della traccia prima di aumentare l'ampiezza del movimento; la scelta dello stile ha l'impatto maggiore sul movimento credibile.
  • Fissa il seme del rumore per riprodurre i risultati tra le esecuzioni; cambialo quando esplori coreografie alternative dagli stessi input.
  • Due output vengono salvati: un'anteprima globale solo movimento e il rendering finale sincronizzato all'audio. Rivedi prima l'anteprima per risparmiare tempo.

Ringraziamenti#

Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo Comfy-Org per la guida ufficiale al workflow di ComfyUI Wan Dancer, Wan-AI per il modello ufficiale Wan-Dancer-14B, e Comfy-Org per i file modello Wan Dancer per i loro contributi e la manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione e ai repository originali collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e ai termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.