Wan Animate 2 ComfyUI trasferimento di movimento: animazione di personaggi da immagine singola a partire da un video di guida#
Wan Animate 2 ComfyUI trasforma un personaggio di riferimento fermo più un video di posa in un nuovo clip di animazione a corpo intero. È costruito attorno a Wan‑Animate‑2, un trasformatore di diffusione end-to-end che trasferisce il movimento direttamente dai fotogrammi grezzi, quindi non hai bisogno di OpenPose o di alcuna estrazione scheletrica. Il flusso di lavoro preserva l'identità del personaggio dal fermo immagine mentre controlli lo sfondo, lo stile e la fotocamera tramite testo.
Questo grafo pronto per RunComfy è ideale per i creatori che desiderano un trasferimento di movimento in stile studio all'interno di ComfyUI. Fornisci un ritratto o un riferimento a corpo intero, inserisci un breve video di guida, imposta due prompt concisi e Wan Animate 2 ComfyUI produce una performance di personaggio fedele all'identità con scenari puliti e guidati dai prompt.
Modelli chiave nel flusso di lavoro Comfyui Wan Animate 2 ComfyUI#
- Pesi core di Wan‑Animate‑2. Il trasformatore di diffusione che esegue il trasferimento di movimento consapevole dell'identità dal clip di guida generando nuovi fotogrammi. Fonte e pesi: Wan‑Animate‑2 GitHub e Comfy‑Org/Wan‑Animate‑2.
- LightX2V I2V 14B 480p distilled LoRA. Un adattatore leggero che allinea la backbone di Wan‑Video per una generazione efficiente da immagine a video e condizionamento del movimento. File: lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors su Hugging Face.
- Codificatore di testo uMT5‑XXL. Interpreta i tuoi prompt positivi e negativi per guidare l'aspetto del personaggio, lo sfondo e lo stile. File: umt5_xxl_fp8_e4m3fn_scaled.safetensors su Hugging Face.
- Codificatore di visione CLIP ViT‑H/14. Estrae caratteristiche di aspetto dall'immagine di riferimento e spunti complementari dai fotogrammi di posa per una guida robusta dell'identità e del movimento. File: clip_vision_h.safetensors su Hugging Face.
- Wan 2.1 VAE. Codifica e decodifica latenti video preservando texture fine e fedeltà cromatica. File: Wan2_1_VAE_bf16.safetensors su Hugging Face.
Come usare il flusso di lavoro Comfyui Wan Animate 2 ComfyUI#
A colpo d'occhio, il flusso di lavoro instrada un'immagine di riferimento e un video di guida attraverso il sottografo di Trasferimento di Movimento, quindi decodifica i fotogrammi in un video e opzionalmente cuce un confronto fianco a fianco. I gruppi seguenti descrivono come ciascuna parte contribuisce e cosa puoi modificare.
Modelli#
Questo gruppo carica il modello core Wan‑Animate‑2, il suo LoRA, il codificatore di testo, CLIP‑Vision e VAE. Mantieni le scelte di modello predefinite a meno che tu non sappia di aver bisogno di alternative dagli stessi repository. La coppia UNet e LoRA definisce come il movimento viene interpretato e reso, mentre il VAE controlla la fedeltà dell'immagine durante la codifica/decodifica latente. Se cambi modelli, assicurati che siano compatibili con i beni di Wan Animate 2 ComfyUI dai repository collegati.
Prompt#
Usa il prompt positivo per descrivere l'aspetto del personaggio e lo sfondo che desideri, e il prompt negativo per escludere delicatamente gli artefatti. Descrivi l'aspetto, i materiali, l'abbigliamento, l'illuminazione e il set; non descrivere il movimento qui perché il movimento proviene dal video. Mantenere i prompt concisi e specifici migliora la preservazione dell'identità e la coerenza dello sfondo tra i fotogrammi. Il codificatore di testo converte il tuo testo in condizionamento utilizzato durante tutta la generazione.
Immagine di Riferimento#
Carica un singolo ritratto di riferimento pulito o un fermo immagine a corpo intero con il personaggio centrato usando Load Image (Reference Image) (#189). Lo sfondo di questo fermo immagine non viene trasferito perché la scena è generata dal tuo prompt. Il gruppo ridimensiona il riferimento per adattarsi alla risoluzione di lavoro utilizzata a valle in modo che le mappe di attenzione si allineino con le caratteristiche di posa. Riferimenti ben illuminati, nitidi e con minima occlusione producono un'identità più forte.
Video di Riferimento della Posa#
Importa il clip di guida con Load Video (Pose Video) (#240). I fotogrammi vengono passati direttamente al modello piuttosto che convertiti in punti chiave scheletrici, quindi la sfumatura naturale come spostamenti di peso e trasferimenti di movimento secondari bene. Il grafo normalizza le dimensioni spaziali mantenendo la cadenza del clip originale, il che significa che l'fps di uscita segue la fonte. Scegli clip il cui inquadramento corrisponde approssimativamente al riferimento (ad esempio corpo intero a corpo intero) per evitare derive di scala.
Finestre di Contesto e Cache#
ContextWindowsManual controlla il contesto temporale, aiutando i movimenti più lunghi a rimanere coerenti tra le finestre. Un piccolo ComfySwitchNode attiva o disattiva se l'espansione del contesto è utilizzata, permettendoti di scambiare memoria per stabilità in riprese estese. WanAnimate2Cache gestisce la cache dell'attenzione su gpu o cpu con precisione ridotta, il che aiuta a controllare i picchi di VRAM su sequenze lunghe. Per GPU strette, posizionare la cache su cpu è una salvaguardia pratica.
Condizionamento#
WanAnimate2ToVideo (#247) è il cuore di Wan Animate 2 ComfyUI. Combina il condizionamento del testo positivo e negativo con l'immagine di riferimento, le caratteristiche CLIP‑Vision e i fotogrammi di posa per produrre una sequenza di latenti video. Puoi passare l'ultimo fotogramma del segmento precedente a continue_motion per mantenere la continuità tra i blocchi, e puoi compensare la lettura del clip di guida con video_frame_offset quando concatenare. Il nodo accetta anche reference_image_strength e pose_strength per bilanciare il blocco dell'identità rispetto alla fedeltà del movimento.
Campionamento#
SamplerCustom denoizza i latenti video utilizzando il modello preparato da ModelSamplingSD3, BasicScheduler e una selezione del campionatore LCM. Questa fase determina velocità e stabilità della texture; un seme fisso mantiene aspetto e grana coerenti tra i segmenti, mentre un seme casuale aggiunge variazione. Il risultato è un clip video latente pronto per la decodifica.
Taglia il primo fotogramma duplicato#
Quando concatenare segmenti, il primo fotogramma di un nuovo segmento può duplicare l'ultimo fotogramma del segmento precedente. TrimVideoLatent più un piccolo percorso di switch rimuovono automaticamente quella giunzione. Se vedi ancora un singhiozzo a singolo fotogramma, elimina la prima immagine del nuovo blocco quando batch.
Assemblaggio e confronto video#
VAEDecode converte i latenti finali in immagini, che vengono raggruppate e quindi inviate a CreateVideo per ereditare l'fps e l'audio del clip sorgente se presente. SaveVideo scrive l'animazione generata su disco. Il sottografo Video Stitch (ImageStitch all'interno) prende il video generato e il video di guida originale per produrre un confronto fianco a fianco per controlli rapidi di qualità, quindi salva quella vista combinata come file separato.
Estendere oltre un singolo blocco#
Ogni passaggio produce un numero fisso di fotogrammi, quindi riprese più lunghe vengono create duplicando il sottografo Motion Transfer (Wan Animate 2) (#261). Collega continue_motion dal passaggio precedente a quello successivo e alimenta il precedente video_frame_offset in avanti in modo che la lettura del clip di guida continui senza soluzione di continuità. Collega l'output image di ciascun passaggio a BatchImagesNode (#289) per concatenare segmenti prima della creazione del video. Un nodo di aiuto matematico in basso a sinistra calcola quanti passaggi ti servono in base alla lunghezza del video di guida, e una piccola anteprima stampa il numero.
Nodi chiave nel flusso di lavoro Comfyui Wan Animate 2 ComfyUI#
WanAnimate2ToVideo (#247)#
Combina il condizionamento del testo, l'immagine di riferimento, le caratteristiche CLIP‑Vision e i fotogrammi di posa per sintetizzare i latenti del video. Regola reference_image_strength per controllare quanto strettamente l'output aderisca al fermo immagine, e usa pose_strength più pose_start_percent e pose_end_percent per finestrare o ammorbidire il movimento. length imposta i fotogrammi per passaggio, video_frame_offset avanza attraverso il clip di guida quando concatenare, e continue_motion ancora la continuità temporale utilizzando l'ultimo fotogramma del segmento precedente. Supportato dall'implementazione e dai pesi di Wan‑Animate‑2 nei repository ufficiali collegati sopra.
ContextWindowsManual (#257) con ComfySwitchNode (#258)#
Espande la finestra di attenzione temporale in modo che i movimenti rimangano coerenti su sequenze più lunghe. Abilitalo per movimenti complessi o quando vedi dettagli che si spostano nel tempo, al costo di memoria extra. Se raggiungi i limiti di memoria, disabilita o riduci le dimensioni della finestra di contesto e fai affidamento sulla continuità da blocco a blocco.
WanAnimate2Cache (#224)#
Memorizza in cache le chiavi e i valori di attenzione per ridurre i calcoli ridondanti e uniformare l'uso della memoria. Imposta il device della cache su cpu quando la VRAM è stretta o su gpu per la massima velocità, e mantieni il dtype leggero per la stabilità. Questo è particolarmente utile quando impili più passaggi per riprese estese. I beni sono forniti con il rilascio ufficiale di Comfy‑Org/Wan‑Animate‑2.
SamplerCustom (#19) con KSamplerSelect e BasicScheduler#
Esegue la traiettoria di denoising sui latenti del video. Il campionatore LCM è scelto per passaggi veloci e di alta qualità adatti per l'iterazione interattiva. Usa un seme fisso per bloccare texture e ombreggiatura tra passaggi concatenati; cambia il seme per esplorare alternative mantenendo il movimento identico.
TrimVideoLatent (#223)#
Rimuove il primo fotogramma duplicato che può apparire quando concatenare segmenti, eliminando le giunzioni visibili. Lascialo abilitato quando costruisci sequenze più lunghe e disabilitalo per clip a passaggio singolo.
Extra opzionali#
- Mantieni l'inquadratura coerente tra il riferimento e il video di guida. Corpo intero a corpo intero o mezzo busto a mezzo busto funziona meglio.
- Poiché Wan Animate 2 ComfyUI legge i fotogrammi grezzi per il movimento, usa clip di guida con silhouette chiare e sfocatura del movimento minima.
- Descrivi gli sfondi nel prompt positivo piuttosto che fare affidamento sullo sfondo dell'immagine di riferimento; il modello genera nuovi scenari dal testo.
- L'fps di uscita segue il clip di input. Se il movimento appare troppo lento o veloce, ricampiona il video di guida prima di eseguire il flusso di lavoro.
- Per GPU con memoria limitata, imposta il device della cache su cpu in
WanAnimate2Cachee preferisci blocchi più brevi che puoi successivamente cucire. - Usa l'output fianco a fianco del sottografo
Video Stitchper controllare rapidamente la fedeltà del movimento prima di eseguire sequenze più lunghe.
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine Comfy Org per l'annuncio e i modelli "Wan Animate 2 è ora disponibile in ComfyUI", Wan-Video per il codice Wan-Animate-2, Comfy-Org per i pesi del modello Wan-Animate-2 su Hugging Face, e ComfyUI per il modello di flusso di lavoro "Wan Animate 2: Trasferimento di Movimento" per i loro contributi e manutenzione. Per i dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- Comfy Org/Wan Animate 2 è ora disponibile in ComfyUI
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/Wan-Animate-2
- Docs / Note di Rilascio: Wan Animate 2 è ora disponibile in ComfyUI
- Wan-Video/Wan-Animate-2
- GitHub: Wan-Video/Wan-Animate-2
- Hugging Face: Wan-AI/Wan2.2-Animate-2-14B
- arXiv: 2608.06009
- Comfy-Org/Wan-Animate-2
- Hugging Face: Comfy-Org/Wan-Animate-2
- arXiv: 2608.06009
- ComfyUI/Wan Animate 2: Trasferimento di Movimento
- Docs / Note di Rilascio: Wan Animate 2: Trasferimento di Movimento - ComfyUI Workflow
Nota: L'uso dei modelli, set di dati e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.


