Transferência de movimento Wan Animate 2 ComfyUI: animação de personagem de imagem única a partir de um vídeo condutor#
O Wan Animate 2 ComfyUI transforma uma imagem fixa de personagem de referência mais um vídeo de pose condutor em um novo clipe de animação de corpo inteiro. É construído em torno do Wan-Animate-2, um transformador de difusão de ponta a ponta que transfere movimento diretamente de quadros brutos, então você não precisa de OpenPose ou qualquer extração de esqueleto. O fluxo de trabalho preserva a identidade do personagem da imagem fixa enquanto você controla o fundo, o estilo e a câmera através de texto.
Este gráfico pronto para RunComfy é ideal para criadores que desejam transferência de movimento estilo estúdio dentro do ComfyUI. Você fornece um retrato ou referência de corpo inteiro, insere um vídeo condutor curto, define dois prompts concisos, e o Wan Animate 2 ComfyUI produz uma performance de personagem fiel à identidade com cenários limpos e guiados por prompts.
Modelos principais no fluxo de trabalho Comfyui Wan Animate 2 ComfyUI#
- Pesos principais do Wan-Animate-2. O transformador de difusão que realiza a transferência de movimento ciente da identidade do clipe condutor enquanto gera novos quadros. Fonte e pesos: Wan-Animate-2 GitHub e Comfy-Org/Wan-Animate-2.
- LightX2V I2V 14B 480p LoRA destilado. Um adaptador leve que alinha a espinha dorsal do Wan-Video para geração de imagem para vídeo eficiente e condicionamento de movimento. Arquivo: lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors em Hugging Face.
- Codificador de texto uMT5-XXL. Interpreta seus prompts positivos e negativos para guiar a aparência do personagem, fundo e estilo. Arquivo: umt5_xxl_fp8_e4m3fn_scaled.safetensors em Hugging Face.
- Codificador de visão CLIP ViT-H/14. Extrai características de aparência da imagem de referência e sinais complementares dos quadros de pose para orientação robusta de identidade e movimento. Arquivo: clip_vision_h.safetensors em Hugging Face.
- Wan 2.1 VAE. Codifica e decodifica latentes de vídeo enquanto preserva textura fina e fidelidade de cor. Arquivo: Wan2_1_VAE_bf16.safetensors em Hugging Face.
Como usar o fluxo de trabalho Comfyui Wan Animate 2 ComfyUI#
Em uma visão geral, o fluxo de trabalho direciona uma imagem de referência e um vídeo condutor através do subgráfico de Transferência de Movimento, então decodifica quadros para um vídeo e opcionalmente costura uma comparação lado a lado. Os grupos abaixo descrevem como cada parte contribui e o que você pode editar.
Modelos#
Este grupo carrega o modelo principal Wan-Animate-2, seu LoRA, codificador de texto, CLIP-Vision e VAE. Mantenha as seleções de modelo padrão a menos que saiba que precisa de alternativas dos mesmos repositórios. O par UNet e LoRA define como o movimento é interpretado e renderizado, enquanto o VAE controla a fidelidade da imagem durante a codificação/decodificação latente. Se você trocar modelos, certifique-se de que sejam compatíveis com os ativos Wan Animate 2 ComfyUI dos repositórios vinculados.
Prompt#
Use o prompt positivo para descrever a aparência do personagem e o fundo que você deseja, e o prompt negativo para excluir suavemente artefatos. Descreva a aparência, materiais, roupas, iluminação e o cenário; não descreva o movimento aqui porque o movimento vem do vídeo. Manter os prompts concisos e específicos melhora a preservação de identidade e a consistência do fundo através dos quadros. O codificador de texto converte seu texto em condicionamento usado ao longo da geração.
Imagem de Referência#
Carregue um retrato de referência único e limpo ou uma imagem fixa de corpo inteiro com o personagem centralizado usando Load Image (Reference Image) (#189). O fundo desta imagem fixa não é transportado porque a cena é gerada a partir do seu prompt. O grupo redimensiona a referência para corresponder à resolução de trabalho usada a jusante para que os mapas de atenção se alinhem com as características da pose. Referências bem iluminadas e nítidas com mínima oclusão produzem uma identidade mais forte.
Vídeo de Referência de Pose#
Importe o clipe condutor com Load Video (Pose Video) (#240). Os quadros são passados diretamente para o modelo em vez de convertidos em pontos-chave esqueléticos, então nuances naturais como mudanças de peso e movimento secundário são bem transferidos. O gráfico normaliza as dimensões espaciais enquanto mantém a cadência original do clipe, o que significa que a taxa de quadros de saída segue a fonte. Escolha clipes cujo enquadramento corresponda aproximadamente à referência (por exemplo, corpo inteiro para corpo inteiro) para evitar desvios de escala.
Janelas de Contexto & Cache#
ContextWindowsManual controla o contexto temporal, ajudando movimentos mais longos a permanecerem coerentes através das janelas. Um pequeno ComfySwitchNode alterna se a expansão do contexto é usada, permitindo que você troque memória por estabilidade em tomadas estendidas. WanAnimate2Cache gerencia o cache de atenção em gpu ou cpu com precisão reduzida, o que ajuda a controlar picos de VRAM em sequências longas. Para GPUs apertadas, colocar o cache na cpu é uma salvaguarda prática.
Condicionamento#
WanAnimate2ToVideo (#247) é o coração do Wan Animate 2 ComfyUI. Ele funde o condicionamento de texto positivo e negativo com a imagem de referência, características CLIP-Vision e os quadros de pose para produzir uma sequência de latentes de vídeo. Você pode passar o último quadro do segmento anterior para continue_motion para manter a continuidade entre os pedaços, e pode deslocar a leitura do clipe condutor com video_frame_offset ao encadear. O nó também aceita reference_image_strength e pose_strength para equilibrar o bloqueio de identidade versus a fidelidade do movimento.
Amostragem#
SamplerCustom remove o ruído dos latentes de vídeo usando o modelo preparado por ModelSamplingSD3, BasicScheduler e uma seleção de amostrador LCM. Esta etapa determina a velocidade e estabilidade de textura; uma semente fixa mantém a aparência e o grão consistentes através dos segmentos, enquanto uma semente aleatória adiciona variação. O resultado é um clipe de vídeo latente pronto para decodificação.
Aparar o primeiro quadro duplicado#
Ao encadear segmentos, o primeiro quadro de um novo segmento pode duplicar o último quadro do segmento anterior. TrimVideoLatent mais um pequeno caminho de comutação removem essa emenda automaticamente. Se você ainda vir um soluço de um único quadro, descarte a primeira imagem do novo pedaço ao agrupar.
Montagem e comparação de vídeo#
VAEDecode converte os latentes finais em imagens, que são agrupadas e enviadas para CreateVideo para herdar a taxa de quadros e o áudio do clipe de origem, se presente. SaveVideo escreve a animação gerada no disco. O subgráfico Video Stitch (ImageStitch dentro) pega o vídeo gerado e o vídeo condutor original para produzir uma comparação lado a lado para verificações rápidas de qualidade, então salva essa visão combinada como um arquivo separado.
Estendendo além de um único pedaço#
Cada passagem produz um número fixo de quadros, então tomadas mais longas são criadas duplicando o subgráfico Motion Transfer (Wan Animate 2) (#261). Conecte continue_motion da passagem anterior para a próxima passagem e alimente o video_frame_offset anterior para frente para que a leitura do clipe condutor continue sem interrupções. Conecte a saída image de cada passagem em BatchImagesNode (#289) para concatenar segmentos antes da criação de vídeo. Um nó de matemática auxiliar no canto inferior esquerdo calcula quantas passagens você precisa com base no comprimento do vídeo condutor, e uma pequena pré-visualização imprime o número.
Nós principais no fluxo de trabalho Comfyui Wan Animate 2 ComfyUI#
WanAnimate2ToVideo (#247)#
Combina o condicionamento de texto, a imagem de referência, características CLIP-Vision e quadros de pose para sintetizar latentes de vídeo. Ajuste reference_image_strength para controlar quão firmemente a saída adere à imagem fixa, e use pose_strength mais pose_start_percent e pose_end_percent para janelas ou suavizar o movimento. length define quadros por passagem, video_frame_offset avança através do clipe condutor ao encadear, e continue_motion ancora a continuidade temporal usando o último quadro do segmento anterior. Apoiado pela implementação e pesos Wan-Animate-2 nos repositórios oficiais vinculados acima.
ContextWindowsManual (#257) com ComfySwitchNode (#258)#
Expande a janela de atenção temporal para que os movimentos permaneçam consistentes em sequências mais longas. Ative para movimentos complexos ou quando vir detalhes desviando ao longo do tempo, ao custo de memória extra. Se atingir limites de memória, desative ou reduza o tamanho da janela de contexto e confie na continuidade de pedaço para pedaço.
WanAnimate2Cache (#224)#
Armazena em cache chaves e valores de atenção para reduzir cálculos redundantes e suavizar o uso de memória. Defina o device do cache para cpu quando a VRAM estiver apertada ou para gpu para o máximo rendimento, e mantenha o dtype leve para estabilidade. Isso é especialmente útil quando você empilha múltiplas passagens para tomadas estendidas. Os ativos são fornecidos com o lançamento oficial Comfy-Org/Wan-Animate-2.
SamplerCustom (#19) com KSamplerSelect e BasicScheduler#
Executa a trajetória de remoção de ruído sobre os latentes de vídeo. O amostrador LCM é escolhido para passos rápidos e de alta qualidade, adequados para iteração interativa. Use uma semente fixa para trancar textura e sombreamento através de passagens encadeadas; mude a semente para explorar alternativas enquanto mantém o movimento idêntico.
TrimVideoLatent (#223)#
Remove o primeiro quadro duplicado que pode aparecer quando você encadeia segmentos, eliminando emendas visíveis. Deixe-o ativado ao construir sequências mais longas e desative-o para clipes de passagem única.
Extras opcionais#
- Mantenha o enquadramento consistente entre a referência e o vídeo condutor. Corpo inteiro para corpo inteiro ou plano médio para plano médio funciona melhor.
- Como o Wan Animate 2 ComfyUI lê quadros brutos para movimento, use clipes condutores com silhuetas claras e mínimo desfoque de movimento.
- Descreva fundos no prompt positivo em vez de confiar no fundo da imagem de referência; o modelo gera novos cenários a partir do texto.
- A taxa de quadros de saída segue o clipe de entrada. Se o movimento parecer muito lento ou rápido, reamostre o vídeo condutor antes de executar o fluxo de trabalho.
- Para GPUs com memória limitada, defina o dispositivo de cache para cpu em
WanAnimate2Cachee prefira pedaços mais curtos que você pode juntar depois. - Use a saída lado a lado do subgráfico
Video Stitchpara rapidamente verificar a fidelidade do movimento antes de renderizar execuções mais longas.
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos sinceramente à Comfy Org pelo anúncio e modelos “Wan Animate 2 is now available in ComfyUI”, Wan-Video pelo código-fonte Wan-Animate-2, Comfy-Org pelos pesos do modelo Wan-Animate-2 no Hugging Face, e ComfyUI pelo modelo de fluxo de trabalho “Wan Animate 2: Motion Transfer” por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação e os repositórios originais vinculados abaixo.
Recursos#
- Comfy Org/Wan Animate 2 is now available in ComfyUI
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/Wan-Animate-2
- Docs / Release Notes: Wan Animate 2 is now available in ComfyUI
- Wan-Video/Wan-Animate-2
- GitHub: Wan-Video/Wan-Animate-2
- Hugging Face: Wan-AI/Wan2.2-Animate-2-14B
- arXiv: 2608.06009
- Comfy-Org/Wan-Animate-2
- Hugging Face: Comfy-Org/Wan-Animate-2
- arXiv: 2608.06009
- ComfyUI/Wan Animate 2: Motion Transfer
- Docs / Release Notes: Wan Animate 2: Motion Transfer - ComfyUI Workflow
Nota: O uso dos modelos, conjuntos de dados e códigos referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.


