Wan Dancer: imagem e música para vídeo de dança sincronizado com ritmo no ComfyUI#
Este fluxo de trabalho Wan Dancer transforma uma única imagem de referência e uma faixa musical em um vídeo curto de dança sincronizada com o ritmo. Ele é projetado para criadores que desejam controle direto de imagem e áudio sobre a coreografia, com interruptores simples para estilo de dança e amplitude de movimento. O pipeline executa uma passagem de planejamento global para esboçar o movimento e o tempo do corpo inteiro, depois uma passagem de refinamento local que aprimora os detalhes e suaviza o movimento antes de renderizar o vídeo final.
Como o Wan Dancer produz uma sequência completa de uma só vez, ele é ideal para conceber tomadas de performance de dança, estudos rápidos de animação de personagens e clipes sociais movidos por música. Você fornece uma imagem de personagem limpa, escolhe um estilo, define a amplitude, e o Wan Dancer alinha o movimento ao áudio enquanto preserva a identidade.
Modelos principais no fluxo de trabalho Comfyui Wan Dancer#
- Wan-Dancer-14B (Modelo Global). Planeja coreografias de longo alcance e coordenação corporal a partir de imagem e áudio, produzindo um esboço de movimento coerente. Veja o cartão oficial do modelo em Wan-AI/Wan-Dancer-14B e os pesos prontos para Comfy em Comfy-Org/Wan-Dancer.
- Wan-Dancer-14B (Modelo Local). Refinar e interpola o movimento em nível de quadro para adicionar precisão em membros, mãos e movimento da cabeça enquanto permanece fiel ao plano global. Pesos são fornecidos junto com o modelo global em Comfy-Org/Wan-Dancer.
- UMT5-XXL text encoder. Interpreta prompts textuais curtos que descrevem o estilo de dança e pistas de aparência; embalado para ComfyUI em Comfy-Org/Wan_2.1_ComfyUI_repackaged.
- CLIP Vision H encoder. Extrai recursos visuais robustos da imagem de referência para preservar a identidade e a vestimenta; fornecido no mesmo pacote pronto para Comfy: clip_vision_h.safetensors.
- Wan 2.1 VAE. Lida com codificação/decodificação latente para quadros de vídeo com cor e contraste estáveis; uma versão testada no Comfy está disponível em Kijai/WanVideo_comfy.
- LightX2V Lightning LoRA opcional para I2V. Um adaptador leve que pode acelerar e aprimorar a síntese de movimento quando habilitado, embalado em Kijai/WanVideo_comfy.
Como usar o fluxo de trabalho Comfyui Wan Dancer#
Em um nível alto, o gráfico executa duas passagens coordenadas. A Geração Global esboça a coreografia e produz uma prévia rápida do vídeo. A Geração Local, então, preenche os quadros-chave, realinha ao áudio e refina os detalhes para a saída final. Você controla o visual e o movimento por meio de seletores de prompt compactos, além de um pequeno conjunto de escolhas de vídeo e duração.
Configurações de Vídeo#
Este grupo define a largura, altura e comprimento da sequência de saída para ambas as passagens. As dimensões são ajustadas automaticamente para múltiplos amigáveis ao hardware, então você pode se concentrar na proporção e resolução. Clipes mais longos e quadros maiores consomem mais VRAM, então use este painel para equilibrar velocidade e qualidade. Essas configurações alimentam diretamente o WanDancerVideo global (#647) e o WanDancerVideo local (#668).
Prompt#
Aqui você escolhe um estilo de dança e uma amplitude de movimento. O seletor de estilo escreve uma frase curta nos prompts de texto globais e locais, enquanto o seletor de amplitude modula quão energético o movimento corporal deve ser. O modelo vem com estilos como Dança Clássica Chinesa, K-Pop, Dança de Rua, Dança Latina e Sapateado, e você pode adicionar o seu próprio. As strings de prompt originais estão em chinês; sinta-se à vontade para localizá-las ou enriquecê-las para atender ao seu projeto.
Cortar Áudio#
Use este grupo para encurtar um arquivo de música longo para pré-visualizações ou para corresponder a uma duração final específica do clipe. O áudio é cortado uma vez e passado para ambas as etapas globais e locais, mantendo o tempo da batida consistente. Se você alterar a duração final, o preenchimento dos quadros-chave a jusante e a passagem local se adaptarão automaticamente. Para iteração rápida, encurte o áudio, verifique o movimento, depois restaure o comprimento para a renderização final.
Modelos Comuns#
Este grupo carrega ativos compartilhados: o codificador de texto UMT5-XXL, CLIP Vision H e o Wan 2.1 VAE. Eles fornecem compreensão de prompt, recursos de identidade de sua imagem e decodificação estável de quadros. Normalmente, nenhuma ação do usuário é necessária aqui, a menos que você troque codificadores ou uma construção VAE diferente.
Modelo Global#
Carrega os pesos globais Wan-Dancer-14B. Nesta passagem, o fluxo de trabalho codifica sua imagem de referência e áudio cortado, aplica o modelo de coreografia global e produz um vídeo de pré-visualização apenas de movimento. Este estágio é rápido e ótimo para validar estilo e amplitude antes de se comprometer com o refinamento.
Geração Global#
Este bloco converte a imagem de referência e o áudio em um rascunho coerente da dança. Os nós do codificador extraem recursos de texto e visual, WanDancerEncodeAudio (#651) transforma música em pistas de ritmo, e WanDancerVideo (#647) sintetiza a sequência completa. Um agendador e um amostrador então removem o ruído do latente para imagens, e um nó de vídeo monta uma pré-visualização. Se o rascunho parecer fora do ritmo ou muito estático, ajuste a amplitude ou experimente um estilo diferente e pré-visualize novamente.
Interruptor#
Uma pequena seção de controle alterna se o modelo deve ser executado através do caminho Lightning LoRA ou dos pesos originais. Deixe o Lightning ativado para iteração mais rápida e desligue quando precisar da reprodução mais fiel ao ponto de verificação base do Wan Dancer. Interruptores adicionais controlam qual contagem de passos e valor de orientação o amostrador deve usar, permitindo que você troque velocidade por qualidade por estágio.
Amostrador#
Define o removedor de ruído e a programação de ruído usados para transformar planos latentes em quadros. A configuração é compartilhada entre as passagens globais e locais para aparência consistente. Usuários avançados podem experimentar com amostradores, mas a configuração fornecida é um padrão sólido para vídeo Wan Dancer. Se você ver cintilação, uma orientação um pouco mais forte combinada com um amostrador mais estável pode ajudar.
Modelo Local#
Carrega os pesos locais Wan-Dancer-14B e, quando habilitado, aplica o mesmo Lightning LoRA a este caminho de refinamento. Este modelo se concentra em interpolação e detalhes finos como mãos, cabelo e movimento sutil do torso enquanto preserva os traços de identidade codificados de sua imagem. Mantenha este estágio ativado para renderizações finais.
Geração Local (interpolando)#
A passagem local começa preenchendo quadros-chave da pré-visualização global para cobrir toda a linha do tempo. WanDancerEncodeAudio (#669) recodifica a música para a contagem de quadros locais, e WanDancerVideo (#668) produz movimento de maior fidelidade alinhado ao áudio. Os latentes refinados são decodificados para quadros, depois reagrupados e montados no vídeo final com som sincronizado. Use esta saída para julgar realismo, movimento das mãos e acabamento geral.
Amostragem#
Este grupo de suporte amarra o agendador, guia e amostrador usados no refinamento local. Ele garante que a passagem local herde o tempo e a resolução consistentes de grupos anteriores enquanto permite que você impulsione a qualidade onde importa. Se você mudar a duração ou resolução a montante, este caminho do amostrador se adaptará sem quebrar o alinhamento.
Nós principais no fluxo de trabalho Comfyui Wan Dancer#
Custom Combo (Estilo de Dança) (#695)#
Seleciona a categoria de dança que é inserida nos prompts de texto globais e locais. Escolha um estilo que combine com o gênero da sua faixa para melhores resultados, ou adicione suas próprias entradas à lista. Se o movimento parecer descompassado com a batida, experimente um estilo com acentos rítmicos mais claros antes de ajustar outros controles.
Custom Combo (Amplitude de Movimento) (#694)#
Controla quão energética a coreografia deve ser. Valores mais baixos mantêm o movimento contido para música suave; valores mais altos aumentam o deslocamento e a velocidade dos membros para faixas enérgicas. Se você notar deriva de identidade ou artefatos em poses extremas, reduza a amplitude um passo e pré-visualize novamente.
WanDancerEncodeAudio (#651)#
Codifica a música cortada em recursos de ritmo e intensidade para a passagem global. Isso impulsiona o alinhamento da batida dentro de WanDancerVideo (#647). Para introduções muito suaves ou longas desvanecimentos, considere cortar para a seção com uma batida clara para ajudar o codificador a travar rapidamente.
WanDancerVideo (#647)#
Sintetiza a coreografia global a partir de texto, imagem e recursos de áudio na resolução e comprimento de sequência escolhidos. Trate isso como um planejador de movimento: verifique o tempo, estilo e dinâmica de pose geral aqui antes de seguir em frente. Se a pré-visualização estiver muito ruidosa em croma, continue; a fidelidade de cores é solidificada na passagem local.
WanDancerPadKeyframesList (#670)#
Constrói uma linha do tempo de quadros-chave a partir da saída global e os alinha à duração escolhida. Isso garante que a passagem local veja tanto âncoras visuais quanto o segmento de áudio correto. Se você estender a duração, este nó preenche lacunas suavemente para que o modelo local possa interpolar de forma limpa.
WanDancerEncodeAudio (#669)#
Recodifica o áudio para o orçamento de quadros locais após o preenchimento dos quadros-chave. Isso mantém o movimento refinado sincronizado com a música. Ao alterar o comprimento do clipe, sempre execute este nó para que o modelo local ouça o segmento correto.
WanDancerVideo (#668)#
Gera o movimento refinado e de alta fidelidade condicionado a quadros-chave, recursos de imagem e áudio recodificado. Use-o para resolver mãos, cabelo, ondulações de roupas e sutis viradas de cabeça enquanto mantém a identidade. Se pequenos tremores aparecerem, experimente um amostrador mais estável ou um pouco mais de orientação no seu removedor de ruído.
Switch(Model) (#644)#
Alterna entre os pesos base do Wan Dancer e o caminho aumentado Lightning LoRA. Mantenha-o ativado para esboços rápidos; desative para máxima aderência ao ponto de verificação base. Para material delicado como mangas fluídas ou cabelos longos, o caminho base pode preservar melhor os micro-detalhes.
TrimAudioDuration (#494)#
Encurta a faixa de entrada para pré-visualizações ou para impor um comprimento alvo. É a maneira mais rápida de iterar em estilo e amplitude sem aumentar o uso de VRAM. Depois que você gostar do movimento, restaure a seção completa e renderize o final.
Extras opcionais#
- Wan Dancer processa muitos quadros por passagem e se beneficia de uma GPU forte. Para hardware mais leve, reduza a resolução ou encurte a duração durante as pré-visualizações.
- Use uma referência limpa, bem iluminada de retrato ou corpo inteiro com oclusão mínima; fundos ocupados podem confundir recursos de identidade.
- Combine o estilo de dança com o ritmo da faixa antes de aumentar a amplitude de movimento; a escolha do estilo tem o maior impacto no movimento crível.
- Fixe a semente de ruído para reproduzir resultados em execuções; mude-a ao explorar coreografias alternativas a partir dos mesmos inputs.
- Duas saídas são salvas: uma pré-visualização global apenas de movimento e a renderização final sincronizada com áudio. Revise a pré-visualização primeiro para economizar tempo.
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos profundamente à Comfy-Org pelo guia oficial do fluxo de trabalho ComfyUI Wan Dancer, Wan-AI pelo modelo oficial Wan-Dancer-14B, e Comfy-Org pelos arquivos do modelo Wan Dancer por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- Guia oficial do fluxo de trabalho ComfyUI Wan Dancer da Comfy-Org
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- Docs / Notas de Lançamento: Guia oficial do fluxo de trabalho ComfyUI Wan Dancer
- Modelo oficial Wan-AI/Wan-Dancer-14B
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Arquivos do modelo Comfy-Org/Wan Dancer
- Hugging Face: Comfy-Org/Wan-Dancer
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.


