Wan Dancer: imagen y música a video de baile sincronizado con ritmo en ComfyUI#
Este flujo de trabajo de Wan Dancer convierte una sola imagen de referencia y una pista de música en un video corto de baile sincronizado con ritmo. Está diseñado para creadores que desean control directo de imagen y audio sobre la coreografía, con interruptores simples para el estilo de baile y la amplitud del movimiento. La canalización realiza un pase de planificación global para esbozar el movimiento y la sincronización de todo el cuerpo, luego un pase de refinamiento local que afina los detalles y suaviza el movimiento antes de renderizar el video final.
Debido a que Wan Dancer produce una secuencia completa de una sola vez, es ideal para conceptualizar tomas de actuaciones de baile, estudios rápidos de animación de personajes y clips sociales impulsados por música. Proporcionas una imagen limpia del personaje, eliges un estilo, estableces la amplitud, y Wan Dancer alinea el movimiento con el audio mientras preserva la identidad.
Modelos clave en el flujo de trabajo de Comfyui Wan Dancer#
- Wan-Dancer-14B (Modelo Global). Planifica coreografías a largo plazo y coordinación corporal a partir de imagen y audio, produciendo un esquema de movimiento coherente. Consulta la tarjeta oficial del modelo en Wan-AI/Wan-Dancer-14B y los pesos listos para Comfy en Comfy-Org/Wan-Dancer.
- Wan-Dancer-14B (Modelo Local). Refina e interpola el movimiento a nivel de cuadro para añadir precisión en el movimiento de extremidades, manos y cabeza mientras se mantiene fiel al plan global. Los pesos se proporcionan junto al modelo global en Comfy-Org/Wan-Dancer.
- Codificador de texto UMT5‑XXL. Interpreta indicaciones textuales cortas que describen el estilo de baile y las pistas de apariencia; empaquetado para ComfyUI en Comfy-Org/Wan_2.1_ComfyUI_repackaged.
- Codificador CLIP Vision H. Extrae características visuales robustas de la imagen de referencia para preservar la identidad y la vestimenta; proporcionado en el mismo paquete listo para Comfy: clip_vision_h.safetensors.
- Wan 2.1 VAE. Maneja la codificación/decodificación latente para los cuadros de video con color y contraste estables; una construcción probada por Comfy está disponible en Kijai/WanVideo_comfy.
- LightX2V Lightning LoRA opcional para I2V. Un adaptador ligero que puede acelerar y agudizar la síntesis de movimiento cuando está habilitado, empaquetado en Kijai/WanVideo_comfy.
Cómo usar el flujo de trabajo de Comfyui Wan Dancer#
A un nivel alto, el gráfico realiza dos pases coordinados. La Generación Global bosqueja la coreografía y produce una vista previa rápida del video. La Generación Local luego rellena los cuadros clave, re-alinea con el audio, y refina los detalles para el resultado final. Tienes control sobre la apariencia y el movimiento a través de selectores de indicaciones compactos, además de un pequeño conjunto de opciones de video y duración.
Configuración de Video#
Este grupo define el ancho de salida, la altura y la longitud de la secuencia para ambos pases. Las dimensiones se ajustan automáticamente a múltiplos compatibles con el hardware, por lo que puedes centrarte en la relación de aspecto y la resolución. Los clips más largos y los cuadros más grandes consumen más VRAM, así que usa este panel para equilibrar velocidad y calidad. Estas configuraciones alimentan directamente al WanDancerVideo global (#647) y al WanDancerVideo local (#668).
Indicaciones#
Aquí eliges un estilo de baile y una amplitud de movimiento. El selector de estilo escribe una frase corta en las indicaciones de texto globales y locales, mientras que el selector de amplitud modula cuán energético debe ser el movimiento corporal. La plantilla viene con estilos como Danza Clásica China, K‑Pop, Danza Callejera, Danza Latina y Tap Dance, y puedes añadir los tuyos propios. Las cadenas de indicaciones originales están en chino; siéntete libre de localizarlas o enriquecerlas para adaptarlas a tu proyecto.
Recortar Audio#
Usa este grupo para acortar un archivo de música largo para vistas previas o para ajustar una duración específica del clip final. El audio se recorta una vez y se pasa a las etapas global y local, manteniendo la sincronización del ritmo consistente. Si cambias la duración final, el relleno de cuadros clave y el pase local se adaptarán automáticamente. Para iteraciones rápidas, acorta el audio, verifica el movimiento, luego restaura la longitud para el renderizado final.
Modelos Comunes#
Este grupo carga activos compartidos: el codificador de texto UMT5‑XXL, CLIP Vision H, y el Wan 2.1 VAE. Proporcionan comprensión de indicaciones, características de identidad de tu imagen, y decodificación estable de cuadros. Normalmente no se necesita acción del usuario aquí a menos que cambies codificadores o una construcción VAE diferente.
Modelo Global#
Carga los pesos globales Wan‑Dancer‑14B. En este pase, el flujo de trabajo codifica tu imagen de referencia y audio recortado, aplica el modelo de coreografía global, y produce un video de vista previa solo de movimiento. Esta etapa es rápida y excelente para validar estilo y amplitud antes de comprometerse con el refinamiento.
Generación Global#
Este bloque convierte la imagen de referencia y el audio en un borrador coherente de la danza. Los nodos de codificación extraen características textuales y visuales, WanDancerEncodeAudio (#651) convierte la música en pistas de ritmo, y WanDancerVideo (#647) sintetiza la secuencia completa. Un planificador y un muestreador luego eliminan el ruido del latente para imágenes, y un nodo de video ensambla una vista previa. Si el borrador se siente fuera de ritmo o demasiado estático, ajusta la amplitud o prueba un estilo diferente y vuelve a previsualizar.
Interruptor#
Una pequeña sección de control alterna si ejecutar el modelo a través de la ruta Lightning LoRA o los pesos originales. Deja Lightning activado para una iteración más rápida y apágalo cuando necesites la reproducción más fiel al punto de control base de Wan Dancer. Interruptores adicionales controlan qué conteo de pasos y valor de guía debería usar el muestreador, permitiéndote intercambiar velocidad por calidad por etapa.
Muestreador#
Define el eliminador de ruido y el programa de ruido utilizado para convertir planes latentes en cuadros. La configuración se comparte entre los pases global y local para una apariencia consistente. Los usuarios avanzados pueden experimentar con muestreadores, pero la configuración proporcionada es un sólido valor predeterminado para video Wan Dancer. Si ves parpadeo, una guía ligeramente más fuerte junto con un muestreador más estable puede ayudar.
Modelo Local#
Carga los pesos locales Wan‑Dancer‑14B y, cuando está habilitado, aplica el mismo Lightning LoRA a este camino de refinamiento. Este modelo se enfoca en la interpolación y detalles finos como manos, cabello, y movimiento sutil del torso mientras preserva los rasgos de identidad codificados de tu imagen. Mantén esta etapa habilitada para renderizados finales.
Generación Local (interpolación)#
El pase local comienza rellenando los cuadros clave de la vista previa global para cubrir toda la línea de tiempo. WanDancerEncodeAudio (#669) re-codifica la música para el conteo de cuadros local, y WanDancerVideo (#668) produce movimiento de alta fidelidad alineado con el audio. Los latentes refinados se decodifican en cuadros, luego se reorganizan y ensamblan en el video final con sonido sincronizado. Usa esta salida para juzgar realismo, movimiento de manos, y pulido general.
Muestreo#
Este grupo de apoyo une el planificador, guía, y muestreador utilizados en el refinamiento local. Asegura que el pase local herede sincronización y resolución consistentes de grupos anteriores mientras te permite mejorar la calidad donde importa. Si cambias duración o resolución aguas arriba, este camino del muestreador se adaptará sin romper la alineación.
Nodos clave en el flujo de trabajo de Comfyui Wan Dancer#
Custom Combo (Estilo de Baile) (#695)#
Selecciona la categoría de baile que se inserta en ambos las indicaciones de texto globales y locales. Elige un estilo que coincida con el género de tu pista para obtener los mejores resultados, o añade tus propias entradas a la lista. Si el movimiento se ve desajustado con el ritmo, prueba un estilo con acentos rítmicos más claros antes de ajustar otros controles.
Custom Combo (Amplitud de Movimiento) (#694)#
Controla cuán enérgica debe ser la coreografía. Los valores más bajos mantienen el movimiento contenido para música suave; los valores más altos aumentan el desplazamiento y la velocidad de las extremidades para pistas enérgicas. Si notas deriva de identidad o artefactos en poses extremas, reduce la amplitud un paso y vuelve a previsualizar.
WanDancerEncodeAudio (#651)#
Codifica la música recortada en características de ritmo e intensidad para el pase global. Esto impulsa la alineación del ritmo dentro de WanDancerVideo (#647). Para intros muy suaves o desvanecimientos largos, considera recortar a la sección con un ritmo claro para ayudar al codificador a bloquearse rápidamente.
WanDancerVideo (#647)#
Sintetiza la coreografía global a partir de características de texto, imagen y audio a la resolución y longitud de secuencia elegidas. Trata esto como un planificador de movimiento: verifica la sincronización, el estilo, y la dinámica general de poses aquí antes de continuar. Si la vista previa es demasiado ruidosa en croma, sigue adelante; la fidelidad del color se solidifica en el pase local.
WanDancerPadKeyframesList (#670)#
Construye una línea de tiempo de cuadros clave a partir de la salida global y los alinea a la duración elegida. Esto asegura que el pase local vea tanto anclajes visuales como el segmento de audio correcto. Si extiendes la duración, este nodo llena los huecos suavemente para que el modelo local pueda interpolar limpiamente.
WanDancerEncodeAudio (#669)#
Re-codifica el audio para el presupuesto de cuadros local después del relleno de cuadros clave. Esto mantiene el movimiento refinado bloqueado en fase con la música. Al cambiar la longitud del clip, siempre ejecuta este nodo para que el modelo local escuche el segmento correcto.
WanDancerVideo (#668)#
Genera el movimiento refinado y de alta fidelidad condicionado en cuadros clave, características de imagen, y audio re-codificado. Úsalo para resolver manos, cabello, ondulaciones de ropa, y giros sutiles de cabeza mientras mantienes la identidad. Si aparecen pequeños temblores, prueba un muestreador más estable o un poco más de guía en tu eliminador de ruido.
Switch(Model) (#644)#
Alterna entre los pesos base de Wan Dancer y la ruta aumentada Lightning LoRA. Mantenlo habilitado para borradores rápidos; deshabilítalo para la máxima adherencia al punto de control base. Para material delicado como mangas fluidas o cabello largo, la ruta base puede preservar mejor los micro-detalles.
TrimAudioDuration (#494)#
Acorta la pista de entrada para vistas previas o para imponer una longitud objetivo. Es la forma más rápida de iterar en estilo y amplitud sin aumentar el uso de VRAM. Después de que te guste el movimiento, restaura la sección completa y renderiza el final.
Extras opcionales#
- Wan Dancer procesa muchos cuadros por pase y se beneficia de una GPU fuerte. Para hardware más ligero, reduce la resolución o acorta la duración durante las vistas previas.
- Usa un retrato limpio y bien iluminado o una referencia de cuerpo completo con mínima obstrucción; fondos ocupados pueden confundir las características de identidad.
- Empareja el estilo de baile con el ritmo de la pista antes de aumentar la amplitud del movimiento; la elección del estilo tiene el mayor impacto en el movimiento creíble.
- Fija la semilla de ruido para reproducir resultados en ejecuciones; cámbiala al explorar coreografías alternativas de las mismas entradas.
- Se guardan dos salidas: una vista previa global solo de movimiento y el renderizado final sincronizado con audio. Revisa primero la vista previa para ahorrar tiempo.
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos profundamente a Comfy-Org por la guía oficial del flujo de trabajo de ComfyUI Wan Dancer, Wan-AI por el modelo oficial Wan-Dancer-14B, y Comfy-Org por los archivos del modelo Wan Dancer por sus contribuciones y mantenimiento. Para detalles autorizados, por favor consulta la documentación y los repositorios originales enlazados a continuación.
Recursos#
- Guía oficial del flujo de trabajo ComfyUI Wan Dancer de Comfy-Org
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- Documentos / Notas de lanzamiento: Guía oficial del flujo de trabajo ComfyUI Wan Dancer
- Modelo oficial Wan-Dancer-14B de Wan-AI
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Archivos del modelo Wan Dancer de Comfy-Org
- Hugging Face: Comfy-Org/Wan-Dancer
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

