Transferencia de movimiento Wan Animate 2 ComfyUI: animación de personaje de imagen única desde un video de conducción#
Wan Animate 2 ComfyUI convierte un personaje de referencia estático más un video de pose de conducción en un nuevo clip de animación de cuerpo completo. Está construido alrededor de Wan‑Animate‑2, un transformador de difusión de extremo a extremo que transfiere movimiento directamente desde fotogramas sin procesar, por lo que no necesitas OpenPose ni ninguna extracción de esqueletos. El flujo de trabajo preserva la identidad del personaje desde la imagen estática mientras controlas el fondo, estilo y cámara a través de texto.
Este gráfico listo para RunComfy es ideal para creadores que desean transferencia de movimiento al estilo de estudio dentro de ComfyUI. Proporcionas un retrato o referencia de cuerpo completo, insertas un video de conducción corto, configuras dos indicaciones concisas, y Wan Animate 2 ComfyUI produce una actuación de personaje fiel a la identidad con un escenario limpio y guiado por indicaciones.
Modelos clave en el flujo de trabajo Comfyui Wan Animate 2 ComfyUI#
- Pesos centrales de Wan‑Animate‑2. El transformador de difusión que realiza la transferencia de movimiento consciente de la identidad desde el clip de conducción mientras genera nuevos fotogramas. Fuente y pesos: Wan‑Animate‑2 GitHub y Comfy‑Org/Wan‑Animate‑2.
- LightX2V I2V 14B 480p distilled LoRA. Un adaptador ligero que alinea la columna vertebral de Wan‑Video para la generación de imagen a video eficiente y el acondicionamiento de movimiento. Archivo: lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors en Hugging Face.
- Codificador de texto uMT5‑XXL. Interpreta tus indicaciones positivas y negativas para dirigir la apariencia del personaje, el fondo y el estilo. Archivo: umt5_xxl_fp8_e4m3fn_scaled.safetensors en Hugging Face.
- Codificador de visión CLIP ViT‑H/14. Extrae características de apariencia de la imagen de referencia y pistas complementarias de fotogramas de pose para una guía robusta de identidad y movimiento. Archivo: clip_vision_h.safetensors en Hugging Face.
- Wan 2.1 VAE. Codifica y decodifica latentes de video mientras preserva la textura y la fidelidad de color finas. Archivo: Wan2_1_VAE_bf16.safetensors en Hugging Face.
Cómo usar el flujo de trabajo Comfyui Wan Animate 2 ComfyUI#
A simple vista, el flujo de trabajo dirige una imagen de referencia y un video de conducción a través del subgrafo de Transferencia de Movimiento, luego decodifica fotogramas a un video y opcionalmente une una comparación lado a lado. Los grupos a continuación describen cómo contribuye cada parte y qué puedes editar.
Modelos#
Este grupo carga el modelo central Wan‑Animate‑2, su LoRA, codificador de texto, CLIP‑Vision y VAE. Mantén las selecciones de modelo predeterminadas a menos que sepas que necesitas alternativas de los mismos repositorios. El par UNet y LoRA define cómo se interpreta y renderiza el movimiento, mientras que el VAE controla la fidelidad de la imagen durante la codificación/decodificación latente. Si cambias los modelos, asegúrate de que sean compatibles con los activos de Wan Animate 2 ComfyUI de los repositorios vinculados.
Indicación#
Usa la indicación positiva para describir la apariencia del personaje y el fondo que deseas, y la indicación negativa para excluir suavemente artefactos. Describe la apariencia, materiales, ropa, iluminación y el set; no describas el movimiento aquí porque el movimiento proviene del video. Mantener las indicaciones concisas y específicas mejora la preservación de la identidad y la consistencia del fondo a través de los fotogramas. El codificador de texto convierte tu texto en acondicionamiento utilizado durante toda la generación.
Imagen de Referencia#
Carga un retrato de referencia limpio y único o una imagen estática de cuerpo completo con el personaje centrado usando Load Image (Reference Image) (#189). El fondo de esta imagen estática no se transfiere porque la escena se genera a partir de tu indicación. El grupo redimensiona la referencia para que coincida con la resolución de trabajo utilizada aguas abajo para que los mapas de atención se alineen con las características de pose. Las referencias bien iluminadas y nítidas con mínima oclusión producen una identidad más fuerte.
Video de Referencia de Pose#
Importa el clip de conducción con Load Video (Pose Video) (#240). Los fotogramas se pasan directamente al modelo en lugar de convertirse en puntos clave esqueléticos, por lo que los matices naturales como los cambios de peso y el movimiento secundario se transfieren bien. El gráfico normaliza las dimensiones espaciales mientras mantiene la cadencia del clip original, lo que significa que la salida fps sigue la fuente. Elige clips cuyo encuadre coincida aproximadamente con la referencia (por ejemplo, de cuerpo completo a cuerpo completo) para evitar el deslizamiento de escala.
Ventanas de Contexto y Caché#
ContextWindowsManual controla el contexto temporal, ayudando a que los movimientos más largos se mantengan coherentes a través de las ventanas. Un pequeño ComfySwitchNode alterna si se utiliza la expansión del contexto, permitiéndote intercambiar memoria por estabilidad en tomas extendidas. WanAnimate2Cache gestiona el caché de atención en gpu o cpu con precisión reducida, lo que ayuda a controlar los picos de VRAM en secuencias largas. Para GPUs ajustadas, colocar el caché en cpu es una salvaguardia práctica.
Acondicionamiento#
WanAnimate2ToVideo (#247) es el corazón de Wan Animate 2 ComfyUI. Combina el acondicionamiento de texto positivo y negativo con la imagen de referencia, características CLIP‑Vision y los fotogramas de pose para producir una secuencia de latentes de video. Puedes pasar el último fotograma del segmento anterior a continue_motion para mantener la continuidad entre los trozos, y puedes compensar la lectura del clip de conducción con video_frame_offset al encadenar. El nodo también acepta reference_image_strength y pose_strength para equilibrar el bloqueo de identidad frente a la fidelidad del movimiento.
Muestreo#
SamplerCustom elimina el ruido de los latentes de video usando el modelo preparado por ModelSamplingSD3, BasicScheduler, y una selección de muestreador LCM. Esta etapa determina la velocidad y estabilidad de la textura; una semilla fija mantiene la apariencia y el grano consistentes a través de los segmentos, mientras que una semilla aleatoria añade variación. El resultado es un clip de video latente listo para decodificación.
Recortar el primer fotograma duplicado#
Al encadenar segmentos, el primer fotograma de un nuevo segmento puede duplicar el último fotograma del segmento anterior. TrimVideoLatent más una pequeña ruta de conmutación eliminan automáticamente esa costura. Si aún ves un tropiezo de un solo fotograma, elimina la primera imagen del nuevo trozo al procesar por lotes.
Ensamblaje y comparación de video#
VAEDecode convierte los latentes finales en imágenes, que se agrupan y luego se envían a CreateVideo para heredar el fps y el audio del clip fuente si está presente. SaveVideo escribe la animación generada en disco. El subgrafo Video Stitch (ImageStitch dentro) toma el video generado y el video de conducción original para producir una comparación lado a lado para comprobaciones rápidas de calidad, luego guarda esa vista combinada como un archivo separado.
Extender más allá de un solo trozo#
Cada pasada produce un número fijo de fotogramas, por lo que las tomas más largas se crean duplicando el subgrafo Motion Transfer (Wan Animate 2) (#261). Conecta continue_motion de la pasada anterior a la siguiente y alimenta el video_frame_offset previo para que la lectura del clip de conducción continúe sin problemas. Conecta la salida image de cada pasada a BatchImagesNode (#289) para concatenar segmentos antes de la creación de video. Un nodo matemático auxiliar en la parte inferior izquierda calcula cuántas pasadas necesitas según la longitud del video de conducción, y una pequeña vista previa imprime el número.
Nodos clave en el flujo de trabajo Comfyui Wan Animate 2 ComfyUI#
WanAnimate2ToVideo (#247)#
Combina el acondicionamiento de texto, la imagen de referencia, características CLIP‑Vision y fotogramas de pose para sintetizar latentes de video. Ajusta reference_image_strength para controlar qué tan estrechamente se adhiere la salida a la imagen estática, y usa pose_strength más pose_start_percent y pose_end_percent para enmarcar o suavizar el movimiento. length establece fotogramas por pasada, video_frame_offset avanza a través del clip de conducción al encadenar, y continue_motion ancla la continuidad temporal usando el último fotograma del segmento anterior. Respaldado por la implementación y pesos de Wan‑Animate‑2 en los repositorios oficiales vinculados arriba.
ContextWindowsManual (#257) con ComfySwitchNode (#258)#
Expande la ventana de atención temporal para que los movimientos permanezcan consistentes a través de secuencias más largas. Habilítalo para movimientos complejos o cuando veas detalles desplazándose a través del tiempo, a costa de memoria adicional. Si alcanzas los límites de memoria, desactiva o reduce el tamaño de la ventana de contexto y confía en la continuidad de trozo a trozo.
WanAnimate2Cache (#224)#
Almacena en caché las claves y valores de atención para reducir el cálculo redundante y suavizar el uso de memoria. Establece el dispositivo de caché en cpu cuando la VRAM es limitada o en gpu para el máximo rendimiento, y mantén el tipo de datos ligero para la estabilidad. Esto es especialmente útil cuando apilas múltiples pasadas para tomas extendidas. Los activos se proporcionan con el lanzamiento oficial Comfy‑Org/Wan‑Animate‑2.
SamplerCustom (#19) con KSamplerSelect y BasicScheduler#
Ejecuta la trayectoria de eliminación de ruido sobre los latentes de video. El muestreador LCM se elige para pasos rápidos y de alta calidad adecuados para la iteración interactiva. Usa una semilla fija para bloquear la textura y el sombreado a través de pasadas encadenadas; cambia la semilla para explorar alternativas manteniendo el movimiento idéntico.
TrimVideoLatent (#223)#
Elimina el primer fotograma duplicado que puede aparecer al encadenar segmentos, eliminando costuras visibles. Déjalo habilitado cuando construyas secuencias más largas y desactívalo para clips de una sola pasada.
Extras opcionales#
- Mantén el encuadre consistente entre la referencia y el video de conducción. De cuerpo completo a cuerpo completo o de plano medio a plano medio funciona mejor.
- Debido a que Wan Animate 2 ComfyUI lee fotogramas sin procesar para el movimiento, usa clips de conducción con siluetas claras y mínimo desenfoque de movimiento.
- Describe fondos en la indicación positiva en lugar de confiar en el fondo de la imagen de referencia; el modelo genera nuevos escenarios a partir del texto.
- El fps de salida sigue al clip de entrada. Si el movimiento parece demasiado lento o rápido, vuelve a muestrear el video de conducción antes de ejecutar el flujo de trabajo.
- Para GPUs con memoria limitada, establece el dispositivo de caché en cpu en
WanAnimate2Cachey prefiere trozos más cortos que luego puedes unir. - Usa la salida lado a lado del subgrafo
Video Stitchpara verificar rápidamente la fidelidad del movimiento antes de renderizar carreras más largas.
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a Comfy Org por el anuncio “Wan Animate 2 is now available in ComfyUI” y las plantillas, Wan-Video por el código base de Wan-Animate-2, Comfy-Org por los pesos del modelo Wan-Animate-2 en Hugging Face, y ComfyUI por la plantilla de flujo de trabajo “Wan Animate 2: Motion Transfer” por sus contribuciones y mantenimiento. Para detalles autorizados, por favor consulta la documentación original y los repositorios vinculados a continuación.
Recursos#
- Comfy Org/Wan Animate 2 is now available in ComfyUI
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/Wan-Animate-2
- Docs / Release Notes: Wan Animate 2 is now available in ComfyUI
- Wan-Video/Wan-Animate-2
- GitHub: Wan-Video/Wan-Animate-2
- Hugging Face: Wan-AI/Wan2.2-Animate-2-14B
- arXiv: 2608.06009
- Comfy-Org/Wan-Animate-2
- Hugging Face: Comfy-Org/Wan-Animate-2
- arXiv: 2608.06009
- ComfyUI/Wan Animate 2: Motion Transfer
- Docs / Release Notes: Wan Animate 2: Motion Transfer - ComfyUI Workflow
Nota: El uso de los modelos, conjuntos de datos y códigos referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

