Wan Dancer: image-and-music to rhythm‑synced dance video in ComfyUI#
이 Wan Dancer 워크플로우는 단일 참조 이미지와 음악 트랙을 짧은 리듬‑동기화된 댄스 비디오로 변환합니다. 춤 스타일과 움직임 진폭을 간단히 전환할 수 있는 이미지 및 오디오 제어를 원하는 창작자를 위해 설계되었습니다. 이 파이프라인은 전역 계획 단계를 실행하여 전체 신체 움직임 및 타이밍을 초안으로 작성한 다음, 세부 사항을 선명하게 하고 최종 비디오를 렌더링하기 전에 움직임을 부드럽게 하는 지역 세부 조정 단계를 실행합니다.
Wan Dancer는 한 번에 전체 시퀀스를 생성하므로 댄스 퍼포먼스 샷 구상, 빠른 캐릭터 애니메이션 연구 및 음악 기반 소셜 클립에 이상적입니다. 깨끗한 캐릭터 이미지를 제공하고 스타일을 선택하고 진폭을 설정하면, Wan Dancer가 신원을 보존하면서 오디오에 움직임을 맞춥니다.
Comfyui Wan Dancer 워크플로우의 주요 모델#
- Wan-Dancer-14B (전역 모델). 이미지와 오디오로부터 장거리 안무 및 신체 조정을 계획하여 일관된 움직임 청사진을 생성합니다. 공식 모델 카드는 Wan-AI/Wan-Dancer-14B에서 확인할 수 있으며, Comfy‑ready 가중치는 Comfy-Org/Wan-Dancer에서 제공됩니다.
- Wan-Dancer-14B (로컬 모델). 프레임 수준의 움직임을 세부적으로 정밀하게 하여 사지, 손, 머리 움직임에 정확성을 추가하면서 전역 계획에 충실하게 유지합니다. 가중치는 Comfy-Org/Wan-Dancer에서 전역 모델과 함께 제공됩니다.
- UMT5‑XXL 텍스트 인코더. 춤 스타일과 외형 단서를 설명하는 짧은 텍스트 프롬프트를 해석합니다. ComfyUI용으로 Comfy-Org/Wan_2.1_ComfyUI_repackaged에서 패키지화되었습니다.
- CLIP Vision H 인코더. 참조 이미지에서 신원과 의상을 보존하기 위해 강력한 시각적 특징을 추출합니다. 동일한 Comfy‑ready 패키지에서 제공됩니다: clip_vision_h.safetensors.
- Wan 2.1 VAE. 안정적인 색상 및 대비로 비디오 프레임의 잠재 인코딩/디코딩을 처리합니다. Comfy‑tested 빌드는 Kijai/WanVideo_comfy에서 사용할 수 있습니다.
- 선택적 LightX2V Lightning LoRA for I2V. 활성화되면 모션 합성을 가속화하고 선명하게 할 수 있는 경량 어댑터로, Kijai/WanVideo_comfy에서 패키지화되었습니다.
Comfyui Wan Dancer 워크플로우 사용 방법#
높은 수준에서 그래프는 두 개의 조정된 패스를 실행합니다. 전역 생성은 안무를 초안으로 작성하고 빠른 비디오 미리보기를 생성합니다. 로컬 생성은 키프레임을 패딩하고, 오디오에 맞춰 재정렬하며, 최종 출력을 위한 세부 사항을 정밀하게 조정합니다. 콤팩트한 프롬프트 선택기와 비디오 및 지속 시간 선택의 소규모 세트를 통해 모양과 움직임을 제어할 수 있습니다.
비디오 설정#
이 그룹은 두 패스의 출력 너비, 높이 및 시퀀스 길이를 정의합니다. 차원은 하드웨어 친화적인 배수로 자동 조정되므로, 비율 및 해상도에 집중할 수 있습니다. 더 긴 클립과 더 큰 프레임은 더 많은 VRAM을 소모하므로 이 패널을 사용하여 속도와 품질의 균형을 맞춥니다. 이러한 설정은 전역 WanDancerVideo (#647) 및 로컬 WanDancerVideo (#668)에 직접 입력됩니다.
프롬프트#
여기서 춤 스타일과 움직임 진폭을 선택합니다. 스타일 선택기는 전역 및 로컬 텍스트 프롬프트에 짧은 문구를 작성하고, 진폭 선택기는 신체 움직임의 활력을 조절합니다. 템플릿은 중국 고전 무용, K‑Pop, 스트리트 댄스, 라틴 댄스, 탭 댄스와 같은 스타일을 제공합니다. 원래 프롬프트 문자열은 중국어로 되어 있으며, 프로젝트에 맞게 현지화하거나 풍부하게 할 수 있습니다.
오디오 자르기#
이 그룹을 사용하여 미리보기 또는 특정 최종 클립 지속 시간에 맞추기 위해 긴 음악 파일을 단축합니다. 오디오는 한 번 잘라서 전역 및 로컬 단계에 전달되어 비트 타이밍을 일관되게 유지합니다. 지속 시간을 변경하면 다운스트림 키프레임 패딩 및 로컬 패스가 자동으로 조정됩니다. 빠른 반복을 위해 오디오를 단축하고, 움직임을 확인한 후 길이를 복원하여 최종 렌더링을 수행합니다.
공통 모델#
이 그룹은 공유 자산을 로드합니다: UMT5‑XXL 텍스트 인코더, CLIP Vision H 및 Wan 2.1 VAE. 이들은 프롬프트 이해, 이미지에서의 신원 특징 및 프레임의 안정적인 디코딩을 제공합니다. 일반적으로 사용자가 여기서 작업할 필요는 없으며, 인코더를 교체하거나 다른 VAE 빌드를 사용하는 경우에만 필요합니다.
전역 모델#
Wan‑Dancer‑14B 전역 가중치를 로드합니다. 이 단계에서 워크플로우는 참조 이미지와 잘린 오디오를 인코딩하고 전역 안무 모델을 적용하여 움직임 전용 미리보기 비디오를 생성합니다. 이 단계는 빠르며, 세부 조정 전에 스타일 및 진폭을 검증하는 데 뛰어납니다.
전역 생성#
이 블록은 참조 이미지와 오디오를 일관된 안무 초안으로 변환합니다. 인코더 노드는 텍스트와 시각적 특징을 추출하고, WanDancerEncodeAudio (#651)는 음악을 리듬 신호로 변환하며, WanDancerVideo (#647)는 전체 시퀀스를 합성합니다. 스케줄러와 샘플러는 잠재적 이미지를 디노이징하고, 비디오 노드는 미리보기를 조립합니다. 초안이 리듬에 맞지 않거나 너무 정적이라면, 진폭을 조정하거나 다른 스타일을 시도하고 다시 미리보기하십시오.
스위치#
모델을 Lightning LoRA 경로 또는 원래 가중치를 통해 실행할지 여부를 전환하는 작은 제어 섹션입니다. 빠른 반복을 위해 Lightning을 켜두고, 기본 Wan Dancer 체크포인트에 가장 충실한 재현이 필요할 때는 끄십시오. 흐르는 소매나 긴 머리와 같은 섬세한 소재의 경우, 기본 경로가 미세한 세부 사항을 더 잘 보존할 수 있습니다.
샘플러#
잠재 계획을 프레임으로 변환하는 데 사용되는 디노이저 및 노이즈 스케줄을 정의합니다. 구성은 전역 및 로컬 패스 간에 일관된 외관을 위해 공유됩니다. 고급 사용자는 샘플러를 실험할 수 있지만 제공된 설정은 Wan Dancer 비디오에 대한 견고한 기본값입니다. 깜박임이 보이면, 약간 더 강한 가이드와 더 안정적인 샘플러를 사용하면 도움이 될 수 있습니다.
로컬 모델#
Wan‑Dancer‑14B 로컬 가중치를 로드하고, 활성화되면 이 정제 경로에 동일한 Lightning LoRA를 적용합니다. 이 모델은 신체, 머리카락, 미세한 신체 움직임과 같은 세부 사항을 보존하면서 신원 특성을 인코딩합니다. 최종 렌더링을 위해 이 단계를 활성화 상태로 유지하십시오.
로컬 생성 (보간)#
로컬 패스는 전체 타임라인을 커버하기 위해 전역 미리보기에서 키프레임을 패딩하는 것으로 시작합니다. WanDancerEncodeAudio (#669)는 로컬 프레임 수에 맞춰 음악을 재인코딩하고, WanDancerVideo (#668)는 오디오에 맞춰 더 높은 충실도의 움직임을 생성합니다. 정제된 잠재적 이미지는 프레임으로 디코딩한 후, 다시 배치되고 동기화된 소리와 함께 최종 비디오로 조립됩니다. 현실감, 손 움직임 및 전반적인 세련됨을 판단하기 위해 이 출력을 사용하십시오.
샘플링#
이 지원 그룹은 로컬 정제에서 사용되는 스케줄러, 가이드 및 샘플러를 묶습니다. 이는 로컬 패스가 이전 그룹에서 일관된 타이밍과 해상도를 상속받도록 보장하면서 품질을 중요하게 여기는 곳에서 품질을 높일 수 있게 합니다. 상위에서 지속 시간이나 해상도를 변경하면 이 샘플러 패스가 정렬을 깨지 않고 적응합니다.
Comfyui Wan Dancer 워크플로우의 주요 노드#
Custom Combo (Dance Style) (#695)#
전역 및 로컬 텍스트 프롬프트에 삽입되는 춤 카테고리를 선택합니다. 트랙의 장르에 맞는 스타일을 선택하여 최상의 결과를 얻거나, 목록에 자신의 항목을 추가하십시오. 움직임이 비트와 일치하지 않는 것 같으면, 리듬 강조가 더 명확한 스타일을 시도한 후 다른 제어를 조정하십시오.
Custom Combo (Motion Amplitude) (#694)#
안무의 활력도를 제어합니다. 낮은 값은 부드러운 음악에 맞춰 움직임을 제한하고, 높은 값은 에너지 넘치는 트랙에 맞춰 이동 및 사지 속도를 증가시킵니다. 극단적인 포즈에서 신원 드리프트나 아티팩트가 발생하면 진폭을 한 단계 줄이고 다시 미리보기를 실행하십시오.
WanDancerEncodeAudio (#651)#
전역 패스를 위해 잘린 음악을 리듬 및 강도 특징으로 인코딩합니다. 이는 WanDancerVideo (#647) 내에서 비트 정렬을 주도합니다. 매우 부드러운 인트로나 긴 페이드에서는 인코더가 빠르게 잠글 수 있도록 명확한 비트가 있는 섹션으로 자르는 것을 고려하십시오.
WanDancerVideo (#647)#
선택한 해상도 및 시퀀스 길이에서 텍스트, 이미지 및 오디오 특징으로부터 전역 안무를 합성합니다. 이를 동작 계획기로 취급하십시오: 타이밍, 스타일 및 일반적인 포즈 역학을 여기서 확인한 후 다음 단계로 이동하십시오. 미리보기가 너무 색상 노이즈가 많으면 계속 진행하십시오; 색상 충실도는 로컬 패스에서 확고해집니다.
WanDancerPadKeyframesList (#670)#
전역 출력에서 키프레임 타임라인을 작성하고 선택한 지속 시간에 맞춥니다. 이는 로컬 패스가 시각적 앵커와 올바른 오디오 세그먼트를 모두 보도록 보장합니다. 지속 시간을 늘리면, 이 노드는 로컬 모델이 깨끗하게 보간할 수 있도록 간격을 매끄럽게 채웁니다.
WanDancerEncodeAudio (#669)#
키프레임 패딩 후 로컬 프레임 예산에 맞춰 오디오를 재인코딩합니다. 이는 정제된 움직임이 음악에 위상 고정되도록 유지합니다. 클립 길이를 변경할 때는 항상 이 노드를 실행하여 로컬 모델이 올바른 세그먼트를 듣도록 하십시오.
WanDancerVideo (#668)#
키프레임, 이미지 특징 및 재인코딩된 오디오에 조건화된 정제되고 높은 충실도의 움직임을 생성합니다. 손, 머리카락, 의상 주름 및 미세한 머리 회전을 해결하면서 신원을 유지하는 데 사용하십시오. 작은 떨림이 나타나면, 더 안정적인 샘플러나 디노이저에 약간 더 많은 가이드를 시도하십시오.
Switch(Model) (#644)#
기본 Wan Dancer 가중치와 Lightning LoRA로 보강된 경로 간 전환합니다. 빠른 초안을 위해 활성화하고, 기본 체크포인트에 최대한 충실하게 하려면 비활성화하십시오. 흐르는 소매나 긴 머리와 같은 섬세한 소재의 경우, 기본 경로가 미세한 세부 사항을 더 잘 보존할 수 있습니다.
TrimAudioDuration (#494)#
미리보기용 또는 목표 길이를 강제하기 위해 입력 트랙을 단축합니다. 스타일 및 진폭을 증가시키지 않고 반복하는 가장 빠른 방법입니다. 움직임이 마음에 들면 전체 섹션을 복원하고 최종 렌더링을 수행하십시오.
선택적 추가 기능#
- Wan Dancer는 패스당 많은 프레임을 처리하며, 강력한 GPU를 사용할 때 효과적입니다. 하드웨어가 가벼운 경우, 미리보기를 위한 해상도를 줄이거나 지속 시간을 단축하십시오.
- 깨끗하고 잘 조명된 초상화 또는 전체 신체 참조를 사용하십시오. 배경이 복잡하면 신원 특징을 혼란시킬 수 있습니다.
- 춤 스타일을 트랙의 리듬에 맞춘 후 움직임 진폭을 높이십시오. 스타일 선택은 믿을 수 있는 움직임에 가장 큰 영향을 미칩니다.
- 결과를 여러 실행에 걸쳐 재현하려면 노이즈 시드를 고정하십시오. 동일한 입력에서 대체 안무를 탐색할 때 변경하십시오.
- 두 개의 출력이 저장됩니다: 움직임 전용 전역 미리보기와 최종 오디오 동기화 렌더링. 시간을 절약하기 위해 먼저 미리보기를 검토하십시오.
감사의 글#
이 워크플로우는 다음 작품과 자원을 구현하고 구축합니다. 우리는 Comfy-Org의 공식 ComfyUI Wan Dancer 워크플로우 가이드, Wan-AI의 Wan-Dancer-14B 공식 모델 및 Comfy-Org의 Wan Dancer 모델 파일에 대해 그들의 기여와 유지에 대해 감사드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서 및 저장소를 참조하십시오.
자원#
- Comfy-Org/Official ComfyUI Wan Dancer workflow guide
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- Docs / Release Notes: Official ComfyUI Wan Dancer workflow guide
- Wan-AI/Wan-Dancer-14B official model
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Comfy-Org/Wan Dancer model files
- Hugging Face: Comfy-Org/Wan-Dancer
json


