Wan Dancer: 在 ComfyUI 中将图像和音乐转换为节奏同步的舞蹈视频#
这个 Wan Dancer 工作流程将单个参考图像和音乐轨道转化为短节奏同步的舞蹈视频。它为希望直接控制编舞的创作者设计,具有简单的舞蹈风格和运动幅度开关。该流程先进行全局计划,通过整个身体运动和时间安排草拟,然后进行局部细化,锐化细节并平滑运动,最后渲染最终视频。
由于 Wan Dancer 一次生成完整序列,它非常适合构思舞蹈表演镜头、快速角色动画研究和音乐驱动的社交剪辑。您提供一个干净的角色图像,选择一个风格,设置幅度,Wan Dancer 在保持身份的同时将运动与音频对齐。
ComfyUI Wan Dancer 工作流程中的关键模型#
- Wan-Dancer-14B(全局模型)。从图像和音频中计划长程编舞和身体协调,生成连贯的运动蓝图。请参阅官方模型卡:Wan-AI/Wan-Dancer-14B 和 Comfy 准备的权重:Comfy-Org/Wan-Dancer。
- Wan-Dancer-14B(局部模型)。细化和插值帧级运动,在保持全局计划的同时增加四肢、手和头部运动的精度。权重与全局模型一起提供:Comfy-Org/Wan-Dancer。
- UMT5-XXL 文本编码器。解释描述舞蹈风格和外观提示的简短文本提示;在 ComfyUI 中打包:Comfy-Org/Wan_2.1_ComfyUI_repackaged。
- CLIP Vision H 编码器。从参考图像中提取强大的视觉特征,以保持身份和服装;在同一 Comfy 准备的包中提供:clip_vision_h.safetensors。
- Wan 2.1 VAE。处理视频帧的潜在编码/解码,具有稳定的颜色和对比度;在 Kijai/WanVideo_comfy 中提供了 Comfy 测试版构建。
- 可选的 LightX2V Lightning LoRA for I2V。一个轻量级适配器,可以在启用时加速和增强运动合成,在 Kijai/WanVideo_comfy 中打包。
如何使用 ComfyUI Wan Dancer 工作流程#
在高层次上,图形运行两个协调的过程。全局生成草拟编舞并生成快速视频预览。局部生成然后填充关键帧,重新对齐音频,并细化细节以获得最终输出。您通过紧凑的提示选择器控制外观和运动,以及一小部分视频和持续时间选择。
视频设置#
此组定义两次过程的输出宽度、高度和序列长度。维度自动调整为硬件友好的倍数,因此您可以专注于宽高比和分辨率。较长的剪辑和较大的帧消耗更多的 VRAM,因此使用此面板来平衡速度和质量。这些设置直接输入全局 WanDancerVideo (#647) 和局部 WanDancerVideo (#668)。
提示#
在这里,您选择一个舞蹈风格和运动幅度。风格选择器将短语写入全局和局部文本提示,而幅度选择器调节身体运动的能量。模板附带中国古典舞、K-Pop、街舞、拉丁舞和踢踏舞等风格,您可以添加自己的风格。原始提示字符串是中文的;可以根据项目自由本地化或丰富它们。
修剪音频#
使用此组缩短长音乐文件以进行预览或匹配特定的最终剪辑长度。音频被修剪一次并传递到全局和局部阶段,保持节拍时间一致。如果您更改最终持续时间,下游关键帧填充和局部过程将自动调整。为了快速迭代,缩短音频,验证运动,然后恢复长度以进行最终渲染。
通用模型#
此组加载共享资产:UMT5-XXL 文本编码器、CLIP Vision H 和 Wan 2.1 VAE。它们提供提示理解、图像中的身份特征和帧的稳定解码。通常不需要用户在此处采取行动,除非您更换编码器或使用不同的 VAE 构建。
全局模型#
加载 Wan-Dancer-14B 全局权重。在此过程中,工作流程对您的参考图像和修剪的音频进行编码,应用全局编舞模型,并生成仅含运动的预览视频。此阶段速度快,非常适合在承诺细化之前验证风格和幅度。
全局生成#
这个模块将参考图像和音频转化为连贯的舞蹈草稿。编码器节点提取文本和视觉特征,WanDancerEncodeAudio (#651) 将音乐转化为节奏提示,WanDancerVideo (#647) 合成完整序列。调度器和采样器然后将潜在的噪声去噪为图像,视频节点组装预览。如果草稿感觉节奏不对或过于静态,请调整幅度或尝试不同的风格并重新预览。
开关#
一个小的控制部分切换是否通过 Lightning LoRA 路径运行模型或使用原始权重。保持 Lightning 开启以更快的迭代,当您需要最忠实于基础 Wan Dancer 检查点时关闭。额外的开关控制采样器应使用的步数和指导值,让您在每个阶段以速度换取质量。
采样器#
定义用于将潜在计划转化为帧的去噪器和噪声时间表。配置在全局和局部过程中共享,以保持一致的外观。高级用户可以尝试采样器,但提供的设置是 Wan Dancer 视频的可靠默认设置。如果看到闪烁,略微增强的指导与更稳定的采样器结合可以有所帮助。
局部模型#
加载 Wan-Dancer-14B 局部权重,并在启用时将相同的 Lightning LoRA 应用于此细化路径。此模型专注于插值和细节,如手、头发和细微的躯干运动,同时保持从图像编码的身份特征。保持此阶段启用以进行最终渲染。
局部生成(插值)#
局部过程从全局预览填充关键帧以覆盖完整时间线。WanDancerEncodeAudio (#669) 重新编码音乐以适应局部帧计数,WanDancerVideo (#668) 生成与音频对齐的更高保真度的运动。细化的潜在变量被解码为帧,然后重新批处理并组装成最终视频,声音同步。使用此输出判断真实感、手部运动和整体抛光。
采样#
这个支持组结合了局部细化中使用的调度器、引导器和采样器。它确保局部过程从早期组继承一致的时间和分辨率,同时让您在需要的地方推动质量。如果更改上游的持续时间或分辨率,此采样器路径将适应而不会破坏对齐。
ComfyUI Wan Dancer 工作流程中的关键节点#
Custom Combo (Dance Style) (#695)#
选择插入到全局和局部文本提示中的舞蹈类别。选择一个与您的曲目风格相匹配的风格以获得最佳效果,或者将您自己的条目添加到列表中。如果运动与节拍不匹配,请尝试具有更明确节奏重音的风格,然后再调整其他控制。
Custom Combo (Motion Amplitude) (#694)#
控制编舞的活力。较低的值保持运动适中,以适应轻柔的音乐;较高的值增加旅行和四肢速度以适应活力四射的曲目。如果在极端姿势中发现身份漂移或伪影,请减少幅度一级并重新预览。
WanDancerEncodeAudio (#651)#
将修剪的音乐编码为全局过程的节奏和强度特征。这推动 WanDancerVideo (#647) 内部的节拍对齐。对于非常柔和的引子或长淡出,考虑修剪到具有清晰节拍的部分,以帮助编码器快速锁定。
WanDancerVideo (#647)#
从文本、图像和音频特征在选择的分辨率和序列长度合成全局编舞。将其视为运动策划者:在继续之前验证时间、风格和一般姿势动态。如果预览过于色彩噪声,继续进行;颜色保真度在局部过程中得到巩固。
WanDancerPadKeyframesList (#670)#
从全局输出构建关键帧时间线,并将其与选择的持续时间对齐。这确保局部过程看到视觉锚点和正确的音频片段。如果扩展持续时间,此节点平滑填充空隙,以便局部模型可以清晰地插值。
WanDancerEncodeAudio (#669)#
在关键帧填充后为局部帧预算重新编码音频。这保持精细运动与音乐的相位锁定。更改剪辑长度时,请始终运行此节点,以便局部模型听到正确的片段。
WanDancerVideo (#668)#
生成基于关键帧、图像特征和重新编码音频的精细、高保真运动。用于解决手、头发、衣服波纹和细微的头部转动,同时保持身份。如果出现小抖动,请尝试更稳定的采样器或在去噪器中增加一些指导。
Switch(Model) (#644)#
在基础 Wan Dancer 权重和 Lightning LoRA 增强路径之间切换。保持启用以快速草稿;禁用以最大程度地遵循基础检查点。对于像流动的袖子或长发这样的细腻材料,基础路径可以更好地保留微观细节。
TrimAudioDuration (#494)#
缩短输入轨道以进行预览或强制目标长度。这是迭代风格和幅度的最快方式,而不会增加 VRAM 使用。在您喜欢运动后,恢复完整部分并渲染最终版本。
可选额外功能#
- Wan Dancer 每次通过处理许多帧,因此需要强大的 GPU。对于较轻的硬件,减少分辨率或在预览期间缩短持续时间。
- 使用干净、光线良好的肖像或全身参考,遮挡最小;繁忙的背景可能会混淆身份特征。
- 在提高运动幅度之前,先将舞蹈风格与曲目的节奏匹配;风格选择对可信运动的影响最大。
- 固定噪声种子以在多次运行中重现结果;在从相同输入中探索替代编舞时更改它。
- 保存两个输出:仅含运动的全局预览和最终音频同步渲染。首先查看预览以节省时间。
致谢#
此工作流程实现并建立在以下作品和资源之上。我们感谢 Comfy-Org 提供的官方 ComfyUI Wan Dancer 工作流程指南,Wan-AI 提供的 Wan-Dancer-14B 官方模型,以及 Comfy-Org 提供的 Wan Dancer 模型文件的贡献和维护。有关权威细节,请参阅下面链接的原始文档和存储库。
资源#
- Comfy-Org/Official ComfyUI Wan Dancer 工作流程指南
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- Docs / Release Notes: Official ComfyUI Wan Dancer 工作流程指南
- Wan-AI/Wan-Dancer-14B 官方模型
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Comfy-Org/Wan Dancer 模型文件
- Hugging Face: Comfy-Org/Wan-Dancer
注意:使用引用的模型、数据集和代码受其作者和维护者提供的各自许可和条款的约束。


