Wan Dancer: 圖像與音樂同步舞蹈視頻在 ComfyUI#
這個 Wan Dancer 工作流程將單個參考圖像和音樂曲目轉換為短節奏同步的舞蹈視頻。它專為希望直接控制編舞圖像和音頻的創作者設計,具有簡單的開關以調整舞蹈風格和運動幅度。該管道運行全局計劃通過繪製整體身體運動和時間,然後進行局部精細化以在渲染最終視頻之前銳化細節和平滑運動。
由於 Wan Dancer 一次生成完整的序列,因此非常適合構思舞蹈表演鏡頭、快速角色動畫研究和音樂驅動的社交剪輯。您提供乾淨的角色圖像,選擇風格,設置幅度,Wan Dancer 在保持身份的同時將運動與音頻對齊。
Comfyui Wan Dancer 工作流程中的關鍵模型#
- Wan-Dancer-14B(全局模型)。從圖像和音頻中規劃長程編舞和身體協調,生成連貫的運動藍圖。查看官方模型卡在 Wan-AI/Wan-Dancer-14B 和 Comfy-ready 權重在 Comfy-Org/Wan-Dancer。
- Wan-Dancer-14B(局部模型)。細化和插值幀級運動以增加四肢、手和頭部運動的精確度,同時忠實於全局計劃。權重與全局模型一起提供在 Comfy-Org/Wan-Dancer。
- UMT5-XXL 文本編碼器。解釋描述舞蹈風格和外觀提示的短文本提示;打包在 ComfyUI 中 Comfy-Org/Wan_2.1_ComfyUI_repackaged。
- CLIP Vision H 編碼器。從參考圖像中提取強大的視覺特徵以保持身份和服裝;提供在相同的 Comfy-ready 包中:clip_vision_h.safetensors。
- Wan 2.1 VAE。處理視頻幀的潛在編碼/解碼,穩定顏色和對比度;一個 Comfy 測試的構建可在 Kijai/WanVideo_comfy。
- 可選 LightX2V Lightning LoRA 用於 I2V。一個輕量級的適配器,可以在啟用時加速和清晰化運動合成,打包在 Kijai/WanVideo_comfy。
如何使用 Comfyui Wan Dancer 工作流程#
在高層次上,圖形運行兩個協調的通道。全局生成草擬編舞並生成快速視頻預覽。局部生成然後填充關鍵幀,重新對齊音頻,並細化細節以獲得最終輸出。您可以通過緊湊的提示選擇器以及一小組視頻和持續時間選擇來控制外觀和運動。
視頻設置#
此組定義兩個通道的輸出寬度、高度和序列長度。尺寸自動調整為硬件友好的倍數,因此您可以專注於縱橫比和分辨率。較長的剪輯和較大的幀會消耗更多的 VRAM,因此使用此面板來平衡速度和質量。這些設置直接進入全局 WanDancerVideo (#647) 和局部 WanDancerVideo (#668)。
提示#
在這裡您選擇舞蹈風格和運動幅度。風格選擇器將短語插入全局和局部文本提示,而幅度選擇器調節身體運動的活力。模板附帶的風格如中國古典舞、K-Pop、街舞、拉丁舞和踢踏舞,您可以添加自己的風格。原始提示字符串是中文;隨意本地化或豐富它們以適應您的項目。
修剪音頻#
使用此組縮短長音樂文件以進行預覽或匹配特定的最終剪輯時長。音頻修剪一次並傳遞給全局和局部階段,保持節拍時間一致。如果您更改最終時長,下游關鍵幀填充和局部通道將自動適應。為了快速迭代,縮短音頻,驗證運動,然後恢復長度以進行最終渲染。
通用模型#
此組加載共享資產:UMT5-XXL 文本編碼器、CLIP Vision H 和 Wan 2.1 VAE。它們提供提示理解、圖像中的身份特徵和幀的穩定解碼。除非您更換編碼器或不同的 VAE 構建,否則通常不需要用戶操作。
全局模型#
加載 Wan-Dancer-14B 全局權重。在此通道中,工作流程編碼您的參考圖像和修剪後的音頻,應用全局編舞模型,並生成僅運動預覽視頻。此階段速度快,非常適合在精細化之前驗證風格和幅度。
全局生成#
此塊將參考圖像和音頻轉換為舞蹈的連貫草稿。編碼器節點提取文本和視覺特徵,WanDancerEncodeAudio (#651) 將音樂轉換為節奏提示,WanDancerVideo (#647) 合成完整序列。調度器和取樣器然後將潛在去噪為圖像,視頻節點組裝預覽。如果草稿感覺不合拍或過於靜態,調整幅度或嘗試不同的風格並重新預覽。
開關#
一個小的控制部分切換是否通過 Lightning LoRA 路徑運行模型或原始權重。保持 Lightning 開啟以加快迭代速度,當您需要最忠實於基礎 Wan Dancer 檢查點時關閉。其他開關控制採樣器應使用的步數和指導值,讓您在每個階段之間權衡速度和質量。
採樣器#
定義用於將潛在計劃轉換為幀的去噪器和噪聲計劃。配置在全局和局部通道之間共享以獲得一致的外觀。高級用戶可以嘗試使用採樣器,但提供的設置是 Wan Dancer 視頻的穩固默認值。如果您看到閃爍,稍強的指導結合更穩定的採樣器可以有所幫助。
局部模型#
加載 Wan-Dancer-14B 局部權重,並在啟用時將相同的 Lightning LoRA 應用於此精細化路徑。此模型專注於插值和精細細節,如手、頭髮和微妙的軀幹運動,同時保持從圖像編碼的身份特徵。保持此階段啟用以進行最終渲染。
局部生成(插值)#
局部通道從全局預覽填充關鍵幀以覆蓋完整時間線。WanDancerEncodeAudio (#669) 重新編碼音樂以適應局部幀數,WanDancerVideo (#668) 生成與音頻對齊的高保真運動。精細化的潛在解碼為幀,然後重新批處理並組裝成最終視頻與同步的聲音。使用此輸出來判斷現實主義、手部運動和整體拋光。
採樣#
此支持組將調度器、指導器和採樣器聯繫在一起,用於局部精細化。它確保局部通道繼承早期組的時間和分辨率的一致性,同時讓您在需要的地方提升質量。如果您改變上游的持續時間或分辨率,此採樣器路徑將適應而不會破壞對齊。
Comfyui Wan Dancer 工作流程中的關鍵節點#
Custom Combo (Dance Style) (#695)#
選擇插入到全局和局部文本提示中的舞蹈類別。選擇與您音軌風格匹配的風格以獲得最佳效果,或添加自己的條目到列表中。如果運動看起來與節拍不匹配,請嘗試使用節奏更清晰的風格,然後再調整其他控制。
Custom Combo (Motion Amplitude) (#694)#
控制編舞應有的活力程度。較低的值保持運動在柔和音樂中受限;較高的值增加旅行和四肢速度以適應活力的曲目。如果您注意到在極端姿勢中身份漂移或出現偽影,請降低幅度一個步驟並重新預覽。
WanDancerEncodeAudio (#651)#
將修剪後的音樂編碼為節奏和強度特徵以用於全局通道。這驅動著 WanDancerVideo (#647) 中的節拍對齊。對於非常柔和的開場或長淡出,考慮修剪到有明確節拍的段落以幫助編碼器快速鎖定。
WanDancerVideo (#647)#
在選擇的分辨率和序列長度下,從文本、圖像和音頻特徵合成全局編舞。將其視為運動規劃器:在繼續之前驗證時間、風格和一般姿勢動態。如果預覽顏色噪點過多,請繼續;顏色保真度在局部通道中得到鞏固。
WanDancerPadKeyframesList (#670)#
從全局輸出構建關鍵幀時間線並將其對齊到選擇的持續時間。這確保局部通道看到視覺錨點和正確的音頻段。如果您延長持續時間,這個節點會平滑填補空白,以便局部模型可以干淨地插值。
WanDancerEncodeAudio (#669)#
在關鍵幀填充後重新編碼局部幀預算的音頻。這保持精細化運動相位鎖定到音樂。更改剪輯長度時,始終運行此節點以便局部模型聽到正確的段落。
WanDancerVideo (#668)#
生成以關鍵幀、圖像特徵和重新編碼音頻為條件的精細化、高保真運動。使用它來解決手、頭髮、衣服的波動和微妙的頭部轉動,同時保持身份。如果出現小抖動,嘗試更穩定的採樣器或在去噪器中稍微多一點指導。
Switch(Model) (#644)#
在基礎 Wan Dancer 權重和 Lightning LoRA 增強路徑之間切換。保持啟用以獲得快速草稿;禁用以最大程度地遵循基礎檢查點。對於精細材料如流動的袖子或長髮,基礎路徑可以更好地保留微細節。
TrimAudioDuration (#494)#
縮短輸入曲目以進行預覽或強制執行目標長度。這是迭代風格和幅度的最快方法,而不增加 VRAM 使用量。在您喜歡運動後,恢復完整部分並渲染最終。
可選擇的額外功能#
- Wan Dancer 每次處理許多幀,受益於強大的 GPU。對於較輕的硬件,預覽期間降低分辨率或縮短持續時間。
- 使用乾淨、光線充足的肖像或全身參考,最小遮擋;繁忙的背景可能會混淆身份特徵。
- 在提高運動幅度之前,將舞蹈風格與曲調的節奏匹配;風格選擇對可信的運動影響最大。
- 固定噪聲種子以跨運行重現結果;在從相同輸入探索替代編舞時更改它。
- 保存兩個輸出:僅運動的全局預覽和最終音頻同步渲染。先查看預覽以節省時間。
致謝#
此工作流程實現並建立在以下作品和資源之上。我們感謝 Comfy-Org 提供的官方 ComfyUI Wan Dancer 工作流程指南,Wan-AI 提供的 Wan-Dancer-14B 官方模型,以及 Comfy-Org 提供的 Wan Dancer 模型文件的貢獻和維護。有關權威詳細信息,請參閱下列原始文檔和存儲庫。
資源#
- Comfy-Org/官方 ComfyUI Wan Dancer 工作流程指南
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- Docs / 發布說明: 官方 ComfyUI Wan Dancer 工作流程指南
- Wan-AI/Wan-Dancer-14B 官方模型
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Comfy-Org/Wan Dancer 模型文件
- Hugging Face: Comfy-Org/Wan-Dancer
注意:使用所引用的模型、數據集和代碼受其作者和維護者提供的各自許可和條款約束。

