Wan Dancer: image-and-music to rhythm‑synced dance video in ComfyUI#
このWan Dancerワークフローは、単一のリファレンスイメージと音楽トラックを短いリズム同期されたダンスビデオに変換します。これは、振り付けに直接的なイメージとオーディオのコントロールを望むクリエイター向けに設計されており、ダンススタイルと動きの振幅を簡単に切り替えることができます。パイプラインは全身の動きとタイミングを下書きするグローバルプランニングパスを実行し、詳細をシャープにして最終ビデオをレンダリングする前にスムーズな動きを行うローカルリファインメントパスを実行します。
Wan Dancerは一度に完全なシーケンスを生成するため、ダンスパフォーマンスショットのコンセプト化、クイックキャラクターアニメーションスタディ、音楽駆動のソーシャルクリップに最適です。クリーンなキャラクターイメージを提供し、スタイルを選び、振幅を設定すると、Wan Dancerはオーディオに動きを合わせながらアイデンティティを保持します。
Comfyui Wan Dancerワークフローの主要モデル#
- Wan-Dancer-14B (Global model)。画像とオーディオから長距離の振り付けと体の調整を計画し、一貫した動きの設計図を生成します。公式モデルカードはWan-AI/Wan-Dancer-14Bで、Comfy対応の重みはComfy-Org/Wan-Dancerで確認できます。
- Wan-Dancer-14B (Local model)。フレームレベルの動きを洗練し、四肢、手、頭の動きに精度を追加しながら、グローバルプランに忠実であることを維持します。重みはグローバルモデルとともにComfy-Org/Wan-Dancerで提供されています。
- UMT5‑XXLテキストエンコーダー。ダンススタイルと外観のキューを説明する短いテキストプロンプトを解釈します;ComfyUI用にComfy-Org/Wan_2.1_ComfyUI_repackagedでパッケージ化されています。
- CLIP Vision Hエンコーダー。リファレンスイメージから頑強な視覚特徴を抽出し、アイデンティティと衣装を保持します;同じComfy対応パックで提供されています: clip_vision_h.safetensors。
- Wan 2.1 VAE。安定した色とコントラストを持つビデオフレームの潜在エンコード/デコードを処理します;ComfyでテストされたビルドはKijai/WanVideo_comfyで利用可能です。
- I2V用の任意のLightX2V Lightning LoRA。動きの合成を加速し、鮮明にする軽量アダプターで、Kijai/WanVideo_comfyでパッケージ化されています。
Comfyui Wan Dancerワークフローの使用方法#
高レベルでは、グラフは二つの協調されたパスを実行します。グローバル生成は振り付けを下書きし、クイックビデオプレビューを生成します。ローカル生成はキーフレームをパッドし、オーディオに再調整し、最終出力の詳細を洗練します。外観と動きをコンパクトなプロンプトセレクターを通じて制御し、ビデオと期間の選択肢を少し加えます。
ビデオ設定#
このグループは、両パスの出力幅、高さ、シーケンス長を定義します。寸法はハードウェアに優しい倍数に自動調整されるため、アスペクト比と解像度に集中できます。長いクリップと大きなフレームはVRAMを多く消費するため、このパネルを使用して速度と品質をバランスさせます。これらの設定は、グローバルWanDancerVideo (#647)とローカルWanDancerVideo (#668)に直接送信されます。
プロンプト#
ここではダンススタイルと動きの振幅を選択します。スタイルセレクターはグローバルとローカルのテキストプロンプトに短いフレーズを書き込み、振幅セレクターは体の動きの活発さを調節します。テンプレートには中国古典舞踊、K‑Pop、ストリートダンス、ラテンダンス、タップダンスなどのスタイルが含まれており、独自のスタイルを追加することもできます。元のプロンプト文字列は中国語で記述されており、プロジェクトに合わせてローカライズまたは充実させてください。
オーディオのトリム#
このグループを使用して、プレビュー用に長い音楽ファイルを短縮したり、特定の最終クリップの期間に合わせたりします。オーディオは一度トリムされ、グローバルおよびローカルステージに渡され、ビートのタイミングが一貫しています。最終期間を変更すると、下流のキーフレームパディングとローカルパスが自動的に適応します。クイックイテレーションのためにオーディオを短縮し、動きを確認してから、最終レンダリングのために長さを復元します。
共通モデル#
このグループは共有アセットをロードします:UMT5‑XXLテキストエンコーダー、CLIP Vision H、およびWan 2.1 VAE。プロンプトの理解、画像からのアイデンティティ特徴、およびフレームの安定したデコードを提供します。エンコーダーを交換したり、異なるVAEビルドを使用しない限り、通常はユーザーのアクションは必要ありません。
グローバルモデル#
Wan‑Dancer‑14Bグローバル重みをロードします。このパスでは、ワークフローがリファレンスイメージとトリムされたオーディオをエンコードし、グローバル振り付けモデルを適用し、動きのみのプレビュー動画を生成します。このステージは高速で、洗練にコミットする前にスタイルと振幅を検証するのに最適です。
グローバル生成#
このブロックは、リファレンスイメージとオーディオを一貫したダンスの下書きに変換します。エンコーダーノードはテキストと視覚的特徴を抽出し、WanDancerEncodeAudio (#651)は音楽をリズムキューに変換し、WanDancerVideo (#647)は完全なシーケンスを合成します。スケジューラーとサンプラーは潜在を画像にデノイズし、ビデオノードはプレビューを組み立てます。下書きがビートから外れている、または静的すぎる場合は、振幅を調整するか、異なるスタイルを試して再プレビューします。
スイッチ#
小さなコントロールセクションで、モデルをLightning LoRAパスまたは元の重みを通して実行するかどうかを切り替えます。より速いイテレーションのためにLightningをオンにし、ベースのWan Dancerチェックポイントへの最も忠実な再現が必要な場合はオフにします。追加のスイッチは、サンプラーがどのステップ数とガイダンス値を使用するかをゲートし、ステージごとに速度と品質をトレードオフできます。
サンプラー#
潜在計画をフレームに変換するために使用されるデノイザーとノイズスケジュールを定義します。構成はグローバルおよびローカルパス間で一貫した外観を維持するために共有されています。上級ユーザーはサンプラーで実験できますが、提供された設定はWan Dancerビデオのための堅実なデフォルトです。ちらつきが見られる場合は、より強いガイダンスと安定したサンプラーを組み合わせることで改善できます。
ローカルモデル#
Wan‑Dancer‑14Bローカル重みをロードし、有効にされている場合は、このリファインメントパスに同じLightning LoRAを適用します。このモデルは補間と手、髪、微妙な胴体の動きのような細部に焦点を当て、あなたの画像からエンコードされたアイデンティティ特性を維持します。最終レンダリングのためにこのステージを有効にしておいてください。
ローカル生成(補間)#
ローカルパスは、グローバルプレビューからのキーフレームをパッドして完全なタイムラインをカバーすることから始まります。WanDancerEncodeAudio (#669)はローカルフレーム数に合わせて音楽を再エンコードし、WanDancerVideo (#668)はオーディオに整列した高精細な動きを生成します。洗練された潜在はフレームにデコードされ、再バッチされ、同期されたサウンドとともに最終ビデオに組み立てられます。この出力を使用して、リアリズム、手の動き、全体的な仕上がりを判断します。
サンプリング#
このサポートグループは、ローカルリファインメントで使用されるスケジューラー、ガイダー、およびサンプラーを結び付けます。これにより、ローカルパスは早期のグループから一貫したタイミングと解像度を継承し、品質を押し上げることができます。上流で期間または解像度を変更する場合、このサンプラーパスは整合性を保ちながら適応します。
Comfyui Wan Dancerワークフローの主要ノード#
Custom Combo (Dance Style) (#695)#
グローバルおよびローカルテキストプロンプトに挿入されるダンスカテゴリを選択します。トラックのジャンルに合ったスタイルを選択して最良の結果を得るか、リストに独自のエントリーを追加します。動きがビートに一致していないように見える場合は、他のコントロールを調整する前にリズムのアクセントが明確なスタイルを試してください。
Custom Combo (Motion Amplitude) (#694)#
振り付けがどれだけエネルギッシュであるべきかを制御します。低い値は穏やかな音楽のために動きを抑え、高い値はエネルギッシュなトラックのために移動距離と四肢の速度を増加させます。極端なポーズでアイデンティティがずれる、またはアーティファクトが現れる場合は、振幅を一段階下げて再プレビューします。
WanDancerEncodeAudio (#651)#
トリムされた音楽をリズムと強度の特徴にエンコードし、グローバルパスでのビート整合を促進します。非常にソフトなイントロや長いフェードの場合は、エンコーダーが素早くロックオンするのを助けるために、クリアなビートのあるセクションにトリムすることを検討してください。
WanDancerVideo (#647)#
選択した解像度とシーケンス長でテキスト、画像、およびオーディオ特徴からグローバル振り付けを合成します。これをモーションプランナーとして扱い、タイミング、スタイル、一般的なポーズのダイナミクスをここで確認します。プレビューがクロマノイズが多すぎる場合は、続けてください;色の忠実度はローカルパスで固まります。
WanDancerPadKeyframesList (#670)#
グローバル出力からキーフレームのタイムラインを構築し、選択した期間に整列させます。これにより、ローカルパスが視覚的アンカーと正しいオーディオセグメントの両方を確認できます。期間を延長する場合、このノードはギャップをスムーズに埋めるので、ローカルモデルがクリーンに補間できます。
WanDancerEncodeAudio (#669)#
キーフレームパディング後にローカルフレーム予算のためにオーディオを再エンコードします。これにより、洗練された動きが音楽に位相ロックされます。クリップの長さを変更する場合は、常にこのノードを実行して、ローカルモデルが正しいセグメントを聞くことができるようにします。
WanDancerVideo (#668)#
キーフレーム、画像特徴、および再エンコードされたオーディオに基づいて、洗練された高精細な動きを生成します。手、髪、衣服の波紋、微妙な頭の向きなどを解決しながら、アイデンティティを維持します。小さなジッターが現れた場合は、より安定したサンプラーまたはデノイザーで少し多くのガイダンスを試してください。
Switch(Model) (#644)#
基礎のWan Dancer重みとLightning LoRAで強化されたパスを切り替えます。素早いドラフトのために有効にしておき、ベースチェックポイントへの最大の忠実性が必要な場合は無効にします。流れる袖や長い髪のような繊細な素材には、ベースパスが微細なディテールをよりよく保持できます。
TrimAudioDuration (#494)#
プレビュー用に入力トラックを短縮したり、目標長を強制したりします。スタイルと振幅を増加させることなく、VRAM使用量を増やさずにイテレーションするための最も迅速な方法です。動きが気に入ったら、完全なセクションを復元して最終レンダリングを行います。
オプションの追加機能#
- Wan Dancerはパスごとに多くのフレームを処理し、強力なGPUの恩恵を受けます。軽量なハjson
ードウェアの場合、プレビュー中に解像度を下げたり、期間を短くしたりしてください。
- 清潔でよく照らされた肖像画または全身のリファレンスを使用し、遮蔽が最小限のものを使用してください;忙しい背景はアイデンティティ特徴を混乱させる可能性があります。
- ダンススタイルをトラックのグルーブに合わせてから、動きの振幅を上げてください;スタイルの選択は信じられる動きに最も大きな影響を与えます。
- ノイズシードを固定して、同じ入力からの異なる振り付けを探索するときに結果を再現します。
- 2つの出力が保存されます:動きのみのグローバルプレビューと最終的なオーディオ同期レンダリング。時間を節約するためにまずプレビューを確認してください。
謝辞#
このワークフローは、次の作品とリソースを実装および構築しています。公式ComfyUI Wan DancerワークフローガイドのためのComfy-Org、Wan-Dancer-14B公式モデルのためのWan-AI、およびその貢献と維持のためのComfy-Orgに感謝します。権威ある詳細については、以下にリンクされた元のドキュメントとリポジトリを参照してください。
リソース#
- Comfy-Org/Official ComfyUI Wan Dancerワークフローガイド
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- ドキュメント / リリースノート: Official ComfyUI Wan Dancerワークフローガイド
- Wan-AI/Wan-Dancer-14B公式モデル
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Comfy-Org/Wan Dancerモデルファイル
- Hugging Face: Comfy-Org/Wan-Dancer
注: 参照されているモデル、データセット、コードの使用は、それぞれの著者と管理者によって提供されるライセンスと条件に従うものとします。

