Wan Dancer: изображение-и-музыка в ритм‑синхронизированное танцевальное видео в ComfyUI#
Этот рабочий процесс Wan Dancer превращает одно референсное изображение и музыкальный трек в короткое, ритмически синхронизированное танцевальное видео. Он предназначен для создателей, которые хотят прямого контроля изображения и аудио над хореографией, с простыми переключателями для стиля танца и амплитуды движения. Пайплайн запускает глобальное планирование для черновика движения всего тела и времени, затем проходит локальная доработка, которая уточняет детали и сглаживает движение перед финальной визуализацией видео.
Поскольку Wan Dancer производит полную последовательность за один раз, он идеально подходит для концептуальных танцевальных съемок, быстрых исследований анимации персонажей и музыкальных клипов для социальных сетей. Вы предоставляете чистое изображение персонажа, выбираете стиль, устанавливаете амплитуду, и Wan Dancer выравнивает движение с аудио, сохраняя идентичность.
Ключевые модели в рабочем процессе Comfyui Wan Dancer#
- Wan-Dancer-14B (глобальная модель). Планирует хореографию на дальние расстояния и координацию тела из изображения и аудио, создавая последовательную схему движения. См. официальную карточку модели на Wan-AI/Wan-Dancer-14B и готовые веса Comfy на Comfy-Org/Wan-Dancer.
- Wan-Dancer-14B (локальная модель). Уточняет и интерполирует движение на уровне кадров, добавляя точность в движениях конечностей, рук и головы, оставаясь верным глобальному плану. Веса предоставлены вместе с глобальной моделью на Comfy-Org/Wan-Dancer.
- UMT5-XXL текстовый энкодер. Интерпретирует короткие текстовые подсказки, описывающие стиль танца и визуальные подсказки; упакован для ComfyUI в Comfy-Org/Wan_2.1_ComfyUI_repackaged.
- CLIP Vision H энкодер. Извлекает надежные визуальные особенности из референсного изображения для сохранения идентичности и одежды; предоставлен в том же пакете Comfy: clip_vision_h.safetensors.
- Wan 2.1 VAE. Обрабатывает латентное кодирование/декодирование для видео кадров со стабильным цветом и контрастом; проверенная сборка Comfy доступна в Kijai/WanVideo_comfy.
- Опционально LightX2V Lightning LoRA для I2V. Легкий адаптер, который может ускорить и улучшить синтез движения, когда он включен, упакован в Kijai/WanVideo_comfy.
Как использовать рабочий процесс Comfyui Wan Dancer#
На высоком уровне график выполняет два координированных прохода. Глобальная генерация чертит хореографию и создает быстрое видео превью. Локальная генерация затем заполняет ключевые кадры, выравнивает аудио и уточняет детали для финального результата. Вы контролируете внешний вид и движение через компактные селекторы подсказок, а также небольшой набор видео и временных параметров.
Настройки видео#
Эта группа определяет ширину, высоту и длину последовательности вывода для обоих проходов. Размеры автоматически подстраиваются под удобные для оборудования множители, так что вы можете сосредоточиться на соотношении сторон и разрешении. Длинные клипы и большие кадры потребляют больше VRAM, так что используйте эту панель для баланса скорости и качества. Эти настройки напрямую поступают в глобальный WanDancerVideo (#647) и локальный WanDancerVideo (#668).
Подсказка#
Здесь вы выбираете стиль танца и амплитуду движения. Селектор стиля записывает короткую фразу в глобальные и локальные текстовые подсказки, в то время как селектор амплитуды модулирует, насколько энергичными должны быть движения тела. Шаблон поставляется со стилями, такими как китайский классический танец, K‑Pop, уличный танец, латиноамериканский танец и степ, и вы можете добавить свои собственные. Оригинальные строки подсказок на китайском языке; не стесняйтесь локализовать или обогатить их в соответствии с вашим проектом.
Обрезка аудио#
Используйте эту группу, чтобы укоротить длинный музыкальный файл для предварительного просмотра или для соответствия определенной продолжительности финального клипа. Аудио обрезается один раз и передается на обе стадии, глобальную и локальную, сохраняя согласованность ритма. Если вы измените финальную продолжительность, подгонка ключевых кадров и локальный проход автоматически адаптируются. Для быстрой итерации укоротите аудио, проверьте движение, затем восстановите длину для финальной визуализации.
Общие модели#
Эта группа загружает общие активы: текстовый энкодер UMT5-XXL, CLIP Vision H и Wan 2.1 VAE. Они обеспечивают понимание подсказок, идентификационные особенности из вашего изображения и стабильное декодирование кадров. Обычно здесь не требуется действия пользователя, если только вы не меняете энкодеры или другую сборку VAE.
Глобальная модель#
Загружает глобальные веса Wan‑Dancer‑14B. В этом проходе рабочий процесс кодирует ваше референсное изображение и обрезанное аудио, применяет глобальную модель хореографии и создает видео предварительного просмотра, содержащее только движение. Этот этап быстрый и отлично подходит для проверки стиля и амплитуды перед переходом к уточнению.
Глобальная генерация#
Этот блок преобразует референсное изображение и аудио в последовательный черновик танца. Узлы энкодера извлекают текстовые и визуальные особенности, WanDancerEncodeAudio (#651) превращает музыку в ритмические подсказки, а WanDancerVideo (#647) синтезирует полную последовательность. Планировщик и семплер затем удаляют шум с латентных данных до изображений, и узел видео собирает предварительный просмотр. Если черновик кажется несинхронизированным или слишком статичным, отрегулируйте амплитуду или попробуйте другой стиль и пересмотрите.
Переключатель#
Небольшой контрольный раздел переключает, следует ли запускать модель через путь Lightning LoRA или использовать оригинальные веса. Оставьте Lightning включенным для более быстрой итерации и выключите, когда требуется наибольшая точность в воспроизведении базовой контрольной точки Wan Dancer. Дополнительные переключатели управляют, какое количество шагов и значение руководства должен использовать семплер, позволяя вам обменивать скорость на качество на каждом этапе.
Семплер#
Определяет денойзер и график шума, используемые для преобразования латентных планов в кадры. Конфигурация общая между глобальными и локальными проходами для согласованного внешнего вида. Продвинутые пользователи могут экспериментировать с семплерами, но предоставленная настройка является надежным стандартом для видео Wan Dancer. Если вы видите мерцание, немного более сильное руководство в сочетании с более стабильным семплером может помочь.
Локальная модель#
Загружает локальные веса Wan‑Dancer‑14B и, когда включено, применяет тот же Lightning LoRA к этому пути уточнения. Эта модель фокусируется на интерполяции и мелких деталях, таких как руки, волосы и тонкое движение торса, сохраняя черты идентичности, закодированные из вашего изображения. Оставьте этот этап включенным для финальных визуализаций.
Локальная генерация (интерполяция)#
Локальный проход начинается с заполнения ключевых кадров из глобального предварительного просмотра для охвата всей временной шкалы. WanDancerEncodeAudio (#669) перекодирует музыку для локального количества кадров, и WanDancerVideo (#668) создает движение более высокого качества, выровненное с аудио. Уточненные латентные данные декодируются в кадры, затем ребатчируются и собираются в финальное видео с синхронизированным звуком. Используйте этот выход для оценки реалистичности, движения рук и общей полировки.
Семплирование#
Эта вспомогательная группа связывает планировщик, руководство и семплер, используемые в локальном уточнении. Это гарантирует, что локальный проход наследует согласованное время и разрешение от предыдущих групп, в то время как вы можете повысить качество там, где это важно. Если вы изменяете продолжительность или разрешение на предыдущих этапах, этот путь семплера адаптируется без нарушения выравнивания.
Ключевые узлы в рабочем процессе Comfyui Wan Dancer#
Custom Combo (Dance Style) (#695)#
Выбирает категорию танца, которая вставляется в глобальные и локальные текстовые подсказки. Выберите стиль, соответствующий жанру вашей композиции для наилучших результатов, или добавьте свои собственные записи в список. Если движение не совпадает с ритмом, попробуйте стиль с более четкими ритмическими акцентами, прежде чем настраивать другие элементы управления.
Custom Combo (Motion Amplitude) (#694)#
Контролирует, насколько энергичной должна быть хореография. Более низкие значения удерживают движение в рамках для спокойной музыки; более высокие значения увеличивают скорость и амплитуду конечностей для энергичных треков. Если вы замечаете дрейф идентичности или артефакты в экстремальных позах, уменьшите амплитуду на один шаг и пересмотрите.
WanDancerEncodeAudio (#651)#
Кодирует обрезанную музыку в ритмические и интенсивные особенности для глобального прохода. Это управляет выравниванием ритма внутри WanDancerVideo (#647). Для очень мягких вступлений или длинных затуханий рассмотрите возможность обрезки до раздела с четким ритмом, чтобы помочь энкодеру быстро захватить.
WanDancerVideo (#647)#
Синтезирует глобальную хореографию из текстовых, визуальных и аудио особенностей на выбранном разрешении и длине последовательности. Относитесь к этому как к планировщику движений: проверьте время, стиль и общую динамику поз здесь, прежде чем переходить дальше. Если предварительный просмотр слишком шумный по хроматичности, продолжайте; цветовая точность закрепляется на локальном проходе.
WanDancerPadKeyframesList (#670)#
Создает временную шкалу ключевых кадров из глобального вывода и выравнивает их с выбранной продолжительностью. Это гарантирует, что локальный проход видит как визуальные якоря, так и правильный аудиосегмент. Если вы увеличиваете продолжительность, этот узел плавно заполняет пробелы, чтобы локальная модель могла интерполировать чисто.
WanDancerEncodeAudio (#669)#
Перекодирует аудио для локального бюджета кадров после заполнения ключевых кадров. Это сохраняет уточненное движение, фазово заблокированное на музыку. При изменении длины клипа всегда запускайте этот узел, чтобы локальная модель слышала правильный сегмент.
WanDancerVideo (#668)#
Генерирует уточненное, высококачественное движение, обусловленное ключевыми кадрами, особенностями изображения и перекодированным аудио. Используйте его для разрешения движений рук, волос, ряби одежды и тонких поворотов головы, сохраняя идентичность. Если появляются небольшие дрожания, попробуйте более стабильный семплер или немного больше руководства в вашем денойзере.
Switch(Model) (#644)#
Переключает между базовыми весами Wan Dancer и путем, дополненным Lightning LoRA. Оставьте включенным для быстрых черновиков; отключите для максимального соблюдения базовой контрольной точки. Для деликатных материалов, таких как развивающиеся рукава или длинные волосы, базовый путь может лучше сохранить микро‑детали.
TrimAudioDuration (#494)#
Укорачивает входной трек для предварительных просмотров или для соблюдения целевой длины. Это самый быстрый способ итерации стиля и амплитуды без увеличения использования VRAM. После того, как вам понравится движение, восстановите полную секцию и визуализируйте финал.
Дополнительные опции#
- Wan Dancer обрабатывает много кадров за проход и выигрывает от сильного GPU. Для более легкого оборудования уменьшите разрешение или сократите продолжительность во время предварительных просмотров.
- Используйте чистый, хорошо освещенный портрет или референс всего тела с минимальными перекрытиями; загруженные фоны могут сбить с толку идентификационные особенности.
- Соответствуйте стилю танца ритму трека, прежде чем увеличивать амплитуду движения; выбор стиля оказывает наибольшее влияние на правдоподобное движение.
- Зафиксируйте начальное значение шума, чтобы воспроизводить результаты в разных запусках; измените его при исследовании альтернативных хореографий из тех же входных данных.
- Сохраняются два вывода: предварительный просмотр движения и финальная визуализация с синхронизированным аудио. Сначала пересмотрите предварительный просмотр, чтобы сэкономить время.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим Comfy-Org за Официальное руководство по рабочему процессу ComfyUI Wan Dancer, Wan-AI за официальную модель Wan-Dancer-14B и Comfy-Org за файлы модели Wan Dancer за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, связанным ниже.
Ресурсы#
- Comfy-Org/Официальное руководство по рабочему процессу ComfyUI Wan Dancer
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/Wan-Dancer
- Документы / Примечания к выпуску: Официальное руководство по рабочему процессу ComfyUI Wan Dancer
- Wan-AI/Официальная модель Wan-Dancer-14B
- GitHub: Wan-Video/Wan-Dancer
- Hugging Face: Wan-AI/Wan-Dancer-14B
- arXiv: 2607.09581
- Файлы модели Comfy-Org/Wan Dancer
- Hugging Face: Comfy-Org/Wan-Dancer
Примечание: Использование упомянутых моделей, данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и кураторами.

