LTX 2.3 Синхронизация речи и пения: Рабочий процесс ComfyUI от портрета до перформанса#
LTX 2.3 Синхронизация речи и пения превращает четкий фронтальный портрет и голос или песню в кинематографическое видео цифрового человека с выразительным, синхронизированным движением рта. Создан для RunComfy, он использует генерацию видео LTX 2.3 с узлами LTXV ComfyUI и аудиоразделение Mel-Band RoFormer, чтобы сохранить лицо читаемым, одновременно соответствуя речи или тексту песни.
Этот рабочий процесс ComfyUI подходит для AI музыкальных видео, виртуальных певцов, тестов производительности персонажей и демонстраций для создателей, где и исполнитель на экране, и финальный аудио должны оставаться пригодными для использования. Вы предоставляете портретное изображение и аудиотрек, выбираете частоту кадров и продолжительность, и конвейер рендерит mp4 с синхронизацией губ, выровненной с вашим треком.
Примечание: Для особенно впечатляющих результатов мы настоятельно рекомендуем генерировать песню с помощью Ace Step Model, а затем создавать четкий кинематографический портрет с помощью Seedream 5.0 Pro. Используйте эти два ресурса в качестве аудио и портретных входных данных для этого рабочего процесса, чтобы получить более отточенное выступление цифрового человека.
Ключевые модели в рабочем процессе Comfyui LTX 2.3 Синхронизация речи и пения#
- Модель генерации видео LTX-2.3 от Lightricks. Трансформер-генератор аудио-видео, который сочетает аудиофункции с визуальным движением для создания временно согласованных кадров, подходящих для речи и пения. Карта модели и официальное хранилище.
- Видео VAE и аудио VAE LTX-2.3. Латентные кодировщики/декодеры, которые упаковывают видео и аудио в AV латентное пространство, используемое LTX-2.3, обеспечивая эффективное выборку и чистую реконструкцию. Реализовано в интеграции LTX ComfyUI. ComfyUI-LTXVideo.
- MelBandRoFormer. Современная модель разделения источников музыки, используемая здесь для опционального извлечения вокала для более чистой кондиции губ, сохраняя ваш оригинальный микс для финального рендера. Веса и узел ComfyUI.
Как использовать рабочий процесс Comfyui LTX 2.3 Синхронизация речи и пения#
Рабочий процесс выполняется в три этапа: Ввод, Генерация LTX 2.3 и Экспорт. Группы работают вместе от начала до конца, чтобы превратить ваш портрет и аудио в синхронизированное выступление.
ВВОД#
Загрузите портрет с лицом вперед, используя Character Image (front view + 9:16, recommended) (#444). Изображение изменяется по размеру для модели и слегка предварительно обрабатывается, чтобы сохранить идентичность и детали области рта. Загрузите свою песню или голос с помощью Upload Song or Voice (#1755), затем установите Start lip-sync from which second? e.g. 10.0 (seconds) (#1776), если вы хотите пропустить вступительные такты или тишину. Выберите продолжительность с помощью Duration in seconds (best under 35s; enter 0 for full audio) (#1583) и установите Frame Rate (#1586) для рендера. Напишите намерение в Prompt (#1624), чтобы направить выражение и поведение камеры; рабочий процесс также вводит полезные негативные подсказки, чтобы избежать субтитров, водяных знаков и статичных кадров.
Цифровой человек LTX2.3 Синхронизация речи/пения#
Ваш портрет преобразуется в начальный латентный клип с помощью LTXV Preprocess (#446) и LTXVImgToVideoInplaceKJ (#1762). Управляйте тем, насколько сильно портрет закреплен, используя IMG STRENGTH. Set 0 for T2I mode (#1722): более высокие значения фиксируют на фото, тогда как более низкие значения позволяют больше генеративного движения. Аудиопуть обрезает вашу загрузку, опционально разделяет вокал с помощью Mel-Band RoFormer Sampler (#1599) и кодирует выбранный трек через LTXV Audio VAE Encode (#1605). Аудио и видео латенты объединяются с помощью LTXV Concat AV Latent (#350), а текстовое кондиционирование из узлов CLIP Text Encode управляет общим намерением сцены и чистотой через LTXVConditioning (#164). Модель LTX-2.3 патчится и направляется для точности губ с помощью LTX2 NAG (#508), затем выборка производится с помощью SamplerCustomAdvanced (#161) под выбранным планировщиком и семплером.
Экспорт и сохранение#
После выборки видео латент декодируется с помощью VAE Decode (#1318) в кадры. Video Combine 🎥🅥🅗🅢 (#1747) объединяет эти кадры с вашим обрезанным оригинальным аудио, чтобы создать mp4 с вашей выбранной частотой кадров. Если вы включили только вокал для кондиции, финальный экспорт все равно использует полный микс, чтобы ваш результат оставался готовым к распространению. Выход сохраняется с четким префиксом для легкой версии.
Ключевые узлы в рабочем процессе Comfyui LTX 2.3 Синхронизация речи и пения#
LTXVImgToVideoInplaceKJ (#1762)#
Преобразует эталонный портрет в начальное латентное видео. Настройте IMG STRENGTH. Set 0 for T2I mode (#1722), чтобы сбалансировать закрепление идентичности и свободу движения. Для точного сходства и стабильной позы головы держите силу выше; для более выразительного движения уменьшите её. Если вы установите её на 0, относитесь к рабочему процессу как к тексту-видео и больше полагайтесь на подсказку и аудио.
Mel-Band RoFormer Sampler (#1599)#
Разделяет вокал из песни, чтобы подать более чистые речевые характеристики в модель. Используйте USE VOCALS ONLY (#1616), когда инструментал доминирует или когда согласные теряются; держите его выключенным, когда вы хотите, чтобы весь микс влиял на выразительность. Финальный рендер использует оригинальное обрезанное аудио, сохраняя ваш задуманный саундтрек. См. детали модели в расширении ComfyUI и ссылки на веса выше.
LTXV Audio VAE Encode (#1605)#
Кодирует выбранное аудио в латентное пространство аудио LTX, которое управляет формами рта и микроэкспрессиями. Обрежьте очевидные паузы перед кодированием для более быстрой синхронизации. Соедините с смещением времени начала, если ваша текстовая запись не начинается с 0 секунд.
LTX2 NAG (#508)#
Применяет шумовое направленное руководство, адаптированное для LTX 2.3, чтобы улучшить связь аудио-губы. Если губы кажутся недостаточно анимированными, немного увеличьте его руководство; если зубы или формы рта выглядят чрезмерно, уменьшите эффект. Наилучшие результаты достигаются небольшими, постепенными изменениями, так как этот контроль взаимодействует с вашей силой подсказки и настройками семплера. Реализация находится в репозиториях LTX.
SamplerCustomAdvanced (#161)#
Запускает процесс денойзинга с вашим выбранным KSamplerSelect (#154), CFG Guider (#153) и планировщиком. Более низкое руководство без классификатора обычно способствует естественному движению и сохранению идентичности; более высокие значения увеличивают доминирование подсказки, но могут сделать губы жестче. Если вы переключаете семплеры, сохраняйте остальные настройки неизменными для честного сравнения A/B.
Video Combine 🎥🅥🅗🅢 (#1747)#
Записывает финальное mp4, комбинируя кадры и обрезанное аудио. Оставьте настройки по умолчанию для широкой совместимости или увеличьте качество, если планируете последующую цветокоррекцию. Убедитесь, что frame_rate соответствует вашему творческому замыслу и совпадает с тем, что вы установили ранее.
Дополнительные возможности#
- Используйте чистый, фронтальный портрет с нейтральным освещением и обрезкой 9:16 для наиболее убедительных результатов LTX 2.3 Синхронизация речи и пения.
- Если инструменты маскируют согласные, включите
USE VOCALS ONLY(#1616), чтобы модель ориентировалась на более чистый вокальный трек, в то время как ваш экспорт сохраняет полный микс. - Держите клипы короче примерно 35 секунд для более быстрой итерации; соединяйте кадры внешне, если вы создаете длинный музыкальный клип.
- Когда движение слишком статично, уменьшите
IMG STRENGTH; когда идентичность теряется, увеличьте её и упростите подсказку. - Согласуйте текст, обрезая паузы и используя контроль смещения времени начала, чтобы формы губ начинались точно с вашего первого слова.
- Установите фиксированное
Start Seed, чтобы воспроизвести съемку, затем измените seed для альтернатив. - Уважайте сходство и права на музыку при использовании этого рабочего процесса LTX 2.3 Синхронизация речи и пения в публичных проектах.
Ссылки на официальные ресурсы
- Карта модели LTX-2.3: Lightricks/LTX-2.3
- Репозиторий LTX-Video: Lightricks/ltx-video
- ComfyUI-LTXVideo: Lightricks/ComfyUI-LTXVideo
- ComfyUI-MelBandRoFormer: kijai/ComfyUI-MelBandRoFormer
- Веса MelBandRoFormer: Kijai/MelBandRoFormer_comfy
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим Lightricks за LTX-Video (включая модель LTX 2.3 и узлы ComfyUI-LTXVideo), Kijai за MelBandRoFormer (узлы ComfyUI и веса модели), и RunningHub за исходную статью о рабочем процессе за их вклад и поддержку. Для получения авторитетных подробностей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- RunningHub/RunningHub workflow source
- Документы / Примечания к выпуску: RunningHub Post
- Lightricks/LTX 2.3 model
- GitHub: Lightricks/ltx-video
- Hugging Face: Lightricks/LTX-2.3
- Lightricks/LTX-Video official repository
- GitHub: Lightricks/ltx-video
- Hugging Face: Lightricks/LTX-2.3
- Lightricks/ComfyUI-LTXVideo nodes
- GitHub: Lightricks/ComfyUI-LTXVideo
- Kijai/ComfyUI-MelBandRoFormer nodes
- GitHub: kijai/ComfyUI-MelBandRoFormer
- Hugging Face: Kijai/MelBandRoFormer_comfy
- Kijai/MelBandRoFormer ComfyUI model weights
- Hugging Face: Kijai/MelBandRoFormer_comfy
- GitHub: kijai/ComfyUI-MelBandRoFormer
Примечание: Использование ссылочных моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.

