ComfyUI>Рабочие процессы>LTX 2.3 Создатель видео с синхронизацией речи и пения

LTX 2.3 Создатель видео с синхронизацией речи и пения

Workflow Name: RunComfy/LTX-2.3-Talking-Sync
Workflow ID: 0000...1461
Этот рабочий процесс позволяет преобразовывать портретные изображения в говорящие или поющие видео с естественной синхронизацией рта. Он помогает дизайнерам и создателям оживлять статичных персонажей для повествования, музыкальных клипов или интерактивного контента. Основан на передовом разделении аудио, он обеспечивает четкость вокала и точное движение губ. Вы можете легко генерировать результаты кинематографического качества, соответствующие выражению лица и ритму речи. Идеально подходит для анимации цифровых людей, виртуальных певцов и тестирования производительности.

ComfyUI LTX 2.3 Talking and Singing Lip Sync Workflow

LTX 2.3 Talking and Singing Lip Sync in ComfyUI | Portrait2Video Sync
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Talking and Singing Lip Sync Examples

LTX 2.3 Синхронизация речи и пения: Рабочий процесс ComfyUI от портрета до перформанса#

LTX 2.3 Синхронизация речи и пения превращает четкий фронтальный портрет и голос или песню в кинематографическое видео цифрового человека с выразительным, синхронизированным движением рта. Создан для RunComfy, он использует генерацию видео LTX 2.3 с узлами LTXV ComfyUI и аудиоразделение Mel-Band RoFormer, чтобы сохранить лицо читаемым, одновременно соответствуя речи или тексту песни.

Этот рабочий процесс ComfyUI подходит для AI музыкальных видео, виртуальных певцов, тестов производительности персонажей и демонстраций для создателей, где и исполнитель на экране, и финальный аудио должны оставаться пригодными для использования. Вы предоставляете портретное изображение и аудиотрек, выбираете частоту кадров и продолжительность, и конвейер рендерит mp4 с синхронизацией губ, выровненной с вашим треком.

Примечание: Для особенно впечатляющих результатов мы настоятельно рекомендуем генерировать песню с помощью Ace Step Model, а затем создавать четкий кинематографический портрет с помощью Seedream 5.0 Pro. Используйте эти два ресурса в качестве аудио и портретных входных данных для этого рабочего процесса, чтобы получить более отточенное выступление цифрового человека.

Ключевые модели в рабочем процессе Comfyui LTX 2.3 Синхронизация речи и пения#

  • Модель генерации видео LTX-2.3 от Lightricks. Трансформер-генератор аудио-видео, который сочетает аудиофункции с визуальным движением для создания временно согласованных кадров, подходящих для речи и пения. Карта модели и официальное хранилище.
  • Видео VAE и аудио VAE LTX-2.3. Латентные кодировщики/декодеры, которые упаковывают видео и аудио в AV латентное пространство, используемое LTX-2.3, обеспечивая эффективное выборку и чистую реконструкцию. Реализовано в интеграции LTX ComfyUI. ComfyUI-LTXVideo.
  • MelBandRoFormer. Современная модель разделения источников музыки, используемая здесь для опционального извлечения вокала для более чистой кондиции губ, сохраняя ваш оригинальный микс для финального рендера. Веса и узел ComfyUI.

Как использовать рабочий процесс Comfyui LTX 2.3 Синхронизация речи и пения#

Рабочий процесс выполняется в три этапа: Ввод, Генерация LTX 2.3 и Экспорт. Группы работают вместе от начала до конца, чтобы превратить ваш портрет и аудио в синхронизированное выступление.

ВВОД#

Загрузите портрет с лицом вперед, используя Character Image (front view + 9:16, recommended) (#444). Изображение изменяется по размеру для модели и слегка предварительно обрабатывается, чтобы сохранить идентичность и детали области рта. Загрузите свою песню или голос с помощью Upload Song or Voice (#1755), затем установите Start lip-sync from which second? e.g. 10.0 (seconds) (#1776), если вы хотите пропустить вступительные такты или тишину. Выберите продолжительность с помощью Duration in seconds (best under 35s; enter 0 for full audio) (#1583) и установите Frame Rate (#1586) для рендера. Напишите намерение в Prompt (#1624), чтобы направить выражение и поведение камеры; рабочий процесс также вводит полезные негативные подсказки, чтобы избежать субтитров, водяных знаков и статичных кадров.

Цифровой человек LTX2.3 Синхронизация речи/пения#

Ваш портрет преобразуется в начальный латентный клип с помощью LTXV Preprocess (#446) и LTXVImgToVideoInplaceKJ (#1762). Управляйте тем, насколько сильно портрет закреплен, используя IMG STRENGTH. Set 0 for T2I mode (#1722): более высокие значения фиксируют на фото, тогда как более низкие значения позволяют больше генеративного движения. Аудиопуть обрезает вашу загрузку, опционально разделяет вокал с помощью Mel-Band RoFormer Sampler (#1599) и кодирует выбранный трек через LTXV Audio VAE Encode (#1605). Аудио и видео латенты объединяются с помощью LTXV Concat AV Latent (#350), а текстовое кондиционирование из узлов CLIP Text Encode управляет общим намерением сцены и чистотой через LTXVConditioning (#164). Модель LTX-2.3 патчится и направляется для точности губ с помощью LTX2 NAG (#508), затем выборка производится с помощью SamplerCustomAdvanced (#161) под выбранным планировщиком и семплером.

Экспорт и сохранение#

После выборки видео латент декодируется с помощью VAE Decode (#1318) в кадры. Video Combine 🎥🅥🅗🅢 (#1747) объединяет эти кадры с вашим обрезанным оригинальным аудио, чтобы создать mp4 с вашей выбранной частотой кадров. Если вы включили только вокал для кондиции, финальный экспорт все равно использует полный микс, чтобы ваш результат оставался готовым к распространению. Выход сохраняется с четким префиксом для легкой версии.

Ключевые узлы в рабочем процессе Comfyui LTX 2.3 Синхронизация речи и пения#

LTXVImgToVideoInplaceKJ (#1762)#

Преобразует эталонный портрет в начальное латентное видео. Настройте IMG STRENGTH. Set 0 for T2I mode (#1722), чтобы сбалансировать закрепление идентичности и свободу движения. Для точного сходства и стабильной позы головы держите силу выше; для более выразительного движения уменьшите её. Если вы установите её на 0, относитесь к рабочему процессу как к тексту-видео и больше полагайтесь на подсказку и аудио.

Mel-Band RoFormer Sampler (#1599)#

Разделяет вокал из песни, чтобы подать более чистые речевые характеристики в модель. Используйте USE VOCALS ONLY (#1616), когда инструментал доминирует или когда согласные теряются; держите его выключенным, когда вы хотите, чтобы весь микс влиял на выразительность. Финальный рендер использует оригинальное обрезанное аудио, сохраняя ваш задуманный саундтрек. См. детали модели в расширении ComfyUI и ссылки на веса выше.

LTXV Audio VAE Encode (#1605)#

Кодирует выбранное аудио в латентное пространство аудио LTX, которое управляет формами рта и микроэкспрессиями. Обрежьте очевидные паузы перед кодированием для более быстрой синхронизации. Соедините с смещением времени начала, если ваша текстовая запись не начинается с 0 секунд.

LTX2 NAG (#508)#

Применяет шумовое направленное руководство, адаптированное для LTX 2.3, чтобы улучшить связь аудио-губы. Если губы кажутся недостаточно анимированными, немного увеличьте его руководство; если зубы или формы рта выглядят чрезмерно, уменьшите эффект. Наилучшие результаты достигаются небольшими, постепенными изменениями, так как этот контроль взаимодействует с вашей силой подсказки и настройками семплера. Реализация находится в репозиториях LTX.

SamplerCustomAdvanced (#161)#

Запускает процесс денойзинга с вашим выбранным KSamplerSelect (#154), CFG Guider (#153) и планировщиком. Более низкое руководство без классификатора обычно способствует естественному движению и сохранению идентичности; более высокие значения увеличивают доминирование подсказки, но могут сделать губы жестче. Если вы переключаете семплеры, сохраняйте остальные настройки неизменными для честного сравнения A/B.

Video Combine 🎥🅥🅗🅢 (#1747)#

Записывает финальное mp4, комбинируя кадры и обрезанное аудио. Оставьте настройки по умолчанию для широкой совместимости или увеличьте качество, если планируете последующую цветокоррекцию. Убедитесь, что frame_rate соответствует вашему творческому замыслу и совпадает с тем, что вы установили ранее.

Дополнительные возможности#

  • Используйте чистый, фронтальный портрет с нейтральным освещением и обрезкой 9:16 для наиболее убедительных результатов LTX 2.3 Синхронизация речи и пения.
  • Если инструменты маскируют согласные, включите USE VOCALS ONLY (#1616), чтобы модель ориентировалась на более чистый вокальный трек, в то время как ваш экспорт сохраняет полный микс.
  • Держите клипы короче примерно 35 секунд для более быстрой итерации; соединяйте кадры внешне, если вы создаете длинный музыкальный клип.
  • Когда движение слишком статично, уменьшите IMG STRENGTH; когда идентичность теряется, увеличьте её и упростите подсказку.
  • Согласуйте текст, обрезая паузы и используя контроль смещения времени начала, чтобы формы губ начинались точно с вашего первого слова.
  • Установите фиксированное Start Seed, чтобы воспроизвести съемку, затем измените seed для альтернатив.
  • Уважайте сходство и права на музыку при использовании этого рабочего процесса LTX 2.3 Синхронизация речи и пения в публичных проектах.

Ссылки на официальные ресурсы

Благодарности#

Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим Lightricks за LTX-Video (включая модель LTX 2.3 и узлы ComfyUI-LTXVideo), Kijai за MelBandRoFormer (узлы ComfyUI и веса модели), и RunningHub за исходную статью о рабочем процессе за их вклад и поддержку. Для получения авторитетных подробностей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: Использование ссылочных моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.