ComfyUI>Рабочие процессы>MiniMax H3 Разговор и Пение Двух Персонажей | 4-этапное Ускорение

MiniMax H3 Разговор и Пение Двух Персонажей | 4-этапное Ускорение

Workflow Name: RunComfy/MiniMax-H3-Talking-Singing-Dual-Character-4-step-Acceleration
Workflow ID: 0000...1486
Превратите два неподвижных изображения в выступление по разговору и пению лицом к лицу. Вы управляете диалогом или вокалом с помощью одного аудиоклипа. Hailuo H3 сохраняет обе идентичности стабильными. Блокировка аудио обеспечивает плотную синхронизацию губ. Turbo LoRA работает в четыре этапа. Вы получаете быстрые дуэты без отдельной системы синхронизации губ.

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Workflow

MiniMax H3 Talking & Singing Dual Character | 4-step Acceleration
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Examples

MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#

Этот готовый к RunComfy рабочий процесс превращает два портретных изображения и короткую речь или трек с пением в одно видео с синхронизацией губ, где оба персонажа делят сцену. Построенный на MiniMax H3 reference-to-video с официальным Turbo LoRA, он обеспечивает генерацию в несколько этапов, сохраняя обе идентичности стабильными, а движение губ заблокированным к вашему исходному аудио.

MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение идеально подходит для дуэтов, диалогов между двумя персонажами, трейлеров или быстрых предварительных просмотров выступлений. Вы приносите два изображения и один аудиофайл, добавляете короткий запрос, выбираете размер, и график рендерит mp4 с оригинальным саундтреком.

Основные модели в рабочем процессе Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#

  • MiniMax-H3 reference-to-video основа от Comfy-Org — генеративная модель, которая отображает ваши референсы и текст в аудиовизуальный латент для синтеза видео. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE FP16 — кодирует и декодирует видео латенты, чтобы кадры могли быть эффективно устранены от шума и восстановлены с высокой точностью. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE FP32 — представляет управляющее аудио в латентном пространстве, чтобы движение губ и синхронизация времени обучались по вашему треку. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 32B текстовый энкодер (варианты AWQ/NVFP упакованы для H3) — интерпретирует ваш запрос, чтобы задать сцену, стиль и замысел кадра для композиции с двумя персонажами. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-step LoRA — ускоряет выборку, чтобы вы могли рендерить с минимальным количеством этапов устранения шума, сохраняя идентичность и синхронизацию губ. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora

Как использовать Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#

Этот график движется слева направо: вы загружаете два неподвижных изображения персонажей и один аудиоклип, задаете запрос и размер, затем основной путь H3 объединяет референсы и аудио в AV латент. Короткая стадия блокировки аудио сохраняет ваш оригинальный саундтрек, одновременно управляя движением губ, а выборщик с Turbo LoRA выполняет несколько этапов устранения шума перед окончательной сборкой видео.

  • Загрузите Изображение (Персонаж A)
    • Вставьте четкое изображение лицом вперед для персонажа A в LoadImage (#227). Отдавайте предпочтение схожему размеру головы и освещению с персонажем B для стабильного сосуществования. Фон может быть простым; приоритетом являются идентичность и поза. Узел подает в стек референсов H3, чтобы модель узнала, кто первый говорящий в общей сцене.
  • Загрузите Изображение (Персонаж B)
    • Предоставьте персонажа B в LoadImage (#137). Держите кадрирование, ориентацию и выражение лица примерно сопоставимыми с персонажем A, чтобы уменьшить дрейф между кадрами. Эта вторая ссылка позволяет H3 синтезировать два кадра, где оба индивидуума остаются последовательными, разговаривая или поя друг другу.
  • Загрузите Аудио
    • Добавьте свой диалог или вокал в LoadAudio (#171). Используйте AudioCrop (#177), чтобы установить время начала и окончания, чтобы длина клипа соответствовала сегменту, который вы хотите. Чистое, центрированное аудио улучшает артикуляцию рта и уменьшает дрожание времени.
  • Запрос
    • Опишите кадр в Input Text (Prompt) (#138). Краткие, кинематографические фразы работают хорошо, например, описывая дистанцию камеры, фон и настроение для двух персонажей. Запрос направляет компоновку и стиль без замены руководства по идентичности от неподвижных изображений и синхронизации времени с вашего трека.
  • Селектор Разрешения (Размер)
    • Выберите аспект и целевой размер в Resolution Selector (Size) (#115). Селектор выводит ширину и высоту, уже выровненные по кратным, удобным для модели, чтобы сбалансировать детали и скорость. Встроенная заметка о размере предлагает готовые к использованию пресеты 16:9, чтобы вы могли выбрать уровень мегапикселей, соответствующий вашему бюджету GPU.
  • Результат
    • Кадры декодируются и объединяются с оригинальным аудио в VHS_VideoCombine (#142) для создания mp4. Если ваш рендер немного длиннее или короче, используйте предоставленный переключатель на этом этапе для обрезки до длины аудио. Имена файлов и формат предварительно настроены для быстрой итерации.
  • Ядро (Не Изменять)
    • Внутри этой защищенной области MiniMaxH3ReferenceToVideo (#136) объединяет оба референсных изображения, запрос и обрезанное аудио в совместный AV латент и положительное кондиционирование. VRGDG_MiniMaxH3AudioDrive (#172) блокирует исходное аудио, чтобы синхронизация губ следовала за вашим треком, в то время как саундтрек передается без изменений. UNet патчирован для эффективности памяти, и LoraLoaderModelOnly (#234) применяет Turbo 4-step LoRA перед тем, как выборщик устраняет шум, а VAEDecode восстанавливает кадры. Эти внутренние элементы настроены для стабильности и скорости, поэтому вам обычно не нужно их регулировать.

Ключевые узлы в рабочем процессе Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#

  • MiniMaxH3ReferenceToVideo (#136)
    • Сердце графика, который принимает оба неподвижных изображения персонажей, ваш запрос, ширину, высоту и автоматически вычисленную длину клипа. Он также принимает обрезанное аудио в качестве ссылки, чтобы время фонем и формы визем соответствовали саундтреку. Если вам нужно более строгое управление, вы можете напрямую настроить prompt, width, height или переопределить length для специальных временных интервалов.
  • VRGDG_MiniMaxH3AudioDrive (#172)
    • Блокирует движение губ к предоставленному исходному аудио, обеспечивая использование того же аудио трека в финальном видео. Используйте это, когда вам нужна точная синхронизация текста или диалога без каких-либо генеративных изменений аудио. Подайте чистый вокал или диалог для достижения наилучших результатов.
  • LoraLoaderModelOnly (#234)
    • Загружает MiniMax-H3 Turbo 4-step LoRA, чтобы выборщик мог сходиться за очень небольшое количество шагов. Если вы предпочитаете более медленное, но потенциально более консервативное устранение шума, вы можете уменьшить влияние LoRA; для максимальной скорости оставьте силу по умолчанию. Ссылка на модель: MiniMax-H3 Turbo LoRA.
  • SamplerCustomAdvanced (#125)
    • Выполняет фактическое устранение шума, используя планировщик и выборщик, выбранные выше по потоку. С активным Turbo LoRA вы можете быстро рендерить с минимальным количеством шагов; увеличивайте количество шагов только если замечаете нестабильность движения. Управление семенем поступает от RandomNoise (#129) для воспроизводимых дублей.
  • Resolution Selector (Size) (#115)
    • Выводит выровненные по модели ширину и высоту, чтобы вам не нужно было возиться с кратными или математикой аспектов. Используйте его для переключения между предварительным просмотром, средним и финальным размерами, сохраняя компоновку последовательной. Большие размеры увеличивают детализацию идентичности, но требуют больше VRAM и времени.
  • AudioCrop (#177)
    • Обрезает входное аудио до точного сегмента, который вы хотите анимировать. Используйте это, чтобы вырезать тишину или изолировать куплет или диалог. Чистые точки входа и выхода помогают с синхронизацией открывания/закрывания рта.
  • VHS_VideoCombine (#142)
    • Собирает декодированные кадры и переданное аудио в mp4 для обмена. Используйте встроенные опции, чтобы выровнять продолжительность по саундтреку и установить конвенции именования файлов. Это ваш финальный шаг доставки для выводов MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение.

Дополнительные возможности#

  • Соответствуйте масштабу субъекта и углу лица на обоих изображениях, чтобы минимизировать дрейф идентичности.
  • Держите запросы краткими и визуальными: дистанция камеры, обстановка, настроение и подсказки по освещению.
  • Используйте семена шума при итерациях, чтобы надежно сравнивать изменения между дублями.
  • Если клип немного превышает длину, включите обрезку на этапе объединения для точной синхронизации кадров.
  • Начните с разрешения среднего уровня, затем увеличьте, когда блокировка и синхронизация будут выглядеть правильно.

Благодарности#

Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы выражаем благодарность MiniMax Research за MiniMax H3, Comfy.org за учебник ComfyUI MiniMax H3 и Comfy-Org и larryvrh за веса моделей MiniMax-H3 и MiniMax-H3 Turbo LoRA за их вклад и поддержку. Для получения авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: Использование указанных моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и сопровождающими.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.