ComfyUI>Рабочие процессы>MiniMax H3 Разговор и Пение Двух Персонажей | 4-этапное Ускорение

MiniMax H3 Разговор и Пение Двух Персонажей | 4-этапное Ускорение

Workflow Name: RunComfy/MiniMax-H3-Talking-Singing-Dual-Character-4-step-Acceleration
Workflow ID: 0000...1486
Превратите два неподвижных изображения в выступление по разговору и пению лицом к лицу. Вы управляете диалогом или вокалом с помощью одного аудиоклипа. Hailuo H3 сохраняет обе идентичности стабильными. Блокировка аудио обеспечивает плотную синхронизацию губ. Turbo LoRA работает в четыре этапа. Вы получаете быстрые дуэты без отдельной системы синхронизации губ.
Avoid using 2X Large or 2XL Plus for this workflow. These machine types may cause the generated video to contain only noise. Use Medium, Large, or X Large instead.

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Workflow

MiniMax H3 Talking & Singing Dual Character | 4-step Acceleration
Хотите запустить этот рабочий процесс?
  • Полностью функциональные рабочие процессы
  • Нет недостающих узлов или моделей
  • Не требуется ручная настройка
  • Отличается потрясающей визуализацией

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Examples

MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#

Этот готовый к RunComfy рабочий процесс превращает два портретных изображения и короткую речь или трек с пением в одно видео с синхронизацией губ, где оба персонажа делят сцену. Построенный на MiniMax H3 reference-to-video с официальным Turbo LoRA, он обеспечивает генерацию в несколько этапов, сохраняя обе идентичности стабильными, а движение губ заблокированным к вашему исходному аудио.

MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение идеально подходит для дуэтов, диалогов между двумя персонажами, трейлеров или быстрых предварительных просмотров выступлений. Вы приносите два изображения и один аудиофайл, добавляете короткий запрос, выбираете размер, и график рендерит mp4 с оригинальным саундтреком.

Основные модели в рабочем процессе Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#

  • MiniMax-H3 reference-to-video основа от Comfy-Org — генеративная модель, которая отображает ваши референсы и текст в аудиовизуальный латент для синтеза видео. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE FP16 — кодирует и декодирует видео латенты, чтобы кадры могли быть эффективно устранены от шума и восстановлены с высокой точностью. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE FP32 — представляет управляющее аудио в латентном пространстве, чтобы движение губ и синхронизация времени обучались по вашему треку. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 32B текстовый энкодер (варианты AWQ/NVFP упакованы для H3) — интерпретирует ваш запрос, чтобы задать сцену, стиль и замысел кадра для композиции с двумя персонажами. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-step LoRA — ускоряет выборку, чтобы вы могли рендерить с минимальным количеством этапов устранения шума, сохраняя идентичность и синхронизацию губ. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora

Как использовать Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#

Этот график движется слева направо: вы загружаете два неподвижных изображения персонажей и один аудиоклип, задаете запрос и размер, затем основной путь H3 объединяет референсы и аудио в AV латент. Короткая стадия блокировки аудио сохраняет ваш оригинальный саундтрек, одновременно управляя движением губ, а выборщик с Turbo LoRA выполняет несколько этапов устранения шума перед окончательной сборкой видео.

  • Загрузите Изображение (Персонаж A)
    • Вставьте четкое изображение лицом вперед для персонажа A в LoadImage (#227). Отдавайте предпочтение схожему размеру головы и освещению с персонажем B для стабильного сосуществования. Фон может быть простым; приоритетом являются идентичность и поза. Узел подает в стек референсов H3, чтобы модель узнала, кто первый говорящий в общей сцене.
  • Загрузите Изображение (Персонаж B)
    • Предоставьте персонажа B в LoadImage (#137). Держите кадрирование, ориентацию и выражение лица примерно сопоставимыми с персонажем A, чтобы уменьшить дрейф между кадрами. Эта вторая ссылка позволяет H3 синтезировать два кадра, где оба индивидуума остаются последовательными, разговаривая или поя друг другу.
  • Загрузите Аудио
    • Добавьте свой диалог или вокал в LoadAudio (#171). Используйте AudioCrop (#177), чтобы установить время начала и окончания, чтобы длина клипа соответствовала сегменту, который вы хотите. Чистое, центрированное аудио улучшает артикуляцию рта и уменьшает дрожание времени.
  • Запрос
    • Опишите кадр в Input Text (Prompt) (#138). Краткие, кинематографические фразы работают хорошо, например, описывая дистанцию камеры, фон и настроение для двух персонажей. Запрос направляет компоновку и стиль без замены руководства по идентичности от неподвижных изображений и синхронизации времени с вашего трека.
  • Селектор Разрешения (Размер)
    • Выберите аспект и целевой размер в Resolution Selector (Size) (#115). Селектор выводит ширину и высоту, уже выровненные по кратным, удобным для модели, чтобы сбалансировать детали и скорость. Встроенная заметка о размере предлагает готовые к использованию пресеты 16:9, чтобы вы могли выбрать уровень мегапикселей, соответствующий вашему бюджету GPU.
  • Результат
    • Кадры декодируются и объединяются с оригинальным аудио в VHS_VideoCombine (#142) для создания mp4. Если ваш рендер немного длиннее или короче, используйте предоставленный переключатель на этом этапе для обрезки до длины аудио. Имена файлов и формат предварительно настроены для быстрой итерации.
  • Ядро (Не Изменять)
    • Внутри этой защищенной области MiniMaxH3ReferenceToVideo (#136) объединяет оба референсных изображения, запрос и обрезанное аудио в совместный AV латент и положительное кондиционирование. VRGDG_MiniMaxH3AudioDrive (#172) блокирует исходное аудио, чтобы синхронизация губ следовала за вашим треком, в то время как саундтрек передается без изменений. UNet патчирован для эффективности памяти, и LoraLoaderModelOnly (#234) применяет Turbo 4-step LoRA перед тем, как выборщик устраняет шум, а VAEDecode восстанавливает кадры. Эти внутренние элементы настроены для стабильности и скорости, поэтому вам обычно не нужно их регулировать.

Ключевые узлы в рабочем процессе Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#

  • MiniMaxH3ReferenceToVideo (#136)
    • Сердце графика, который принимает оба неподвижных изображения персонажей, ваш запрос, ширину, высоту и автоматически вычисленную длину клипа. Он также принимает обрезанное аудио в качестве ссылки, чтобы время фонем и формы визем соответствовали саундтреку. Если вам нужно более строгое управление, вы можете напрямую настроить prompt, width, height или переопределить length для специальных временных интервалов.
  • VRGDG_MiniMaxH3AudioDrive (#172)
    • Блокирует движение губ к предоставленному исходному аудио, обеспечивая использование того же аудио трека в финальном видео. Используйте это, когда вам нужна точная синхронизация текста или диалога без каких-либо генеративных изменений аудио. Подайте чистый вокал или диалог для достижения наилучших результатов.
  • LoraLoaderModelOnly (#234)
    • Загружает MiniMax-H3 Turbo 4-step LoRA, чтобы выборщик мог сходиться за очень небольшое количество шагов. Если вы предпочитаете более медленное, но потенциально более консервативное устранение шума, вы можете уменьшить влияние LoRA; для максимальной скорости оставьте силу по умолчанию. Ссылка на модель: MiniMax-H3 Turbo LoRA.
  • SamplerCustomAdvanced (#125)
    • Выполняет фактическое устранение шума, используя планировщик и выборщик, выбранные выше по потоку. С активным Turbo LoRA вы можете быстро рендерить с минимальным количеством шагов; увеличивайте количество шагов только если замечаете нестабильность движения. Управление семенем поступает от RandomNoise (#129) для воспроизводимых дублей.
  • Resolution Selector (Size) (#115)
    • Выводит выровненные по модели ширину и высоту, чтобы вам не нужно было возиться с кратными или математикой аспектов. Используйте его для переключения между предварительным просмотром, средним и финальным размерами, сохраняя компоновку последовательной. Большие размеры увеличивают детализацию идентичности, но требуют больше VRAM и времени.
  • AudioCrop (#177)
    • Обрезает входное аудио до точного сегмента, который вы хотите анимировать. Используйте это, чтобы вырезать тишину или изолировать куплет или диалог. Чистые точки входа и выхода помогают с синхронизацией открывания/закрывания рта.
  • VHS_VideoCombine (#142)
    • Собирает декодированные кадры и переданное аудио в mp4 для обмена. Используйте встроенные опции, чтобы выровнять продолжительность по саундтреку и установить конвенции именования файлов. Это ваш финальный шаг доставки для выводов MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение.

Дополнительные возможности#

  • Соответствуйте масштабу субъекта и углу лица на обоих изображениях, чтобы минимизировать дрейф идентичности.
  • Держите запросы краткими и визуальными: дистанция камеры, обстановка, настроение и подсказки по освещению.
  • Используйте семена шума при итерациях, чтобы надежно сравнивать изменения между дублями.
  • Если клип немного превышает длину, включите обрезку на этапе объединения для точной синхронизации кадров.
  • Начните с разрешения среднего уровня, затем увеличьте, когда блокировка и синхронизация будут выглядеть правильно.

Благодарности#

Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы выражаем благодарность MiniMax Research за MiniMax H3, Comfy.org за учебник ComfyUI MiniMax H3 и Comfy-Org и larryvrh за веса моделей MiniMax-H3 и MiniMax-H3 Turbo LoRA за их вклад и поддержку. Для получения авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: Использование указанных моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и сопровождающими.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.