MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#
Этот готовый к RunComfy рабочий процесс превращает два портретных изображения и короткую речь или трек с пением в одно видео с синхронизацией губ, где оба персонажа делят сцену. Построенный на MiniMax H3 reference-to-video с официальным Turbo LoRA, он обеспечивает генерацию в несколько этапов, сохраняя обе идентичности стабильными, а движение губ заблокированным к вашему исходному аудио.
MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение идеально подходит для дуэтов, диалогов между двумя персонажами, трейлеров или быстрых предварительных просмотров выступлений. Вы приносите два изображения и один аудиофайл, добавляете короткий запрос, выбираете размер, и график рендерит mp4 с оригинальным саундтреком.
Основные модели в рабочем процессе Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#
- MiniMax-H3 reference-to-video основа от Comfy-Org — генеративная модель, которая отображает ваши референсы и текст в аудиовизуальный латент для синтеза видео. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — кодирует и декодирует видео латенты, чтобы кадры могли быть эффективно устранены от шума и восстановлены с высокой точностью. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — представляет управляющее аудио в латентном пространстве, чтобы движение губ и синхронизация времени обучались по вашему треку. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B текстовый энкодер (варианты AWQ/NVFP упакованы для H3) — интерпретирует ваш запрос, чтобы задать сцену, стиль и замысел кадра для композиции с двумя персонажами. Включено в пакет модели. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA — ускоряет выборку, чтобы вы могли рендерить с минимальным количеством этапов устранения шума, сохраняя идентичность и синхронизацию губ. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Как использовать Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#
Этот график движется слева направо: вы загружаете два неподвижных изображения персонажей и один аудиоклип, задаете запрос и размер, затем основной путь H3 объединяет референсы и аудио в AV латент. Короткая стадия блокировки аудио сохраняет ваш оригинальный саундтрек, одновременно управляя движением губ, а выборщик с Turbo LoRA выполняет несколько этапов устранения шума перед окончательной сборкой видео.
- Загрузите Изображение (Персонаж A)
- Вставьте четкое изображение лицом вперед для персонажа A в
LoadImage(#227). Отдавайте предпочтение схожему размеру головы и освещению с персонажем B для стабильного сосуществования. Фон может быть простым; приоритетом являются идентичность и поза. Узел подает в стек референсов H3, чтобы модель узнала, кто первый говорящий в общей сцене.
- Вставьте четкое изображение лицом вперед для персонажа A в
- Загрузите Изображение (Персонаж B)
- Предоставьте персонажа B в
LoadImage(#137). Держите кадрирование, ориентацию и выражение лица примерно сопоставимыми с персонажем A, чтобы уменьшить дрейф между кадрами. Эта вторая ссылка позволяет H3 синтезировать два кадра, где оба индивидуума остаются последовательными, разговаривая или поя друг другу.
- Предоставьте персонажа B в
- Загрузите Аудио
- Добавьте свой диалог или вокал в
LoadAudio(#171). ИспользуйтеAudioCrop(#177), чтобы установить время начала и окончания, чтобы длина клипа соответствовала сегменту, который вы хотите. Чистое, центрированное аудио улучшает артикуляцию рта и уменьшает дрожание времени.
- Добавьте свой диалог или вокал в
- Запрос
- Опишите кадр в
Input Text (Prompt)(#138). Краткие, кинематографические фразы работают хорошо, например, описывая дистанцию камеры, фон и настроение для двух персонажей. Запрос направляет компоновку и стиль без замены руководства по идентичности от неподвижных изображений и синхронизации времени с вашего трека.
- Опишите кадр в
- Селектор Разрешения (Размер)
- Выберите аспект и целевой размер в
Resolution Selector (Size)(#115). Селектор выводит ширину и высоту, уже выровненные по кратным, удобным для модели, чтобы сбалансировать детали и скорость. Встроенная заметка о размере предлагает готовые к использованию пресеты 16:9, чтобы вы могли выбрать уровень мегапикселей, соответствующий вашему бюджету GPU.
- Выберите аспект и целевой размер в
- Результат
- Кадры декодируются и объединяются с оригинальным аудио в
VHS_VideoCombine(#142) для создания mp4. Если ваш рендер немного длиннее или короче, используйте предоставленный переключатель на этом этапе для обрезки до длины аудио. Имена файлов и формат предварительно настроены для быстрой итерации.
- Кадры декодируются и объединяются с оригинальным аудио в
- Ядро (Не Изменять)
- Внутри этой защищенной области
MiniMaxH3ReferenceToVideo(#136) объединяет оба референсных изображения, запрос и обрезанное аудио в совместный AV латент и положительное кондиционирование.VRGDG_MiniMaxH3AudioDrive(#172) блокирует исходное аудио, чтобы синхронизация губ следовала за вашим треком, в то время как саундтрек передается без изменений. UNet патчирован для эффективности памяти, иLoraLoaderModelOnly(#234) применяет Turbo 4-step LoRA перед тем, как выборщик устраняет шум, аVAEDecodeвосстанавливает кадры. Эти внутренние элементы настроены для стабильности и скорости, поэтому вам обычно не нужно их регулировать.
- Внутри этой защищенной области
Ключевые узлы в рабочем процессе Comfyui MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение#
MiniMaxH3ReferenceToVideo(#136)- Сердце графика, который принимает оба неподвижных изображения персонажей, ваш запрос, ширину, высоту и автоматически вычисленную длину клипа. Он также принимает обрезанное аудио в качестве ссылки, чтобы время фонем и формы визем соответствовали саундтреку. Если вам нужно более строгое управление, вы можете напрямую настроить
prompt,width,heightили переопределитьlengthдля специальных временных интервалов.
- Сердце графика, который принимает оба неподвижных изображения персонажей, ваш запрос, ширину, высоту и автоматически вычисленную длину клипа. Он также принимает обрезанное аудио в качестве ссылки, чтобы время фонем и формы визем соответствовали саундтреку. Если вам нужно более строгое управление, вы можете напрямую настроить
VRGDG_MiniMaxH3AudioDrive(#172)- Блокирует движение губ к предоставленному исходному аудио, обеспечивая использование того же аудио трека в финальном видео. Используйте это, когда вам нужна точная синхронизация текста или диалога без каких-либо генеративных изменений аудио. Подайте чистый вокал или диалог для достижения наилучших результатов.
LoraLoaderModelOnly(#234)- Загружает MiniMax-H3 Turbo 4-step LoRA, чтобы выборщик мог сходиться за очень небольшое количество шагов. Если вы предпочитаете более медленное, но потенциально более консервативное устранение шума, вы можете уменьшить влияние LoRA; для максимальной скорости оставьте силу по умолчанию. Ссылка на модель: MiniMax-H3 Turbo LoRA.
SamplerCustomAdvanced(#125)- Выполняет фактическое устранение шума, используя планировщик и выборщик, выбранные выше по потоку. С активным Turbo LoRA вы можете быстро рендерить с минимальным количеством шагов; увеличивайте количество шагов только если замечаете нестабильность движения. Управление семенем поступает от
RandomNoise(#129) для воспроизводимых дублей.
- Выполняет фактическое устранение шума, используя планировщик и выборщик, выбранные выше по потоку. С активным Turbo LoRA вы можете быстро рендерить с минимальным количеством шагов; увеличивайте количество шагов только если замечаете нестабильность движения. Управление семенем поступает от
Resolution Selector (Size)(#115)- Выводит выровненные по модели ширину и высоту, чтобы вам не нужно было возиться с кратными или математикой аспектов. Используйте его для переключения между предварительным просмотром, средним и финальным размерами, сохраняя компоновку последовательной. Большие размеры увеличивают детализацию идентичности, но требуют больше VRAM и времени.
AudioCrop(#177)- Обрезает входное аудио до точного сегмента, который вы хотите анимировать. Используйте это, чтобы вырезать тишину или изолировать куплет или диалог. Чистые точки входа и выхода помогают с синхронизацией открывания/закрывания рта.
VHS_VideoCombine(#142)- Собирает декодированные кадры и переданное аудио в mp4 для обмена. Используйте встроенные опции, чтобы выровнять продолжительность по саундтреку и установить конвенции именования файлов. Это ваш финальный шаг доставки для выводов MiniMax H3 ComfyUI Разговор и Пение Двух Персонажей 4-этапное Ускорение.
Дополнительные возможности#
- Соответствуйте масштабу субъекта и углу лица на обоих изображениях, чтобы минимизировать дрейф идентичности.
- Держите запросы краткими и визуальными: дистанция камеры, обстановка, настроение и подсказки по освещению.
- Используйте семена шума при итерациях, чтобы надежно сравнивать изменения между дублями.
- Если клип немного превышает длину, включите обрезку на этапе объединения для точной синхронизации кадров.
- Начните с разрешения среднего уровня, затем увеличьте, когда блокировка и синхронизация будут выглядеть правильно.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы выражаем благодарность MiniMax Research за MiniMax H3, Comfy.org за учебник ComfyUI MiniMax H3 и Comfy-Org и larryvrh за веса моделей MiniMax-H3 и MiniMax-H3 Turbo LoRA за их вклад и поддержку. Для получения авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Официальное объявление MiniMax Research/MiniMax H3
- Документы / Примечания к выпуску: Официальное объявление MiniMax H3
- Учебник Comfy.org/MiniMax H3
- GitHub: Comfy-Org/docs
- Документы / Примечания к выпуску: Учебник Comfy.org MiniMax H3
- Веса модели Comfy-Org/MiniMax-H3
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Примечание: Использование указанных моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и сопровождающими.

