ComfyUI>Рабочие процессы>ComfyUI MiniMax H3 | Реалистичные говорящие аватары

ComfyUI MiniMax H3 | Реалистичные говорящие аватары

Workflow Name: RunComfy/ComfyUI-MiniMax-H3
Workflow ID: 0000...1481
Превратите фронтальный портрет в говорящего аватара. Добавьте короткий образец голоса, чтобы клонировать его речь. Вы получите синхронизированные губы и совместно созданное аудио. Идентичность и фон остаются стабильными. QwenVL закрепляет изображение для управления. Создавайте демонстрации, ведущих и цифровых представителей быстрее.

ComfyUI MiniMax H3 Talking Digital Human Workflow

ComfyUI MiniMax H3 | Voice-Cloned Talking Avatars
Хотите запустить этот рабочий процесс?
  • Полностью функциональные рабочие процессы
  • Нет недостающих узлов или моделей
  • Не требуется ручная настройка
  • Отличается потрясающей визуализацией

ComfyUI MiniMax H3 Talking Digital Human Examples

ComfyUI MiniMax H3 Talking Digital Human: портрет и голос в видео аватара с синхронизацией губ#

Этот рабочий процесс превращает один фронтальный портрет и короткую голосовую ссылку в высококачественный клип говорящей головы с синхронизированной речью на RunComfy. Основан на MiniMax H3 reference-to-video-and-audio с QwenVL image grounding, он сохраняет идентичность и фон, генерируя говорящий голос из вашего образца. ComfyUI MiniMax H3 Talking Digital Human идеально подходит для объяснения продуктов, аватаров ведущих, социальных постов и коротких видео с представителями без отдельной TTS или липсинхронизирующей системы.

Вы предоставляете одно изображение и один голосовой клип. Рабочий процесс выводит компактное описание лица и сцены, условливает MiniMax H3 с этим руководством и совместно генерирует видеокадры и соответствующее аудио в едином латенте, так что губы и голос остаются согласованными. Результат рендерится в один видеофайл, который вы можете скачать и поделиться.

Ключевые модели в Comfyui ComfyUI MiniMax H3 Talking Digital Human workflow#

  • MiniMax H3 Reference-to-Video-and-Audio diffusion model. Основной генератор, который использует портрет и необязательное аудио в качестве ссылок для создания синхронизированной говорящей головы. Размещен Comfy-Org для легкого использования в ComfyUI. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax H3 Video VAE. Кодирует и декодирует видеочасть общего латентного пространства, используемого MiniMax H3, помогая сохранить идентичность и фон стабильными. Распространяется с тем же пакетом модели. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax H3 Audio VAE. Кодирует и декодирует аудиочасть общего латента, так что речь генерируется синхронно с движением рта. Также доступен в пакете модели. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 4B Instruct. Модель видения-языка, используемая для закрепления подсказок в визуальных деталях загруженного портрета, что улучшает сохранение идентичности и сцены. Hugging Face: Qwen/Qwen3-VL-4B-Instruct

Как использовать Comfyui ComfyUI MiniMax H3 Talking Digital Human workflow#

Этот рабочий процесс организован в четыре области: раздел загрузки и редактирования, помощник по продолжительности, ядро генерации MiniMax H3 и стадия вывода. Работайте слева направо, начиная с медиа-входов, затем с подсказок, затем запускайте генерацию и сохраняйте видео.

Загрузка / Редактирование: обычно изменяется только здесь; оставьте остальное по умолчанию#

Используйте LoadImage (#137), чтобы загрузить один фронтальный портрет персонажа. Фронтальная или почти фронтальная съемка с видимыми глазами и ртом лучше всего подходит для естественного движения губ. Используйте LoadAudio (#141), чтобы загрузить чистый образец речи, тембр которого вы хотите имитировать; это могут быть несколько секунд разговора с минимальным фоновым шумом. Если нужно, обрежьте голосовой образец с помощью AudioCrop (#142), установив начало и конец на произнесенный сегмент, который вы хотите, чтобы аватар соответствовал. Добавьте любые стилистические или содержательные подсказки в Prompt (#138); рабочий процесс автоматически добавит детали, основанные на изображении, для большей согласованности.

Продолжительность видео (в секундах):#

Установите целевую продолжительность, используя числовой контроль в верхней части группы продолжительности. Помощник ComfyMathExpression (#131) преобразует секунды в допустимое количество кадров для модели и выравнивает его с требованиями семплера. Это сохраняет стабильность времени и предотвращает обрыв на середине фонемы. Если вы измените продолжительность позже, обновите обрезку аудио, чтобы финальная речь и движение губ были согласованы.

MiniMax-H3 Open Source - Изображение говорящего цифрового человека#

Это основная генерационная цепочка, построенная вокруг MiniMaxH3ReferenceToVideo (#136). Узел получает ваш портрет в качестве референсного изображения и ваш обрезанный голосовой клип в качестве референсного аудио, а также ширину, высоту и длину от селекторов. Описание портрета на основе QwenVL объединяется с вашей письменной подсказкой, чтобы модель получала как визуальное закрепление, так и ваши инструкции. Модель выдает единый латент, содержащий как видео, так и аудио, а также условия, используемые стэком семплера, что делает синхронизацию губ надежной без отдельной стадии липсинхронизации.

Закрепление подсказки с QwenVL#

AILab_QwenVL (#152) анализирует загруженный портрет и возвращает краткое, фактическое описание. Рабочий процесс объединяет это описание с вашим директивным текстом через JoinStrings (#150, #148, #144), создавая окончательную подсказку, которая говорит модели сохранить фон неизменным и использовать ваше аудио для говорящего голоса. Это автоматическое закрепление заметно укрепляет стабильность идентичности и фона. Вы можете оставить свою письменную подсказку короткой и позволить закреплению заполнить точные детали лица и сцены.

Разрешение / Соотношение сторон видео#

Выберите аспект и целевое разрешение с помощью ResolutionSelector (#115). Он выводит ширину и высоту, которые подходят для модели и вашего GPU, которые основная нода использует напрямую. Для портретных аватаров высокие аспекты сохраняют больше субъекта, оставляя пространство для естественного движения головы. Если вы измените соотношение сторон после тестирования, сохраните ту же рамку в вашем входном портрете для получения согласованных результатов.

Вывод сгенерированного видео#

Путь семплера удаляет шум из совместного латента, затем VAEDecode (#122) превращает его в кадры, а VAEDecodeAudio (#121) превращает его в звуковую волну. CreateVideo (#130) объединяет кадры и аудио в один клип с выбранной вами частотой кадров, а SaveVideo (#92) записывает файл. Сохраненный результат содержит как изображение, так и синхронизированный голос из одного и того же процесса генерации. Скачайте и просмотрите; если время кажется неправильным, подкорректируйте обрезку аудио или продолжительность и запустите снова.

Ключевые узлы в Comfyui ComfyUI MiniMax H3 Talking Digital Human workflow#

MiniMaxH3ReferenceToVideo (#136)#

Сердце трубопровода, принимающее референсный портрет и образец голоса для совместной генерации видео и аудио. Основные элементы управления - prompt для содержимого и стиля, width и height для кадрирования, а length для продолжительности в кадрах. Используйте единственный, четкий портрет в качестве первого референсного изображения и держите ref_image_size совпадающим, чтобы пропорции лица передавались правильно. Если вы видите дрейф или изменения фона, усилите ваш директивный текст, чтобы явно сохранить фон неизменным.

ResolutionSelector (#115)#

Устанавливает соотношение сторон и общее количество пикселей, затем выдает ширину и высоту, согласованные с дружественными к модели множителями. Выберите аспект, соответствующий вашему обрезанному портрету, чтобы уменьшить артефакты ресемплинга. Увеличение общего разрешения может улучшить детализацию, но также увеличивает VRAM и время; тестируйте на меньших настройках перед увеличением. Держите кадрирование согласованным на протяжении всех запусков для воспроизводимой идентичности.

AudioCrop (#142)#

Обрезает загруженную референсную речь до сегмента, который вы хотите, чтобы аватар произнес. Установите начало и конец на произнесенную часть, оставляя небольшой запас тишины на концах для естественных переходов. Соответствие длины обрезанного аудио вашей целевой продолжительности видео помогает генератору согласовать фонемы с формами рта. Если взрывные или шипящие звуки выглядят неправильно, попробуйте более чистую запись или сократите обрезанный диапазон.

AILab_QwenVL (#152)#

Генерирует описание, закрепленное на изображении, которое автоматически добавляется к вашей подсказке. Это добавляет конкретные детали о лице, волосах, одежде и фоне, что помогает модели сохранить идентичность и сцену. Если закрепленное описание чрезмерно ограничивает стиль, держите вашу письменную подсказку минимальной и нейтральной, чтобы закрепление могло выполнить свою задачу. Для изображений с несколькими персонажами загрузите более плотное обрезание, чтобы описание фокусировалось на одном субъекте.

CreateVideo (#130)#

Объединяет декодированные кадры и аудио в один воспроизводимый файл. Вы можете изменить fps, если вам нужно соответствовать временной шкале ниже по потоку, но держите его согласованным с преобразованием продолжительности в кадры ранее. Если вы видите заикания на некоторых платформах, переэкспортируйте с общей частотой кадров для этой платформы. Управление bit_depth можно оставить по умолчанию для веб-доставки.

ComfyMathExpression (#131)#

Преобразует вашу продолжительность в секундах в допустимое количество кадров для генератора и выравнивает его с шагом семплера. Это предотвращает частичные шаги, которые могут вызвать дрейф времени. Если вы измените частоту кадров ниже по потоку, пересмотрите продолжительность, чтобы сохранить согласование движения губ с слогами. Рассматривайте этот узел как источник времени для всего запуска.

Опциональные дополнения#

  • Используйте чистый, равномерно освещенный портрет с открытыми глазами и ртом для наиболее естественной артикуляции.
  • Запишите 5-10 секунд чистой речи в тихой комнате; избегайте музыки или сильной компрессии в референсном клипе.
  • Для воспроизводимых результатов фиксируйте RandomNoise seed в RandomNoise (#129) вместо рандомизации между запусками.
  • Если вам нужны субтитры, добавьте их после, а не встраивайте в подсказку, чтобы модель сосредоточилась на лице и голосе.
  • Уважайте права на образы и голоса при создании ComfyUI MiniMax H3 Talking Digital Human для реальных людей.

Благодарности#

Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы благодарны MiniMax за модель MiniMax H3, Comfy-Org за веса модели MiniMax-H3 и Comfy.org за руководство MiniMax H3 за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: Использование указанных моделей, наборов данных и кода регулируется соответствующими лицензиями и условиями, предоставленными их авторами и поддерживающими.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.