ComfyUI>Рабочие процессы>MiniMax H3 Fun Control | Точное преобразование изображения в видео

MiniMax H3 Fun Control | Точное преобразование изображения в видео

Workflow Name: RunComfy/MiniMax-H3-Control
Workflow ID: 0000...1506
Преобразуйте референсное изображение в управляемое видео. Сохраните идентичность вашего объекта, одежду и сцену. Управляйте движением с помощью H3 Fun ControlNet. Выбирайте одноконтрольные или ветви глубина плюс поза. Используйте опциональную SolAttn для более быстрых запусков. Создавайте чистые прогулки, повороты, волны и движения всего тела.

ComfyUI MiniMax H3 Fun Control Workflow

MiniMax H3 Fun Control in ComfyUI | Depth and Pose Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Fun Control Examples

MiniMax H3 Fun Control: управляемое создание видео из референсного изображения в ComfyUI#

Этот готовый к RunComfy холст приносит MiniMax H3 Fun Control в ComfyUI для точного, управляемого создания видео из изображений. Он следует за вашей структурной передачей (глубина, canny, поза, HED или MLSD), при этом уважая либо референс первого кадра, либо полные референсы персонажа/стиля. По умолчанию макет поставляется с тремя готовыми к запуску ветвями, чтобы вы могли начать с простого и увеличить контроль по мере необходимости.

Граф 1 запускает одноконтрольный поток и включен по умолчанию. Граф 2 добавляет цепочку глубина плюс поза с референсами персонажа/стиля и истинным отрицательным управлением. Граф 3 зеркалирует Граф 2, но включает опциональный патч ускорения SolAttn. Вы можете включить или обойти любую подготовленную ветвь после загрузки рабочего процесса.

Ключевые модели в рабочем процессе Comfyui MiniMax H3 Fun Control#

  • Базовый UNet MiniMax H3 (fl2va) и UNet референс-видео (ref2va). Это видеоосновы, которые синтезируют движение либо из подсказки и первого кадра (fl2va), либо из постоянных референсов изображений (ref2va). Весы, упакованные сообществом для ComfyUI, доступны в экспериментальном наборе MiniMax H3 на Hugging Face: MiniMax-H3-experimental.
  • MiniMax H3 Video VAE и Audio VAE. Они кодируют и декодируют латентные видеопотоки и аудиопотоки, используемые H3, чтобы конвейер мог эффективно выборочно обрабатывать, а затем превращать результаты обратно в пиксели и звук. См. тот же пакет моделей: MiniMax-H3-experimental.
  • Текстовый энкодер семейства Qwen-VL. Рабочий процесс использует вариант Qwen-VL, настроенный MiniMax, для разбора подсказок и подачи текстовых условий в H3. Для получения дополнительной информации об этом семействе моделей см. официальный репозиторий: Qwen2-VL.
  • MiniMax H3 Fun ControlNet Union (формы кривой). Этот единичный ControlNet поддерживает несколько контрольных передач (глубина, canny, HED, поза, MLSD) и позволяет вам управлять структурой сцены по кадрам. Используйте контрольную точку формы кривой из официального выпуска: MiniMax-H3-Fun-Controlnet-Union.

Как использовать рабочий процесс Comfyui MiniMax H3 Fun Control#

Холст содержит три подготовленные ветви. Граф 1 (один контроль) включен, Граф 2 (глубина+поза с референсами) и Граф 3 (ускорение SolAttn) обойдены. Включите ветвь, когда будете готовы; будет запущена только включенная ветвь.

01 · Одноконтрольный · ВКЛЮЧЕН ПО УМОЛЧАНИЮ#

01 · Модели Эта группа загружает базовый UNet MiniMax H3, текстовый энкодер Qwen-VL и VAE для видео и аудио H3. Она также загружает MiniMax H3 Fun ControlNet Union формы кривой, чтобы один контрольный поток мог управлять структурой. Вам не нужно ничего менять здесь, если вы не хотите заменить весы из другого набора контрольных точек.

01 · КОНТРОЛЬ: это узел Загрузите одно контрольное видео, соответствующее вашей предполагаемой ширине, высоте и количеству кадров вывода; узел проверяет и увеличит оба числа, если они не совпадают. Выберите любой из поддерживаемых проходов (глубина, canny, поза, HED, MLSD) в зависимости от того, что лучше всего захватывает ваше движение и силуэты. Сила действует как бюджет приверженности; 1.0 — это правильная отправная точка для одного контроля, и увеличение этого значения, как правило, насыщает детали. Окно расписания контроля определяет, когда контроль активен во время выборки; завершение окна около 0.6 часто фиксирует структуру на ранних этапах, освобождая поздние шаги для добавления тонкой текстуры. Используйте контрольную точку ControlNet формы кривой; вариант полной ширины не загрузится в этом узле.

01 · Условие Запишите вашу подсказку и при необходимости предоставьте первый кадр. С первым кадром модель инициализируется с этого изображения и, как правило, сохраняет композицию; без него только подсказка управляет внешним видом. Установите ширину, высоту и длину здесь; MiniMax H3 привязывает длину к своей допустимой сетке при 24 fps (17n + 5), поэтому планируйте редактирование вокруг этих подсчетов. Если первый и последний кадры не заданы, используется естественное начало и конец модели; добавление последнего кадра не требуется для этой ветви.

01 · Выборка Выборка выполняется с использованием базового гайдера, который не имеет CFG и не имеет отрицательного ввода, что означает, что отрицательные элементы в вашем тексте здесь игнорируются; используйте Граф 2 или переключитесь на CFG гайдер, если вам нужны отрицательные элементы. Сдвиг сигмы применяется для балансировки графиков диффузии видео и аудио для стабильного декодирования позже. Расписание и выборка в этой ветви настроены для разумных компромиссов между качеством и скоростью; как только у вас будет базовая линия, не стесняйтесь экспериментировать.

01 · Выход Выборочные латенты декодируются с помощью H3 Video VAE и, если присутствует, Audio VAE. Кадры и аудио объединяются в видео и сохраняются в ваши выходы. Используйте сохраненный результат как проверку стиля и при необходимости возвращайтесь к силе контроля, окну расписания или подсказке.

02 · Глубина + Поза с референсом · ПО УМОЛЧАНИЮ ОБОЙДЕНА#

02 · Модели Эта ветвь загружает H3 UNet референс-видео, который предназначен для сохранения идентичности и стиля с неподвижных изображений на каждом кадре. Он разделяет текстовый энкодер Qwen-VL и VAE H3. MiniMax H3 Fun ControlNet Union формы кривой повторно используется здесь для управления структурой.

02 · КОНТРОЛЬ: соединенные, силы СУММИРУЮТСЯ до около 1.0 Два узла Apply соединены, так что каждый контрольный поток добавляет свой вклад, сначала глубина, затем поза. Рассматривайте силу как бюджет: две силы складываются, и превышение общего значения выше 1.0 размывает детали и размывает объект. Глубина отлично подходит для грубой геометрии и размещения камеры; поза фиксирует конечности и артикуляцию. Настройте, установив одну силу в ноль и слушая другую, затем объедините их около общей суммы 1.0.

02 · Условие и референсы Используйте MiniMaxH3ReferenceToVideo, чтобы подавать реальные референсные изображения вместе с вашей подсказкой, чтобы идентичность и стиль сохранялись на всех кадрах. ref_image_size значения max дает самую сильную идентичность (большие референсные токены) при вычислительных затратах; match быстрее и часто достаточно для более свободного контроля стиля. Добавьте отрицательную ветвь с теми же референсами и вашим отрицательным текстом, чтобы CFG гайдер мог вычесть то, что вам не нужно. Длина, размер и количество кадров следуют тем же правилам, что и в Графе 1.

02 · Выборка Переключается на CFGGuider, чтобы отрицательное условие фактически применялось; руководство добавляет стоимость, потому что модель оценивает как положительные, так и отрицательные на каждом шаге. Шаги установлены выше здесь, чтобы дать соединенным контролям и референсам пространство для разрешения; вы можете сократить для скорости, когда вам понравится внешний вид. Контроль семени обеспечивает воспроизводимость; держите его фиксированным, пока вы балансируете бюджет глубины и позы.

02 · Выход Декодирование и сборка видео зеркалируют Граф 1. Если выход соответствует структуре, но выглядит чрезмерно сглаженным, уменьшите конец окна контроля до 0.6 или немного уменьшите общую силу контроля. Если идентичность ускользает, увеличьте ref_image_size или добавьте второе референсное изображение.

03 · Опциональное ускорение Sol-Attn · ПО УМОЛЧАНИЮ ОБОЙДЕНА#

03 · Модели Эта ветвь зеркалирует модели и контроли Графа 2, но добавляет патч ускорения разреженного внимания. Он требует расширения SolAttn Triton. Если у вас нет Triton или узлового пакета, оставьте эту ветвь обойденной.

03 · КОНТРОЛЬ: соединенные, силы СУММИРУЮТСЯ до около 1.0 Применяется та же цепочка глубина плюс поза; держите общую силу около 1.0 для четких результатов. Используйте тот же подход к настройке, что и в Графе 2, чтобы найти разделение, которое лучше всего подходит для вашего кадра и размера объекта.

03 · Условие и референсы Идентично Графу 2. Держите референсы последовательными в положительных и отрицательных ветвях, чтобы CFG вычитала правильные функции. Если вам нужна максимальная идентичность, комбинируйте ref_image_size: max с немного более высоким количеством шагов.

03 · ОПЦИОНАЛЬНО: разреженное внимание SolAttnPatch ускоряет блоки с интенсивным вниманием, сохраняя качество там, где это наиболее важно. Оставьте morton выключенным, потому что перестановка видеотокенов в Z-порядке нарушает выравнивание, где ControlNet применяет свои строковые смещения и фактически удаляет контроль. Держите первые и последние трансформаторные блоки точными, когда хотите скорость без потери приверженности. Ожидайте более быстрых запусков после компиляции ядер Triton; первый проход в основном измеряет время компиляции.

03 · Выборка и Выход Выборка, декодирование и сохранение следуют Графу 2. Сравните SolAttn включенным и отключенным с фиксированным семенем, чтобы оценить качество и приверженность для вашего контента. Если контроль кажется слабее с SolAttn, дважды проверьте, что morton отключен, прежде чем настраивать силы.

Ключевые узлы в рабочем процессе Comfyui MiniMax H3 Fun Control#

Apply H3 Fun ControlNet (#23) Добавляет один контрольный поток к текущей модели и принимает пакет контрольных кадров, извлеченных из вашего контрольного видео. Используйте strength как бюджет приверженности: для одного контроля начните с 1.0; при соединении контролей держите сумму около 1.0, чтобы избежать размытых деталей. Окно расписания (start_percent, end_percent) определяет, когда контроль активен; завершение около 0.6 часто сохраняет текстуры, которые контроль не может описать.

Prompt + first frame -> conditioning (#31) Создает условие из вашей текстовой подсказки и опционального первого кадра, чтобы модель могла уважать начальную композицию. Если вы опустите первый кадр, только подсказка управляет содержанием. Ширина, высота и длина находятся здесь; H3 принимает длины на своей сетке 17n + 5 при 24 fps, поэтому планируйте редактирование на эти длительности.

Positive: references + prompt (#1031) Передает постоянные референсные изображения и текст подсказки в H3, чтобы идентичность и стиль сохранялись на каждом кадре. ref_image_size значения max использует большие токены для сильной идентичности при более высокой стоимости; match быстрее с меньшим давлением на идентичность. Сочетайте это с отрицательной ветвью и CFGGuider, если вам нужны сильные исключения.

CFGGuider: the negative only works here (#1040) Включает руководство без классификатора, чтобы отрицательное условие имело эффект. Более высокое руководство усиливает приверженность подсказке и референсу, но увеличивает вычисления, потому что каждый шаг выполняется как положительный, так и отрицательный. Для длинных, специфических стилей, умеренный cfg может значительно улучшить приверженность; тестируйте бок о бок с фиксированным семенем.

Sigma shift (video 12 / audio 3) (#24) Настраивает расписания диффузии, чтобы дать видео и аудио путям соответствующие профили сигмы перед выборкой. Сохраняйте это в цепочке, когда планируете декодировать аудио, чтобы VAE аудио получал совместимое латентное распределение.

Sol-Attn (OPTIONAL, needs the SolAttn node pack + Triton) (#2060) Применяет ядра разреженного внимания, чтобы ускорить H3 без изменения графа. Оставьте morton отключенным; включение его переставляет токены и делает вклад ControlNet не соответствующим предполагаемым строкам, что выглядит как идеальный вывод, который просто игнорирует контроль. Для консервативных ускорений держите самые ранние и последние трансформаторные блоки точными и профилируйте после компиляции Triton.

BasicScheduler (#42) Предоставляет расписание сигмы и количество шагов для выборки. Для строго контролируемых кадров несколько дополнительных шагов могут помочь стабилизировать структуру до того, как контроль исчезнет; для быстрых стилей сокращайте шаги, чтобы сэкономить время. Сочетайте настройки расписания с окном контроля, чтобы сбалансировать приверженность и текстуру.

Опциональные дополнения#

  • Контрольное видео должно точно соответствовать ширине, высоте и количеству кадров генерации; узел проверяет и увеличивает оба числа, если они отличаются.
  • Используйте контрольную точку ControlNet формы кривой; оригинальная версия полной ширины не загрузится в H3FunControlLoader.
  • Если ваш контрольный проход имеет большие области без особенностей, завершите окно контроля около 0.6, чтобы поздние шаги могли добавить текстуру из подсказки.
  • Для критически важных для идентичности клипов, предпочитайте Граф 2 или Граф 3 с MiniMaxH3ReferenceToVideo и рассмотрите ref_image_size: max.
  • Нужны отрицательные элементы в Графе 1? Вставьте CFGGuider или перейдите на Граф 2/3, где отрицательная ветвь уже подключена.
  • Ресурсы проекта: пользовательский узел ComfyUI-H3-FunControl, контрольная точка формы кривой ControlNet MiniMax-H3-Fun-Controlnet-Union, весы сообщества H3 MiniMax-H3-experimental, опциональное ускорение ComfyUI-SolAttn_triton.

Благодарности#

Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим wyzborrero за пользовательский узел ComfyUI-H3-FunControl, alibaba-pai за модель MiniMax H3 Fun ControlNet Union, Kijai за экспериментальные файлы модели MiniMax Hjson 3, kijai за опциональный узел ускорения SolAttn Triton и RunComfy за рабочий процесс Cloud Save за их вклад и поддержку. Для получения авторитетной информации, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: использование упомянутых моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.