FastH3 4-Step ComfyUI Workflow#
Этот график, готовый для RunComfy, обеспечивает быстрое создание MiniMax H3 текст-видео и изображение-видео с синхронизированным аудио. FastH3 4-Step ComfyUI Workflow следует пути FastVideo VSA-DataFree из 4-х шагов, сохраняя при этом 8-шаговый планировщик в ComfyUI для практической визуальной стабильности. Он отлично подходит для кинематографических сцен, моментов с персонажами, продуктовых кадров и клипов с богатой атмосферой, где важна быстрая итерация.
Рабочий процесс автоматически соединяет кадры и аудио в MP4 и поддерживает необязательную ветку I2V для первого кадра. Подключите начальное изображение для кадров, чувствительных к непрерывности, или оставьте его пустым для чистого T2V генерации. Подсказки могут быть длинными и структурированными, позволяя вам сохранять визуальную и звуковую непрерывность между клипами.
Основные модели в Comfyui FastH3 4-Step ComfyUI Workflow#
- Модель диффузии MiniMax H3 (FL2VA). Управляет кросс-модальной генерацией видео и аудио с использованием унифицированного латентного дизайна. Ссылка на семейство моделей: MiniMaxAI/MiniMax-H3.
- Веса FastVideo FastH3 4-step VSA-DataFree. Позволяют использовать ультракороткий путь из 4-х шагов, используемый здесь для черновиков с приоритетом на скорость. Ссылка на веса: FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree.
- Текстовый энкодер Qwen3-VL 32B AWQ для MiniMax H3. Обеспечивает высокую емкость понимания подсказок для стиля, композиции и аудиоподсказок. Распространяется с активами Comfy-Org MiniMax H3: Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE (FP16). Декодирует латентное видео в RGB кадры с использованием собственного кодека H3. Ссылка на активы: Comfy-Org/MiniMax-H3.
- MiniMax H3 Audio VAE (FP32). Декодирует латентную аудиодорожку, выровненную с сгенерированными кадрами. Ссылка на активы: Comfy-Org/MiniMax-H3.
Как использовать Comfyui FastH3 4-Step ComfyUI Workflow#
На высоком уровне, пользовательские входные данные определяют разрешение, длительность и подсказку. График подготавливает компоненты MiniMax H3, строит кондиционирование для T2V или I2V, затем запускает сжатый проход выборки, настроенный для пути FastH3 из 4-х шагов. Наконец, он декодирует видео и аудио и объединяет их в готовый для совместного использования MP4.
Входные данные пользователя#
Установите желаемый вид и время в группе Входных данных пользователя. Используйте ResolutionSelector (#115) для выбора соотношения сторон и бюджета пикселей; разрешения квантованы до кратных 32 для совместимости с декодером. Выберите кадры в секунду через (input:FPS) PrimitiveFloat (#5986) и длину клипа в секундах через (input:Duration) Seconds (#221). Выражение в ComfyMathExpression (#220) преобразует длительность в количество кадров и привязывает его к кратному, удобному для шага, обеспечивая стабильное планирование и постоянную длину клипов. Добавьте свою длинную подсказку в (input:prompt) Text Prompt PrimitiveStringMultiline (#6005); помощник StringConcatenate (#6115) позволяет вам сохранять повторно используемые стили или якоря непрерывности.
Модели#
Группа Моделей загружает основные компоненты H3 и необязательные изменения внимания. UNETLoader (#215) выбирает веса FastVideo VSA-DataFree FL2VA, которые делают путь из 4-х шагов жизнеспособным для скорости, сохраняя при этом согласованность под 8-шаговым планировщиком. CLIPLoader (#216) приносит текстовый энкодер Qwen3-VL 32B AWQ для богатого языкового заземления. Два узла VAELoader обрабатывают ветки видео и аудио для точного декодирования в конце. PathchSageAttentionKJ (#223) применяет легкое изменение внимания перед планированием, которое может улучшить сохранение деталей в очень коротких расписаниях.
Кондиционирование#
Кондиционирование собирается MiniMaxH3ImageToVideo (#219), который также действует как точка входа для T2V или первого кадра I2V. Если вы подключаете изображение к first_frame, узел кондиционирует движение из этого кадра; в противном случае он выполняет чистое текст-видео из вашей подсказки. Ширина, высота и длина поступают из группы Входных данных пользователя, так что вы можете быстро масштабироваться, не касаясь нижестоящих узлов. Get_duration (#6067) и Get_strPrompt (#6069) аккуратно управляют общими значениями, чтобы подсказка и время применялись последовательно. Выход обеспечивает положительное кондиционирование и подготовленный латент, который уточняет выборщик.
Выборка#
Выборка компактная и настроена для FastH3. RandomNoise (#217) задает траекторию, BasicGuider (#214) строит руководство из вашего кондиционирования, а KSamplerSelect (#211) выбирает многослойный выборщик, оптимизированный для коротких путей. MiniMaxH3SigmaShift (#6007) корректирует шумовой график H3 для весов FL2VA, в то время как BasicScheduler (#212) сохраняет сохраненный рабочий процесс на 8 шагах для практического баланса между скоростью и достоверностью. SamplerCustomAdvanced (#213) затем управляет денойзингом для создания единого латентного потока, который содержит как видео, так и аудио контент.
Декодирование и создание видео#
После завершения выборки VAEDecode (#210) превращает латентное видео в кадры, а VAEDecodeAudio (#209) восстанавливает синхронизированное аудио. VHS_VideoCombine (#6104) из Video Helper Suite соединяет последовательность в MP4 с частотой кадров проекта. Вы можете просмотреть выходные данные, и узел запишет один файл в выходной каталог, готовый для обзора. Поскольку ширина, высота и количество кадров уже проверены наверху, этот этап без участия и быстрый. Если вы предоставили первый кадр, движение будет исходить из него; в противном случае клип будет полностью исходить из подсказки.
Ключевые узлы в Comfyui FastH3 4-Step ComfyUI Workflow#
MiniMaxH3ImageToVideo (#219)#
Центральный узел кондиционирования для T2V и первого кадра I2V. Предоставьте свои входные данные для подсказки и времени и, при необходимости, подключите first_frame для кадров, чувствительных к непрерывности. Настройте ширину и высоту для масштаба и соотношения сторон, сохраняя их кратными 32. Длина берется из логики преобразования длительности в кадры, так что вам редко нужно устанавливать ее вручную.
MiniMaxH3SigmaShift (#6007)#
Применяет сдвиг сигмы, настроенный на график FL2VA MiniMax H3, чтобы короткий путь выборки оставался стабильным. Оставьте его как настроено для маршрута FastH3; он в первую очередь является защитой совместимости и качества. Рассмотрите возможность изменения только если вы заменяете веса H3 или планировщики.
BasicScheduler (#212)#
Обеспечивает 8-шаговое расписание, которое хорошо сочетается с весовым путем из 4-х шагов для практического качества. Вы можете уменьшить количество шагов для более быстрых черновиков или немного увеличить их для большей стабильности, отмечая компромисс между детализацией и скоростью. Количество шагов взаимодействует со сдвигом сигмы и выбором выборщика, поэтому вносите изменения обдуманно.
SamplerCustomAdvanced (#213) с KSamplerSelect (#211)#
Выполняет короткую траекторию денойзинга, используемую FastH3. Выбранный выборщик настроен для многослойной эффективности и согласованности с очень небольшим количеством обновлений. Сохраняйте эту пару, если только вы не экспериментируете с альтернативными выборщиками, проверенными для H3.
ResolutionSelector (#115)#
Высокоуровневый контроль за соотношением сторон и бюджетом пикселей. Используйте его для масштабирования вида, не касаясь внутренних моделей, и предпочитайте разрешения, которые переводятся в примерно 0.7–1.0 мегапикселей для очень быстрых черновиков, затем увеличивайте масштаб при закреплении финальных кадров. Выходы квантованы для обеспечения эффективности декодеров.
VHS_VideoCombine (#6104)#
Соединяет декодированные кадры и аудио в единый MP4. Качество и размер можно сбалансировать через его параметры сжатия и частоты кадров. Это часть Video Helper Suite, которую вы можете изучить здесь: Kosinkadink/ComfyUI-VideoHelperSuite.
Дополнительные возможности#
- Первый кадр I2V: подключите изображение к
first_frameнаMiniMaxH3ImageToVideo(#219) для продолжения с доски дизайна, фотографии или предыдущего кадра. - Подсказки: храните повторно используемую стильную библию в
StringConcatenate(#6115) и помещайте только сценические указания в основную подсказку для согласованности между клипами. - Время: изменяйте только секунды; график привязывает количество кадров к кратному, удобному для шага, чтобы избежать заикания и автоматически сохраняет выравнивание аудио.
- Скорость против качества: черновики на более низких мегапикселях в
ResolutionSelector(#115), затем повышайте разрешение и, при необходимости, количество шагов вBasicScheduler(#212) для завершения. - Ссылки: изучите веса и активы, используемые этим рабочим процессом, на MiniMaxAI/MiniMax-H3, FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree, и адаптацию Comfy на barelymining/ComfyUI-MiniMax-H3-FastVideo.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы благодарно признаем MiniMaxAI за MiniMax-H3, FastVideo за веса FastH3 4-step VSA-DataFree, и barelymining за ComfyUI-MiniMax-H3-FastVideo за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, связанным ниже.
Ресурсы#
- AI Future Tech/Workflow source and reference
- Документы / Примечания к выпуску: Patreon post
- barelymining/ComfyUI-MiniMax-H3-FastVideo
- Hugging Face: barelymining/ComfyUI-MiniMax-H3-FastVideo
- FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree
- MiniMaxAI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Comfy.org/MiniMax H3 tutorial
- Документы / Примечания к выпуску: Comfy.org tutorial
Примечание: Использование упомянутых моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими.



