FastH3 8-шаговый V2 ComfyUI Workflow: двухкадровое условное MiniMax H3 видео с аудио#
FastH3 8-шаговый V2 ComfyUI Workflow превращает первый и последний референсный кадры в непрерывное MiniMax H3 видео с синхронизированным сгенерированным аудио. Он использует FastVideo FastH3 V2 INT8 контрольную точку с восьмишаговым расписанием, разреженным вниманием и явным условием первого/последнего кадра для достижения быстрых и контролируемых результатов.
Этот рабочий процесс идеально подходит для кинематографических переходов, движений персонажей, социальных видео-концепций и коротких сюжетных кадров, которые требуют определенной начальной и конечной композиции. Если вы хотите стабильных объектов, фиксированного кадрирования и естественного движения, сохраняя высокую скорость, FastH3 8-шаговый V2 ComfyUI Workflow создан для вас.
Ключевые модели в ComfyUI FastH3 8-шаговый V2 ComfyUI Workflow#
- FastVideo FastH3 8-шаговый V2 (INT8). Диффузионный базис, который генерирует видео и аудио латенты всего за восемь шагов выборки для быстрой итерации. Контрольные точки: FastVideo/FastVideo-FastH3-8-Step-V2 и готовые для ComfyUI веса в FastVideo/FastVideo-FastH3-Comfy.
- Qwen3-VL 32B текстовый энкодер для MiniMax H3. Кодирует подсказку в условные встраивания, используемые для управления движением, деталями сцены и аудиосигналами. Веса распространяются с официальным набором моделей в Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE. Декодирует видео латенты в RGB кадры с целевым разрешением, указанным входными данными. См. Comfy-Org/MiniMax-H3.
- MiniMax H3 Audio VAE. Декодирует аудио латенты в аудиоволновую форму, которая объединяется с сгенерированными кадрами. См. Comfy-Org/MiniMax-H3.
Как использовать ComfyUI FastH3 8-шаговый V2 ComfyUI Workflow#
График следует официальному шаблону FastH3 из изображения в видео и собирает ваш кадр слева направо. Вы предоставляете два референсных изображения и текстовую подсказку, рабочий процесс вычисляет необходимое условие и выборку за восемь шагов с разреженным вниманием, затем декодирует синхронизированное видео и аудио и сохраняет готовый к публикации файл.
Изображения/Видео Входы (2)
- Загрузите ваши первые и последние кадры, используя
LoadImage(#136) иLoadImage(#161). Выберите изображения из одной сцены и с одинаковым соотношением сторон, чтобы композиция и идентичность оставались последовательными на протяжении всего клипа. - Первый кадр автоматически изменяется по размеру с помощью
ImageScaleToTotalPixels(#142) для соответствия вычислительному бюджету, затемGetImageSize(#141) считывает его ширину и высоту, чтобы сгенерированная последовательность соответствовала этому разрешению. - Используйте естественные, точно соответствующие сцене референсные кадры. Последний кадр закрепляет финальную композицию, чтобы кадр завершался именно там, где вы планировали.
Обработка (19)
- Основные веса загружаются с помощью
UNETLoader(#151),CLIPLoader(#152) и двух узловVAELoader(#143 видео, #144 аудио). УзелMiniMaxH3ImageToVideo(#155) объединяет ваш первый кадр, последний кадр, подсказку и целевую продолжительность в единый пакет условий и первоначальный латент. - Продолжительность устанавливается один раз с помощью удобного управления
Float (duration)(#157).ComfyMathExpression(#156) преобразует это время в количество кадров, выровненное с шагом модели для плавного внимания на протяжении всей последовательности. - Временные и эффективные помощники включают
MiniMaxH3SigmaShift(#160) для смещения расписания для MiniMax H3,ModelAttentionBackend(#159) для выбора реализации внимания иBlockSparseAttention(#158) для снижения вычислений при сохранении четкости в важных областях. - Основной процесс денойзинга использует
BasicGuider(#150) с положительным условием от узла изображения-видео, восьмишаговымBasicScheduler(#148), выборщикомres_multistep, выбранным вKSamplerSelect(#147), иSamplerCustomAdvanced(#149) для создания совместных видео и аудио латентов за один проход.
Выходы (2)
- Видео латенты декодируются в кадры через
VAEDecode(#146), в то время как аудио латенты декодируются черезVAEDecodeAudio(#145).CreateVideo(#154) затем объединяет последовательность изображений и аудио в один клип. SaveVideo(#92) записывает файл. Установите префикс имени файла и выберите формат и кодек, которые соответствуют вашей платформе доставки или монтажному процессу.
Ключевые узлы в ComfyUI FastH3 8-шаговый V2 ComfyUI Workflow#
MiniMaxH3ImageToVideo (#155)
- Создает условие из ваших первых и последних референсных кадров плюс подсказку и выводит первоначальный латент для совместной генерации видео и аудио. Настройте текстовую подсказку, чтобы описать движение, камеру, атмосферу и любые желаемые звуковые сигналы. Сохраняйте идентичность и элементы сцены последовательными с референсами для наиболее стабильных результатов. Настройте управление продолжительностью в левой группе, чтобы изменить длину клипа, не изменяя настройки выборщика.
BlockSparseAttention (#158)
- Применяет разреженное внимание к загруженной модели для ускорения выборки, сохраняя внимание там, где это важно. Если вы видите потерю деталей в насыщенных сценах, увеличьте оставшуюся долю или зарезервируйте дополнительные токены для передних объектов. Для простых сцен более сильная разреженность может значительно ускорить рендеринг.
MiniMaxH3SigmaShift (#160)
- Смещает расписание шума для видео и аудио, чтобы временная структура и звук оставались согласованными на протяжении короткой восьмишаговой траектории. Если движение кажется дрожащим, увеличьте сдвиг видео; если выравнивание аудио смещается, слегка настройте сдвиг аудио. Используйте небольшие изменения и тестируйте короткие предварительные просмотры, чтобы найти баланс.
SamplerCustomAdvanced (#149)
- Выполняет восьмишаговый денойзинг с выборщиком
res_multistepи расписанием отBasicScheduler(#148). Оставьте фиксированным зерно вRandomNoise(#153) для воспроизводимости, затем измените его, чтобы исследовать альтернативы, как только вам понравится движение. Сильное руководство отBasicGuider(#150) помогает следовать подсказке, когда композиции сложны.
CreateVideo (#154)
- Объединяет декодированные кадры и аудио в финальный клип. Установите количество кадров в секунду для управления каденцией, выберите цветовое пространство для вашего рабочего процесса, и если вы планируете редактировать позже, выберите кодек, который балансирует размер и качество для вашего NLE.
Опциональные дополнения#
- Выбор референсов: выберите два кадра с одинаковым объективом и перспективой, с одинаковой экспозицией и балансом белого. Более четкие референсы обычно дают более чистые текстуры.
- Подсказка: напишите, что делает объект, как ведет себя камера и как звучит окружение. Сохраняйте формулировку, соответствующую вашим референсам, чтобы избежать смещения идентичности.
- Разрешение против скорости: если вы достигаете пределов памяти, уменьшите целевой пиксельный бюджет в
ImageScaleToTotalPixels(#142). Для героических кадров увеличьте его и рендерьте меньше вариаций. - Продолжительность и fps: настройте продолжительность для темпа, затем установите fps в
CreateVideo(#154) для управления ощущением. Рабочий процесс автоматически выравнивает количество кадров для стабильного внимания. - Зерна и итерации: зафиксируйте зерно шума, чтобы уточнить подсказки и референсы, затем попробуйте новые зерна для альтернатив, как только композиция и время блокированы.
- Паритет шаблона: график следует официальной структуре FastH3 I2V, поэтому советы из референсного шаблона в Comfy-Org/workflow_templates переносятся напрямую.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы с благодарностью признаем FastVideo за модель FastH3 8-шаговый V2 и веса ComfyUI, Comfy-Org за шаблон рабочего процесса FastH3 I2V, и RunningHub.ai за исходный код рабочего процесса за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- RunningHub.ai/Источник рабочего процесса
- Документация / Примечания к релизу: RunningHub.ai пост
- FastVideo/FastVideo-FastH3-8-Step-V2
- GitHub: hao-ai-lab/FastVideo
- Hugging Face: FastVideo/FastVideo-FastH3-8-Step-V2
- arXiv: 2405.14867
- FastVideo/FastVideo-FastH3-Comfy
- Hugging Face: FastVideo/FastVideo-FastH3-Comfy
- Comfy-Org/workflow_templates (FastH3 I2V шаблон)
- GitHub: Comfy-Org/workflow_templates
Примечание: Использование упомянутых моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.

