Все-в-одном MiniMax H3 ComfyUI Multi References Accelerated: многоцелевое видео Ref2VA с синхронизированным стереозвуком#
Этот Все-в-одном MiniMax H3 ComfyUI Multi References Accelerated рабочий процесс превращает до девяти визуальных ссылок плюс дополнительные видео и аудиоподсказки в короткий кинематографический клип с родным стереозвуковым сопровождением. Он предназначен для создателей, которые хотят получать кадры с последовательными персонажами, объединяющими несколько идентичностей, реквизит или локации, сохраняя такие теги, как <Picture 1> в соответствии с правильной ссылкой.
Основанный на открытой платформе Comfy‑Org MiniMax‑H3 Ref2VA, график позволяет ускорение SageAttention для более быстрой выборки на поддерживаемых GPU и использует модель int8‑pruned для контроля VRAM без ущерба для согласованности. В результате получается холст, готовый к запуску RunComfy, для MiniMax H3, где управление многоцелевой направленностью, временем, разрешением и экспортом связано последовательно.
Ключевые модели в Comfyui Все-в-одном MiniMax H3 ComfyUI Multi References Accelerated рабочем процессе#
- MiniMax‑H3 Ref2VA модель диффузии (pruned int8 convrot). Основной генератор, который объединяет ваши ссылки и подсказку в совместные видео и аудио латенты. Весы: Comfy‑Org/MiniMax‑H3.
- Qwen3‑VL 32B текст‑изображение‑язык энкодер (AWQ, поставляется с выпуском MiniMax‑H3). Интерпретирует вашу подсказку, включая такие теги, как <Picture 1>, и настраивает генератор. Весы включены в Comfy‑Org/MiniMax‑H3.
- MiniMax H3 Video VAE (FP16). Декодирует видео латенты в кадры с высокой точностью. Весы: Comfy‑Org/MiniMax‑H3.
- MiniMax H3 Audio VAE (FP32). Декодирует аудио латенты в чистую стерео волну, готовую к мультиплексированию. Весы: Comfy‑Org/MiniMax‑H3.
Как использовать Comfyui Все-в-одном MiniMax H3 ComfyUI Multi References Accelerated рабочий процесс#
На высоком уровне вы загружаете модели, предоставляете ссылки и подсказку, рабочий процесс создает настройку MiniMax‑H3, запускает ускоренный семплер, затем декодирует и объединяет видео кадры с созданным стереозвуком. Группы работают последовательно: пользовательские входы подают настраивание, которое управляет выборкой; декодированные результаты отправляются на экспорт.
Пользовательские входы#
Используйте узлы LoadImage для подключения до девяти ссылок. Сохраняйте последовательный порядок, чтобы теги подсказок, такие как <Picture 1>, <Picture 2>, и так далее, соответствовали предполагаемым изображениям. Напишите свою сцену и диалог в поле Input Text (Prompt), явно сопоставляя идентичности или активы с пронумерованными тегами в верхней части подсказки. Выберите аспект и размер в Resolution Selector (Size); он выводит ширину и высоту, округленные до кратного 32 пикселям для стабильности. Установите продолжительность клипа в секундах; внутренняя формула преобразует это в количество кадров около 24 кадров в секунду и выравнивает его на дружественное модели кратное для плавной выборки.
Модели#
Эта группа загружает MiniMax‑H3 UNet, Qwen3‑VL 32B текстовый энкодер и оба VAE. int8‑pruned Ref2VA модель снижает память, сохраняя качество движения и синхронизации губ. Текстовый энкодер инициализируется для MiniMax‑H3, чтобы визуальные теги в вашей подсказке связывались с правильными ссылками. Отдельные VAE для видео и аудио обеспечивают точное и эффективное декодирование. Модели принадлежат той же семье, что и официальный шаблон Ref2VA, адаптированный здесь для управления многоцелевыми ссылками и совместного аудио. Ссылка: MiniMax‑H3 R2V template.
Настройка#
MiniMaxH3ReferenceToVideo создает фактическую настройку H3 и начальный латентный клип. Он принимает ваш CLIP, VAE, все подключенные ссылки изображений, подсказку и выбранные ширину, высоту и длину. Узел соблюдает заполнительные теги, чтобы идентичности, локации и реквизит оставались привязанными к правильным ссылкам. Используйте режим размера ссылки, чтобы сохранить композицию в масштабе относительно вашего вывода. Узел излучает положительный поток настройки и латентный клип, которые вместе управляют семплером.
Выборка#
Перед выборкой график оборачивает модель с помощью PathchSageAttentionKJ, чтобы включить ускорение SageAttention, затем проходит через менеджер VRAM, чтобы большие клипы могли более комфортно поместиться. BasicGuider, BasicScheduler и KSamplerSelect определяют стратегию управления, график шагов и алгоритм семплера. RandomNoise задаёт процесс, а SamplerCustomAdvanced выполняет проходы денойзинга против модели и настройки, производя уточнённые видео и аудио латенты. Макет балансирует скорость и качество для MiniMax‑H3, сохраняя параметры доступными.
Экспорт#
VAEDecode и VAEDecodeAudio преобразуют финальные латенты в кадры и стерео волну. Затем VHS_VideoCombine мультиплексирует кадры и аудио в единый MP4 с выбранной частотой кадров, с контролем качества через CRF и простым префиксом имени файла для организации. Вы можете немедленно просмотреть результат и сохранить его в вашей выходной папке. Если позже вы добавите внешнюю ссылку на аудио, экспортер может обрезать до длины этого трека для идеального выравнивания. Экспортер исходит из широко используемого Video Helper Suite для ComfyUI: ComfyUI‑VideoHelperSuite.
Ключевые узлы в Comfyui Все-в-одном MiniMax H3 ComfyUI Multi References Accelerated рабочем процессе#
MiniMaxH3ReferenceToVideo (#136) Это сердце рабочего процесса, где ссылки, подсказка, размер и длина объединяются в настройку MiniMax‑H3 и латентный клип. Настройте текст prompt с явными сопоставлениями тегов, такими как <Picture 1> = character A, чтобы закрепить идентичности. Настройте width, height и length, чтобы задать композицию и время выполнения; верхний селектор и контроль продолжительности заботятся о безопасных кратных. Используйте режим размера ссылки, чтобы сбалансировать масштаб объекта относительно выходного кадра. Узел поддерживает официальный путь Ref2VA и адаптирован здесь для управления многоцелевыми ссылками.
PathchSageAttentionKJ (#144) Оборачивает модель с помощью SageAttention для ускорения слоёв внимания и снижения давления на память на поддерживаемых GPU. Оставьте режим ускорения на auto для большинства карт; включайте компиляцию модели только если ваша среда извлекает из этого выгоду. Если вы замечаете нестабильность, переключите режим на отключено, чтобы сравнить производительность. Источник: ComfyUI‑KJNodes.
BasicScheduler (#124) Определяет график сигма и общее количество шагов, используемых во время денойзинга. Увеличение шагов может добавить детали, но увеличивает время рендеринга; сочетайте любые изменения здесь с совместимым типом семплера. Держите denoise близким к полному для чистой генерации, и рассматривайте снижение его только при выполнении ограниченного по силе уточнения.
SamplerCustomAdvanced (#125) Запускает петлю диффузии с выбранным семплером, графиком и гидером. Стандартный семплер балансирует временную стабильность и плавность движения для MiniMax‑H3. Если вы измените семейство планировщиков, выберите семплер, разработанный для него, чтобы избежать артефактов.
Resolution Selector (Size) (#115) Выводит ширину и высоту, округленные до кратного 32 пикселям для форм, дружественных GPU. Установите megapixels для быстрого компромисса между качеством и скоростью, и выберите аспект, такой как 16:9 для широкоформатных снимков. Используйте умеренные размеры для черновых предварительных просмотров, затем увеличивайте после того, как время и кадрирование будут зафиксированы.
ComfyMathExpression (#131) Преобразует запрашиваемые секунды в количество кадров около 24 кадров в секунду и выравнивает его на кратное, которое сотрудничает с семплером и моделью. Это помогает избежать временного дрожания и проблем с таймингом "на один кадр". Вам редко нужно это трогать; контролируйте время с помощью ввода секунд.
VHS_VideoCombine (#143) Мультиплексирует кадры и созданный стереозвук в финальный продукт. Установите frame_rate, чтобы соответствовать вашей целевой временной шкале, и отрегулируйте crf для качества. Используйте trim_to_audio, когда вы предоставляете внешнюю дорожку и хотите идеальный обрезок до длины.
Дополнительные опции#
- Быстрые размеры 16:9, которые быстро рендерятся и выглядят чисто: 1056×608 (0.6 MP), 1216×672 (0.8 MP), 1344×768 (0.98 MP), 1664×928 (1.5 MP), 1920×1088 (2.0 MP).
- Держите подсказки явными: начните с блока сопоставления, который связывает
<Picture 1..9>с идентичностями, нарядами, реквизитом или местами, прежде чем описывать кадр. - Для последовательных лиц используйте чёткие, фронтальные изображения и изменяйте только освещение или угол слегка между ссылками.
- Диалоги и фоли хорошо работают, когда написаны как короткие, естественные предложения; аудио VAE синтезирует чистую стереодорожку из латентов Ref2VA.
- Если VRAM ограничен, сначала рендерьте более короткий клип или уменьшайте количество мегапикселей, затем увеличивайте или продлевайте, когда удовлетворены движением и кадрированием.
- Этот макет следует по линии официального шаблона Ref2VA, адаптированного для управления многоцелевыми ссылками и ускорения. См. базовый шаблон для контекста: MiniMax‑H3 R2V template.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим MiniMax за MiniMax H3, Comfy-Org за веса модели MiniMax-H3 и шаблон рабочего процесса MiniMax H3 R2V, а также Comfy.org за учебник MiniMax H3 за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Официальное объявление MiniMax H3
- Документы / Примечания к выпуску: MiniMax H3 announcement
- Comfy-Org MiniMax-H3 веса модели
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org MiniMax H3 учебник
- Документы / Примечания к выпуску: Comfy.org tutorial
- Comfy.org MiniMax H3 R2V шаблон
- GitHub: Comfy-Org/workflow_templates
Примечание: Использование ссылочных моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими лицами.

