MiniMax H3 ComfyUI Image to Video 4-step Turbo#
MiniMax H3 ComfyUI Image to Video 4-step Turbo é um fluxo de trabalho pronto para RunComfy que transforma uma única imagem estática em um vídeo curto com áudio estéreo nativo, diretamente no ComfyUI. Ele executa o pipeline de imagem para vídeo MiniMax H3 (Hailuo) e aplica um Turbo LoRA para que você possa visualizar movimento e diálogo em muito menos etapas de amostragem do que o cronograma padrão.
Este gráfico é construído para criadores que desejam rascunhos rápidos de I2V sem sair da tela do ComfyUI: personagens falantes, giros rápidos de produtos ou cenas ambientais com som sincronizado. Forneça um quadro inicial e um prompt de movimento/diálogo; o fluxo de trabalho gera quadros de vídeo e áudio estéreo juntos, depois os mescla em um clipe finalizado que você pode baixar.
Modelos chave no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Image to Video 4-step Turbo#
- MiniMaxAI/MiniMax-H3 modelo de vídeo multimodal. O modelo oficial H3 produz vídeo com áudio estéreo sincronizado e suporta I2V no primeiro quadro; este fluxo de trabalho usa o repack Comfy-Org para ComfyUI. MiniMaxAI/MiniMax-H3 e Comfy-Org/MiniMax-H3
- MiniMax H3 Video VAE. Codifica/decodifica latentes de vídeo usados pelo backbone de difusão do H3. Incluído no repack Comfy-Org. Comfy-Org/MiniMax-H3
- MiniMax H3 Audio VAE. Decodifica os latentes de áudio do modelo para formas de onda estéreo nativas alinhadas aos quadros. Incluído no repack Comfy-Org. Comfy-Org/MiniMax-H3
- Qwen3‑VL 32B codificador de texto (variante MiniMax H3). Interpreta seu prompt de movimento e diálogo em condicionamento para o H3. Empacotado com a liberação Comfy-Org em text_encoders. Comfy-Org/MiniMax-H3
- MiniMax‑H3 Turbo LoRA (4‑step). Um LoRA que acelera a amostragem do H3 para que visualizações nítidas sejam possíveis com contagens de etapas muito baixas. larryvrh/MiniMax-H3-Turbo-Lora e o artigo conceitual do LoRA LoRA: Low‑Rank Adaptation
Como usar o fluxo de trabalho Comfyui MiniMax H3 ComfyUI Image to Video 4-step Turbo#
Fluxo geral. O gráfico escala sua imagem carregada, converte sua duração em uma contagem de quadros H3 válida, depois alimenta o quadro inicial e o prompt no H3 com o Turbo LoRA aplicado. O amostrador produz latentes conjuntos de vídeo e áudio, que são decodificados e mesclados em um clipe baixável.
Carregar imagem. Use LoadImage (#114) para fornecer o primeiro quadro que você deseja animar. A imagem é redimensionada automaticamente por LayerUtility: ImageScaleByAspectRatio V2 (#167) para um lado longo alvo enquanto preserva o aspecto; a largura/altura derivadas alimentam o núcleo do nó H3. O letterboxing é usado quando necessário para evitar distorção. Isso mantém sua composição intacta enquanto corresponde à grade preferida do H3.
Parâmetros e prompt. Defina o comprimento do clipe usando o controle de Duração (rótulo "Duration (sec)") que alimenta um pequeno nó matemático, ComfyMathExpression (#134), que converte segundos em quadros na taxa de filme e se ajusta à grade válida do H3. Insira seu movimento e diálogo no nó de prompt verde easy positive (#152); você pode escrever sentenças naturais e discursos citados. O prompt é codificado pelo codificador de texto Qwen3‑VL via CLIPLoader (#130), preparando o condicionamento para o modelo.
Geração principal. UNETLoader (#129) carrega o backbone de difusão MiniMax H3 e VAELoader (#121, #122) carrega os VAEs de vídeo e áudio. O Turbo LoRA é mesclado em tempo de execução por LoraLoaderModelOnly (#171), e um patch de atenção eficiente em memória (MiniMaxH3MemoryEfficientSageAttentionPatch (#170)) ajuda a reduzir o VRAM. O nó principal, MiniMaxH3ImageToVideo (#133), recebe seu quadro inicial, prompt e largura/altura/comprimento calculados, depois produz latentes de vídeo e áudio sincronizados.
Amostragem e decodificação. Uma pilha de amostrador compacta (KSamplerSelect (#125), BasicScheduler (#126), BasicGuider (#128), SamplerCustomAdvanced (#127), RandomNoise (#131)) realiza a remoção de ruído em muito poucas iterações graças ao Turbo LoRA. VAEDecode (#124) transforma latentes de vídeo em quadros, e VAEDecodeAudio (#123) produz áudio estéreo alinhado a esses quadros. Você não precisa ajustar as configurações de decodificação; elas estão configuradas para visualizações limpas.
Saída. CreateVideo (#132) mescla os quadros e o áudio em um único clipe na taxa de quadros de trabalho, e SaveVideo (#92) grava-o com o prefixo de nome de arquivo configurado para que você possa baixar imediatamente do RunComfy. O resultado é um vídeo curto e sincronizado que reflete seu quadro inicial, prompt de movimento e diálogo.
Nós chave no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Image to Video 4-step Turbo#
MiniMaxH3ImageToVideo (#133). O coração do gráfico: consome o quadro inicial, o prompt codificado e seu tamanho/comprimento alvo e produz latentes conjuntos de vídeo e áudio. Ajuste apenas os poucos inputs expostos a você neste fluxo de trabalho: forneça um prompt forte e descritivo (inclua diálogo citado) e defina uma duração realista; o nó cuida do resto usando o modelo H3 e os VAEs do repack Comfy-Org. Comfy-Org/MiniMax-H3
LoraLoaderModelOnly (#171). Injeta o MiniMax‑H3 Turbo LoRA para que o amostrador possa alcançar alta nitidez em muito poucas etapas. Se você precisar trocar artefatos por velocidade, diminua ligeiramente a força do LoRA; se você ver borrão de movimento, aumente um pouco. O LoRA foi projetado para funcionar em todas as variantes base comuns do H3, incluindo repacks podados e quantizados. larryvrh/MiniMax-H3-Turbo-Lora
BasicScheduler (#126) e SamplerCustomAdvanced (#127). Juntos, controlam o cronograma de remoção de ruído e o comportamento de etapas. Com o Turbo LoRA em vigor, você pode executar com contagens de etapas muito baixas para visualizações rápidas; aumentar as etapas irá melhorar modestamente a estabilidade se você puder arcar com o tempo. Mantenha as escolhas de agendador e amostrador convencionais, a menos que você tenha um visual específico em mente.
LayerUtility: ImageScaleByAspectRatio V2 (#167). Garante que a imagem estática carregada seja redimensionada para uma resolução limpa e amigável ao modelo enquanto preserva o aspecto. Use isso ao trocar imagens de origem para evitar cortes ou distorções inesperadas; o nó fornece a largura/altura exata que o nó principal H3 consome. ComfyUI_LayerStyle
ComfyMathExpression (#134). Converte segundos em quadros e ajusta a contagem para a grade de quadros válida do H3 para que o áudio permaneça sincronizado com o vídeo. Você pode pensar nisso como um "guarda de segurança" que evita contagens de quadros que o H3 não suporta, evitando desincronizações sutis na fase de mesclagem. A entrada é a duração em inglês simples que você define no topo da tela.
MiniMaxH3MemoryEfficientSageAttentionPatch (#170). Aplica uma otimização de atenção experimental que reduz o pico de VRAM durante a amostragem no H3. Ative-o ao trabalhar com tamanhos maiores ou em GPUs com memória limitada; ele preserva a intenção criativa enquanto melhora o ajuste. ComfyUI‑KJNodes
Extras opcionais#
- Prompt para sincronização labial: escreva a linha real entre aspas (por exemplo, "O jantar está pronto — experimente esta carbonara.") e descreva a ambientação e o movimento da câmera em linguagem clara.
- Composição primeiro: escolha um quadro inicial que já enquadre seu sujeito à distância pretendida; a animação respeitará essa composição.
- Velocidade vs polimento: a configuração MiniMax H3 ComfyUI Image to Video 4-step Turbo é ajustada para visualizações rápidas; se uma tomada for importante, adicione algumas etapas ou reduza ligeiramente a força do LoRA para domar o grão excessivamente nítido.
- Espaço de execução: se você atingir limites de VRAM, tente um comprimento máximo de imagem lateral menor, reduza a duração ou ative o patch de atenção eficiente em memória.
- Explore bases: o fluxo de trabalho é compatível com as variantes do repack H3 do Comfy-Org (bf16, int8 convrot, podado). Se você mudar a base, mantenha o Turbo LoRA conectado entre o carregador do modelo e o amostrador para o mesmo efeito de aceleração. Comfy-Org/MiniMax-H3
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos imensamente à MiniMax pelo modelo MiniMax H3, à Comfy.org pelo tutorial do fluxo de trabalho MiniMax H3 ComfyUI, à Comfy-Org pelos pesos do modelo MiniMax-H3, e a larryvrh pelo MiniMax-H3 Turbo LoRA por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- Anúncio oficial MiniMax/MiniMax H3
- Documentos / Notas de Lançamento: Anúncio oficial MiniMax H3
- Tutorial Comfy.org/MiniMax H3
- GitHub: Comfy-Org/docs
- Documentos / Notas de Lançamento: Tutorial MiniMax H3
- Pesos do modelo Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Nota: O uso dos modelos, conjuntos de dados e códigos referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

