ComfyUI>Fluxos de Trabalho>MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos

MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1483
Transforme um prompt cinematográfico em um vídeo curto. Você obtém som estéreo nativo na mesma passagem. Crie diálogos claros, canto e cenas de ambiente. Hailuo H3 Turbo usa amostragem de quatro passos para rascunhos mais rápidos. Você pode testar ideias rapidamente. Exporte movimento e áudio juntos.

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Workflow

MiniMax H3 ComfyUI Text-to-Video | 4-Step Turbo
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Examples

MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos: prompt-para-clipe com áudio nativo em uma passagem#

Este fluxo de trabalho transforma um único prompt cinematográfico em um vídeo curto com áudio estéreo gerado conjuntamente usando MiniMax H3. Aplica uma aceleração Turbo de 4 passos LoRA para que você possa iterar rapidamente sobre diálogos, canto e cenas de ambiente enquanto mantém movimento e som intimamente acoplados.

Desenvolvido para criadores que desejam rascunhos apenas de prompt, o fluxo de trabalho Turbo de 4 passos MiniMax H3 ComfyUI Texto-para-Vídeo produz fala ou vocais limpos, som ambiental coeso e cinematografia consistente sem montagem manual de áudio. O gráfico lida com alinhamento de comprimento, amostragem latente, decodificação e muxing automaticamente, para que você possa se concentrar em narrativas e indicações de desempenho.

Modelos principais no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos#

  • Modelo de difusão MiniMax H3 (FL2VA UNet). Gerador audiovisual principal que aprende um latente compartilhado para imagem e som, permitindo movimento e áudio sincronizados a partir da mesma passagem de amostragem. Pesos: Comfy-Org/MiniMax-H3.
  • Codificador de texto Qwen3-VL 32B para H3 (variante AWQ/NVFP4). Codifica prompts ricos e de várias sentenças em condicionamentos que direcionam o layout da cena, desempenho e eventos de áudio. Empacotado em Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. Decodifica o vídeo latente amostrado em quadros com tom e detalhe cinematográficos. Arquivo: minimax_h3_video_vae_fp16.safetensors.
  • MiniMax H3 Audio VAE. Decodifica o latente compartilhado em áudio estéreo alinhado no tempo para fala, canto e ambiente. Arquivo: minimax_h3_audio_vae_fp32.safetensors.
  • MiniMax H3 Turbo 4-step LoRA. Aplica a receita de aceleração que preserva a fidelidade da cena enquanto permite amostragem muito rápida. Arquivo: minimax_h3_turbo_4step_pruned_comfyui.safetensors.

Como usar o fluxo de trabalho Comfyui MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos#

Em um nível alto, seu prompt é codificado, um modelo H3 aumentado com Turbo amostra um único latente audiovisual, e os VAEs de vídeo e áudio decodificam aquele latente antes de o clipe ser muxado em um arquivo reproduzível.

1) Escreva o prompt cinematográfico e defina a duração#

Use o campo de texto easy positive (#147) para descrever aparência, ação e desempenho. Para guiar a voz ou música, inclua pistas claras como “Audio: voz masculina de meia-idade entrega a linha... ambiente de chuva... trilha de suspense baixa.” O controlador Float (duration) (#133) define o comprimento do clipe em segundos. Um nó matemático converte sua duração em quadros e alinha silenciosamente a contagem ao ritmo necessário do H3, para que você não precise gerenciar a matemática dos quadros.

2) Carregue o H3, codificador de texto, VAEs e Turbo LoRA#

UNETLoader (#127) carrega o modelo de difusão MiniMax H3, e CLIPLoader (#128) carrega o codificador de texto Qwen3‑VL adaptado para H3. Dois nós VAELoader trazem o VAE de vídeo (#119) e o VAE de áudio (#120). LoraLoaderModelOnly (#153) aplica o MiniMax H3 Turbo de 4 passos LoRA ao modelo para que o programador e o sampler operem em um regime rápido sem perder a coerência audiovisual.

3) Construa o condicionamento e o latente audiovisual inicial#

MiniMaxH3ImageToVideo (#131) transforma seu prompt em condicionamento positivo e prepara um latente inicial alinhado à largura, altura e contagem de quadros escolhidas. Entradas opcionais first_frame e last_frame existem para ancorar uma imagem inicial ou final se você escolher estender o gráfico mais tarde. O nó produz o condicionamento e o latente que a amostragem a jusante irá refinar.

4) Amostre com Turbo#

BasicGuider (#126) emparelha o modelo com seu condicionamento, KSamplerSelect (#123) escolhe o algoritmo de amostragem, e BasicScheduler (#124) define o cronograma de passos que funciona com o Turbo LoRA. RandomNoise (#129) semeia a geração para reprodutibilidade. SamplerCustomAdvanced (#125) realiza a passagem de remoção de ruído para produzir o latente compartilhado final que codifica tanto o vídeo quanto o áudio.

5) Decodifique e exporte o clipe final#

VAEDecode (#122) reconstrói os quadros de imagem a partir do latente enquanto VAEDecodeAudio (#121) reconstrói o áudio estéreo sincronizado. CreateVideo (#130) muxa os quadros e o áudio em um único fluxo, então SaveVideo (#92) grava o arquivo no disco usando o prefixo de nome de arquivo que você definiu.

Nós principais no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos#

MiniMaxH3ImageToVideo (#131)#

Produz o condicionamento positivo e inicializa o latente audiovisual a partir do seu prompt, resolução e comprimento. Ajustar width, height ou length altera tanto a escala de movimento quanto quanto de ação na tela pode caber. Se você estender o gráfico mais tarde, first_frame e last_frame permitem que você bloqueie a continuidade entre as tomadas.

LoraLoaderModelOnly (#153)#

Aplica o Turbo de 4 passos LoRA ao modelo H3 carregado. Mantenha o programador em um regime de baixo número de passos para beneficiar-se do Turbo; aumentar substancialmente os passos desvia o visual do comportamento de iteração rápida pretendido. Este LoRA é construído especificamente para MiniMax H3 e vive junto aos pesos principais no repositório do H3.

BasicScheduler (#124)#

Controla o cronograma de remoção de ruído que o sampler segue. Use-o para equilibrar velocidade e fidelidade enquanto permanece compatível com o Turbo LoRA. Se você mudar o algoritmo do sampler, revise a escolha do cronograma para manter movimento estável e áudio limpo.

SamplerCustomAdvanced (#125)#

Executa a remoção de ruído real dado o ruído, guia, sampler, sigmas e o latente inicial. É o árbitro final de textura, tempo e nitidez audiovisual. Use a mesma semente ao comparar ajustes de prompt para que você possa atribuir diferenças às mudanças de texto em vez de ruído.

PathchSageAttentionKJ (#150)#

Aplica uma otimização de atenção antes da injeção de LoRA para melhorar a vazão em grandes resoluções. Fornecido por KJNodes, que oferece ajudantes de desempenho para ComfyUI. Repositório: ComfyUI-KJNodes.

CreateVideo (#130)#

Combina quadros decodificados com o áudio decodificado em um clipe sincronizado. Você pode mudar a taxa de quadros ou profundidade de bits aqui se precisar corresponder às especificações de entrega. O nó mantém a sincronia áudio-vídeo derivada do latente compartilhado.

SaveVideo (#92)#

Grava o clipe renderizado no disco com o prefixo de nome de arquivo, contêiner e codec escolhidos. Use nomes consistentes para acompanhar iterações para a mesma cena e semente.

Extras opcionais#

  • Prompt para fala: coloque a linha exata após “Audio:” e descreva idade, gênero, tom e ritmo da voz. Para canto, especifique estilo e tempo. Para ambiente, liste fontes, intensidade e se você deseja apenas trilha de fundo.
  • Trocas entre resolução e duração: contagens de pixels mais altas e clipes mais longos custam mais tempo de amostragem. Se você precisar de muitas tomadas, comece menor, depois aumente a escala ou o comprimento uma vez que o tempo e a entrega pareçam corretos.
  • Reprodutibilidade: mantenha a mesma semente ao ajustar apenas o texto para que você possa comparar pequenas edições de prompt.
  • Alinhamento de comprimento é automático: o gráfico converte segundos em quadros e alinha a contagem ao ritmo interno do H3 para síntese audiovisual estável.
  • Opções de continuidade: o nó do modelo expõe first_frame e last_frame opcionais. Se você estender o fluxo de trabalho mais tarde, conecte imagens lá para corresponder ao início ou final das tomadas entre edições.
  • Segurança: evite personagens com direitos autorais, semelhanças de pessoas reais sem consentimento, e logotipos ou legendas na tela no seu prompt.

Agradecimentos#

Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos imensamente à MiniMax pelo modelo de geração multimodal MiniMax H3 e anúncio, Comfy.org pelo tutorial de fluxo de trabalho ComfyUI MiniMax H3, e Comfy-Org pelos pesos do modelo MiniMax-H3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.