MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos: prompt-para-clipe com áudio nativo em uma passagem#
Este fluxo de trabalho transforma um único prompt cinematográfico em um vídeo curto com áudio estéreo gerado conjuntamente usando MiniMax H3. Aplica uma aceleração Turbo de 4 passos LoRA para que você possa iterar rapidamente sobre diálogos, canto e cenas de ambiente enquanto mantém movimento e som intimamente acoplados.
Desenvolvido para criadores que desejam rascunhos apenas de prompt, o fluxo de trabalho Turbo de 4 passos MiniMax H3 ComfyUI Texto-para-Vídeo produz fala ou vocais limpos, som ambiental coeso e cinematografia consistente sem montagem manual de áudio. O gráfico lida com alinhamento de comprimento, amostragem latente, decodificação e muxing automaticamente, para que você possa se concentrar em narrativas e indicações de desempenho.
Modelos principais no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos#
- Modelo de difusão MiniMax H3 (FL2VA UNet). Gerador audiovisual principal que aprende um latente compartilhado para imagem e som, permitindo movimento e áudio sincronizados a partir da mesma passagem de amostragem. Pesos: Comfy-Org/MiniMax-H3.
- Codificador de texto Qwen3-VL 32B para H3 (variante AWQ/NVFP4). Codifica prompts ricos e de várias sentenças em condicionamentos que direcionam o layout da cena, desempenho e eventos de áudio. Empacotado em Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE. Decodifica o vídeo latente amostrado em quadros com tom e detalhe cinematográficos. Arquivo: minimax_h3_video_vae_fp16.safetensors.
- MiniMax H3 Audio VAE. Decodifica o latente compartilhado em áudio estéreo alinhado no tempo para fala, canto e ambiente. Arquivo: minimax_h3_audio_vae_fp32.safetensors.
- MiniMax H3 Turbo 4-step LoRA. Aplica a receita de aceleração que preserva a fidelidade da cena enquanto permite amostragem muito rápida. Arquivo: minimax_h3_turbo_4step_pruned_comfyui.safetensors.
Como usar o fluxo de trabalho Comfyui MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos#
Em um nível alto, seu prompt é codificado, um modelo H3 aumentado com Turbo amostra um único latente audiovisual, e os VAEs de vídeo e áudio decodificam aquele latente antes de o clipe ser muxado em um arquivo reproduzível.
1) Escreva o prompt cinematográfico e defina a duração#
Use o campo de texto easy positive (#147) para descrever aparência, ação e desempenho. Para guiar a voz ou música, inclua pistas claras como “Audio: voz masculina de meia-idade entrega a linha... ambiente de chuva... trilha de suspense baixa.” O controlador Float (duration) (#133) define o comprimento do clipe em segundos. Um nó matemático converte sua duração em quadros e alinha silenciosamente a contagem ao ritmo necessário do H3, para que você não precise gerenciar a matemática dos quadros.
2) Carregue o H3, codificador de texto, VAEs e Turbo LoRA#
UNETLoader (#127) carrega o modelo de difusão MiniMax H3, e CLIPLoader (#128) carrega o codificador de texto Qwen3‑VL adaptado para H3. Dois nós VAELoader trazem o VAE de vídeo (#119) e o VAE de áudio (#120). LoraLoaderModelOnly (#153) aplica o MiniMax H3 Turbo de 4 passos LoRA ao modelo para que o programador e o sampler operem em um regime rápido sem perder a coerência audiovisual.
3) Construa o condicionamento e o latente audiovisual inicial#
MiniMaxH3ImageToVideo (#131) transforma seu prompt em condicionamento positivo e prepara um latente inicial alinhado à largura, altura e contagem de quadros escolhidas. Entradas opcionais first_frame e last_frame existem para ancorar uma imagem inicial ou final se você escolher estender o gráfico mais tarde. O nó produz o condicionamento e o latente que a amostragem a jusante irá refinar.
4) Amostre com Turbo#
BasicGuider (#126) emparelha o modelo com seu condicionamento, KSamplerSelect (#123) escolhe o algoritmo de amostragem, e BasicScheduler (#124) define o cronograma de passos que funciona com o Turbo LoRA. RandomNoise (#129) semeia a geração para reprodutibilidade. SamplerCustomAdvanced (#125) realiza a passagem de remoção de ruído para produzir o latente compartilhado final que codifica tanto o vídeo quanto o áudio.
5) Decodifique e exporte o clipe final#
VAEDecode (#122) reconstrói os quadros de imagem a partir do latente enquanto VAEDecodeAudio (#121) reconstrói o áudio estéreo sincronizado. CreateVideo (#130) muxa os quadros e o áudio em um único fluxo, então SaveVideo (#92) grava o arquivo no disco usando o prefixo de nome de arquivo que você definiu.
Nós principais no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Texto-para-Vídeo Turbo de 4 Passos#
MiniMaxH3ImageToVideo (#131)#
Produz o condicionamento positivo e inicializa o latente audiovisual a partir do seu prompt, resolução e comprimento. Ajustar width, height ou length altera tanto a escala de movimento quanto quanto de ação na tela pode caber. Se você estender o gráfico mais tarde, first_frame e last_frame permitem que você bloqueie a continuidade entre as tomadas.
LoraLoaderModelOnly (#153)#
Aplica o Turbo de 4 passos LoRA ao modelo H3 carregado. Mantenha o programador em um regime de baixo número de passos para beneficiar-se do Turbo; aumentar substancialmente os passos desvia o visual do comportamento de iteração rápida pretendido. Este LoRA é construído especificamente para MiniMax H3 e vive junto aos pesos principais no repositório do H3.
BasicScheduler (#124)#
Controla o cronograma de remoção de ruído que o sampler segue. Use-o para equilibrar velocidade e fidelidade enquanto permanece compatível com o Turbo LoRA. Se você mudar o algoritmo do sampler, revise a escolha do cronograma para manter movimento estável e áudio limpo.
SamplerCustomAdvanced (#125)#
Executa a remoção de ruído real dado o ruído, guia, sampler, sigmas e o latente inicial. É o árbitro final de textura, tempo e nitidez audiovisual. Use a mesma semente ao comparar ajustes de prompt para que você possa atribuir diferenças às mudanças de texto em vez de ruído.
PathchSageAttentionKJ (#150)#
Aplica uma otimização de atenção antes da injeção de LoRA para melhorar a vazão em grandes resoluções. Fornecido por KJNodes, que oferece ajudantes de desempenho para ComfyUI. Repositório: ComfyUI-KJNodes.
CreateVideo (#130)#
Combina quadros decodificados com o áudio decodificado em um clipe sincronizado. Você pode mudar a taxa de quadros ou profundidade de bits aqui se precisar corresponder às especificações de entrega. O nó mantém a sincronia áudio-vídeo derivada do latente compartilhado.
SaveVideo (#92)#
Grava o clipe renderizado no disco com o prefixo de nome de arquivo, contêiner e codec escolhidos. Use nomes consistentes para acompanhar iterações para a mesma cena e semente.
Extras opcionais#
- Prompt para fala: coloque a linha exata após “Audio:” e descreva idade, gênero, tom e ritmo da voz. Para canto, especifique estilo e tempo. Para ambiente, liste fontes, intensidade e se você deseja apenas trilha de fundo.
- Trocas entre resolução e duração: contagens de pixels mais altas e clipes mais longos custam mais tempo de amostragem. Se você precisar de muitas tomadas, comece menor, depois aumente a escala ou o comprimento uma vez que o tempo e a entrega pareçam corretos.
- Reprodutibilidade: mantenha a mesma semente ao ajustar apenas o texto para que você possa comparar pequenas edições de prompt.
- Alinhamento de comprimento é automático: o gráfico converte segundos em quadros e alinha a contagem ao ritmo interno do H3 para síntese audiovisual estável.
- Opções de continuidade: o nó do modelo expõe
first_frameelast_frameopcionais. Se você estender o fluxo de trabalho mais tarde, conecte imagens lá para corresponder ao início ou final das tomadas entre edições. - Segurança: evite personagens com direitos autorais, semelhanças de pessoas reais sem consentimento, e logotipos ou legendas na tela no seu prompt.
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos imensamente à MiniMax pelo modelo de geração multimodal MiniMax H3 e anúncio, Comfy.org pelo tutorial de fluxo de trabalho ComfyUI MiniMax H3, e Comfy-Org pelos pesos do modelo MiniMax-H3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.
Recursos#
- MiniMax/MiniMax H3: Um Modelo Aberto Que Quebra as Fronteiras Entre Tarefas e Modalidades
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Docs / Release Notes: MiniMax H3 official announcement
- Comfy.org/MiniMax H3: Exemplos de Fluxo de Trabalho ComfyUI
- GitHub: Comfy-Org/docs
- Docs / Release Notes: Comfy.org MiniMax H3 tutorial
- Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.


