MiniMax H3 T2V ComfyUI: prompt-para-vídeo com áudio estéreo nativo#
MiniMax H3 T2V ComfyUI transforma um único prompt em um vídeo curto cinematográfico com áudio estéreo sincronizado. Construído a partir do modelo oficial Comfy.org e dos pesos abertos MiniMax-H3 do Comfy-Org, ele segue o caminho FL2VA para que movimento e som sejam gerados juntos, não costurados após o fato. É ideal para explorações rápidas de cenas apenas com prompt, clipes de diálogo ou canto, e cenas conceituais que precisam de visuais e som em uma única passagem.
Descreva as cenas, a câmera, a performance e as dicas de áudio em um único bloco, escolha o tamanho e a duração, então coloque o gráfico na fila. O fluxo de trabalho carrega os componentes MiniMax-H3 corretos, amostra latentes audiovisuais conjuntos, decodifica-os para quadros e áudio estéreo, e salva um arquivo de vídeo finalizado.
Modelos-chave no fluxo de trabalho Comfyui MiniMax H3 T2V ComfyUI#
- Modelo de difusão MiniMax-H3 FL2VA. O núcleo UNet que realiza o desruído conjunto áudio-vídeo para que movimento e som permaneçam alinhados em fase. Pesos fornecidos pelo Comfy-Org sob diffusion_models. Model files
- MiniMax-H3 Video VAE. Codifica e decodifica latentes visuais para quadros RGB, preservando detalhes cinematográficos e continuidade de movimento. minimax_h3_video_vae_fp16.safetensors
- MiniMax-H3 Audio VAE. Codifica e decodifica latentes de áudio para uma onda estéreo alinhada no tempo para cada clipe. minimax_h3_audio_vae_fp32.safetensors
- Codificador de texto Qwen3-VL 32B (AWQ para MiniMax-H3). Interpreta o prompt em condicionamento que cobre semântica de cena, tempo e intenção de áudio. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
Se você quiser comparar o modelo original no qual este gráfico se baseia, veja a referência do Comfy.org. Template JSON
Como usar o fluxo de trabalho Comfyui MiniMax H3 T2V ComfyUI#
Em um nível alto, você define a resolução e duração alvo, escreve um único prompt que inclui visuais e áudio, opcionalmente adiciona quadros iniciais e finais, então executa. Dentro do subgráfico, MiniMax-H3 cria latentes de vídeo e áudio sincronizados, que são decodificados, unidos em um filme de 24 fps e salvos.
ResolutionSelector (#115)#
Escolha uma proporção de aspecto e escala para definir width e height. O seletor arredonda para múltiplos eficientes de 32 e alimenta esses valores no subgráfico MiniMax-H3, para que você não precise calcular manualmente as dimensões. Comece com tamanhos moderados para iteração mais rápida, depois aumente quando o seu prompt estiver correto. Mudar a proporção de aspecto é uma alavanca criativa poderosa para trailers, clipes verticais e pré-visualizações quadradas.
Image to Video (MiniMax H3) (#105)#
Este subgráfico orquestra o pipeline MiniMax H3 T2V ComfyUI. Cole um único prompt coerente que descreva cenas, edições e a trilha sonora juntas, e opcionalmente forneça imagens de first_frame e last_frame para ancorar a entrada e saída. Defina uma duration amigável ao humano e o gráfico converte isso em uma contagem de quadros válida para o modelo. O subgráfico retorna latentes audiovisuais sincronizados que seguem para decodificação e multiplexação.
Grupo de modelos#
O grupo de modelos carrega os componentes MiniMax-H3 exatos para este fluxo de trabalho. UNETLoader (#6) puxa o modelo de difusão FL2VA, CLIPLoader (#13) carrega o codificador Qwen3-VL, e dois nós VAELoader (#11 vídeo, #24 áudio) preparam decodificadores. Estes estão apontados para os arquivos MiniMax-H3 do Comfy-Org para que você possa executar sem fiação manual. Manter os modelos centralizados aqui torna futuras trocas ou atualizações diretas.
Grupo de condicionamento#
MiniMaxH3ImageToVideo (#104) transforma seu prompt, first_frame e last_frame opcionais, e os width, height e length selecionados em condicionamento MiniMax-H3 mais um latente inicial. A ideia é permitir que o modelo leia tanto o conteúdo da cena quanto a intenção de áudio de uma só vez, o que leva a uma sincronização mais apertada. Se você fornecer quadros de referência, a entrada e a saída são guiadas para continuidade; se deixá-los vazios, a geração começa fria.
Grupo de amostragem#
A amostragem é gerida por RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16), e o principal SamplerCustomAdvanced (#14). Juntos, eles desruem o latente conjunto para que o movimento das imagens e eventos de som se desenvolvam em sincronia. Você pode executar novamente com uma nova semente para tomadas alternativas mantendo a mesma direção criativa. Uma vez confortável, experimentar com a escolha do amostrador ou cronograma pode mudar ligeiramente a energia de movimento e a textura sonora.
Decodificação e criação de grupo de vídeo#
VAEDecode (#10) reconstrói a sequência de quadros a partir do latente de vídeo, e VAEDecodeAudio (#23) reconstrói uma onda estéreo a partir do latente de áudio. CreateVideo (#91) multiplica quadros e áudio em um clipe finalizado a 24 fps. É aqui que cortes limpos e batidas especificadas no prompt se juntam na linha do tempo. A saída segue para o salvamento.
SaveVideo (#92)#
Grava o vídeo final no seu saída ComfyUI sob video/MiniMax_H3. O nó usa nomenclatura automática para que você possa iterar rapidamente, e você pode alterar o caminho para manter diferentes projetos separados. A saída contém tanto a imagem gerada quanto o áudio estéreo.
Nós-chave no fluxo de trabalho Comfyui MiniMax H3 T2V ComfyUI#
MiniMaxH3ImageToVideo (#104)#
Nó de condicionamento central para MiniMax-H3 que aceita prompt, first_frame e last_frame opcionais, além de width, height e length. Mantenha os prompts concisos, mas cinematográficos, e inclua dicas de áudio como ambiente, SFX, diálogo e batidas musicais no mesmo bloco de texto. Use quadros de referência quando precisar de uma entrada ou saída específica; omita-os para uma encenação mais livre.
ComfyMathExpression (#107)#
Mapeia uma duration legível por humanos em segundos para o length inteiro que o modelo espera, ajustando-se à grade de quadros do modelo para um tempo limpo. Defina o float para o comprimento de clipe pretendido e deixe o nó lidar com a conversão. Clipes ligeiramente mais curtos tendem a preservar a sincronização nítida de movimento e som em resoluções mais altas.
SamplerCustomAdvanced (#14)#
Conduz o processo de desruído com base no amostrador e cronograma selecionados. Use uma noise_seed fixa para travar uma tomada para comparação, depois mude apenas a semente para explorar novas variações. Se o movimento parecer muito caótico ou muito rígido, experimente um amostrador diferente em KSamplerSelect (#17) ou ajuste o cronograma em BasicScheduler (#9).
CreateVideo (#91)#
Combina quadros decodificados e áudio estéreo em um único fluxo de vídeo na taxa de quadros escolhida. Para edições guiadas por ritmo, defina fps para corresponder à cadência descrita no prompt. O nó também é onde você mudaria fps se quiser uma sensação mais lenta ou mais rápida.
ResolutionSelector (#115)#
Um controle para proporção de aspecto e contagem total de pixels, com arredondamento automático para tamanhos amigáveis ao modelo. Escolha a proporção primeiro, depois ajuste a escala para equilibrar velocidade e fidelidade. Telas maiores recompensam prompts cuidadosos e durações mais curtas.
SaveVideo (#92)#
Finaliza o clipe no disco. Aponte para uma subpasta do projeto para manter os experimentos organizados e renomeie sabiamente quando encontrar um guardião.
Extras opcionais#
- Escreva prompts como mini storyboards com dicas de tempo e batidas de áudio explícitas para sincronização confiável.
- Inclua palavras de intenção de áudio como vento, passos, multidão, reverberação ou instrumentos específicos para direcionar a trilha sonora.
- Adicione linhas para diálogo ou canto diretamente no prompt e note o tom do falante.
- Trave uma
noise_seedao comparar ajustes de prompt, mude apenas a semente ao explorar tomadas alternativas. - Use
first_frameelast_framepara enquadrar o movimento quando precisar de continuidade entre cortes ou uma pose final precisa.
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos ao Comfy-Org pelo modelo de fluxo de trabalho MiniMax H3 T2V e aos pesos do modelo MiniMax-H3, Comfy.org pelo tutorial MiniMax H3, e MiniMax pelo anúncio oficial do MiniMax H3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- Modelo de fluxo de trabalho Comfy-Org/MiniMax H3 T2V
- GitHub: video_minimax_h3_t2v.json
- Tutorial Comfy.org/MiniMax H3
- Docs / Notas de Lançamento: MiniMax H3 tutorial
- Anúncio oficial MiniMax/MiniMax H3
- Docs / Notas de Lançamento: MiniMax H3 official announcement
- Pesos do modelo Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

