ComfyUI>Fluxos de Trabalho>MiniMax H3 T2V ComfyUI - Gerador de Texto para Vídeo por IA

MiniMax H3 T2V ComfyUI - Gerador de Texto para Vídeo por IA

Workflow Name: RunComfy/MiniMax-H3-T2V
Workflow ID: 0000...1472
Transforme um único prompt em uma cena de vídeo completa. Você obtém movimento cinematográfico e som estéreo nativo juntos. Crie diálogo, canto ou cenas conceituais. O gráfico de texto para vídeo do MiniMax H3 mantém o áudio sincronizado. Você pode testar ideias mais rapidamente. Execute-o pronto no RunComfy.

MiniMax H3 T2V ComfyUI Workflow

MiniMax H3 T2V ComfyUI - Video and Native Stereo Audio
Deseja executar este fluxo de trabalho?
  • Fluxos de trabalho totalmente operacionais
  • Sem nós ou modelos ausentes
  • Nenhuma configuração manual necessária
  • Apresenta visuais impressionantes

MiniMax H3 T2V ComfyUI Examples

MiniMax H3 T2V ComfyUI: prompt-para-vídeo com áudio estéreo nativo#

MiniMax H3 T2V ComfyUI transforma um único prompt em um vídeo curto cinematográfico com áudio estéreo sincronizado. Construído a partir do modelo oficial Comfy.org e dos pesos abertos MiniMax-H3 do Comfy-Org, ele segue o caminho FL2VA para que movimento e som sejam gerados juntos, não costurados após o fato. É ideal para explorações rápidas de cenas apenas com prompt, clipes de diálogo ou canto, e cenas conceituais que precisam de visuais e som em uma única passagem.

Descreva as cenas, a câmera, a performance e as dicas de áudio em um único bloco, escolha o tamanho e a duração, então coloque o gráfico na fila. O fluxo de trabalho carrega os componentes MiniMax-H3 corretos, amostra latentes audiovisuais conjuntos, decodifica-os para quadros e áudio estéreo, e salva um arquivo de vídeo finalizado.

Modelos-chave no fluxo de trabalho Comfyui MiniMax H3 T2V ComfyUI#

  • Modelo de difusão MiniMax-H3 FL2VA. O núcleo UNet que realiza o desruído conjunto áudio-vídeo para que movimento e som permaneçam alinhados em fase. Pesos fornecidos pelo Comfy-Org sob diffusion_models. Model files
  • MiniMax-H3 Video VAE. Codifica e decodifica latentes visuais para quadros RGB, preservando detalhes cinematográficos e continuidade de movimento. minimax_h3_video_vae_fp16.safetensors
  • MiniMax-H3 Audio VAE. Codifica e decodifica latentes de áudio para uma onda estéreo alinhada no tempo para cada clipe. minimax_h3_audio_vae_fp32.safetensors
  • Codificador de texto Qwen3-VL 32B (AWQ para MiniMax-H3). Interpreta o prompt em condicionamento que cobre semântica de cena, tempo e intenção de áudio. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Se você quiser comparar o modelo original no qual este gráfico se baseia, veja a referência do Comfy.org. Template JSON

Como usar o fluxo de trabalho Comfyui MiniMax H3 T2V ComfyUI#

Em um nível alto, você define a resolução e duração alvo, escreve um único prompt que inclui visuais e áudio, opcionalmente adiciona quadros iniciais e finais, então executa. Dentro do subgráfico, MiniMax-H3 cria latentes de vídeo e áudio sincronizados, que são decodificados, unidos em um filme de 24 fps e salvos.

ResolutionSelector (#115)#

Escolha uma proporção de aspecto e escala para definir width e height. O seletor arredonda para múltiplos eficientes de 32 e alimenta esses valores no subgráfico MiniMax-H3, para que você não precise calcular manualmente as dimensões. Comece com tamanhos moderados para iteração mais rápida, depois aumente quando o seu prompt estiver correto. Mudar a proporção de aspecto é uma alavanca criativa poderosa para trailers, clipes verticais e pré-visualizações quadradas.

Image to Video (MiniMax H3) (#105)#

Este subgráfico orquestra o pipeline MiniMax H3 T2V ComfyUI. Cole um único prompt coerente que descreva cenas, edições e a trilha sonora juntas, e opcionalmente forneça imagens de first_frame e last_frame para ancorar a entrada e saída. Defina uma duration amigável ao humano e o gráfico converte isso em uma contagem de quadros válida para o modelo. O subgráfico retorna latentes audiovisuais sincronizados que seguem para decodificação e multiplexação.

Grupo de modelos#

O grupo de modelos carrega os componentes MiniMax-H3 exatos para este fluxo de trabalho. UNETLoader (#6) puxa o modelo de difusão FL2VA, CLIPLoader (#13) carrega o codificador Qwen3-VL, e dois nós VAELoader (#11 vídeo, #24 áudio) preparam decodificadores. Estes estão apontados para os arquivos MiniMax-H3 do Comfy-Org para que você possa executar sem fiação manual. Manter os modelos centralizados aqui torna futuras trocas ou atualizações diretas.

Grupo de condicionamento#

MiniMaxH3ImageToVideo (#104) transforma seu prompt, first_frame e last_frame opcionais, e os width, height e length selecionados em condicionamento MiniMax-H3 mais um latente inicial. A ideia é permitir que o modelo leia tanto o conteúdo da cena quanto a intenção de áudio de uma só vez, o que leva a uma sincronização mais apertada. Se você fornecer quadros de referência, a entrada e a saída são guiadas para continuidade; se deixá-los vazios, a geração começa fria.

Grupo de amostragem#

A amostragem é gerida por RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16), e o principal SamplerCustomAdvanced (#14). Juntos, eles desruem o latente conjunto para que o movimento das imagens e eventos de som se desenvolvam em sincronia. Você pode executar novamente com uma nova semente para tomadas alternativas mantendo a mesma direção criativa. Uma vez confortável, experimentar com a escolha do amostrador ou cronograma pode mudar ligeiramente a energia de movimento e a textura sonora.

Decodificação e criação de grupo de vídeo#

VAEDecode (#10) reconstrói a sequência de quadros a partir do latente de vídeo, e VAEDecodeAudio (#23) reconstrói uma onda estéreo a partir do latente de áudio. CreateVideo (#91) multiplica quadros e áudio em um clipe finalizado a 24 fps. É aqui que cortes limpos e batidas especificadas no prompt se juntam na linha do tempo. A saída segue para o salvamento.

SaveVideo (#92)#

Grava o vídeo final no seu saída ComfyUI sob video/MiniMax_H3. O nó usa nomenclatura automática para que você possa iterar rapidamente, e você pode alterar o caminho para manter diferentes projetos separados. A saída contém tanto a imagem gerada quanto o áudio estéreo.

Nós-chave no fluxo de trabalho Comfyui MiniMax H3 T2V ComfyUI#

MiniMaxH3ImageToVideo (#104)#

Nó de condicionamento central para MiniMax-H3 que aceita prompt, first_frame e last_frame opcionais, além de width, height e length. Mantenha os prompts concisos, mas cinematográficos, e inclua dicas de áudio como ambiente, SFX, diálogo e batidas musicais no mesmo bloco de texto. Use quadros de referência quando precisar de uma entrada ou saída específica; omita-os para uma encenação mais livre.

ComfyMathExpression (#107)#

Mapeia uma duration legível por humanos em segundos para o length inteiro que o modelo espera, ajustando-se à grade de quadros do modelo para um tempo limpo. Defina o float para o comprimento de clipe pretendido e deixe o nó lidar com a conversão. Clipes ligeiramente mais curtos tendem a preservar a sincronização nítida de movimento e som em resoluções mais altas.

SamplerCustomAdvanced (#14)#

Conduz o processo de desruído com base no amostrador e cronograma selecionados. Use uma noise_seed fixa para travar uma tomada para comparação, depois mude apenas a semente para explorar novas variações. Se o movimento parecer muito caótico ou muito rígido, experimente um amostrador diferente em KSamplerSelect (#17) ou ajuste o cronograma em BasicScheduler (#9).

CreateVideo (#91)#

Combina quadros decodificados e áudio estéreo em um único fluxo de vídeo na taxa de quadros escolhida. Para edições guiadas por ritmo, defina fps para corresponder à cadência descrita no prompt. O nó também é onde você mudaria fps se quiser uma sensação mais lenta ou mais rápida.

ResolutionSelector (#115)#

Um controle para proporção de aspecto e contagem total de pixels, com arredondamento automático para tamanhos amigáveis ao modelo. Escolha a proporção primeiro, depois ajuste a escala para equilibrar velocidade e fidelidade. Telas maiores recompensam prompts cuidadosos e durações mais curtas.

SaveVideo (#92)#

Finaliza o clipe no disco. Aponte para uma subpasta do projeto para manter os experimentos organizados e renomeie sabiamente quando encontrar um guardião.

Extras opcionais#

  • Escreva prompts como mini storyboards com dicas de tempo e batidas de áudio explícitas para sincronização confiável.
  • Inclua palavras de intenção de áudio como vento, passos, multidão, reverberação ou instrumentos específicos para direcionar a trilha sonora.
  • Adicione linhas para diálogo ou canto diretamente no prompt e note o tom do falante.
  • Trave uma noise_seed ao comparar ajustes de prompt, mude apenas a semente ao explorar tomadas alternativas.
  • Use first_frame e last_frame para enquadrar o movimento quando precisar de continuidade entre cortes ou uma pose final precisa.

Agradecimentos#

Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos ao Comfy-Org pelo modelo de fluxo de trabalho MiniMax H3 T2V e aos pesos do modelo MiniMax-H3, Comfy.org pelo tutorial MiniMax H3, e MiniMax pelo anúncio oficial do MiniMax H3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.