ComfyUI>Fluxos de Trabalho>VDN H3 ComfyUI Texto Para Vídeo | Fluxo de Trabalho Mais Rápido MiniMax H3 VDN 8-Passos Sem LoRA

VDN H3 ComfyUI Texto Para Vídeo | Fluxo de Trabalho Mais Rápido MiniMax H3 VDN 8-Passos Sem LoRA

Workflow Name: RunComfy/VDN-H3-Text-To-Video
Workflow ID: 0000...1513
Crie vídeos MiniMax H3 com áudio a partir de prompts de texto. Você obtém amostragem de 8 passos com atenção híbrida do Video DeltaNet. Construa cenas de fantasia, corrida ou combate. Compare saídas com o ramo FastVideo. Refinar prompts para controle criativo.

VDN H3 ComfyUI Text To Video Workflow

VDN H3 ComfyUI Text To Video | 8-Step Video and Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

VDN H3 ComfyUI Text To Video Examples

VDN H3 MiniMax ComfyUI Texto Para Vídeo#

VDN H3 ComfyUI Texto Para Vídeo transforma prompts de linguagem natural em vídeos curtos e cinematográficos com áudio sincronizado. Combina a família MiniMax H3 com atenção híbrida do Video DeltaNet e amostragem de 8 passos para gerar vídeo e áudio a partir de um único prompt. É bem adequado para storyboards, clipes de produtos e cenas estilizadas como fantasia cinematográfica, corrida de rali e combate com espada armada.

O gráfico inclui dois ramos selecionáveis independentemente. O ramo VDN-H3 aplica o patch do Video DeltaNet e foi usado para produzir os exemplos incluídos. O ramo FastVideo é fornecido para comparar a saída e o tempo de geração com o caminho VDN. Ambos os ramos renderizam MP4 com áudio na taxa de quadros escolhida.

Construído em componentes abertos: VDN para MiniMax H3 GitHub e Hugging Face, nós VDN-H3 ComfyUI por Saganaki22 GitHub, e pesos e VAEs base MiniMax H3 Hugging Face.

Modelos principais no fluxo de trabalho Comfyui VDN H3 ComfyUI Texto Para Vídeo#

  • Modelo de difusão MiniMax-H3 (UNet). Conduz o processo de remoção de ruído que transforma ruído em latentes de vídeo e áudio coerentes no espaço-tempo. Os pesos são fornecidos no pacote MiniMax H3 no Hugging Face.
  • Codificador de texto Qwen3-VL 32B MiniMax-H3. Converte seu prompt em condicionamento para geração de vídeo e áudio, ajustado para a família H3. Incluído no lançamento MiniMax H3 no Hugging Face.
  • VAE de Vídeo MiniMax-H3. Decodifica latentes de vídeo para quadros RGB. Disponível na seção de VAEs do Hugging Face.
  • VAE de Áudio MiniMax-H3. Reconstrói áudio em forma de onda a partir de latentes de áudio. Também fornecido no Hugging Face.
  • Pesos de patch VDN-H3. Video DeltaNet aplica atenção híbrida ao MiniMax H3. Obtenha os checkpoints do Hugging Face.
  • Variante UNet FastVideo. O ramo de comparação usa minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensors de Kijai/MiniMax-H3-experimental.

Como usar o fluxo de trabalho Comfyui VDN H3 MiniMax ComfyUI Texto Para Vídeo#

Comece definindo seu prompt, resolução, duração e taxa de quadros. Selecione o ramo VDN-H3 ou o ramo FastVideo para uma execução individual. Queue All pode executar ambos os ramos habilitados e produzir dois MP4s; ramos de gráfico separados não garantem execução simultânea de GPU. Ambos os ramos são configurados para 8 passos de amostragem.

Entrada do Usuário#

Use o painel (input:prompt) Texto Prompt para descrever tanto visuais quanto som em linguagem simples. Para áudio, adicione uma linha final começando com Audio: para solicitar Foley específico ou ambiente, por exemplo, “Audio: batidas rítmicas de cascos, vento, rugido distante.” Controle o tamanho visual com (input:Resolution) Megapixels, que alimenta o ResolutionSelector para produzir uma largura e altura que são amigáveis ao cálculo. Defina (input:Duration) Seconds e (input:FPS) para definir quão longo e suave o clipe deve parecer. O fluxo de trabalho converte duração e FPS em uma contagem de quadros válida e a ajusta silenciosamente a um comprimento de sequência que funciona bem com os internos do H3.

Modelos#

O CLIPLoader fornece o codificador de texto ajustado para MiniMax usado para condicionamento. Dois nós VAELoader trazem o VAE de Vídeo MiniMax-H3 e o VAE de Áudio para que quadros decodificados e som correspondam ao espaço latente do modelo. Esses carregadores são compartilhados por ambos os ramos para garantir resultados A/B consistentes.

Condicionamento#

MiniMaxH3ImageToVideo (#219) transforma seu prompt mais tamanho e comprimento em o latente inicial de vídeo e áudio junto com o condicionamento positivo. Entradas de imagem opcionais podem ser usadas para travar o primeiro ou último quadro quando você precisa de uma pose de entrada ou saída específica. Este estágio é onde suas decisões narrativas mais importam: movimento de câmera, ação do sujeito, iluminação, e a linha Audio: se tornam orientação para o amostrador a jusante.

Patch VDN-H3#

O ramo VDN aplica a atualização do Video DeltaNet com ApplyVDNH3Advanced (#6126). Aplica o patch de atenção híbrida selecionado. MiniMaxChunkFeedForward e ModelPatchTorchSettings configuram memória e configurações de execução. MiniMaxH3SigmaShift ajusta a programação de ruído para vídeo e áudio antes de começar a amostragem.

Amostragem (VDN-H3)#

A amostragem VDN começa a partir de RandomNoise (#6141), mescla orientação com BasicGuider (#6134), escolhe o resolvedor em KSamplerSelect (#6137), e agenda um número compacto de passos de difusão em BasicScheduler (#6136). SamplerCustomAdvanced (#6135) realiza a remoção de ruído sobre a sequência completa para produzir latentes de vídeo e áudio refinados. Mantenha a semente fixa para repetibilidade ou mude-a para variações frescas com o mesmo prompt.

Decodificação e criação de vídeo (VDN-H3)#

VAEDecode (#6146) reconstrói quadros enquanto VAEDecodeAudio (#6145) reconstrói a trilha sonora. VHS_VideoCombine (#6170) combina quadros e áudio em um MP4, honrando a taxa de quadros que você definiu anteriormente e salvando um arquivo pronto para visualização. A saída VDN é salva com um prefixo de nome de arquivo distinto para que seja fácil comparar com o resultado do FastVideo.

Ramo de comparação FastVideo#

O caminho FastVideo carrega um MiniMax H3 UNet ajustado para velocidade e aplica um patch de atenção leve antes da amostragem. Reutiliza seu prompt, tamanho e contagem de quadros para que você possa comparar diretamente o tempo e a aparência. A amostragem espelha a estrutura do ramo VDN e também é configurada para 8 passos. Quadros e áudio são decodificados e combinados com VHS_VideoCombine (#6104) para produzir um segundo MP4. Use essas saídas lado a lado para decidir qual ramo se adapta melhor à sua cena.

Nós principais no fluxo de trabalho Comfyui VDN H3 ComfyUI Texto Para Vídeo#

  • ApplyVDNH3Advanced (#6126). Habilita Video DeltaNet no MiniMax H3 usando o checkpoint selecionado do lançamento VDN-H3. Ajuste apenas quando quiser mudar o checkpoint VDN ou alternar backends de atenção; mantenha os padrões de atenção híbrida para uso geral. Implementação de referência: Saganaki22/ComfyUI-VDN-H3.
  • MiniMaxH3ImageToVideo (#219). Ponto de controle central para história e tempo, aceitando o prompt de texto, largura e altura computadas, e a contagem de quadros derivada. Para áudio, adicione uma única linha Audio: ao prompt para direcionar Foley e ambiente enquanto evita fala, a menos que explicitamente solicitado.
  • MiniMaxH3SigmaShift (#6131, #6007). Reequilibra a programação de sigma para fluxos de vídeo e áudio, o que pode ajudar a reduzir tremores e preservar detalhes em contagens de passos baixas. Considere pequenos ajustes apenas se você mudar variantes de modelo ou notar instabilidade de movimento.
  • VHS_VideoCombine (#6170, #6104). Combina quadros decodificados e áudio em MP4 com sua taxa de quadros escolhida e prefixo de nome de arquivo. Opções úteis incluem corte para o comprimento do áudio e seleção do formato de pixel H.264 desejado. Página do projeto: ComfyUI-VideoHelperSuite.

Extras opcionais#

  • Dicas de prompt: comece com uma única frase que defina sujeito, ação e movimento de câmera, depois adicione dicas de aparência e uma linha Audio: para foley.
  • Para clipes mais longos, prefira megapixels modestos a alta resolução para manter o movimento estável e o uso de memória sob controle.
  • Fixe a semente em RandomNoise quando quiser iterações consistentes; mude-a para explorar variações.
  • Compare os dois ramos em sua própria cena para avaliar a qualidade da saída e o tempo de geração.
  • Se você atingir limites de memória, reduza megapixels ou duração primeiro; o feed-forward em pedaços já ajuda com sequências mais longas.

Agradecimentos#

Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos sinceramente à OpenVDN pelo modelo vdn-minimax-h3, pesos e repositório, Saganaki22 pelos nós ComfyUI-VDN-H3, e Benji (AI Future Tech) pelo fluxo de trabalho VDN-H3 por suas contribuições e manutenção. Para detalhes autorizados, consulte a documentação original e os repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.