VDN H3 MiniMax ComfyUI Texto Para Vídeo#
VDN H3 ComfyUI Texto Para Vídeo transforma prompts de linguagem natural em vídeos curtos e cinematográficos com áudio sincronizado. Combina a família MiniMax H3 com atenção híbrida do Video DeltaNet e amostragem de 8 passos para gerar vídeo e áudio a partir de um único prompt. É bem adequado para storyboards, clipes de produtos e cenas estilizadas como fantasia cinematográfica, corrida de rali e combate com espada armada.
O gráfico inclui dois ramos selecionáveis independentemente. O ramo VDN-H3 aplica o patch do Video DeltaNet e foi usado para produzir os exemplos incluídos. O ramo FastVideo é fornecido para comparar a saída e o tempo de geração com o caminho VDN. Ambos os ramos renderizam MP4 com áudio na taxa de quadros escolhida.
Construído em componentes abertos: VDN para MiniMax H3 GitHub e Hugging Face, nós VDN-H3 ComfyUI por Saganaki22 GitHub, e pesos e VAEs base MiniMax H3 Hugging Face.
Modelos principais no fluxo de trabalho Comfyui VDN H3 ComfyUI Texto Para Vídeo#
- Modelo de difusão MiniMax-H3 (UNet). Conduz o processo de remoção de ruído que transforma ruído em latentes de vídeo e áudio coerentes no espaço-tempo. Os pesos são fornecidos no pacote MiniMax H3 no Hugging Face.
- Codificador de texto Qwen3-VL 32B MiniMax-H3. Converte seu prompt em condicionamento para geração de vídeo e áudio, ajustado para a família H3. Incluído no lançamento MiniMax H3 no Hugging Face.
- VAE de Vídeo MiniMax-H3. Decodifica latentes de vídeo para quadros RGB. Disponível na seção de VAEs do Hugging Face.
- VAE de Áudio MiniMax-H3. Reconstrói áudio em forma de onda a partir de latentes de áudio. Também fornecido no Hugging Face.
- Pesos de patch VDN-H3. Video DeltaNet aplica atenção híbrida ao MiniMax H3. Obtenha os checkpoints do Hugging Face.
- Variante UNet FastVideo. O ramo de comparação usa
minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensorsde Kijai/MiniMax-H3-experimental.
Como usar o fluxo de trabalho Comfyui VDN H3 MiniMax ComfyUI Texto Para Vídeo#
Comece definindo seu prompt, resolução, duração e taxa de quadros. Selecione o ramo VDN-H3 ou o ramo FastVideo para uma execução individual. Queue All pode executar ambos os ramos habilitados e produzir dois MP4s; ramos de gráfico separados não garantem execução simultânea de GPU. Ambos os ramos são configurados para 8 passos de amostragem.
Entrada do Usuário#
Use o painel (input:prompt) Texto Prompt para descrever tanto visuais quanto som em linguagem simples. Para áudio, adicione uma linha final começando com Audio: para solicitar Foley específico ou ambiente, por exemplo, “Audio: batidas rítmicas de cascos, vento, rugido distante.” Controle o tamanho visual com (input:Resolution) Megapixels, que alimenta o ResolutionSelector para produzir uma largura e altura que são amigáveis ao cálculo. Defina (input:Duration) Seconds e (input:FPS) para definir quão longo e suave o clipe deve parecer. O fluxo de trabalho converte duração e FPS em uma contagem de quadros válida e a ajusta silenciosamente a um comprimento de sequência que funciona bem com os internos do H3.
Modelos#
O CLIPLoader fornece o codificador de texto ajustado para MiniMax usado para condicionamento. Dois nós VAELoader trazem o VAE de Vídeo MiniMax-H3 e o VAE de Áudio para que quadros decodificados e som correspondam ao espaço latente do modelo. Esses carregadores são compartilhados por ambos os ramos para garantir resultados A/B consistentes.
Condicionamento#
MiniMaxH3ImageToVideo (#219) transforma seu prompt mais tamanho e comprimento em o latente inicial de vídeo e áudio junto com o condicionamento positivo. Entradas de imagem opcionais podem ser usadas para travar o primeiro ou último quadro quando você precisa de uma pose de entrada ou saída específica. Este estágio é onde suas decisões narrativas mais importam: movimento de câmera, ação do sujeito, iluminação, e a linha Audio: se tornam orientação para o amostrador a jusante.
Patch VDN-H3#
O ramo VDN aplica a atualização do Video DeltaNet com ApplyVDNH3Advanced (#6126). Aplica o patch de atenção híbrida selecionado. MiniMaxChunkFeedForward e ModelPatchTorchSettings configuram memória e configurações de execução. MiniMaxH3SigmaShift ajusta a programação de ruído para vídeo e áudio antes de começar a amostragem.
Amostragem (VDN-H3)#
A amostragem VDN começa a partir de RandomNoise (#6141), mescla orientação com BasicGuider (#6134), escolhe o resolvedor em KSamplerSelect (#6137), e agenda um número compacto de passos de difusão em BasicScheduler (#6136). SamplerCustomAdvanced (#6135) realiza a remoção de ruído sobre a sequência completa para produzir latentes de vídeo e áudio refinados. Mantenha a semente fixa para repetibilidade ou mude-a para variações frescas com o mesmo prompt.
Decodificação e criação de vídeo (VDN-H3)#
VAEDecode (#6146) reconstrói quadros enquanto VAEDecodeAudio (#6145) reconstrói a trilha sonora. VHS_VideoCombine (#6170) combina quadros e áudio em um MP4, honrando a taxa de quadros que você definiu anteriormente e salvando um arquivo pronto para visualização. A saída VDN é salva com um prefixo de nome de arquivo distinto para que seja fácil comparar com o resultado do FastVideo.
Ramo de comparação FastVideo#
O caminho FastVideo carrega um MiniMax H3 UNet ajustado para velocidade e aplica um patch de atenção leve antes da amostragem. Reutiliza seu prompt, tamanho e contagem de quadros para que você possa comparar diretamente o tempo e a aparência. A amostragem espelha a estrutura do ramo VDN e também é configurada para 8 passos. Quadros e áudio são decodificados e combinados com VHS_VideoCombine (#6104) para produzir um segundo MP4. Use essas saídas lado a lado para decidir qual ramo se adapta melhor à sua cena.
Nós principais no fluxo de trabalho Comfyui VDN H3 ComfyUI Texto Para Vídeo#
ApplyVDNH3Advanced(#6126). Habilita Video DeltaNet no MiniMax H3 usando o checkpoint selecionado do lançamento VDN-H3. Ajuste apenas quando quiser mudar o checkpoint VDN ou alternar backends de atenção; mantenha os padrões de atenção híbrida para uso geral. Implementação de referência: Saganaki22/ComfyUI-VDN-H3.MiniMaxH3ImageToVideo(#219). Ponto de controle central para história e tempo, aceitando o prompt de texto, largura e altura computadas, e a contagem de quadros derivada. Para áudio, adicione uma única linhaAudio:ao prompt para direcionar Foley e ambiente enquanto evita fala, a menos que explicitamente solicitado.MiniMaxH3SigmaShift(#6131, #6007). Reequilibra a programação de sigma para fluxos de vídeo e áudio, o que pode ajudar a reduzir tremores e preservar detalhes em contagens de passos baixas. Considere pequenos ajustes apenas se você mudar variantes de modelo ou notar instabilidade de movimento.VHS_VideoCombine(#6170, #6104). Combina quadros decodificados e áudio em MP4 com sua taxa de quadros escolhida e prefixo de nome de arquivo. Opções úteis incluem corte para o comprimento do áudio e seleção do formato de pixel H.264 desejado. Página do projeto: ComfyUI-VideoHelperSuite.
Extras opcionais#
- Dicas de prompt: comece com uma única frase que defina sujeito, ação e movimento de câmera, depois adicione dicas de aparência e uma linha
Audio:para foley. - Para clipes mais longos, prefira megapixels modestos a alta resolução para manter o movimento estável e o uso de memória sob controle.
- Fixe a semente em
RandomNoisequando quiser iterações consistentes; mude-a para explorar variações. - Compare os dois ramos em sua própria cena para avaliar a qualidade da saída e o tempo de geração.
- Se você atingir limites de memória, reduza megapixels ou duração primeiro; o feed-forward em pedaços já ajuda com sequências mais longas.
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos sinceramente à OpenVDN pelo modelo vdn-minimax-h3, pesos e repositório, Saganaki22 pelos nós ComfyUI-VDN-H3, e Benji (AI Future Tech) pelo fluxo de trabalho VDN-H3 por suas contribuições e manutenção. Para detalhes autorizados, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- OpenVDN/vdn-minimax-h3
- GitHub: OpenVDN/vdn-minimax-h3
- Hugging Face: OpenVDN/vdn-minimax-h3
- Saganaki22/ComfyUI-VDN-H3
- GitHub: Saganaki22/ComfyUI-VDN-H3
- Benji (AI Future Tech)/VDN-H3 Workflow
- Docs / Release Notes: AI Future Tech Patreon post
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.


