FastH3 8-Passos V2 ComfyUI Workflow: vídeo MiniMax H3 condicionado a dois quadros com áudio#
FastH3 8-Passos V2 ComfyUI Workflow transforma um quadro de referência inicial e final em um vídeo contínuo MiniMax H3 com áudio gerado sincronizado. Utiliza o ponto de verificação FastVideo FastH3 V2 INT8 com uma programação de oito passos, atenção esparsa e condicionamento explícito dos primeiros/últimos quadros para entregar resultados rápidos e controlados.
Este fluxo de trabalho é ideal para transições cinematográficas, movimento de personagens, conceitos de vídeo social e tomadas narrativas curtas que precisam de uma composição de abertura e fechamento definidas. Se você deseja assuntos estáveis, enquadramento fixo e movimento natural enquanto mantém alta velocidade, o FastH3 8-Passos V2 ComfyUI Workflow é feito para você.
Modelos chave no ComfyUI FastH3 8-Passos V2 ComfyUI Workflow#
- FastVideo FastH3 8-Passos V2 (INT8). A base de difusão que gera latentes de vídeo e áudio em apenas oito passos de amostragem para iteração rápida. Pontos de verificação: FastVideo/FastVideo-FastH3-8-Step-V2 e pesos prontos para ComfyUI em FastVideo/FastVideo-FastH3-Comfy.
- Qwen3-VL 32B codificador de texto para MiniMax H3. Codifica o prompt em embeddings de condicionamento usados para guiar o movimento, detalhes da cena e dicas de áudio. Pesos são distribuídos com o conjunto de modelos oficial em Comfy-Org/MiniMax-H3.
- MiniMax H3 Vídeo VAE. Decodifica latentes de vídeo para quadros RGB na resolução alvo especificada pelas entradas. Veja Comfy-Org/MiniMax-H3.
- MiniMax H3 Áudio VAE. Decodifica latentes de áudio em áudio de forma de onda que é muxado com os quadros gerados. Veja Comfy-Org/MiniMax-H3.
Como usar o ComfyUI FastH3 8-Passos V2 ComfyUI Workflow#
O gráfico segue o padrão oficial de imagem para vídeo do FastH3 e monta sua tomada da esquerda para a direita. Você fornece duas imagens de referência e um prompt de texto, o fluxo de trabalho calcula o condicionamento e amostragem necessários em oito passos com atenção esparsa, depois decodifica vídeo e áudio sincronizados e salva um arquivo pronto para publicação.
Entradas de Imagem/Vídeo (2)
- Carregue seus primeiros e últimos quadros usando
LoadImage(#136) eLoadImage(#161). Escolha imagens da mesma cena e proporção para que a composição e identidade permaneçam consistentes ao longo do clipe. - O primeiro quadro é redimensionado automaticamente por
ImageScaleToTotalPixels(#142) para caber em um orçamento de computação, entãoGetImageSize(#141) lê sua largura e altura para que a sequência gerada corresponda a essa resolução. - Use quadros de referência naturais e precisos da cena. O último quadro ancora a composição final para que a tomada se resolva exatamente onde você pretende.
Processamento (19)
- Os pesos principais são carregados com
UNETLoader(#151),CLIPLoader(#152) e dois nósVAELoader(#143 vídeo, #144 áudio). O nóMiniMaxH3ImageToVideo(#155) funde seu primeiro quadro, último quadro, prompt e duração alvo em um único pacote de condicionamento e latente inicial. - A duração é definida uma vez com o controle prático
Float (duration)(#157). UmaComfyMathExpression(#156) converte esse tempo para uma contagem de quadros alinhada ao passo do modelo para atenção suave ao longo da sequência. - Auxiliares temporais e de eficiência incluem
MiniMaxH3SigmaShift(#160) para ajustar a programação para MiniMax H3,ModelAttentionBackend(#159) para selecionar a implementação de atenção, eBlockSparseAttention(#158) para reduzir a computação enquanto preserva a fidelidade em regiões importantes. - O núcleo de remoção de ruído usa
BasicGuider(#150) com condicionamento positivo do nó de imagem para vídeo, umBasicSchedulerde oito passos (#148), o samplerres_multistepescolhido emKSamplerSelect(#147), eSamplerCustomAdvanced(#149) para produzir latentes de vídeo e áudio em uma única passagem.
Saídas (2)
- Latentes de vídeo decodificam para quadros via
VAEDecode(#146) enquanto latentes de áudio decodificam viaVAEDecodeAudio(#145).CreateVideo(#154) então muxa a sequência de imagens e áudio em um único clipe. SaveVideo(#92) grava o arquivo. Defina um prefixo de nome de arquivo e escolha um formato e codec que correspondam à sua plataforma de entrega ou pipeline de edição.
Nós chave no ComfyUI FastH3 8-Passos V2 ComfyUI Workflow#
MiniMaxH3ImageToVideo (#155)
- Constrói o condicionamento a partir dos seus primeiros e últimos quadros de referência mais o prompt, e produz um latente inicial para geração conjunta de vídeo e áudio. Ajuste o prompt de texto para descrever o movimento, câmera, atmosfera e quaisquer dicas sonoras desejadas. Mantenha as identidades e elementos da cena consistentes com as referências para os resultados mais estáveis. Ajuste o controle de duração no grupo à esquerda para alterar o comprimento do clipe sem mexer nas configurações do sampler.
BlockSparseAttention (#158)
- Aplica atenção esparsa ao modelo carregado para acelerar a amostragem enquanto preserva a atenção onde é mais importante. Se você ver perda de detalhes em cenas movimentadas, aumente a fração mantida ou reserve tokens adicionais para assuntos em primeiro plano. Para cenas simples, uma maior esparsidade pode acelerar significativamente os renders.
MiniMaxH3SigmaShift (#160)
- Ajusta a programação de ruído para vídeo e áudio para que a estrutura temporal e o som permaneçam coerentes ao longo da curta trajetória de oito passos. Se o movimento parecer trêmulo, aumente o desvio de vídeo; se o alinhamento de áudio se desviar, ajuste ligeiramente o desvio de áudio. Use pequenas mudanças e teste prévias curtas para encontrar um equilíbrio.
SamplerCustomAdvanced (#149)
- Executa a remoção de ruído em oito passos com o sampler
res_multistepe a programação doBasicScheduler(#148). Mantenha a semente fixa emRandomNoise(#153) para reprodutibilidade, depois varie-a para explorar alternativas uma vez que você goste do movimento. Uma orientação forte doBasicGuider(#150) ajuda a aderir ao prompt quando as composições são complexas.
CreateVideo (#154)
- Muxa quadros decodificados e áudio em um clipe final. Defina quadros por segundo para controlar a cadência, escolha um espaço de cor para seu fluxo de trabalho, e se você planeja editar mais tarde, escolha um codec que equilibre tamanho e qualidade para seu NLE.
Extras opcionais#
- Seleção de referência: escolha dois quadros da mesma lente e perspectiva, com exposição e balanço de branco correspondentes. Referências mais nítidas geralmente resultam em texturas mais limpas.
- Prompting: escreva o que o sujeito faz, como a câmera se comporta e como o ambiente soa. Mantenha a redação consistente com suas referências para evitar desvio de identidade.
- Resolução vs velocidade: se você atingir limites de memória, reduza o orçamento de pixels alvo em
ImageScaleToTotalPixels(#142). Para tomadas heroicas, aumente e renderize menos variações. - Duração e fps: ajuste a duração para o ritmo, depois defina fps em
CreateVideo(#154) para controlar a sensação. O fluxo de trabalho alinha automaticamente a contagem de quadros para atenção estável. - Sementes e iteração: bloqueie a semente de ruído para refinar prompts e referências, depois tente novas sementes para alternativas uma vez que a composição e o tempo estejam bloqueados.
- Paridade de modelo: o gráfico segue a estrutura oficial FastH3 I2V, então dicas do modelo de referência em Comfy-Org/workflow_templates transferem diretamente.
Agradecimentos#
Este fluxo de trabalho implementa e baseia-se nos seguintes trabalhos e recursos. Agradecemos imensamente à FastVideo pelo modelo FastH3 8-Passos V2 e pesos do ComfyUI, Comfy-Org pelo modelo de fluxo de trabalho FastH3 I2V e RunningHub.ai pela fonte do fluxo de trabalho por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação e repositórios originais vinculados abaixo.
Recursos#
- RunningHub.ai/Fonte do fluxo de trabalho
- Documentação / Notas de lançamento: RunningHub.ai post
- FastVideo/FastVideo-FastH3-8-Step-V2
- GitHub: hao-ai-lab/FastVideo
- Hugging Face: FastVideo/FastVideo-FastH3-8-Step-V2
- arXiv: 2405.14867
- FastVideo/FastVideo-FastH3-Comfy
- Hugging Face: FastVideo/FastVideo-FastH3-Comfy
- Comfy-Org/workflow_templates (modelo FastH3 I2V)
- GitHub: Comfy-Org/workflow_templates
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.


