MiniMax H3 Latent Upscaler: Fluxo de Trabalho de Geração de Vídeo BUNNY de Duas Passagens#
Este fluxo de trabalho ComfyUI transforma prompts de texto e imagens de referência opcionais em vídeos curtos e cinematográficos com áudio sincronizado. Ele usa um design BUNNY de duas passagens: O Estágio 1 estabelece movimento e composição em uma resolução base modesta, então o MiniMax H3 Latent Upscaler amplia o latente 3D de vídeo-áudio antes que o Estágio 2 reconstrua detalhes de alta frequência e decodifique os quadros e o som finais. O MiniMax H3 Latent Upscaler está integrado na geração, portanto, não é um aprimorador genérico para vídeos pré-existentes; é construído para cortes publicitários e cenas cinematográficas estilizadas onde você deseja clareza extra sem perder a intenção de movimento.
O resultado é um clipe de alta resolução cujo visual é regido pelo seu prompt, referências e um pequeno conjunto de LoRAs, enquanto a estabilidade do movimento é protegida pelo pipeline de upsample-then-reconstruct de duas passagens. O Estágio 2 é obrigatório e sempre realiza a reconstrução de detalhes reais após o latente ter sido ampliado.
Modelos principais no fluxo de trabalho Comfyui MiniMax H3 Latent Upscaler#
- Modelo de vídeo-áudio MiniMax H3 e nós personalizados T8. Fornece o gerador principal, condicionamento, planejamento de duas passagens e utilitários de decodificação usados em todo o pipeline. Veja o conjunto de nós no repositório T8 para comportamentos e interfaces específicos do modelo. GitHub: comfyui-minimax-h3-audio-T8
- VAE de Vídeo MiniMax H3. Codifica e decodifica latentes de vídeo que o Estágio 2 eventualmente transforma em quadros. Incluído e consumido pelos nós T8 acima. GitHub: comfyui-minimax-h3-audio-T8
- VAE de Áudio MiniMax H3. Codifica e decodifica latentes de áudio para manter o som ambiente coerente com o plano de movimento visual. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Latent Upscaler 3D. Um upscaler latente 3D aprendido que amplia o latente de vídeo-áudio conjunto em largura e altura antes da reconstrução de detalhes, preservando a estrutura temporal melhor do que a interpolação pós-processamento. Use o ponto de verificação oficial 3D fp16. Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- Patch de atenção SageAttention eficiente em memória para H3. Serve como o único patch de atenção usado por este fluxo de trabalho para inferência estável e amigável à memória. GitHub: ComfyUI-h3_sage_amd
Como usar o fluxo de trabalho Comfyui MiniMax H3 Latent Upscaler#
O fluxo de trabalho tem sete grupos rotulados que cooperam para produzir o clipe final. O Estágio 1 planeja o movimento na resolução base, o MiniMax H3 Latent Upscaler amplia o latente, e o Estágio 2 reconstrói o detalhe no tamanho maior antes da decodificação para vídeo e áudio.
01 · Entradas, Upscale & Referências#
Use a caixa de prompt BUNNY para descrever a cena, movimento, humor e paisagem sonora. Opcionalmente, adicione até quatro imagens de referência para direcionar identidade, paleta ou design de tomada; deixe-as desconectadas para geração apenas de texto. Defina sua duração alvo; a contagem de quadros é computada automaticamente para corresponder à grade de amostragem do modelo. Escolha uma resolução base do Estágio 1 que se adapte ao seu hardware, depois ajuste a Escala de Upscale para determinar quanto o MiniMax H3 Latent Upscaler aumenta a largura e a altura no espaço latente. Lembre-se de que a área de pixels escala com o quadrado do fator de escala, então VRAM e tempo de renderização aumentam com upscale mais alto.
02 · Base do Modelo · Apenas Sage#
Este grupo carrega o modelo base MiniMax H3, aplica o Turbo LoRA opcional para velocidade e ativa o patch SageAttention como a única modificação de atenção. Os VAEs de Vídeo e Áudio MiniMax H3 correspondentes e o codificador de texto H3 são carregados para garantir o condicionamento e a decodificação consistentes. Mantenha esta seção como está, a menos que você tenha um motivo específico para trocar um arquivo de modelo compatível; misturar backends de atenção não é recomendado.
03 · LoRAs do Estágio 1 & Estágio 2 BUNNY#
As LoRAs no Estágio 1 influenciam a lógica de movimento, composição e padrões de interação; as LoRAs no Estágio 2 se concentram na reconstrução da estrutura ampliada e no detalhe fino. Você pode substituir os arquivos LoRA por aqueles adequados ao seu tema e ajustar seus pesos com parcimônia. Se o Estágio 2 começar a alterar a intenção de movimento, reduza a força do LoRA do Estágio 2 antes de tocar no Estágio 1. Nunca roteie LoRAs do Estágio 2 de volta para o Estágio 1 e não ignore o Estágio 2.
04 · Movimento do Estágio 1#
Stage 1 Conditioning · AUTO (#7) analisa seu prompt e referências, seleciona o modo de geração apropriado e monta uma tela latente conjunta de vídeo-áudio. Stage 1 Dual Clock (#8) dirige agendas de vídeo e áudio separadas, mas sincronizadas, para que movimento e som evoluam coerentemente. O nó de plano de duas passagens aloca um pequeno orçamento para o Estágio 1 para estrutura de movimento e reserva mais para detalhe do Estágio 2. Stage 1 · Motion Structure executa a remoção de ruído grosseira que estabelece composição e tempo; a saída é um latente refinado, não quadros finais.
05 · Upscale Latente 3D H3#
H3 3D Learned Latent Upscale (#13) aplica o MiniMax H3 Latent Upscaler ao latente do Estágio 1, ampliando largura e altura diretamente no espaço latente 3D. Como o upscaling ocorre antes da reconstrução de detalhes, a consistência temporal é preservada melhor do que com upscalers em espaço de quadros. Use apenas o ponto de verificação oficial 3D fp16 e ajuste a escala aqui se você quiser uma resolução final diferente. O nó também relata as novas dimensões, que são entregues ao Estágio 2 automaticamente.
06 · Reconstrução HQ do Estágio 2 (OBRIGATÓRIO)#
Stage 2 Conditioning · AUTO (#14) reutiliza seu prompt, referências e as dimensões ampliadas para alinhar a orientação com a tela maior. Stage 2 Reconcile · Size & Audio (#15) fixa essas dimensões e a política de áudio para que vídeo e som permaneçam sincronizados. Stage 2 Detail Mixer · Fixed 5 Steps (#16) realiza a passagem de reconstrução decisiva que adiciona textura nítida enquanto respeita o movimento do Estágio 1. Stage 2 · 5-Step HQ Reconstruction remove o ruído do ruído semeado no latente final, e Stage 2 AV Decode (#20) o converte em quadros e áudio gerado para saída.
07 · Saída Final#
CreateVideo empacota quadros decodificados e áudio em um fluxo de vídeo na taxa de quadros escolhida. Clean VRAM After Generation libera memória entre renderizações. BUNNY HQ · Save Final Video grava o arquivo final com seu prefixo de nome de arquivo, formato e codec. Sempre salve da decodificação do Estágio 2; as pré-visualizações do Estágio 1 não são finais.
Nós principais no fluxo de trabalho Comfyui MiniMax H3 Latent Upscaler#
Stage 1 Conditioning · AUTO(#7). Entrada central para texto, referências e roteamento de modo. Ajuste o prompt e, quando necessário, o modo que governa como as referências são usadas. Mantenha isso em AUTO, a menos que você tenha uma razão clara para forçar um modo, e certifique-se de que as referências correspondam à história que você descreve.Stage 1 Dual Clock · Video 12 / Audio 3(#8). Orquestra relógios de amostragem separados para vídeo e áudio para manter batidas de movimento e eventos sonoros alinhados. Se você precisar reajustar o tempo, faça-o suavemente e mantenha ambos os relógios consistentes com seu ritmo alvo.H3 3D Learned Latent Upscale(#13). Aplica o MiniMax H3 Latent Upscaler usando o ponto de verificação oficial 3D fp16. O único parâmetro que a maioria dos usuários deve tocar é o fator de escala; aumentá-lo eleva a largura e a altura no espaço latente, e o total de pixels aumenta com o quadrado desse fator. Use o ponto de verificação validado do upscaler do cartão do modelo para evitar latentes corrompidos. Hugging FaceStage 2 Reconcile · Size & Audio(#15). Garante que o latente do Estágio 2 carregue o tamanho ampliado e a política de áudio selecionada antes da reconstrução. Se você experimentar configurações de áudio, mantenha a reconciliação ativada para que tempo e dimensões permaneçam consistentes.Stage 2 Detail Mixer · Fixed 5 Steps(#16). O coração da reconstrução de alta resolução que adiciona detalhe sem reescrever a lógica de movimento. Se o resultado parecer excessivamente nítido ou desviar na animação, reduza primeiro as forças do LoRA do Estágio 2, depois ajuste os balanços do mixer apenas se necessário.Stage 2 AV Decode(#20). Decodifica o latente reconstruído em quadros e áudio sincronizado. Sempre roteie saídas deste nó paraCreateVideoeSave Final Videopara garantir que o espaço de cor e áudio sejam tratados corretamente.
Extras Opcionais#
- Para geração apenas de texto, desconecte todas as entradas de imagem de referência para que AUTO selecione um caminho puro de texto para vídeo.
- Ao alterar o upscale, lembre-se de que o custo de renderização escala com o quadrado do fator; prefira aumentar a resolução base do Estágio 1 apenas após a escala do MiniMax H3 Latent Upscaler ser definida.
- Para melhorar a consistência entre tentativas, fixe a semente em
Seeded Noisee varie-a intencionalmente ao explorar alternativas. - Se o Estágio 2 alterar as batidas de movimento, diminua os pesos do LoRA do Estágio 2 antes de tocar nos amostradores ou configurações do mixer.
- Mantenha o SageAttention como o único patch de atenção; evite empilhar backends de atenção adicionais para estabilidade. GitHub
- Use o ponto de verificação oficial do MiniMax H3 Latent Upscaler para evitar tensores inválidos e chaves incompatíveis. Hugging Face
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos a RunningHub.ai pela fonte do fluxo de trabalho, LBH-123-AI pelo modelo Minimax H3 Latent Upscaler, e T8mars pelos nós personalizados MiniMax H3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.
Recursos#
- RunningHub.ai/Fonte do fluxo de trabalho
- Docs / Release Notes: runninghub.ai post
- LBH-123-AI/Minimax_h3_latent_Upscaler
- GitHub: LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler
- Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- T8mars/comfyui-minimax-h3-audio-T8
Note: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.



