ComfyUI>Fluxos de Trabalho>MiniMax H3 Latent Upscaler | Fluxo de Trabalho BUNNYH3 de Duas Passagens

MiniMax H3 Latent Upscaler | Fluxo de Trabalho BUNNYH3 de Duas Passagens

Workflow Name: RunComfy/MiniMax-H3-Upscaler
Workflow ID: 0000...1512
O MiniMax H3 Latent Upscaler gera vídeos de alta resolução com áudio a partir de prompts de texto e imagens de referência opcionais. Este fluxo de trabalho BUNNYH3 de duas passagens do ComfyUI primeiro gera a cena e o movimento em uma resolução mais baixa, depois amplia a representação latente do vídeo e executa uma segunda passagem de amostragem para refinar o resultado ampliado antes da decodificação. Use-o para criar anúncios de produtos curtos e cenas cinematográficas com resolução de saída ajustável. O upscaling é incorporado à geração de vídeo; este não é uma ferramenta de uso geral para restaurar vídeos enviados.

ComfyUI MiniMax H3 Latent Upscaler Workflow

MiniMax H3 Latent Upscaler BUNNYH3 ComfyUI graph showing two-pass video generation with latent upscaling
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Latent Upscaler Examples

MiniMax H3 Latent Upscaler: Fluxo de Trabalho de Geração de Vídeo BUNNY de Duas Passagens#

Este fluxo de trabalho ComfyUI transforma prompts de texto e imagens de referência opcionais em vídeos curtos e cinematográficos com áudio sincronizado. Ele usa um design BUNNY de duas passagens: O Estágio 1 estabelece movimento e composição em uma resolução base modesta, então o MiniMax H3 Latent Upscaler amplia o latente 3D de vídeo-áudio antes que o Estágio 2 reconstrua detalhes de alta frequência e decodifique os quadros e o som finais. O MiniMax H3 Latent Upscaler está integrado na geração, portanto, não é um aprimorador genérico para vídeos pré-existentes; é construído para cortes publicitários e cenas cinematográficas estilizadas onde você deseja clareza extra sem perder a intenção de movimento.

O resultado é um clipe de alta resolução cujo visual é regido pelo seu prompt, referências e um pequeno conjunto de LoRAs, enquanto a estabilidade do movimento é protegida pelo pipeline de upsample-then-reconstruct de duas passagens. O Estágio 2 é obrigatório e sempre realiza a reconstrução de detalhes reais após o latente ter sido ampliado.

Modelos principais no fluxo de trabalho Comfyui MiniMax H3 Latent Upscaler#

  • Modelo de vídeo-áudio MiniMax H3 e nós personalizados T8. Fornece o gerador principal, condicionamento, planejamento de duas passagens e utilitários de decodificação usados em todo o pipeline. Veja o conjunto de nós no repositório T8 para comportamentos e interfaces específicos do modelo. GitHub: comfyui-minimax-h3-audio-T8
  • VAE de Vídeo MiniMax H3. Codifica e decodifica latentes de vídeo que o Estágio 2 eventualmente transforma em quadros. Incluído e consumido pelos nós T8 acima. GitHub: comfyui-minimax-h3-audio-T8
  • VAE de Áudio MiniMax H3. Codifica e decodifica latentes de áudio para manter o som ambiente coerente com o plano de movimento visual. GitHub: comfyui-minimax-h3-audio-T8
  • MiniMax H3 Latent Upscaler 3D. Um upscaler latente 3D aprendido que amplia o latente de vídeo-áudio conjunto em largura e altura antes da reconstrução de detalhes, preservando a estrutura temporal melhor do que a interpolação pós-processamento. Use o ponto de verificação oficial 3D fp16. Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
  • Patch de atenção SageAttention eficiente em memória para H3. Serve como o único patch de atenção usado por este fluxo de trabalho para inferência estável e amigável à memória. GitHub: ComfyUI-h3_sage_amd

Como usar o fluxo de trabalho Comfyui MiniMax H3 Latent Upscaler#

O fluxo de trabalho tem sete grupos rotulados que cooperam para produzir o clipe final. O Estágio 1 planeja o movimento na resolução base, o MiniMax H3 Latent Upscaler amplia o latente, e o Estágio 2 reconstrói o detalhe no tamanho maior antes da decodificação para vídeo e áudio.

01 · Entradas, Upscale & Referências#

Use a caixa de prompt BUNNY para descrever a cena, movimento, humor e paisagem sonora. Opcionalmente, adicione até quatro imagens de referência para direcionar identidade, paleta ou design de tomada; deixe-as desconectadas para geração apenas de texto. Defina sua duração alvo; a contagem de quadros é computada automaticamente para corresponder à grade de amostragem do modelo. Escolha uma resolução base do Estágio 1 que se adapte ao seu hardware, depois ajuste a Escala de Upscale para determinar quanto o MiniMax H3 Latent Upscaler aumenta a largura e a altura no espaço latente. Lembre-se de que a área de pixels escala com o quadrado do fator de escala, então VRAM e tempo de renderização aumentam com upscale mais alto.

02 · Base do Modelo · Apenas Sage#

Este grupo carrega o modelo base MiniMax H3, aplica o Turbo LoRA opcional para velocidade e ativa o patch SageAttention como a única modificação de atenção. Os VAEs de Vídeo e Áudio MiniMax H3 correspondentes e o codificador de texto H3 são carregados para garantir o condicionamento e a decodificação consistentes. Mantenha esta seção como está, a menos que você tenha um motivo específico para trocar um arquivo de modelo compatível; misturar backends de atenção não é recomendado.

03 · LoRAs do Estágio 1 & Estágio 2 BUNNY#

As LoRAs no Estágio 1 influenciam a lógica de movimento, composição e padrões de interação; as LoRAs no Estágio 2 se concentram na reconstrução da estrutura ampliada e no detalhe fino. Você pode substituir os arquivos LoRA por aqueles adequados ao seu tema e ajustar seus pesos com parcimônia. Se o Estágio 2 começar a alterar a intenção de movimento, reduza a força do LoRA do Estágio 2 antes de tocar no Estágio 1. Nunca roteie LoRAs do Estágio 2 de volta para o Estágio 1 e não ignore o Estágio 2.

04 · Movimento do Estágio 1#

Stage 1 Conditioning · AUTO (#7) analisa seu prompt e referências, seleciona o modo de geração apropriado e monta uma tela latente conjunta de vídeo-áudio. Stage 1 Dual Clock (#8) dirige agendas de vídeo e áudio separadas, mas sincronizadas, para que movimento e som evoluam coerentemente. O nó de plano de duas passagens aloca um pequeno orçamento para o Estágio 1 para estrutura de movimento e reserva mais para detalhe do Estágio 2. Stage 1 · Motion Structure executa a remoção de ruído grosseira que estabelece composição e tempo; a saída é um latente refinado, não quadros finais.

05 · Upscale Latente 3D H3#

H3 3D Learned Latent Upscale (#13) aplica o MiniMax H3 Latent Upscaler ao latente do Estágio 1, ampliando largura e altura diretamente no espaço latente 3D. Como o upscaling ocorre antes da reconstrução de detalhes, a consistência temporal é preservada melhor do que com upscalers em espaço de quadros. Use apenas o ponto de verificação oficial 3D fp16 e ajuste a escala aqui se você quiser uma resolução final diferente. O nó também relata as novas dimensões, que são entregues ao Estágio 2 automaticamente.

06 · Reconstrução HQ do Estágio 2 (OBRIGATÓRIO)#

Stage 2 Conditioning · AUTO (#14) reutiliza seu prompt, referências e as dimensões ampliadas para alinhar a orientação com a tela maior. Stage 2 Reconcile · Size & Audio (#15) fixa essas dimensões e a política de áudio para que vídeo e som permaneçam sincronizados. Stage 2 Detail Mixer · Fixed 5 Steps (#16) realiza a passagem de reconstrução decisiva que adiciona textura nítida enquanto respeita o movimento do Estágio 1. Stage 2 · 5-Step HQ Reconstruction remove o ruído do ruído semeado no latente final, e Stage 2 AV Decode (#20) o converte em quadros e áudio gerado para saída.

07 · Saída Final#

CreateVideo empacota quadros decodificados e áudio em um fluxo de vídeo na taxa de quadros escolhida. Clean VRAM After Generation libera memória entre renderizações. BUNNY HQ · Save Final Video grava o arquivo final com seu prefixo de nome de arquivo, formato e codec. Sempre salve da decodificação do Estágio 2; as pré-visualizações do Estágio 1 não são finais.

Nós principais no fluxo de trabalho Comfyui MiniMax H3 Latent Upscaler#

  • Stage 1 Conditioning · AUTO (#7). Entrada central para texto, referências e roteamento de modo. Ajuste o prompt e, quando necessário, o modo que governa como as referências são usadas. Mantenha isso em AUTO, a menos que você tenha uma razão clara para forçar um modo, e certifique-se de que as referências correspondam à história que você descreve.
  • Stage 1 Dual Clock · Video 12 / Audio 3 (#8). Orquestra relógios de amostragem separados para vídeo e áudio para manter batidas de movimento e eventos sonoros alinhados. Se você precisar reajustar o tempo, faça-o suavemente e mantenha ambos os relógios consistentes com seu ritmo alvo.
  • H3 3D Learned Latent Upscale (#13). Aplica o MiniMax H3 Latent Upscaler usando o ponto de verificação oficial 3D fp16. O único parâmetro que a maioria dos usuários deve tocar é o fator de escala; aumentá-lo eleva a largura e a altura no espaço latente, e o total de pixels aumenta com o quadrado desse fator. Use o ponto de verificação validado do upscaler do cartão do modelo para evitar latentes corrompidos. Hugging Face
  • Stage 2 Reconcile · Size & Audio (#15). Garante que o latente do Estágio 2 carregue o tamanho ampliado e a política de áudio selecionada antes da reconstrução. Se você experimentar configurações de áudio, mantenha a reconciliação ativada para que tempo e dimensões permaneçam consistentes.
  • Stage 2 Detail Mixer · Fixed 5 Steps (#16). O coração da reconstrução de alta resolução que adiciona detalhe sem reescrever a lógica de movimento. Se o resultado parecer excessivamente nítido ou desviar na animação, reduza primeiro as forças do LoRA do Estágio 2, depois ajuste os balanços do mixer apenas se necessário.
  • Stage 2 AV Decode (#20). Decodifica o latente reconstruído em quadros e áudio sincronizado. Sempre roteie saídas deste nó para CreateVideo e Save Final Video para garantir que o espaço de cor e áudio sejam tratados corretamente.

Extras Opcionais#

  • Para geração apenas de texto, desconecte todas as entradas de imagem de referência para que AUTO selecione um caminho puro de texto para vídeo.
  • Ao alterar o upscale, lembre-se de que o custo de renderização escala com o quadrado do fator; prefira aumentar a resolução base do Estágio 1 apenas após a escala do MiniMax H3 Latent Upscaler ser definida.
  • Para melhorar a consistência entre tentativas, fixe a semente em Seeded Noise e varie-a intencionalmente ao explorar alternativas.
  • Se o Estágio 2 alterar as batidas de movimento, diminua os pesos do LoRA do Estágio 2 antes de tocar nos amostradores ou configurações do mixer.
  • Mantenha o SageAttention como o único patch de atenção; evite empilhar backends de atenção adicionais para estabilidade. GitHub
  • Use o ponto de verificação oficial do MiniMax H3 Latent Upscaler para evitar tensores inválidos e chaves incompatíveis. Hugging Face

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos a RunningHub.ai pela fonte do fluxo de trabalho, LBH-123-AI pelo modelo Minimax H3 Latent Upscaler, e T8mars pelos nós personalizados MiniMax H3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.

Recursos#

Note: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.