ComfyUI>Fluxos de Trabalho>MiniMax H3 8-Passos de Aceleração | Fluxo de Trabalho de Vídeo Tudo-em-Um

MiniMax H3 8-Passos de Aceleração | Fluxo de Trabalho de Vídeo Tudo-em-Um

Workflow Name: RunComfy/MiniMax-H3-8-Step
Workflow ID: 0000...1505
MiniMax H3 8-Passos de Aceleração é um fluxo de trabalho tudo-em-um do ComfyUI para criar vídeo cinematográfico com áudio nativo sincronizado. Seu nó de referência unificada suporta imagens, vídeos, vídeo-áudio pareados e áudio independente, enquanto o padrão pronto para rodar utiliza uma imagem e um prompt de movimento. Um Turbo LoRA e amostragem de 8 passos aceleram a geração, com configurações testadas projetadas para funcionar de forma confiável em uma GPU de 48 GB.

ComfyUI MiniMax H3 8-Step Acceleration Workflow

MiniMax H3 8-Step Acceleration All-in-One Video Workflow in ComfyUI
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 8-Step Acceleration Examples

MiniMax H3 8-Passos de Aceleração: Geração multimodal de vídeo tudo-em-um com áudio nativo#

MiniMax H3 8-Passos de Aceleração é um fluxo de trabalho tudo-em-um do ComfyUI para criar vídeo cinematográfico com áudio nativo sincronizado. Através do nó unificado MiniMaxH3Unified, ele suporta referências de imagem, referências de vídeo, vídeos com áudio acompanhante e referências de áudio independentes dentro de um fluxo de trabalho simplificado.

O exemplo pronto para uso utiliza uma única imagem e um prompt de texto orientado para movimento, mas a referência para vídeo é apenas uma maneira de usar o fluxo de trabalho. Seu design multimodal unificado suporta diferentes combinações de orientação visual e de áudio sem exigir gráficos de fluxo de trabalho separados para cada tipo de entrada.

O fluxo de trabalho combina o backbone MiniMax H3 FL2VA com o LightX2V Turbo LoRA e um cronograma compacto de amostragem de 8 passos, dois passes. É projetado para tomadas de personagens cinematográficas, cenas de diálogo, micro-histórias atmosféricas e outras tarefas de vídeo multimodal que se beneficiam de iteração mais rápida e áudio nativo sincronizado.

Modelos-chave no fluxo de trabalho ComfyUI MiniMax H3 8-Passos de Aceleração#

  • Pesos oficiais MiniMax-H3. O backbone de difusão audiovisual que gera vídeo e áudio nativo a partir de prompts e referências multimodais. MiniMaxAI/MiniMax-H3
  • MiniMax H3 Video VAE e Audio VAE. Codificadores e decodificadores pareados usados para mover entre o espaço de pixels, formas de onda de áudio e latentes H3. Incluído na distribuição Comfy-Org. Comfy-Org/MiniMax-H3
  • Codificador de texto Qwen3-VL 32B (AWQ, MiniMax-tuned). Fornece base linguística e visual para prompts e referências ao dirigir MiniMax H3. Distribuído com o pacote Comfy-Org MiniMax H3. Comfy-Org/MiniMax-H3
  • LightX2V MiniMax H3 Turbo LoRA. Um LoRA orientado para velocidade que aperta trajetórias para que H3 possa convergir efetivamente sob um cronograma de 8 passos. lightx2v/Minimax-h3-Turbo
  • MiniMax H3 Latent Upscaler 3D. Um upscaler latente nativo H3 usado entre passes para aumentar o detalhe espacial sem quebrar o alinhamento do áudio.

Como usar o fluxo de trabalho ComfyUI MiniMax H3 8-Passos de Aceleração#

Em alto nível, o fluxo de trabalho coleta prompts e referências multimodais através de um nó de entrada unificado, constrói um cronograma compacto de 8 passos e executa um passe rápido de alta-sigma para estabelecer movimento e estrutura de cena. Ele pode então aumentar o latente de vídeo em 3D antes de executar um passe de refinamento de baixa-sigma, decodificando o áudio e vídeo sincronizados e exportando o resultado como um MP4.

Entradas e dimensionamento#

Use Resolution Selector (Size) (#115) para escolher sua largura e altura alvo. Insira a descrição de sua cena em Input Text (Prompt) (#217); você pode incluir diálogo entre aspas se quiser palavras faladas no clipe gerado.

O nó tudo-em-um MiniMaxH3Unified (#212) atua como o hub de referência multimodal do fluxo de trabalho. Ele suporta referências de imagem, referências de vídeo, vídeos com áudio e referências de áudio independentes, junto com controle de prompt, dimensionamento e duração.

O exemplo incluído é configurado com uma imagem de referência e um prompt de movimento para uso imediato. Você pode substituir essa imagem ou configurar outro tipo de referência suportado dentro do mesmo nó unificado sem reconstruir as etapas de amostragem, aumento, decodificação ou exportação.

Você pode definir duration em MiniMaxH3Unified, ou alternar auto_length_from_audio ao usar uma referência de áudio externa para guiar o tempo.

Configuração do modelo e patches de aceleração#

UNETLoader (#127) traz o checkpoint MiniMax H3 FL2VA. MiniMaxH3MemoryEfficientSageAttentionPatch (#160) e ModelAttentionBackend (#168) então ativam um backend de atenção amigável ao VRAM.

MiniMaxH3SigmaShift (#207) alinha os horizontes de denoising de vídeo e áudio para cronogramas curtos. LoraLoaderModelOnly (#167) aplica o LightX2V Turbo LoRA que permite MiniMax H3 8-Passos de Aceleração sem exigir um gráfico de aceleração separado.

Construtor de cronograma de 8 passos#

BasicScheduler (#163) constrói uma trajetória compacta, que é refinada por ExtendIntermediateSigmas (#220) e H3SigmaRefiner (#209) para as dinâmicas audiovisuais do H3.

SplitSigmas (#197) divide o cronograma em um bloco de alta-sigma para estrutura e um bloco de baixa-sigma para detalhe. Uma única semente RandomNoise (#129) alimenta ambos os passes para ajudar a manter o movimento e o áudio coerentes.

Amostrador de primeiro passe: altas sigmas#

O bloco de alta-sigma flui para SamplerCustomAdvanced (#125), guiado por BasicGuider (#126) com o condicionamento positivo de MiniMaxH3Unified (#212).

Este passe estabelece composição, cadência de movimento e uma base de áudio grosseira dentro de um latente audiovisual unificado. Sua saída denoised é então preparada para aprimoramento intermediário.

Ampliação no espaço latente#

LTXVSeparateAVLatent (#199) divide o latente audiovisual para que apenas os canais de vídeo sejam ampliados por MinimaxH3LatentUpscaler3D (#226). O latente de áudio permanece intocado para preservar a sincronização.

LTXVConcatAVLatent (#198) então recombina o latente de vídeo aprimorado com o latente de áudio original, criando um latente audiovisual mais nítido, mas ainda sincronizado, para refinamento.

Amostrador de segundo passe: baixas sigmas#

O latente recombinado é refinado em SamplerCustomAdvanced (#177) usando o bloco de baixa-sigma e BasicGuider (#178).

Este passe adiciona detalhes de superfície, limpa características faciais e aprimora texturas de áudio enquanto mantém o movimento e o tempo estabelecido durante o primeiro passe.

Decodificação e exportação#

VAEDecode (#186) converte os latentes de vídeo em quadros, enquanto VAEDecodeAudio (#185) reconstrói a trilha de áudio nativa.

VHS_VideoCombine (#189) combina os resultados em um MP4 na taxa de quadros selecionada—24 fps por padrão—produzindo um clipe audiovisual pronto para compartilhar.

Nós-chave no fluxo de trabalho ComfyUI MiniMax H3 8-Passos de Aceleração#

  • MiniMaxH3Unified (#212). O hub central tudo-em-um de referência multimodal para MiniMax H3. Ele traz imagem, vídeo, vídeo-áudio, áudio independente, prompt, dimensionamento e controles de duração em um nó, permitindo que diferentes tarefas de referência H3 usem o mesmo pipeline de geração acelerada.
  • H3SigmaRefiner (#209). Ajusta o cronograma para favorecer as partes da trajetória onde H3 mais se beneficia. Se você precisar de detalhes mais nítidos na mesma velocidade, adicione um pouco de refinamento; se você priorizar o máximo rendimento, mantenha-o enxuto.
  • SplitSigmas (#197). Divide o cronograma compacto em um plano de dois passos. Com um cronograma de 8 passos, a divisão do ponto médio equilibra velocidade e qualidade; mover a divisão aloca mais passos para estrutura ou detalhe.
  • MiniMaxH3SigmaShift (#207). Desloca intervalos de sigma para vídeo e áudio para que eles convirjam de forma limpa sob cronogramas curtos. Deixe os deslocamentos fornecidos inalterados, a menos que você compreenda seu efeito na sincronização e estabilidade.
  • LoraLoaderModelOnly (#167). Aplica o LightX2V Turbo LoRA. Menor força suaviza o efeito Turbo para movimento mais suave; maior força pode aumentar o impacto, mas pode acentuar demais as texturas.
  • MinimaxH3LatentUpscaler3D (#226). Aumenta o detalhe espacial entre os passes, mantendo o latente de áudio intacto. Use um mode.scale modesto para saídas do tipo 720p ou um multiplicador maior para 1080p quando o VRAM permitir.
  • VHS_VideoCombine (#189). Lida com a combinação final e exportação. Ajuste frame_rate, defina um prefixo de nome de arquivo e use opcionalmente corte ou looping ping-pong para pré-visualizações.

Extras opcionais#

  • Referências multimodais. Use o nó unificado H3 para trabalhar com referências de imagem, referências de vídeo, vídeos com áudio ou referências de áudio independentes sem mudar para um gráfico de geração separado.
  • Prompts de início rápido. MiniMax H3 responde bem a verbos cinematográficos e linguagem de câmera. Cues curtos e específicos, como "slow push-in", "handheld sway" ou uma linha de diálogo entre aspas geralmente produzem movimento mais forte e fala mais limpa.
  • Atalhos de resolução. 0.4 MP com uma ampliação latente de 1.6x fica perto de 720p. Um primeiro passe de 0.5 MP com ampliação de 2x fica perto de 1080p. Se você atingir limites de VRAM, reduza megapixels antes de mudar o cronograma de passos.
  • Dicas de estabilidade. Mantenha a mesma semente para tomadas reproduzíveis. Alterar apenas a semente para variações rápidas enquanto preserva o resto do tempo e direção de cena.
  • Quando ignorar o upscaler. Se você priorizar velocidade ou memória, defina o multiplicador do upscaler latente para 1 para efetivamente pular a etapa de aprimoramento.
  • Cenários de bom ajuste. Este fluxo de trabalho MiniMax H3 8-Passos de Aceleração funciona bem para tomadas de personagens em médio-close, diálogo com som ambiente, referências de cena audiovisual, batidas atmosféricas curtas e tarefas de vídeo multimodal onde a iteração rápida é importante.

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos reconhecidamente a RunningHub pela referência do fluxo de trabalho, MiniMaxAI pelo modelo oficial MiniMax-H3, Comfy-Org pelos pesos do modelo MiniMax-H3, e lightx2v pelo MiniMax H3 Turbo LoRA.

Para detalhes autoritativos, informações de licenciamento e termos de uso do modelo, consulte a documentação original e repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.