ComfyUI>Fluxos de Trabalho>MiniMax H3 Cenas de Ação | Vídeo de Ação Guiado

MiniMax H3 Cenas de Ação | Vídeo de Ação Guiado

Workflow Name: RunComfy/MiniMax-H3-Action
Workflow ID: 0000...1527
Transforme duas imagens de personagens e uma referência de cena em vídeo de ação. Você obtém áudio nativo e personagens guiados por identidade. Estruture prompts para controlar a coreografia. Amostragem em duas etapas refina o movimento. Construa clipes de combate com espada, boxe ou ficção científica. Revise contatos rápidos de mãos e armas para artefatos.

ComfyUI MiniMax H3 Action Scenes Workflow

MiniMax H3 Action Scenes | Reference Video + Native Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Action Scenes Examples

MiniMax H3 Cenas de Ação: Gerador de vídeo de ação guiado por referência com áudio nativo#

MiniMax H3 Cenas de Ação é um fluxo de trabalho ComfyUI para criar vídeos de ação rigorosamente dirigidos, guiados por referência, com áudio nativo sincronizado. Você fornece duas imagens de personagens, uma referência de cena e um prompt estruturado. O fluxo de trabalho organiza o movimento com MiniMax H3 Turbo, depois refina a composição e a legibilidade da luta com LMS e Combat LoRAs enquanto preserva o áudio original. As saídas incluem um vídeo “base” rápido de primeira passagem e um vídeo “refinado” de maior fidelidade.

Este fluxo de trabalho Comfyui MiniMax H3 Cenas de Ação é projetado para previz, design de acrobacias e lutas, cinematografia de jogos e VFX, e clipes sociais curtos. Exemplos testados incluem sparring com espadas em castelos, treino com luvas de boxe e exercício com bastões em espaçonaves. Mantenha a identidade dos personagens e a coreografia explícitas no prompt, e revise contatos rápidos de mãos ou armas para possíveis artefatos.

Modelos principais no fluxo de trabalho Comfyui MiniMax H3 Cenas de Ação#

  • Conjunto principal Comfy‑Org MiniMax H3. Fornece o codificador de texto além dos VAEs de vídeo e áudio usados para construir, separar e decodificar o áudio‑vídeo latente conjunto. Veja modelos e LoRAs na coleção oficial. MiniMax‑H3 models
  • Minimax‑h3 Singularity (UNet). Serve como o gerador base ref‑to‑video que funde referências e prompt em um áudio‑vídeo latente para cenas de ação. Minimax‑h3_Singularity
  • MiniMax‑H3 Turbo LoRA. Acelera a primeira passagem para que você possa iterar rapidamente nos ritmos de movimento antes do refinamento. Incluído na coleção oficial MiniMax H3. MiniMax‑H3 LoRAs
  • MiniMax‑H3 LMS LoRA. Adiciona layout, materiais e nitidez estrutural adequados para saídas no estilo de ação ao vivo; usado durante a segunda passagem. LMS LoRA r64
  • H3 Combat LoRA. Melhora a clareza das silhuetas de luta, contatos de lâmina e trabalho de pés fundamentado em cenários de ação. Incluído na coleção MiniMax H3. MiniMax‑H3 models
  • H3 Latent Upscaler LMS. Um ampliador temporal 3D que aumenta o vídeo latente entre passagens enquanto mantém a continuidade do movimento. Comfyui Minimax H3 Latent Upscaler

Como usar o fluxo de trabalho Comfyui MiniMax H3 Cenas de Ação#

O pipeline funciona em duas passagens coordenadas. A Passagem 1 estabelece movimento e tempo com Turbo para velocidade. O vídeo latente é então ampliado e refinado na Passagem 2 com LMS e Combat LoRAs enquanto o áudio nativo é retido. Você recebe tanto uma visualização rápida “base” quanto uma exportação “refinada” polida.

Configuração#

Use o grupo Configuração para escolher a proporção, resolução de trabalho, duração do clipe e taxa de quadros. O controle de duração converte segundos em uma contagem de quadros que se alinha com o chunking do sampler, o que ajuda na estabilidade. Comece mais baixo para visualizações rápidas, depois aumente uma vez que a estrutura e os ritmos pareçam corretos. Resoluções mais altas e clipes mais longos aumentam o VRAM e o tempo de renderização.

Referências#

Carregue três referências: uma imagem por personagem e uma imagem que define o ambiente. As imagens dos personagens atuam como guias de identidade e figurino, não como fundos, então escolha retratos limpos com rostos legíveis e elementos-chave do guarda-roupa. A referência da cena define iluminação, paleta e arquitetura; escolha uma vista que corresponda à altura da câmera pretendida. Você pode trocar referências livremente para explorar diferentes combinações e locais.

Condições#

O nó MiniMaxH3ReferenceToVideo (#56) funde o prompt estruturado com as referências e os codificadores MiniMax H3 para produzir um áudio‑vídeo latente conjunto e condicionamento positivo. O prompt funciona melhor quando dividido em seções rotuladas como subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, e non_diegetic_music. Seja explícito sobre o número de lutadores, armas, movimento de câmera e a contagem exata de contatos limpos. Evite personagens extras, teletransportes, movimentos sobre-humanos ou efeitos se você quiser resultados fundamentados.

LoRAs#

LoRAs são aplicados em duas etapas. Turbo é injetado para a primeira passagem para acelerar a exploração do movimento sem sacrificar a retenção de identidade. O LMS LoRA flui através de uma correção de compatibilidade AdaLN, depois Combat é aplicado para que o refinador enfatize silhuetas legíveis e trocas de ataque-parada. Você pode ajustar as intensidades do LoRA para equilibrar realismo versus estilização para o seu gênero.

Patchs#

Este grupo configura desempenho e modelagem de cronograma. PathchSageAttentionKJ (#199) otimiza a atenção para memória e velocidade para que cenas de alta movimentação permaneçam responsivas. MiniMaxH3SigmaShift (#297) alinha os cronogramas de sigma de vídeo e áudio, melhorando o tempo de lábios e efeitos sonoros em relação ao movimento. Use-os quando você perceber desvio de tempo ou pequena instabilidade de identidade.

1ª Amostragem#

A primeira passagem inicializa o ruído, define um cronograma compacto e amostra com SamplerCustomAdvanced (#238) guiado pelo seu condicionamento positivo. A saída é salva como um latente base e pode ser decodificada em um vídeo de visualização rápida com áudio nativo para revisão rápida. Esta passagem é onde você julga o bloqueio, a movimentação da câmera e o ritmo dos golpes. Se o mapa de batidas estiver errado, revise o prompt e as referências aqui antes de refinar.

2ª Amostragem + Refinador#

Antes do refinamento, o áudio e o vídeo são separados da primeira passagem, o vídeo latente é ampliado com MinimaxH3LatentUpscaler3D (#124), e o áudio latente é mantido intacto. O refinador então amostra com sigmas de menor ruído usando LMS e Combat LoRAs para adicionar detalhe material, fidelidade de borda e legibilidade de luta. Finalmente, imagens e o áudio preservado são decodificados e combinados na exportação refinada. Espere bordas mais nítidas, mãos e lâminas mais limpas, e identidade mais estável em comparação com a passagem base.

Nós principais no fluxo de trabalho Comfyui MiniMax H3 Cenas de Ação#

MiniMaxH3ReferenceToVideo (#56)#

Constrói um áudio‑vídeo latente sincronizado a partir do seu prompt estruturado e imagens de referência usando o codificador de texto MiniMax H3 e VAEs. Ajuste o prompt, width, height, e length para controlar conteúdo, enquadramento e duração. Para melhores resultados, mantenha as definições de assunto e restrições de cena desambiguadas. Referência: Comfy‑Org MiniMax‑H3.

MinimaxH3LatentUpscaler3D (#124)#

Ampliador latente 3D temporalmente consistente que aumenta o vídeo latente entre passagens antes do refinamento. Aumente mode.scale modestamente para ganhar detalhes sem desestabilizar o movimento. Útil quando você gosta do tempo da passagem‑1 mas quer bordas e texturas mais nítidas. Referência: Comfyui Minimax H3 Latent Upscaler.

MiniMaxH3SigmaShift (#297)#

Muda os cronogramas de sigma de áudio e vídeo usados pelo MiniMax H3 para que movimento, dicas de lábios e efeitos sonoros permaneçam alinhados. Ajustar shift_video e shift_audio pode reduzir desvio de tempo em diálogos ou impactos. Deixe pequenos deslocamentos a menos que você note dessincronização em corte‑in ou corte‑out. Referência: MiniMax‑H3 collection.

VHS_VideoCombine (#264)#

Combina quadros decodificados e áudio no MP4 final com sua taxa de quadros e configurações de qualidade escolhidas. Ative a salvaguarda de metadados para reter detalhes de proveniência e fluxo de trabalho nas exportações. Use trim_to_audio quando seu vídeo refinado se estender além do áudio preservado. Referência: ComfyUI‑VideoHelperSuite.

PathchSageAttentionKJ (#199)#

Otimização de atenção que pode melhorar o rendimento e a estabilidade para cenas de alta‑detalhe e resoluções maiores. Mantenha ativado para tomadas mais longas ou ambientes complexos. Se você encontrar regressões de desempenho em clipes menores, experimente seu modo automático. Referência: ComfyUI‑KJNodes.

Extras opcionais#

  • Padrão de prompting. Use o formato seccionado fornecido e escreva um mapa de batidas para a ação. Especifique o número exato de lutadores e armas, movimento de câmera, e a contagem e tempo de contatos legíveis.
  • Curadoria de referências. Escolha fotos de identidade com rostos claros e guarda-roupa, e uma imagem de localização que corresponda à perspectiva e iluminação pretendidas. Evite fundos ocupados em referências de personagens para reduzir conflitos.
  • Passagem de revisão. Assista ao vídeo base para validar bloqueio e tempo antes de refinar. Se os contatos parecerem confusos, aumente a clareza no prompt e reduza a velocidade frenética de mãos ou lâminas.
  • Problemas típicos e soluções. Contatos rápidos de mãos ou armas podem causar pequenas distorções; simplifique a coreografia em torno de impactos, encurte a troca, ou aumente a distância da câmera para ajudar o modelo a renderizar o momento claramente.
  • Entregáveis. O fluxo de trabalho escreve uma visualização base rápida e uma exportação refinada para que você possa comparar movimento versus aparência final. Use o clipe refinado para compartilhar uma vez que identidades, ambiente e ritmos atendam ao seu objetivo.

Com MiniMax H3 Cenas de Ação você pode transformar duas imagens de personagens, uma referência de cena e um briefing preciso em clipes de ação fundamentados e fiéis à referência com áudio nativo sincronizado, prontos para editorial, previs ou publicação.

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos sinceramente a Innovate Futures @ Benji pela orientação do fluxo de trabalho AI Video MiniMax H3 ComfyUI, WarmBloodAban pelo Minimax-h3_Singularity, e Comfy-Org e RunningHubAI pelos modelos base MiniMax-H3 e LMS LoRA por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.