MiniMax H3 Cenas de Ação: Gerador de vídeo de ação guiado por referência com áudio nativo#
MiniMax H3 Cenas de Ação é um fluxo de trabalho ComfyUI para criar vídeos de ação rigorosamente dirigidos, guiados por referência, com áudio nativo sincronizado. Você fornece duas imagens de personagens, uma referência de cena e um prompt estruturado. O fluxo de trabalho organiza o movimento com MiniMax H3 Turbo, depois refina a composição e a legibilidade da luta com LMS e Combat LoRAs enquanto preserva o áudio original. As saídas incluem um vídeo “base” rápido de primeira passagem e um vídeo “refinado” de maior fidelidade.
Este fluxo de trabalho Comfyui MiniMax H3 Cenas de Ação é projetado para previz, design de acrobacias e lutas, cinematografia de jogos e VFX, e clipes sociais curtos. Exemplos testados incluem sparring com espadas em castelos, treino com luvas de boxe e exercício com bastões em espaçonaves. Mantenha a identidade dos personagens e a coreografia explícitas no prompt, e revise contatos rápidos de mãos ou armas para possíveis artefatos.
Modelos principais no fluxo de trabalho Comfyui MiniMax H3 Cenas de Ação#
- Conjunto principal Comfy‑Org MiniMax H3. Fornece o codificador de texto além dos VAEs de vídeo e áudio usados para construir, separar e decodificar o áudio‑vídeo latente conjunto. Veja modelos e LoRAs na coleção oficial. MiniMax‑H3 models
- Minimax‑h3 Singularity (UNet). Serve como o gerador base ref‑to‑video que funde referências e prompt em um áudio‑vídeo latente para cenas de ação. Minimax‑h3_Singularity
- MiniMax‑H3 Turbo LoRA. Acelera a primeira passagem para que você possa iterar rapidamente nos ritmos de movimento antes do refinamento. Incluído na coleção oficial MiniMax H3. MiniMax‑H3 LoRAs
- MiniMax‑H3 LMS LoRA. Adiciona layout, materiais e nitidez estrutural adequados para saídas no estilo de ação ao vivo; usado durante a segunda passagem. LMS LoRA r64
- H3 Combat LoRA. Melhora a clareza das silhuetas de luta, contatos de lâmina e trabalho de pés fundamentado em cenários de ação. Incluído na coleção MiniMax H3. MiniMax‑H3 models
- H3 Latent Upscaler LMS. Um ampliador temporal 3D que aumenta o vídeo latente entre passagens enquanto mantém a continuidade do movimento. Comfyui Minimax H3 Latent Upscaler
Como usar o fluxo de trabalho Comfyui MiniMax H3 Cenas de Ação#
O pipeline funciona em duas passagens coordenadas. A Passagem 1 estabelece movimento e tempo com Turbo para velocidade. O vídeo latente é então ampliado e refinado na Passagem 2 com LMS e Combat LoRAs enquanto o áudio nativo é retido. Você recebe tanto uma visualização rápida “base” quanto uma exportação “refinada” polida.
Configuração#
Use o grupo Configuração para escolher a proporção, resolução de trabalho, duração do clipe e taxa de quadros. O controle de duração converte segundos em uma contagem de quadros que se alinha com o chunking do sampler, o que ajuda na estabilidade. Comece mais baixo para visualizações rápidas, depois aumente uma vez que a estrutura e os ritmos pareçam corretos. Resoluções mais altas e clipes mais longos aumentam o VRAM e o tempo de renderização.
Referências#
Carregue três referências: uma imagem por personagem e uma imagem que define o ambiente. As imagens dos personagens atuam como guias de identidade e figurino, não como fundos, então escolha retratos limpos com rostos legíveis e elementos-chave do guarda-roupa. A referência da cena define iluminação, paleta e arquitetura; escolha uma vista que corresponda à altura da câmera pretendida. Você pode trocar referências livremente para explorar diferentes combinações e locais.
Condições#
O nó MiniMaxH3ReferenceToVideo (#56) funde o prompt estruturado com as referências e os codificadores MiniMax H3 para produzir um áudio‑vídeo latente conjunto e condicionamento positivo. O prompt funciona melhor quando dividido em seções rotuladas como subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, e non_diegetic_music. Seja explícito sobre o número de lutadores, armas, movimento de câmera e a contagem exata de contatos limpos. Evite personagens extras, teletransportes, movimentos sobre-humanos ou efeitos se você quiser resultados fundamentados.
LoRAs#
LoRAs são aplicados em duas etapas. Turbo é injetado para a primeira passagem para acelerar a exploração do movimento sem sacrificar a retenção de identidade. O LMS LoRA flui através de uma correção de compatibilidade AdaLN, depois Combat é aplicado para que o refinador enfatize silhuetas legíveis e trocas de ataque-parada. Você pode ajustar as intensidades do LoRA para equilibrar realismo versus estilização para o seu gênero.
Patchs#
Este grupo configura desempenho e modelagem de cronograma. PathchSageAttentionKJ (#199) otimiza a atenção para memória e velocidade para que cenas de alta movimentação permaneçam responsivas. MiniMaxH3SigmaShift (#297) alinha os cronogramas de sigma de vídeo e áudio, melhorando o tempo de lábios e efeitos sonoros em relação ao movimento. Use-os quando você perceber desvio de tempo ou pequena instabilidade de identidade.
1ª Amostragem#
A primeira passagem inicializa o ruído, define um cronograma compacto e amostra com SamplerCustomAdvanced (#238) guiado pelo seu condicionamento positivo. A saída é salva como um latente base e pode ser decodificada em um vídeo de visualização rápida com áudio nativo para revisão rápida. Esta passagem é onde você julga o bloqueio, a movimentação da câmera e o ritmo dos golpes. Se o mapa de batidas estiver errado, revise o prompt e as referências aqui antes de refinar.
2ª Amostragem + Refinador#
Antes do refinamento, o áudio e o vídeo são separados da primeira passagem, o vídeo latente é ampliado com MinimaxH3LatentUpscaler3D (#124), e o áudio latente é mantido intacto. O refinador então amostra com sigmas de menor ruído usando LMS e Combat LoRAs para adicionar detalhe material, fidelidade de borda e legibilidade de luta. Finalmente, imagens e o áudio preservado são decodificados e combinados na exportação refinada. Espere bordas mais nítidas, mãos e lâminas mais limpas, e identidade mais estável em comparação com a passagem base.
Nós principais no fluxo de trabalho Comfyui MiniMax H3 Cenas de Ação#
MiniMaxH3ReferenceToVideo (#56)#
Constrói um áudio‑vídeo latente sincronizado a partir do seu prompt estruturado e imagens de referência usando o codificador de texto MiniMax H3 e VAEs. Ajuste o prompt, width, height, e length para controlar conteúdo, enquadramento e duração. Para melhores resultados, mantenha as definições de assunto e restrições de cena desambiguadas. Referência: Comfy‑Org MiniMax‑H3.
MinimaxH3LatentUpscaler3D (#124)#
Ampliador latente 3D temporalmente consistente que aumenta o vídeo latente entre passagens antes do refinamento. Aumente mode.scale modestamente para ganhar detalhes sem desestabilizar o movimento. Útil quando você gosta do tempo da passagem‑1 mas quer bordas e texturas mais nítidas. Referência: Comfyui Minimax H3 Latent Upscaler.
MiniMaxH3SigmaShift (#297)#
Muda os cronogramas de sigma de áudio e vídeo usados pelo MiniMax H3 para que movimento, dicas de lábios e efeitos sonoros permaneçam alinhados. Ajustar shift_video e shift_audio pode reduzir desvio de tempo em diálogos ou impactos. Deixe pequenos deslocamentos a menos que você note dessincronização em corte‑in ou corte‑out. Referência: MiniMax‑H3 collection.
VHS_VideoCombine (#264)#
Combina quadros decodificados e áudio no MP4 final com sua taxa de quadros e configurações de qualidade escolhidas. Ative a salvaguarda de metadados para reter detalhes de proveniência e fluxo de trabalho nas exportações. Use trim_to_audio quando seu vídeo refinado se estender além do áudio preservado. Referência: ComfyUI‑VideoHelperSuite.
PathchSageAttentionKJ (#199)#
Otimização de atenção que pode melhorar o rendimento e a estabilidade para cenas de alta‑detalhe e resoluções maiores. Mantenha ativado para tomadas mais longas ou ambientes complexos. Se você encontrar regressões de desempenho em clipes menores, experimente seu modo automático. Referência: ComfyUI‑KJNodes.
Extras opcionais#
- Padrão de prompting. Use o formato seccionado fornecido e escreva um mapa de batidas para a ação. Especifique o número exato de lutadores e armas, movimento de câmera, e a contagem e tempo de contatos legíveis.
- Curadoria de referências. Escolha fotos de identidade com rostos claros e guarda-roupa, e uma imagem de localização que corresponda à perspectiva e iluminação pretendidas. Evite fundos ocupados em referências de personagens para reduzir conflitos.
- Passagem de revisão. Assista ao vídeo base para validar bloqueio e tempo antes de refinar. Se os contatos parecerem confusos, aumente a clareza no prompt e reduza a velocidade frenética de mãos ou lâminas.
- Problemas típicos e soluções. Contatos rápidos de mãos ou armas podem causar pequenas distorções; simplifique a coreografia em torno de impactos, encurte a troca, ou aumente a distância da câmera para ajudar o modelo a renderizar o momento claramente.
- Entregáveis. O fluxo de trabalho escreve uma visualização base rápida e uma exportação refinada para que você possa comparar movimento versus aparência final. Use o clipe refinado para compartilhar uma vez que identidades, ambiente e ritmos atendam ao seu objetivo.
Com MiniMax H3 Cenas de Ação você pode transformar duas imagens de personagens, uma referência de cena e um briefing preciso em clipes de ação fundamentados e fiéis à referência com áudio nativo sincronizado, prontos para editorial, previs ou publicação.
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos sinceramente a Innovate Futures @ Benji pela orientação do fluxo de trabalho AI Video MiniMax H3 ComfyUI, WarmBloodAban pelo Minimax-h3_Singularity, e Comfy-Org e RunningHubAI pelos modelos base MiniMax-H3 e LMS LoRA por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.
Recursos#
- Innovate Futures @ Benji/AI Video MiniMax H3 (fonte do fluxo de trabalho)
- Documentos / Notas de Lançamento: AI Video Minimax H3 Action Scenes Update — New Sampling Settings in ComfyUI
- WarmBloodAban/Minimax-h3_Singularity
- Hugging Face: WarmBloodAban/Minimax-h3_Singularity
- Comfy-Org/MiniMax-H3
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- RunningHubAI/rh-minimax-h3-lms-v1.0-r64-lora
- Hugging Face: RunningHubAI/rh-minimax-h3-lms-v1.0-r64-lora
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

