ComfyUI>Fluxos de Trabalho>MiniMax Music Video | Pipeline Completo de Vídeo Musical com MiniMax H3 e Music 3

MiniMax Music Video | Pipeline Completo de Vídeo Musical com MiniMax H3 e Music 3

Workflow Name: RunComfy/MiniMax-music-video
Workflow ID: 0000...1502
Transforme sua música completa em uma sequência visual conectada por IA. Use MiniMax H3 e MiniMax Music 3 para combinar cenas com ritmo, vocais e humor. Oriente tomadas com prompts, imagens, áudio ou referências de vídeo. Mantenha personagens e estilo consistentes. Construa clipes de performance ou narrativa mais rapidamente. Exporte um resultado cinematográfico coeso.

ComfyUI MiniMax music video Workflow

MiniMax Music Video in ComfyUI | Build full pipeline with MiniMax H3 and Music 3
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax music video Examples

MiniMax music video: geração de cena a partir de música no ComfyUI#

Este fluxo de trabalho transforma uma música completa em uma sequência de tomadas de vídeo cientes do ritmo usando o MiniMax H3, com criação opcional de música impulsionada pelo MiniMax Music 3. Ele combina prompts de texto, imagens de referência e uma faixa de áudio mestre para produzir clipes cinematográficos que acompanham vocais, batidas e humor. O resultado é um vídeo musical MiniMax coeso com identidade de personagem consistente e transições de tomada naturais.

Projetado para artistas, editores e criadores, o fluxo de trabalho suporta cortes de performance, visuais guiados por letras e inserções narrativas. Você pode trazer sua própria faixa ou gerar uma primeiro, e então montar um vídeo musical MiniMax que mantém a continuidade visual enquanto evolui com a estrutura da música.

Modelos chave no fluxo de trabalho Comfyui MiniMax music video#

Como usar o fluxo de trabalho Comfyui MiniMax music video#

Fluxo geral. O gráfico tem duas partes cooperantes: 1) criação opcional de música que gera uma faixa mestre, e 2) síntese de referência para vídeo que constrói tomadas visualmente coerentes sincronizadas com a música. Você pode executá-los juntos ou conectar seu próprio áudio e pular a criação de música. A etapa final monta quadros e áudio em um vídeo musical MiniMax renderizado.

1) Criação de Música (opcional)#

Este grupo planeja e sintetiza uma faixa com MiniMax Music 3. Comece com M3SongPlanner (#6171) para rascunhar uma legenda estruturada e letras; ambas são editáveis nos visualizadores de texto na tela antes da codificação. MiniMaxMusic3TextEncode (#6157) transforma esse plano em condicionamento e fornece a duração alvo. Um contêiner de áudio latente é criado, amostrado por KSampler (#6162) com o UNet do MiniMax Music 3 (UNETLoader (#6156)), e então decodificado através do DAV VAE usando decodificação padrão ou em mosaico, dependendo do VRAM. O áudio gerado é salvo e definido como a faixa de origem do fluxo de trabalho para vídeo.

2) Entradas do Usuário#

Forneça ou gere uma música mestre. Carregue uma faixa externa com VHS_LoadAudioUpload (#6170), ou use a música produzida na etapa 1. Adicione uma ou mais imagens de referência para aparência e identidade usando LoadImage (#6110) ou um carregador de caminho; as imagens são normalizadas por ImageResizeKJv2 (#6090, #6091) para condicionamento estável. Defina seu briefing criativo em (input:prompt) Text Prompt (#138) — este prompt suporta definições de assunto, notas de tomada e dicas de tempo. Escolha o aspecto e a duração aproximada via Resolution Selector (Size) (#115) e (input:duration) Duration (#132).

3) Patches#

PathchSageAttentionKJ (#142) ativa uma implementação de atenção otimizada que pode melhorar o rendimento e o comportamento de memória em algumas GPUs. Este patch opera no modelo MiniMax H3 carregado antes da amostragem. Mantenha-o ativado, a menos que encontre problemas específicos do dispositivo.

4) Modelos#

UNETLoader (#127) carrega o backbone do MiniMax H3 para referência para vídeo, e um Turbo LoRA opcional é aplicado com LoraLoaderModelOnly (#5959) para resultados mais rápidos e impactantes. VAEs de vídeo e áudio (VAELoader (#119), VAELoader (#120)) são preparados para decodificação. Esses ativos definem o envelope de qualidade e devem permanecer consistentes em todas as tomadas para manter uma aparência uniforme.

5) Condicionamento#

MiniMaxH3ReferenceToVideo (#136) funde seu prompt de texto, imagens de referência, tamanho alvo e comprimento em condicionamento e um latente inicial. É a ponte entre o briefing criativo e o que o sampler irá renderizar. Você pode alimentar duas imagens de referência neste modelo para guiar guarda-roupa, identidade e paleta. O grupo também calcula um comprimento de tomada a partir da duração solicitada para que os quadros se alinhem musicalmente.

6) Amostragem#

A pilha de amostragem combina BasicScheduler (#124), BasicGuider (#126) e SamplerCustomAdvanced (#125) com RandomNoise (#129). MiniMaxH3SigmaShift (#5960) fica a montante para viés de intervalos sigma para movimento de vídeo mais nítido e alinhamento de áudio estável. Juntos, eles iteram o latente em direção a imagens que seguem suas referências e a batida. Para reprodutibilidade, mantenha suas sementes fixas enquanto itera sobre prompt e referências.

7) Decodificação e criação de vídeo#

VAEDecode (#122) transforma os latentes amostrados em quadros e Set_video_1 (#5651) os prepara para exportação. A montagem final usa VHS_VideoCombine (#5645), que costura quadros ao áudio de origem escolhido e aplica sua taxa de quadros alvo do valor armazenado src_fps. O resultado é um clipe de vídeo musical MiniMax pronto para compartilhar que permanece sincronizado com a faixa.

8) Referência para Vídeo#

Este grupo é o coração criativo do pipeline para construir sequências de tomadas contra a música mestre. Recebe o modelo H3 preparado, suas referências, e o comprimento da tomada calculado, então executa uma passagem de amostragem por clipe. Use-o para iterar múltiplos cortes conectados em torno do mesmo assunto para que identidade, guarda-roupa e paleta permaneçam consistentes. Repita por seção da música para cobrir introduções, versos, refrões e pontes com visuais correspondentes.

Nós chave no fluxo de trabalho Comfyui MiniMax music video#

MiniMaxH3ReferenceToVideo (#136)#

Cria o condicionamento que liga prompt, referências e geometria alvo a um latente para amostragem. Use-o para direcionar identidade e direção artística com um pequeno conjunto de imagens de alta qualidade e notas de tomada claras. Se uma tomada precisar de maior adesão a um rosto ou roupa, mantenha as referências estilisticamente semelhantes e evite cortes extremos. Ajuste a formulação do prompt antes de mudar as configurações de amostragem, pois este nó influencia mais fortemente quem e o que aparece na tela.

MiniMaxH3SigmaShift (#5960)#

Desloca cronogramas de sigma na pilha MiniMax H3 para equilibrar mudança temporal e alinhamento de áudio. Aumente o deslocamento de vídeo quando quiser mais movimento e evolução visual dentro de uma tomada; aumente o deslocamento de áudio para favorecer ritmo apertado e sensação labial. Use mudanças modestas e teste em um clipe curto antes de comprometer uma cena inteira.

SamplerCustomAdvanced (#125)#

Executa o loop de remoção de ruído com o agendador e guia selecionados. Aqui você troca tempo por qualidade e textura. Para idealização rápida, reduza passos e mantenha sementes fixas; para finais, dê mais passos e ajuste a orientação para refinar detalhes sem perder identidade. Quando os resultados excedem seu briefing, simplifique primeiro o prompt ou reduza referências conflitantes.

VHS_VideoCombine (#5645)#

Monta quadros decodificados com o áudio escolhido em um único arquivo de vídeo. Mantenha a taxa de quadros constante em todos os clipes destinados a serem editados juntos. Se os visuais se desviarem da batida, confirme que o comprimento da tomada e fps são consistentes com a faixa de origem. Corte em seu NLE apenas depois que os renders coincidirem com o tempo e as dicas de letras dentro do fluxo de trabalho.

MiniMaxMusic3TextEncode (#6157)#

Codifica a legenda e letras que definem estrutura, arranjo e caráter vocal para MiniMax Music 3. Escreva legendas em seções que cubram metadados globais, detalhes vocais e arranjo para que o modelo entenda a intenção. Use tags de seção de letras como [Intro], [Verse] e [Chorus] para marcar transições que o gerador pode seguir. Para ajuda com prompts, consulte a orientação e ferramentas do repositório oficial. MiniMax‑AI/MiniMax‑Music3

ComfyMathExpression (#131)#

Calcula uma contagem de quadros interna a partir da sua duração alvo e a ajusta para uma cadência que a pilha temporal H3 prefere na fps selecionada. Isso evita desincronização sutil e gagueira. Se você mudar fps ou duração, deixe este nó recalcular o comprimento para que a amostragem caia no ritmo.

Extras opcionais#

  • Escreva prompts com uma estrutura estável: definições de assunto, um resumo de uma frase, e então 1–3 parágrafos de tomada com dicas de tempo. Mantenha o tempo verbal e a voz consistentes.
  • Use 1–2 imagens de referência limpas por assunto. Prefira iluminação neutra e um corte médio que inclua detalhes de cabelo e roupa para melhorar a retenção de identidade.
  • Mapeie cenas para a música primeiro. Renderize clipes curtos por seção (introdução, verso, refrão) e concatene-os; isso mantém o vídeo musical MiniMax coeso enquanto permite variação local.
  • Mantenha a resolução e a taxa de quadros consistentes em todos os clipes que você planeja editar juntos. Mudar qualquer um no meio do projeto torna a continuidade mais difícil.
  • Em máquinas de baixo VRAM, habilite decodificação de áudio em mosaico para músicas longas; em alto VRAM, a decodificação padrão geralmente é um pouco mais limpa.
  • Para re-renderizações confiáveis, bloqueie sementes tanto no sampler de vídeo quanto no sampler de música antes de exportar finais.

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos imensamente ao Innovate Futures @ Benji pelo MiniMax Music VideoWorkflow Source por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.