MiniMax music video: geração de cena a partir de música no ComfyUI#
Este fluxo de trabalho transforma uma música completa em uma sequência de tomadas de vídeo cientes do ritmo usando o MiniMax H3, com criação opcional de música impulsionada pelo MiniMax Music 3. Ele combina prompts de texto, imagens de referência e uma faixa de áudio mestre para produzir clipes cinematográficos que acompanham vocais, batidas e humor. O resultado é um vídeo musical MiniMax coeso com identidade de personagem consistente e transições de tomada naturais.
Projetado para artistas, editores e criadores, o fluxo de trabalho suporta cortes de performance, visuais guiados por letras e inserções narrativas. Você pode trazer sua própria faixa ou gerar uma primeiro, e então montar um vídeo musical MiniMax que mantém a continuidade visual enquanto evolui com a estrutura da música.
Modelos chave no fluxo de trabalho Comfyui MiniMax music video#
- Modelo de difusão MiniMax H3. Gerador de vídeo principal que usa referências e condicionamento de prompt para sintetizar sequências de tomadas alinhadas ao áudio. Os ativos do modelo são publicados sob o namespace Comfy‑Org no Hugging Face, incluindo o VAE de vídeo e o codificador de texto. Comfy‑Org/MiniMax‑H3
- MiniMax H3 Video VAE. Decodifica quadros latentes em imagens para visualização e exportação. minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 Audio VAE. Decodifica o latente de áudio auxiliar do modelo quando necessário. minimax_h3_audio_vae_fp32.safetensors
- Codificador de texto MiniMax H3 (variante Qwen3VL 32B empacotada para H3). Fornece compreensão de prompt multimodal para geração de referência para vídeo. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
- Modelo de difusão MiniMax Music 3. Gerador de texto para música que cria músicas completas a partir de uma legenda e plano de letras; usado aqui quando você deseja criar a faixa dentro do ComfyUI. Comfy‑Org/MiniMax‑Music‑3
- Codificador de texto MiniMax Music 3. Codifica legenda e letras em condicionamento para geração de música. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
- MiniMax Music 3 DAV VAE. Decodifica latentes de áudio na forma de onda final. minimax_music3_dav.safetensors
Como usar o fluxo de trabalho Comfyui MiniMax music video#
Fluxo geral. O gráfico tem duas partes cooperantes: 1) criação opcional de música que gera uma faixa mestre, e 2) síntese de referência para vídeo que constrói tomadas visualmente coerentes sincronizadas com a música. Você pode executá-los juntos ou conectar seu próprio áudio e pular a criação de música. A etapa final monta quadros e áudio em um vídeo musical MiniMax renderizado.
1) Criação de Música (opcional)#
Este grupo planeja e sintetiza uma faixa com MiniMax Music 3. Comece com M3SongPlanner (#6171) para rascunhar uma legenda estruturada e letras; ambas são editáveis nos visualizadores de texto na tela antes da codificação. MiniMaxMusic3TextEncode (#6157) transforma esse plano em condicionamento e fornece a duração alvo. Um contêiner de áudio latente é criado, amostrado por KSampler (#6162) com o UNet do MiniMax Music 3 (UNETLoader (#6156)), e então decodificado através do DAV VAE usando decodificação padrão ou em mosaico, dependendo do VRAM. O áudio gerado é salvo e definido como a faixa de origem do fluxo de trabalho para vídeo.
2) Entradas do Usuário#
Forneça ou gere uma música mestre. Carregue uma faixa externa com VHS_LoadAudioUpload (#6170), ou use a música produzida na etapa 1. Adicione uma ou mais imagens de referência para aparência e identidade usando LoadImage (#6110) ou um carregador de caminho; as imagens são normalizadas por ImageResizeKJv2 (#6090, #6091) para condicionamento estável. Defina seu briefing criativo em (input:prompt) Text Prompt (#138) — este prompt suporta definições de assunto, notas de tomada e dicas de tempo. Escolha o aspecto e a duração aproximada via Resolution Selector (Size) (#115) e (input:duration) Duration (#132).
3) Patches#
PathchSageAttentionKJ (#142) ativa uma implementação de atenção otimizada que pode melhorar o rendimento e o comportamento de memória em algumas GPUs. Este patch opera no modelo MiniMax H3 carregado antes da amostragem. Mantenha-o ativado, a menos que encontre problemas específicos do dispositivo.
4) Modelos#
UNETLoader (#127) carrega o backbone do MiniMax H3 para referência para vídeo, e um Turbo LoRA opcional é aplicado com LoraLoaderModelOnly (#5959) para resultados mais rápidos e impactantes. VAEs de vídeo e áudio (VAELoader (#119), VAELoader (#120)) são preparados para decodificação. Esses ativos definem o envelope de qualidade e devem permanecer consistentes em todas as tomadas para manter uma aparência uniforme.
5) Condicionamento#
MiniMaxH3ReferenceToVideo (#136) funde seu prompt de texto, imagens de referência, tamanho alvo e comprimento em condicionamento e um latente inicial. É a ponte entre o briefing criativo e o que o sampler irá renderizar. Você pode alimentar duas imagens de referência neste modelo para guiar guarda-roupa, identidade e paleta. O grupo também calcula um comprimento de tomada a partir da duração solicitada para que os quadros se alinhem musicalmente.
6) Amostragem#
A pilha de amostragem combina BasicScheduler (#124), BasicGuider (#126) e SamplerCustomAdvanced (#125) com RandomNoise (#129). MiniMaxH3SigmaShift (#5960) fica a montante para viés de intervalos sigma para movimento de vídeo mais nítido e alinhamento de áudio estável. Juntos, eles iteram o latente em direção a imagens que seguem suas referências e a batida. Para reprodutibilidade, mantenha suas sementes fixas enquanto itera sobre prompt e referências.
7) Decodificação e criação de vídeo#
VAEDecode (#122) transforma os latentes amostrados em quadros e Set_video_1 (#5651) os prepara para exportação. A montagem final usa VHS_VideoCombine (#5645), que costura quadros ao áudio de origem escolhido e aplica sua taxa de quadros alvo do valor armazenado src_fps. O resultado é um clipe de vídeo musical MiniMax pronto para compartilhar que permanece sincronizado com a faixa.
8) Referência para Vídeo#
Este grupo é o coração criativo do pipeline para construir sequências de tomadas contra a música mestre. Recebe o modelo H3 preparado, suas referências, e o comprimento da tomada calculado, então executa uma passagem de amostragem por clipe. Use-o para iterar múltiplos cortes conectados em torno do mesmo assunto para que identidade, guarda-roupa e paleta permaneçam consistentes. Repita por seção da música para cobrir introduções, versos, refrões e pontes com visuais correspondentes.
Nós chave no fluxo de trabalho Comfyui MiniMax music video#
MiniMaxH3ReferenceToVideo (#136)#
Cria o condicionamento que liga prompt, referências e geometria alvo a um latente para amostragem. Use-o para direcionar identidade e direção artística com um pequeno conjunto de imagens de alta qualidade e notas de tomada claras. Se uma tomada precisar de maior adesão a um rosto ou roupa, mantenha as referências estilisticamente semelhantes e evite cortes extremos. Ajuste a formulação do prompt antes de mudar as configurações de amostragem, pois este nó influencia mais fortemente quem e o que aparece na tela.
MiniMaxH3SigmaShift (#5960)#
Desloca cronogramas de sigma na pilha MiniMax H3 para equilibrar mudança temporal e alinhamento de áudio. Aumente o deslocamento de vídeo quando quiser mais movimento e evolução visual dentro de uma tomada; aumente o deslocamento de áudio para favorecer ritmo apertado e sensação labial. Use mudanças modestas e teste em um clipe curto antes de comprometer uma cena inteira.
SamplerCustomAdvanced (#125)#
Executa o loop de remoção de ruído com o agendador e guia selecionados. Aqui você troca tempo por qualidade e textura. Para idealização rápida, reduza passos e mantenha sementes fixas; para finais, dê mais passos e ajuste a orientação para refinar detalhes sem perder identidade. Quando os resultados excedem seu briefing, simplifique primeiro o prompt ou reduza referências conflitantes.
VHS_VideoCombine (#5645)#
Monta quadros decodificados com o áudio escolhido em um único arquivo de vídeo. Mantenha a taxa de quadros constante em todos os clipes destinados a serem editados juntos. Se os visuais se desviarem da batida, confirme que o comprimento da tomada e fps são consistentes com a faixa de origem. Corte em seu NLE apenas depois que os renders coincidirem com o tempo e as dicas de letras dentro do fluxo de trabalho.
MiniMaxMusic3TextEncode (#6157)#
Codifica a legenda e letras que definem estrutura, arranjo e caráter vocal para MiniMax Music 3. Escreva legendas em seções que cubram metadados globais, detalhes vocais e arranjo para que o modelo entenda a intenção. Use tags de seção de letras como [Intro], [Verse] e [Chorus] para marcar transições que o gerador pode seguir. Para ajuda com prompts, consulte a orientação e ferramentas do repositório oficial. MiniMax‑AI/MiniMax‑Music3
ComfyMathExpression (#131)#
Calcula uma contagem de quadros interna a partir da sua duração alvo e a ajusta para uma cadência que a pilha temporal H3 prefere na fps selecionada. Isso evita desincronização sutil e gagueira. Se você mudar fps ou duração, deixe este nó recalcular o comprimento para que a amostragem caia no ritmo.
Extras opcionais#
- Escreva prompts com uma estrutura estável: definições de assunto, um resumo de uma frase, e então 1–3 parágrafos de tomada com dicas de tempo. Mantenha o tempo verbal e a voz consistentes.
- Use 1–2 imagens de referência limpas por assunto. Prefira iluminação neutra e um corte médio que inclua detalhes de cabelo e roupa para melhorar a retenção de identidade.
- Mapeie cenas para a música primeiro. Renderize clipes curtos por seção (introdução, verso, refrão) e concatene-os; isso mantém o vídeo musical MiniMax coeso enquanto permite variação local.
- Mantenha a resolução e a taxa de quadros consistentes em todos os clipes que você planeja editar juntos. Mudar qualquer um no meio do projeto torna a continuidade mais difícil.
- Em máquinas de baixo VRAM, habilite decodificação de áudio em mosaico para músicas longas; em alto VRAM, a decodificação padrão geralmente é um pouco mais limpa.
- Para re-renderizações confiáveis, bloqueie sementes tanto no sampler de vídeo quanto no sampler de música antes de exportar finais.
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos imensamente ao Innovate Futures @ Benji pelo MiniMax Music VideoWorkflow Source por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.
Recursos#
- Innovate Futures @ Benji/MiniMax Music VideoWorkflow Source
- Docs / Release Notes: MiniMax Music VideoWorkflow Source
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

