Video musical de MiniMax: generación de canción a escena en ComfyUI#
Este flujo de trabajo convierte una canción completa en una secuencia de tomas de video conscientes del ritmo utilizando MiniMax H3, con creación musical opcional potenciada por MiniMax Music 3. Mezcla indicaciones de texto, imágenes de referencia y una pista de audio maestra para producir clips cinematográficos que siguen las voces, el ritmo y el estado de ánimo. El resultado es un video musical de MiniMax cohesivo con identidad de personaje consistente y transiciones naturales entre tomas.
Construido para artistas, editores y creadores, el flujo de trabajo admite cortes de rendimiento, visuales impulsados por letras e inserciones narrativas. Puede traer su propia pista o generar una primero, luego ensamblar un video musical de MiniMax que mantenga la continuidad visual mientras evoluciona con la estructura de la canción.
Modelos clave en el flujo de trabajo de video musical de Comfyui MiniMax#
- Modelo de difusión MiniMax H3. Generador de video principal que utiliza referencias y condicionamiento de indicaciones para sintetizar secuencias de tomas alineadas al audio. Los activos del modelo se publican bajo el espacio de nombres Comfy‑Org en Hugging Face, incluidos el video VAE y el codificador de texto. Comfy‑Org/MiniMax‑H3
- MiniMax H3 Video VAE. Decodifica marcos latentes a imágenes para vista previa y exportación. minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 Audio VAE. Decodifica el audio latente auxiliar del modelo cuando es necesario. minimax_h3_audio_vae_fp32.safetensors
- Codificador de texto MiniMax H3 (variante Qwen3VL 32B empaquetada para H3). Proporciona comprensión de indicaciones multimodales para generación de referencia a video. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
- Modelo de difusión MiniMax Music 3. Generador de texto a música que crea canciones completas a partir de un subtítulo y un plan de letras; se utiliza aquí cuando desea crear la pista dentro de ComfyUI. Comfy‑Org/MiniMax‑Music‑3
- Codificador de texto MiniMax Music 3. Codifica el subtítulo y las letras en un condicionamiento para la generación de música. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
- MiniMax Music 3 DAV VAE. Decodifica latentes de audio en la forma de onda final. minimax_music3_dav.safetensors
Cómo usar el flujo de trabajo de video musical de Comfyui MiniMax#
Flujo general. El gráfico tiene dos partes cooperantes: 1) creación musical opcional que genera una pista maestra, y 2) síntesis de referencia a video que construye tomas visualmente coherentes sincronizadas con la canción. Puede ejecutarlos juntos o insertar su propio audio y omitir la creación musical. El paso final ensambla marcos y audio en un video musical de MiniMax renderizado.
1) Creación Musical (opcional)#
Este grupo planifica y sintetiza una pista con MiniMax Music 3. Comience con M3SongPlanner (#6171) para redactar un subtítulo estructurado y letras; ambos son editables en los visores de texto en el lienzo antes de la codificación. MiniMaxMusic3TextEncode (#6157) convierte ese plan en condicionamiento y proporciona la duración objetivo. Se crea un contenedor de audio latente, muestreado por KSampler (#6162) con el UNet de MiniMax Music 3 (UNETLoader (#6156)), luego decodificado a través del DAV VAE utilizando la decodificación estándar o en mosaico dependiendo del VRAM. El audio generado se guarda y se establece como la pista de origen del flujo de trabajo para video.
2) Entradas del Usuario#
Proporcione o genere una canción maestra. Suba una pista externa con VHS_LoadAudioUpload (#6170), o use la canción producida en el paso 1. Agregue una o más imágenes de referencia para el aspecto e identidad utilizando LoadImage (#6110) o un cargador de rutas; las imágenes se normalizan por ImageResizeKJv2 (#6090, #6091) para un condicionamiento estable. Establezca su resumen creativo en (input:prompt) Text Prompt (#138) — esta indicación admite definiciones de sujeto, notas de toma y sugerencias de tiempo. Elija el aspecto y la duración aproximada a través de Resolution Selector (Size) (#115) y (input:duration) Duration (#132).
3) Parches#
PathchSageAttentionKJ (#142) activa una implementación de atención optimizada que puede mejorar el rendimiento y el comportamiento de la memoria en algunas GPUs. Este parche opera en el modelo MiniMax H3 cargado antes de muestrear. Manténgalo habilitado a menos que encuentre problemas específicos del dispositivo.
4) Modelos#
UNETLoader (#127) carga la columna vertebral de MiniMax H3 para referencia a video, y se aplica un Turbo LoRA opcional con LoraLoaderModelOnly (#5959) para resultados más rápidos y contundentes. Los VAEs de video y audio (VAELoader (#119), VAELoader (#120)) se preparan para la decodificación. Estos activos definen el sobre de calidad y deben permanecer consistentes en todas las tomas para mantener un aspecto uniforme.
5) Condicionamiento#
MiniMaxH3ReferenceToVideo (#136) fusiona su indicación de texto, imágenes de referencia, tamaño objetivo y longitud en un condicionamiento y un latente inicial. Es el puente entre el resumen creativo y lo que el muestreador renderizará. Puede alimentar dos imágenes de referencia en esta plantilla para guiar el vestuario, la identidad y la paleta. El grupo también calcula una longitud de toma a partir de la duración solicitada para que los marcos se alineen musicalmente.
6) Muestreo#
La pila de muestreo combina BasicScheduler (#124), BasicGuider (#126) y SamplerCustomAdvanced (#125) con RandomNoise (#129). MiniMaxH3SigmaShift (#5960) se sitúa aguas arriba para sesgar rangos de sigma para un movimiento de video más nítido y una alineación de audio estable. Juntos iteran el latente hacia imágenes que siguen sus referencias y el ritmo. Para reproducibilidad, mantenga sus semillas fijas mientras itera en indicaciones y referencias.
7) Decodificación y creación de video#
VAEDecode (#122) convierte los latentes muestreados en marcos y Set_video_1 (#5651) los prepara para la exportación. El ensamblaje final utiliza VHS_VideoCombine (#5645), que une los marcos al audio de origen elegido y aplica su tasa de fotogramas objetivo del valor src_fps almacenado. El resultado es un clip de video musical de MiniMax listo para compartir que se mantiene sincronizado con la pista.
8) Referencia a Video#
Este grupo es el núcleo creativo de la canalización para construir secuencias de tomas contra la canción maestra. Recibe el modelo H3 preparado, sus referencias y la longitud de toma calculada, luego ejecuta una pasada de muestreo por clip. Úselo para iterar múltiples cortes conectados alrededor del mismo sujeto para que la identidad, el vestuario y la paleta se mantengan consistentes. Repita por sección de la canción para cubrir intros, versos, coros y puentes con visuales coincidentes.
Nodos clave en el flujo de trabajo de video musical de Comfyui MiniMax#
MiniMaxH3ReferenceToVideo (#136)#
Crea el condicionamiento que une la indicación, las referencias y la geometría objetivo a un latente para muestreo. Úselo para guiar la identidad y la dirección artística con un pequeño conjunto de imágenes de alta calidad y notas de toma claras. Si una toma necesita una adherencia más fuerte a un rostro o atuendo, mantenga las referencias estilísticamente similares y evite recortes extremos. Ajuste la redacción de la indicación antes de cambiar la configuración de muestreo, ya que este nodo influye más fuertemente en quién y qué aparece en pantalla.
MiniMaxH3SigmaShift (#5960)#
Compensa los horarios de sigma en la pila MiniMax H3 para equilibrar el cambio temporal y la alineación de audio. Aumente el cambio de video cuando desee más movimiento y evolución visual dentro de una toma; aumente el cambio de audio para favorecer el ritmo ajustado y la sensación de labios. Use cambios modestos y pruebe en un clip corto antes de comprometerse con una escena completa.
SamplerCustomAdvanced (#125)#
Ejecuta el bucle de desruido con el programador y guía seleccionados. Aquí es donde intercambia tiempo por calidad y textura. Para la ideación rápida, reduzca los pasos y mantenga las semillas fijas; para finales, déle más pasos y ajuste la guía para refinar el detalle sin perder identidad. Cuando los resultados superan su resumen, primero simplifique la indicación o reduzca las referencias conflictivas.
VHS_VideoCombine (#5645)#
Assembles decoded frames with the chosen audio into a single video file. Mantenga constante la tasa de fotogramas en todos los clips que se editarán juntos. Si los visuales se desvían del ritmo, confirme que la longitud de la toma y los fps sean consistentes con la pista de origen. Corte en su NLE solo después de que los renders coincidan con el tempo y las señales de letra dentro del flujo de trabajo.
MiniMaxMusic3TextEncode (#6157)#
Codifica el subtítulo y las letras que definen la estructura, el arreglo y el carácter vocal para MiniMax Music 3. Escriba subtítulos en secciones que cubran metadatos globales, detalles vocales y arreglos para que el modelo comprenda la intención. Use etiquetas de sección de letras como [Intro], [Verse] y [Chorus] para marcar transiciones que el generador pueda seguir. Para ayuda con las indicaciones, consulte la orientación y herramientas del repositorio oficial. MiniMax‑AI/MiniMax‑Music3
ComfyMathExpression (#131)#
Calcula un recuento interno de fotogramas a partir de su duración objetivo y lo ajusta a una cadencia que la pila temporal H3 prefiere a los fps seleccionados. Esto evita desincronizaciones sutiles y tartamudeos. Si cambia los fps o la duración, deje que este nodo recalcule la longitud para que el muestreo aterrice en el ritmo.
Extras opcionales#
- Escriba indicaciones con una estructura estable: definiciones de sujeto, un resumen de una oración, luego 1–3 párrafos de toma con sugerencias de tiempo. Mantenga el tiempo y la voz consistentes.
- Use 1–2 imágenes de referencia limpias por sujeto. Favorezca la iluminación neutral y un recorte medio que incluya detalles de cabello y atuendo para mejorar la retención de identidad.
- Mapee escenas a la canción primero. Renderice clips cortos por sección (intro, verso, coro) y concatenarlos; esto mantiene el video musical de MiniMax coherente mientras permite variación local.
- Mantenga la resolución y la tasa de fotogramas consistentes en todos los clips que planea editar juntos. Cambiar cualquiera de ellos a mitad de proyecto hace que la continuidad sea más difícil.
- En máquinas con bajo VRAM, habilite la decodificación de audio en mosaico para canciones largas; en VRAM alto, la decodificación estándar suele ser un poco más limpia.
- Para re-renders confiables, bloquee las semillas tanto en el muestreador de video como en el muestreador de música antes de exportar finales.
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a Innovate Futures @ Benji por MiniMax Music VideoWorkflow Source por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulte la documentación original y los repositorios vinculados a continuación.
Recursos#
- Innovate Futures @ Benji/MiniMax Music VideoWorkflow Source
- Docs / Release Notes: MiniMax Music VideoWorkflow Source
Nota: El uso de los modelos, conjuntos de datos y códigos referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

