Flujo de trabajo de texto a música de MiniMax Music 3 ComfyUI para canciones estructuradas#
MiniMax Music 3 ComfyUI convierte un Subtítulo detallado y Letras etiquetadas por secciones en una canción completa dentro de ComfyUI en RunComfy. El gráfico está preajustado para generar una pista de 60 segundos por defecto, y el modelo subyacente admite canciones de hasta unos cinco minutos. Tú guías el género, estado de ánimo, voces, instrumentación, tempo, tonalidad y estructura a través del texto, con el modelo tratándolos como direcciones creativas en lugar de garantías estrictas.
Este flujo de trabajo de MiniMax Music 3 ComfyUI es ideal para productores, diseñadores de sonido y creadores que quieren crear pistas vocales originales o conceptos de canciones estructurados a partir del texto. Se centra en la generación limpia de texto a música y no incluye modos de referencia de audio, cover, continuación o edición de audio.
Modelos clave en el flujo de trabajo de MiniMax Music 3 ComfyUI#
- MiniMax Music 3 Diffusion Transformer (DiT). El generador principal que sintetiza la canción en el espacio de audio latente a partir del condicionamiento de texto. Usa los pesos FP16 para mejor calidad o la variante INT8 ConvRot para bajo VRAM. Pesos FP16 y Pesos INT8.
- MiniMax Music 3 Text Encoder. Convierte tu Subtítulo y Letras en un condicionamiento que el generador entiende, incluyendo señales de tiempo derivadas de tu duración objetivo. Codificador de texto.
- MiniMax Music 3 DAV (Decoding Audio VAE). Decodifica el audio latente de vuelta a una forma de onda completa al final del muestreo. VAE.
- Los recursos del proyecto y ejemplos de prompts son mantenidos por los autores aquí: MiniMax‑Music3 en GitHub.
Cómo usar el flujo de trabajo de MiniMax Music 3 ComfyUI#
A un nivel alto, el flujo de trabajo codifica tu Subtítulo y Letras, crea una línea de tiempo de audio latente para la duración solicitada, muestrea la canción, la decodifica a forma de onda, y luego guarda el resultado. Los controles principales se encuentran en el nodo Text to Music (MiniMax Music 3) (#37).
Creación de Subtítulos y Letras#
Escribe el Subtítulo en tres secciones cortas: Metadatos Globales, Detalles Vocales y Arreglo. Describe género, estado de ánimo, tempo, tonalidad, instrumentos, carácter de mezcla y estilo vocal en lenguaje claro. En las Letras, usa etiquetas de sección como [Intro], [Verso], [Coro], [Puente], [Outro] para definir la estructura; las etiquetas son lo que impulsa la forma, mientras que las palabras principalmente informan el ambiente y la fonética. Mantén el Subtítulo conciso y concreto para guiar el estilo sin restringir la creatividad. Para pistas instrumentales, indica que no se desean voces en el Subtítulo.
MiniMaxMusic3TextEncode (#13)#
Este nodo ingiere el Subtítulo y Letras etiquetadas, produciendo un condicionamiento que captura estilo, intención de arreglo y presencia vocal. También emite un valor de tiempo que el gráfico usa para dimensionar la línea de tiempo del audio latente, por lo que tu ajuste de max_duration da forma directamente a la longitud de la canción. Establece una semilla si deseas tomas reproducibles; mantenla fija mientras refinas el texto para iterar en el mismo arreglo. El codificador se empareja con un modelo de texto de la familia MiniMax CLIP cargado en otra parte del gráfico, por lo que rara vez es necesario cambiar codificadores.
EmptyMiniMaxMusic3LatentAudio (#15)#
Crea un lienzo de audio latente vacío cuya longitud coincide con la señal de duración del codificador. Piénsalo como la línea de tiempo multitrack en blanco que el generador llenará con baterías, bajo, armonía, melodía y voces según tu texto. Las duraciones más largas aumentan las necesidades de VRAM y el tiempo de renderizado. Usa esto para moverte entre ideas cortas y canciones completas sin cambiar ninguna otra parte del proceso.
UNETLoader (#6) y KSampler (#9)#
UNETLoader selecciona los pesos de MiniMax Music 3 DiT. KSampler aplica el proceso de difusión usando el condicionamiento positivo de tu texto y un condicionamiento negativo en blanco proporcionado por ConditioningZeroOut (#10). Los pasos y la elección del sampler afectan el detalle y la sensación rítmica, mientras que la escala de guía equilibra la adherencia al texto contra la libertad generativa. Mantén la semilla constante para comparar subtítulos de manera justa, y cámbiala para explorar nuevas alternativas melódicas y estructurales.
Decodificación y control de VRAM: VAEDecodeAudio (#12), VAEDecodeAudioTiled (#42), ComfySwitchNode (#43)#
Después del muestreo, el audio latente se decodifica a forma de onda por el DAV. Para canciones largas o escenarios de bajo VRAM, habilita el interruptor tiled_decode en el nodo principal para enrutar a través de VAEDecodeAudioTiled, que procesa azulejos superpuestos para reducir el uso de memoria. La decodificación en azulejos es ligeramente más lenta y puede introducir sutiles artefactos de frontera en casos límite, por lo que se prefiere la decodificación estándar cuando los recursos lo permiten. El ComfySwitchNode elige automáticamente la ruta adecuada según tu alternancia.
Salida: SaveAudioAdvanced (#35)#
El audio final se guarda en disco en tu formato elegido, como MP3 o WAV. Usa este nodo para establecer convenciones de nombres de archivos y configuraciones de calidad apropiadas para borradores o compartir. Para uso en producción, considera exportar un archivo sin pérdidas para mezcla y masterización posteriores.
Nodos clave en el flujo de trabajo de MiniMax Music 3 ComfyUI#
MiniMaxMusic3TextEncode (#13)#
Central al estilo y la estructura. Ajusta max_duration para establecer la longitud objetivo y seed para reproducibilidad. Si los resultados parecen fuera de lugar, refina primero los Metadatos Globales del Subtítulo, luego ajusta los Detalles Vocales y el Arreglo para reequilibrar la instrumentación y el carácter de la mezcla.
KSampler (#9)#
Gobierna el detalle, la sensación de tiempo y cuán fuertemente la canción sigue el texto. Aumenta los pasos para texturas más ricas a costa de velocidad, prueba samplers alternativos para diferentes grooves y transitorios, y ajusta la escala de guía para intercambiar precisión por creatividad. Mantén la misma semilla al probar subtítulos para aislar cambios de prompt.
VAEDecodeAudioTiled (#42)#
Usa al generar pistas más largas o trabajar con GPUs limitadas. Reduce el pico de memoria decodificando la forma de onda en azulejos superpuestos. Habilítalo solo cuando sea necesario para evitar pequeños riesgos de costura y tiempo de renderizado extra.
UNETLoader (#6)#
Cambia entre los pesos DiT de FP16 e INT8 dependiendo del VRAM. FP16 se recomienda para la mayor fidelidad, mientras que la variante INT8 ConvRot ayuda a ajustar canciones más largas en tarjetas más pequeñas.
SaveAudioAdvanced (#35)#
Controla el formato de exportación y la calidad. Elige MP3 para compartir rápidamente o WAV para stems sin pérdidas y postprocesamiento. Establece prefijos de nombre de archivo claros para mantener múltiples tomas organizadas.
Extras opcionales#
- Usa Subtítulos concisos y concretos. Un fuerte párrafo de Metadatos Globales con género, sensación de BPM, tonalidad, adjetivos de mezcla y era de producción a menudo importa más que una prosa larga.
- Las etiquetas de sección en las Letras impulsan la estructura. Mantén las etiquetas simples, evita el anidamiento, y deja que las secciones instrumentales respiren omitiendo palabras entre etiquetas.
- Para empujar las voces hacia adelante, enfatiza el timbre vocal y la colocación en el Subtítulo. Para salidas instrumentales, di explícitamente que no se desean voces.
- Para más variación, cambia la semilla. Para refinamiento enfocado, mantén la semilla fija e itera sobre el texto.
- El modelo trata el tempo, la tonalidad y la instrumentación como guías. Espera desviaciones creativas e itera hacia el objetivo.
- Este flujo de trabajo de MiniMax Music 3 ComfyUI no incluye modos de referencia de audio, cover, continuación o edición de audio. Para técnicas avanzadas de prompts y ejemplos, consulta los recursos oficiales del proyecto: MiniMax‑Music3 en GitHub y los archivos del modelo en Hugging Face.
Reconocimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a ComfyUI por la plantilla de flujo de trabajo de MiniMax Music 3: Texto a Música, MiniMax-AI por el proyecto oficial de MiniMax Music 3, y Comfy-Org por los pesos del modelo MiniMax Music 3 por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulte la documentación y los repositorios originales a continuación.
Recursos#
- Plantilla de flujo de trabajo de Comfy.org/Source
- Documentos / Notas de lanzamiento: MiniMax Music 3: Texto a Música — Flujo de trabajo de ComfyUI
- Proyecto oficial MiniMax-AI/MiniMax Music 3
- GitHub: MiniMax-AI/MiniMax-Music3
- Hugging Face: MiniMaxAI/MiniMax-Music3
- Pesos del modelo Comfy-Org/MiniMax Music 3
- Hugging Face: Comfy-Org/MiniMax-Music-3
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

