MiniMax H3 Referencia a Video ComfyUI: flujo de trabajo Ref2VA con audio estéreo nativo#
Este flujo de trabajo MiniMax H3 Reference to Video ComfyUI listo para RunComfy convierte imágenes de referencia conectadas en un video cinematográfico corto con audio estéreo nativo generado conjuntamente. Construido a partir de la plantilla Reference-to-Video de Comfy.org y verificado contra los pesos abiertos de Comfy-Org MiniMax-H3, es ideal para tomas consistentes con personajes, pruebas de escenas estilizadas y clips conceptuales donde la redacción del prompt y etiquetas como <Picture 1> y <Picture 2> son importantes.
De fábrica, el gráfico conecta dos referencias de imagen y un prompt de forma libre para producir un video con sonido sincronizado en una sola pasada. El nodo central también expone entradas opcionales para más imágenes de referencia, videos de referencia con su audio y referencias de audio independientes, para que puedas escalar la fuerza de condicionamiento según sea necesario. Si deseas un punto de partida alineado con el diseño original, consulta el archivo de plantilla Comfy.org en GitHub video_minimax_h3_r2v.json.
Modelos clave en el flujo de trabajo MiniMax H3 Reference to Video ComfyUI#
- Comfy-Org/MiniMax-H3 diffusion weights (Ref2VA): El núcleo generativo especializado en referencia-a-video-y-audio, usado a través de
UNETLoader. Aprende de referencias de texto y visual/audio para producir un único latente que lleva tanto video como audio estéreo. Model card and files - MiniMax H3 Video VAE (FP16): Decodifica la mitad de video del latente conjunto a cuadros con alta fidelidad visual. minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 Audio VAE (FP32): Decodifica la mitad de audio del latente conjunto a una forma de onda estéreo nativa. minimax_h3_audio_vae_fp32.safetensors
- Qwen3-VL 32B MiniMax-H3 text-image encoder (AWQ): Codifica tu prompt más las etiquetas de referencia y tokens visuales para el condicionamiento. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
Cómo usar el flujo de trabajo MiniMax H3 Reference to Video ComfyUI#
Este flujo de trabajo dirige tus referencias y prompt en el núcleo Ref2VA de MiniMax H3, muestrea un único latente que contiene tanto video como audio, luego decodifica y mezcla el resultado a un MP4 con sonido sincronizado. Los grupos a continuación se mapean en el gráfico para que puedas ver qué cambiar y por qué.
Entradas del Usuario#
Usa LoadImage (#137) y LoadImage (#139) para proporcionar dos referencias visuales. El prompt va en Input Text (Prompt) (#138); referencia cada entrada explícitamente por etiqueta en el orden en que las conectaste, por ejemplo <Picture 1> y <Picture 2>, antes de describir la escena, movimiento y sonido. Establece tu objetivo de aspecto y conteo de píxeles en Resolution Selector (Size) (#115). Elige la duración del video en segundos con Float (Duration) (#132); se convierte automáticamente en una longitud de cuadro válida por ComfyMathExpression (#131) para que el audio y el video permanezcan alineados.
Modelos#
UNETLoader (#127) carga los pesos de difusión MiniMax H3 Ref2VA que impulsan la generación. CLIPLoader (#128) carga el codificador Qwen3-VL 32B usado para tokenizar tu texto y etiquetas de referencia. Dos nodos VAELoader (#119 video, #120 audio) proporcionan los decodificadores emparejados que luego desempaquetarán el latente conjunto de regreso a cuadros y audio estéreo. Estos modelos son los únicos activos que necesitas intercambiar al migrar a diferentes variantes de MiniMax H3 dentro de la misma familia de tareas.
Condicionamiento#
MiniMaxH3ReferenceToVideo (#136) es el corazón del pipeline. Acepta tu prompt de texto, ancho, altura y la length computada (cuadros), además de cualquier ref_images, ref_videos conectado y referencias de audio opcionales. El nodo emite un flujo de condicionamiento positivo para la guía y un latente inicializado que ancla identidad, composición, movimiento y diseño de sonido según tus referencias y etiquetas. Para fidelidad de identidad a partir de imágenes, conecta referencias bien iluminadas y en modelo, y refiérete a ellas precisamente en el prompt; para movimiento o ritmo, puedes agregar referencias de video con o sin su audio.
Muestreo#
RandomNoise (#129) inicia el proceso, mientras que KSamplerSelect (#123) elige la variante del muestreador y BasicScheduler (#124) establece el cronograma de pasos. BasicGuider (#126) aplica el condicionamiento producido por el nodo MiniMax H3, y SamplerCustomAdvanced (#125) realiza los pasos de eliminación de ruido reales para evolucionar el latente conjunto de audio+video. Las elecciones aquí principalmente intercambian velocidad por fidelidad y adherencia a la referencia; mantén los valores predeterminados para comenzar, luego experimenta una vez que tengas un aspecto y sonido de referencia.
Decodificación y creación de video#
El latente conjunto del muestreador va a VAEDecode (#122) para cuadros y VAEDecodeAudio (#121) para sonido estéreo. CreateVideo (#130) mezcla las imágenes decodificadas y el audio en una secuencia reproducible, y SaveVideo (#92) escribe el archivo final en tu carpeta de salida. Debido a que el video y el audio se generaron juntos, el tiempo es consistente sin ninguna alineación posterior o TTS externo.
Nodos clave en el flujo de trabajo MiniMax H3 Reference to Video ComfyUI#
MiniMaxH3ReferenceToVideo (#136) Este nodo compone referencias de texto, visuales y de audio opcionales en el condicionamiento Ref2VA de MiniMax H3 y un latente inicial que ya "sabe" sobre identidad, estilo, movimiento y sonido. Usa etiquetas de referencia exactas en tu prompt que coincidan con el orden de conexión, y elige ref_image_size según tu objetivo: iteraciones más rápidas al coincidir con la resolución de generación, mayor identidad al mantener tokens de referencia más grandes. Para tomas más largas, favorece descripciones claras de escena y acción para que el modelo pueda mantener la continuidad.
Resolution Selector (Size) (#115) Controla el aspecto objetivo y el conteo de píxeles que respetará todo el gráfico. Elige una forma que coincida con cómo presentarás el clip, y equilibra el detalle con el rendimiento para que puedas iterar rápidamente. Las resoluciones más altas aumentan el VRAM y el tiempo pero preservan mejor las características finas de tus referencias.
ComfyMathExpression (#131) Convierte una duración orientada al usuario en segundos a un conteo de cuadros que el muestreador y el decodificador prefieren. La expresión se limita a un mínimo sensato y se ajusta a un paso amigable para el interno para que el video y el audio se mantengan en sincronía. Ajusta solo la entrada de segundos; el nodo maneja las matemáticas.
KSamplerSelect (#123) y BasicScheduler (#124) Juntos determinan la vía de eliminación de ruido. Comienza con el muestreador y cronograma proporcionados para una adherencia robusta a la referencia; si tu toma se desvía o parece poco detallada, prueba un cronograma alternativo o una familia de muestreadores ligeramente diferente y compara resultados lado a lado.
Extras opcionales#
- Mantén los prompts concretos y basados en referencias: comienza con etiquetas como <Picture 1> y <Picture 2>, luego describe el tipo de toma, movimiento, iluminación y los sonidos que esperas.
- Para una identidad más fuerte a partir de imágenes, aumenta la fidelidad de referencia usando el modo de tamaño de referencia más grande; para un desarrollo de aspecto más rápido, usa el modo de tamaño coincidente.
- Si no conectas ninguna referencia de audio, MiniMax H3 sintetizará audio estéreo nativo solo a partir del prompt; describe ambiente, efectos de sonido y tono de voz para guiarlo.
- Agrega un video de referencia corto cuando te importe más el ritmo del movimiento o el comportamiento de la cámara; agrega su audio emparejado cuando desees que ese carácter sonoro se lleve a la generación.
- Itera primero a resolución y duración modestas, luego escala una vez que el tiempo, identidad y composición se mantengan juntos.
Referencias#
- Pesos y activos del modelo MiniMax H3 en Hugging Face: Comfy-Org/MiniMax-H3
- Plantilla oficial de Comfy.org que sigue este flujo de trabajo: video_minimax_h3_r2v.json
- Integración ComfyUI upstream para MiniMax H3: ComfyUI PR #15224
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a Comfy-Org por la plantilla de flujo de trabajo MiniMax H3 R2V ComfyUI y el tutorial MiniMax H3, a MiniMax por el modelo MiniMax H3 y el anuncio oficial, y a Comfy-Org por los pesos del modelo MiniMax-H3 por sus contribuciones y mantenimiento. Para detalles autorizados, consulte la documentación original y los repositorios enlazados a continuación.
Recursos#
- Plantilla de flujo de trabajo Comfy-Org/MiniMax H3 R2V
- Tutorial Comfy-Org/MiniMax H3
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- Documentación / Notas de lanzamiento: MiniMax H3 tutorial
- Anuncio oficial MiniMax/MiniMax H3
- Documentación / Notas de lanzamiento: MiniMax H3 official announcement
- Pesos del modelo Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

