MiniMax H3 Latent Upscaler: Flujo de Trabajo de Generación de Video en Dos Pasos de BUNNY#
Este flujo de trabajo de ComfyUI convierte indicaciones de texto e imágenes de referencia opcionales en videos cortos y cinematográficos con audio sincronizado. Utiliza un diseño de dos pasos de BUNNY: la Etapa 1 establece el movimiento y la composición a una resolución base modesta, luego el MiniMax H3 Latent Upscaler amplía el latente de video-audio 3D antes de que la Etapa 2 reconstruya detalles de alta frecuencia y decodifique los fotogramas y el sonido finales. El MiniMax H3 Latent Upscaler está integrado en la generación, por lo que no es un mejorador genérico para videos preexistentes; está diseñado específicamente para cortes publicitarios y escenas cinematográficas estilizadas donde se desea una claridad extra sin perder la intención de movimiento.
El resultado es un clip de mayor resolución cuyo aspecto está gobernado por tu indicación, referencias y un pequeño conjunto de LoRAs, mientras que la estabilidad del movimiento está protegida por el pipeline de ampliación-reconstrucción en dos pasos. La Etapa 2 es obligatoria y siempre realiza la reconstrucción de detalles después de que el latente ha sido ampliado.
Modelos clave en el flujo de trabajo de Comfyui MiniMax H3 Latent Upscaler#
- Modelo de video-audio MiniMax H3 y nodos personalizados T8. Proporciona el generador principal, acondicionamiento, planificación de dos pasos y utilidades de decodificación utilizadas a lo largo del pipeline. Consulta el conjunto de nodos en el repositorio T8 para comportamientos e interfaces específicos del modelo. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Video VAE. Codifica y decodifica latentes de video que la Etapa 2 eventualmente convierte en fotogramas. Incluido y consumido por los nodos T8 mencionados. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Audio VAE. Codifica y decodifica latentes de audio para mantener el sonido ambiental coherente con el plan de movimiento visual. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Latent Upscaler 3D. Un ampliador latente 3D aprendido que amplía el latente conjunto de video-audio en ancho y alto antes de la reconstrucción de detalles, preservando la estructura temporal mejor que la interpolación post-proceso. Utiliza el checkpoint oficial 3D fp16. Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- SageAttention parche de atención eficiente en memoria para H3. Sirve como el único parche de atención utilizado por este flujo de trabajo para inferencia estable y amigable con la memoria. GitHub: ComfyUI-h3_sage_amd
Cómo usar el flujo de trabajo de Comfyui MiniMax H3 Latent Upscaler#
El flujo de trabajo tiene siete grupos etiquetados que cooperan para producir el clip final. La Etapa 1 planifica el movimiento a resolución base, el MiniMax H3 Latent Upscaler amplía el latente, y la Etapa 2 reconstruye detalles al tamaño más grande antes de decodificar a video y audio.
01 · Entradas, Ampliación y Referencias#
Usa el cuadro de indicaciones de BUNNY para describir la escena, el movimiento, el ambiente y el paisaje sonoro. Opcionalmente, añade hasta cuatro imágenes de referencia para guiar la identidad, paleta o diseño de la toma; déjalas desconectadas para generación solo con texto. Establece tu duración objetivo; el recuento de fotogramas se calcula automáticamente para coincidir con la cuadrícula de muestreo del modelo. Elige una resolución base de la Etapa 1 que se adapte a tu hardware, luego ajusta la Escala de Ampliación para determinar cuánto crece el MiniMax H3 Latent Upscaler en ancho y alto en el espacio latente. Recuerda que el área de píxeles escala con el cuadrado del factor de escala, por lo que la VRAM y el tiempo de renderizado aumentan con una ampliación mayor.
02 · Modelo Base · Solo Sage#
Este grupo carga el modelo base MiniMax H3, aplica el Turbo LoRA opcional para velocidad, y activa el parche SageAttention como la única modificación de atención. Los VAEs de Video y Audio MiniMax H3 coincidentes y el codificador de texto H3 se cargan para asegurar un acondicionamiento y decodificación consistentes. Mantén esta sección tal cual a menos que tengas una razón específica para intercambiar un archivo de modelo compatible; se desaconseja mezclar backends de atención.
03 · LoRAs de Etapa 1 y Etapa 2 de BUNNY#
Los LoRAs en la Etapa 1 influyen en la lógica de movimiento, composición y patrones de interacción; los LoRAs en la Etapa 2 se centran en reconstruir la estructura ampliada y el detalle fino. Puedes reemplazar los archivos LoRA por otros adecuados a tu tema y ajustar sus pesos con moderación. Si la Etapa 2 comienza a cambiar la intención de movimiento, reduce la fuerza del LoRA de la Etapa 2 antes de tocar la Etapa 1. Nunca enrutes los LoRAs de la Etapa 2 de regreso a la Etapa 1 y no omitas la Etapa 2.
04 · Movimiento de Etapa 1#
Stage 1 Conditioning · AUTO (#7) analiza tu indicación y referencias, selecciona el modo de generación apropiado y ensambla un lienzo latente conjunto de video-audio. Stage 1 Dual Clock (#8) impulsa horarios de muestreo separados pero sincronizados para video y audio para que el movimiento y el sonido evolucionen coherentemente. El nodo de plan de dos pasos asigna un pequeño presupuesto a la Etapa 1 para la estructura de movimiento y reserva más para el detalle de la Etapa 2. Stage 1 · Motion Structure realiza el desruido grueso que establece la composición y el tiempo; la salida es un latente refinado, no fotogramas finales.
05 · Ampliación Latente 3D de H3#
H3 3D Learned Latent Upscale (#13) aplica el MiniMax H3 Latent Upscaler al latente de la Etapa 1, ampliando directamente el ancho y alto en el espacio latente 3D. Debido a que la ampliación ocurre antes de la reconstrucción de detalles, la consistencia temporal se preserva mejor que con ampliadores en el espacio de fotogramas. Usa solo el checkpoint oficial 3D fp16 y ajusta la escala aquí si deseas una resolución final diferente. El nodo también informa las nuevas dimensiones, que se entregan automáticamente a la Etapa 2.
06 · Reconstrucción HQ de Etapa 2 (OBLIGATORIO)#
Stage 2 Conditioning · AUTO (#14) reutiliza tu indicación, referencias y las dimensiones ampliadas para alinear la orientación con el lienzo más grande. Stage 2 Reconcile · Size & Audio (#15) asegura esas dimensiones y la política de audio seleccionada para que el video y el sonido se mantengan sincronizados. Stage 2 Detail Mixer · Fixed 5 Steps (#16) realiza la pasada de reconstrucción decisiva que añade textura nítida respetando el movimiento de la Etapa 1. Stage 2 · 5-Step HQ Reconstruction desruida del ruido sembrado al latente final, y Stage 2 AV Decode (#20) lo convierte en fotogramas y audio generado para la salida.
07 · Salida Final#
CreateVideo empaqueta los fotogramas decodificados y el audio en una secuencia de video a la velocidad de fotogramas que elijas. Clean VRAM After Generation libera memoria entre renderizados. BUNNY HQ · Save Final Video guarda el archivo final con tu prefijo de nombre de archivo, formato y códec. Siempre guarda desde la decodificación de la Etapa 2; las vistas previas de la Etapa 1 no son finales.
Nodos clave en el flujo de trabajo de Comfyui MiniMax H3 Latent Upscaler#
Stage 1 Conditioning · AUTO(#7). Entrada central para texto, referencias y enrutamiento de modo. Ajusta la indicación y, cuando sea necesario, el modo que gobierna cómo se usan las referencias. Mantén esto en AUTO a menos que tengas una razón clara para forzar un modo, y asegura que las referencias coincidan con la historia que describes.Stage 1 Dual Clock · Video 12 / Audio 3(#8). Orquesta relojes de muestreo separados para video y audio para mantener los ritmos de movimiento y los eventos sonoros alineados. Si debes retomar el tiempo, hazlo suavemente y mantén ambos relojes consistentes con tu ritmo objetivo.H3 3D Learned Latent Upscale(#13). Aplica el MiniMax H3 Latent Upscaler usando el checkpoint oficial 3D fp16. El único parámetro que la mayoría de los usuarios debería tocar es el factor de escala; aumentándolo, se incrementa el ancho y alto en el espacio latente, y el total de píxeles aumenta con el cuadrado de ese factor. Usa el checkpoint validado del ampliador del modelo para evitar latentes corruptos. Hugging FaceStage 2 Reconcile · Size & Audio(#15). Asegura que el latente de la Etapa 2 lleve el tamaño ampliado y la política de audio seleccionada antes de la reconstrucción. Si experimentas con configuraciones de audio, mantén la conciliación habilitada para que el tiempo y las dimensiones permanezcan consistentes.Stage 2 Detail Mixer · Fixed 5 Steps(#16). El corazón de la reconstrucción de alta resolución que añade detalle sin reescribir la lógica de movimiento. Si el resultado parece sobreenfocado o se desvía en la animación, reduce primero las fuerzas de LoRA de la Etapa 2, luego ajusta los balances del mezclador solo si es necesario.Stage 2 AV Decode(#20). Decodifica el latente reconstruido en fotogramas y audio sincronizado. Siempre enruta las salidas de este nodo aCreateVideoySave Final Videopara asegurar que el espacio de color y el audio se manejen correctamente.
Extras opcionales#
- Para generación solo con texto, desconecta todas las entradas de imágenes de referencia para que AUTO seleccione una ruta pura de texto a video.
- Al cambiar la ampliación, recuerda que el costo de renderizado escala con el cuadrado del factor; prefiere aumentar la resolución base de la Etapa 1 solo después de que la escala del MiniMax H3 Latent Upscaler esté configurada.
- Para mejorar la consistencia en reintentos, fija la semilla en
Seeded Noisey varíala intencionalmente al explorar alternativas. - Si la Etapa 2 altera los ritmos de movimiento, baja los pesos de LoRA de la Etapa 2 antes de tocar los muestreadores o configuraciones del mezclador.
- Mantén SageAttention como el único parche de atención; evita apilar backends de atención adicionales para estabilidad. GitHub
- Usa el checkpoint oficial del MiniMax H3 Latent Upscaler para prevenir tensores inválidos y claves no coincidentes. Hugging Face
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a RunningHub.ai por la fuente del flujo de trabajo, a LBH-123-AI por el modelo Minimax H3 Latent Upscaler, y a T8mars por los nodos personalizados de MiniMax H3 por sus contribuciones y mantenimiento. Para detalles autorizados, por favor consulta la documentación y los repositorios originales enlazados a continuación.
Recursos#
- RunningHub.ai/Fuente del flujo de trabajo
- Documentación / Notas de lanzamiento: runninghub.ai post
- LBH-123-AI/Minimax_h3_latent_Upscaler
- GitHub: LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler
- Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- T8mars/comfyui-minimax-h3-audio-T8
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

