MiniMax H3 ComfyUI Referencia a Video Turbo de 4 pasos#
El Turbo de 4 pasos de MiniMax H3 ComfyUI Referencia a Video es un flujo de trabajo listo para RunComfy que bloquea una o más identidades de personajes a partir de imágenes fijas y genera un clip corto con audio estéreo nativo en una sola pasada acelerada. Está diseñado para creadores que necesitan caras, vestuario y puesta en escena consistentes a lo largo de una escena, manteniendo el movimiento de cámara, diálogo y sincronización labial coherentes.
Este gráfico utiliza la canalización ref2va de MiniMax H3 más un Turbo LoRA para que la identidad, el movimiento y el habla de múltiples sujetos se mantengan unificados sin el programa predeterminado más largo. Etiquete sus imágenes fijas con <Picture N> dentro del aviso, opcionalmente traiga video y audio de referencia, y renderice un clip limpio directamente en ComfyUI en RunComfy.
Modelos clave en el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Referencia a Video#
- Modelo de difusión MiniMax-H3 Referencia a Video (ref2va). Proporciona la columna vertebral generativa principal para acondicionar imágenes fijas, video opcional y texto para sintetizar tomas coherentes. Los pesos están disponibles en el empaquetado Comfy-Org de MiniMax-H3 en Hugging Face. Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE. Codifica y decodifica latentes de video sobre los que opera el muestreador, preservando la suavidad temporal y el detalle. Distribuido con el mismo paquete. Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE. Maneja la pista de audio estéreo nativa junto con el video, de modo que el habla y el ambiente se autoren con la toma. Incluido junto con los componentes de video. Comfy-Org/MiniMax-H3
- Codificador de texto Qwen-VL 32B ajustado para MiniMax-H3. Traduce el aviso, incluidos los marcadores <Picture N> y las direcciones de escena, en señales de acondicionamiento utilizadas por H3. Empaquetado en el lanzamiento de Comfy-Org. Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA. Un LoRA de aceleración que comprime el programa para que la toma pueda generarse en una pasada rápida manteniendo la consistencia de identidad y movimiento. larryvrh/MiniMax-H3-Turbo-Lora
Cómo usar el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Referencia a Video#
El flujo de trabajo pasa de referencias y temporización a configuración de modelo, acondicionamiento, muestreo y multiplexado final. Puede ejecutarlo solo con imágenes fijas o combinar imágenes fijas con video y audio de referencia opcionales.
Etapa 1 — Referencias, aviso y temporización#
Cargue una o más imágenes fijas a través de los nodos LoadImage y planee referenciarlas como <Picture 1>, <Picture 2>, y así sucesivamente en su aviso. Si tiene un clip guía, páselo a través de los nodos VHS_LoadVideo; su audio también puede pasarse para guiar el ritmo y la energía. Para proporcionar diálogo o ambiente a medida, use los nodos LoadAudio además de o en lugar de audio de video de referencia. Ingrese su descripción completa de la toma en Input Text (Prompt) con cualquier bloqueo de personajes, movimientos de cámara y diálogo. El flujo de trabajo convierte la duración deseada en un recuento de fotogramas estable automáticamente, alineando la línea de tiempo con el paso interno de MiniMax H3.
Etapa 2 — Configuración del modelo y aceleración turbo#
El núcleo UNet H3 ref2va, el codificador de texto y los VAE de video y audio se cargan en el "Core Workspace". El parche de atención eficiente en memoria habilita tomas más grandes o mayor resolución en GPUs típicas sin cambiar su uso. El Turbo LoRA de 4 pasos se aplica mediante LoraLoaderModelOnly (#164) para que pueda mantener bajos los recuentos de pasos mientras preserva el bloqueo de identidad y movimiento. No se requiere cableado manual; el gráfico está preconectado para RunComfy. Si no está utilizando algunas entradas, desactive los nodos Load Image / Load Video / Load Audio no utilizados con Ctrl+B para mantener la ejecución ligera.
Etapa 3 — Acondicionamiento y ensamblaje latente#
MiniMaxH3ReferenceToVideo (#136) ingiere su aviso, imágenes fijas y cualquier video o audio de referencia opcional para construir el acondicionamiento y una línea de tiempo latente inicial. Use etiquetas <Picture N> para vincular claramente a cada persona u objeto a una imagen fija específica; el orden sigue las ranuras de referencia que llenó. Puede dirigir el comportamiento de la cámara, la sincronización labial y el ambiente en lenguaje natural. Anchura, altura y duración fluyen hacia este nodo para que el encuadre y el tiempo coincidan con su intención. Si tiene muchas imágenes fijas, mantenga solo las que realmente definen la identidad y el vestuario para el ritmo actual.
Etapa 4 — Muestreo#
El gráfico dirige el latente a través de un programa mínimo y un muestreador rápido seleccionado por KSamplerSelect (#123), guiado por BasicGuider (#126). BasicScheduler (#124) proporciona el patrón de pasos que el Turbo LoRA espera, equilibrando velocidad y fidelidad. SamplerCustomAdvanced (#125) resuelve la línea de tiempo en una pasada eficiente utilizando ruido sembrado para reproducibilidad. En la mayoría de los casos, puede dejar estos componentes como están configurados y centrarse en el aviso, las referencias y el encuadre.
Etapa 5 — Decodificación, multiplexado y guardado#
Después del muestreo, VAEDecode restaura los fotogramas de video y VAEDecodeAudio restaura la pista estéreo. CreateVideo (#130) multiplexa las imágenes y el audio en un archivo reproducible con su tasa y profundidad de bits elegidas. Finalmente, SaveVideo (#92) escribe el resultado en disco utilizando el contenedor y códec seleccionados. La salida es un clip corto con personajes bloqueados en identidad, movimiento de cámara y audio estéreo nativo autorado por MiniMax H3 ComfyUI Referencia a Video Turbo de 4 pasos.
Nodos clave en el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Referencia a Video#
MiniMaxH3ReferenceToVideo (#136)#
Este es el corazón del flujo de trabajo que fusiona texto de aviso, referencias fijas y video/audio opcional en acondicionamiento y un latente inicializado. Ajuste prompt para incluir marcadores <Picture N> y direcciones de escena claras para cámara, diálogo y ambiente. Ajuste width, height y length para establecer encuadre y duración para la toma. Si necesita equilibrar detalle versus velocidad en imágenes fijas, cambie ref_image_size entre modos como coincidir con el tamaño de renderizado versus cambiar de tamaño para ejecuciones más ligeras. Mantenga su conjunto de referencias enfocado a las identidades que realmente necesita en la escena.
LoraLoaderModelOnly (#164)#
Aplica el MiniMax-H3 Turbo de 4 pasos LoRA al modelo ref2va para que el programa pueda comprimirse para inferencia rápida. El strength controla cuán fuertemente el LoRA influye en la columna vertebral; los valores más altos favorecen la velocidad y el aspecto turbo, mientras que los más bajos se mezclan de nuevo hacia la base H3. Si nota pérdida de detalle fino con aceleración extrema, reduzca ligeramente la fuerza del LoRA o alargue el programa en el scheduler para recuperar fidelidad. Consulte la tarjeta del modelo LoRA para notas de versión y uso previsto. MiniMax-H3 Turbo LoRA
MiniMaxH3MemoryEfficientSageAttentionPatch (#163)#
Habilita una implementación de atención eficiente en memoria compatible con MiniMax H3 para que pueda ejecutar resoluciones más altas o tomas más largas con VRAM limitada. Es sin parámetros en este gráfico; simplemente manténgalo habilitado para la mejor capacidad. El nodo es parte de KJNodes para ComfyUI. kijai/ComfyUI-KJNodes
BasicScheduler (#124)#
Define el programa de difusión utilizado durante el muestreo. Con el Turbo LoRA activo, mantenga el conteo de pasos compacto para la velocidad, ajustándolo solo cuando necesite nitidez o estabilidad adicionales. denoise le permite impulsar una reinterpretación más fuerte de las referencias si su aviso requiere cambios mayores. Los cambios aquí interactúan con la fuerza del LoRA y el muestreador elegido, así que ajuste en pequeños incrementos.
KSamplerSelect (#123)#
Selecciona el algoritmo de muestreo para la pasada. Un muestreador simple y estable se empareja bien con programas turbo y ayuda a preservar la identidad a través de los fotogramas. Si enfatiza la estilización o un movimiento de cámara muy rápido, pruebe muestreadores alternativos que pueden agregar textura de movimiento a costa de una ligera variabilidad.
CreateVideo (#130) y SaveVideo (#92)#
CreateVideo ensambla fotogramas decodificados y audio en un flujo final, donde puede configurar fps y bit_depth para que coincidan con sus necesidades de entrega. SaveVideo selecciona el contenedor y el códec para exportar; use una combinación ampliamente compatible para compartir en general o una variante de alta calidad para trabajo posterior. Si está iterando rápidamente, mantenga los ajustes ligeros y luego cambie a configuraciones de producción para el renderizado final.
Extras opcionales#
- Para múltiples personajes, coloque primero las imágenes fijas más claras de frente y refiérase a ellas como <Picture 1>, <Picture 2>, etc. Use una o dos imágenes fijas adicionales por sujeto para cobertura de ángulo o vestuario.
- Si lleva un video de referencia, incluya una breve descripción del comportamiento de cámara deseado en el aviso para que H3 sepa qué preservar y qué reinterpretar.
- El control de duración se ajusta internamente a un recuento de fotogramas seguro para H3; si cambia su tasa de fotogramas objetivo en
CreateVideo, vuelva a verificar las notas de temporización en su aviso. - Los nodos auxiliares de video y audio provienen del Video Helper Suite; proporcionan E/S de medios robusta dentro de ComfyUI. Kosinkadink/ComfyUI-VideoHelperSuite
- ¿Busca un flujo de trabajo de comparación base para MiniMax H3 referencia a video en ComfyUI? Revise la plantilla oficial y adapte ideas según sea necesario. Comfy-Org workflow template
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a MiniMax Research por el modelo MiniMax H3, a Comfy.org por los ejemplos de flujo de trabajo de ComfyUI MiniMax H3, a Comfy-Org por los pesos del modelo MiniMax-H3, y a larryvrh por el MiniMax-H3 Turbo LoRA por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulte la documentación original y los repositorios enlazados a continuación.
Recursos#
- MiniMax Research/MiniMax H3 anuncio oficial
- Documentos / Notas de lanzamiento: MiniMax H3 anuncio oficial
- Comfy.org/MiniMax H3 tutorial
- GitHub: comfy-org/docs
- Documentos / Notas de lanzamiento: MiniMax H3: Ejemplos de flujo de trabajo ComfyUI
- Comfy-Org/pesos del modelo MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.



