ComfyUI>Flujos de trabajo>FastH3 8-Step V2 ComfyUI Workflow | Fast MiniMax H3 I2V

FastH3 8-Step V2 ComfyUI Workflow | Fast MiniMax H3 I2V

Workflow Name: RunComfy/FastH3-8-Step-V2
Workflow ID: 0000...1518
Tú eliges los primeros y últimos fotogramas. FastH3 V2 crea un video continuo MiniMax H3 entre ellos. Obtienes audio generado y movimiento suave. La inferencia INT8 de ocho pasos ahorra tiempo. La atención dispersa aumenta la eficiencia. Crea transiciones cinematográficas e historias cortas con tomas de inicio y final definidas.

FastH3 8-Step V2 ComfyUI Workflow Workflow

FastH3 8-Step V2 ComfyUI Workflow | INT8 Video + Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

FastH3 8-Step V2 ComfyUI Workflow Examples

FastH3 8-Step V2 ComfyUI Workflow: video MiniMax H3 condicionado a dos fotogramas con audio#

FastH3 8-Step V2 ComfyUI Workflow convierte un fotograma de referencia inicial y final en un video continuo MiniMax H3 con audio generado sincronizado. Utiliza el checkpoint FastVideo FastH3 V2 INT8 con un cronograma de ocho pasos, atención dispersa y condicionamiento explícito de primer/último fotograma para ofrecer resultados rápidos y controlados.

Este flujo de trabajo es ideal para transiciones cinematográficas, movimiento de personajes, conceptos de video social y tomas narrativas cortas que necesitan una composición de apertura y cierre definida. Si deseas sujetos estables, encuadre fijo y movimiento natural manteniendo alta la velocidad, el FastH3 8-Step V2 ComfyUI Workflow está hecho para ti.

Modelos clave en ComfyUI FastH3 8-Step V2 ComfyUI Workflow#

  • FastVideo FastH3 8-Step V2 (INT8). La columna vertebral de difusión que genera latentes de video y audio en solo ocho pasos de muestreo para iteración rápida. Checkpoints: FastVideo/FastVideo-FastH3-8-Step-V2 y pesos listos para ComfyUI en FastVideo/FastVideo-FastH3-Comfy.
  • Codificador de texto Qwen3-VL 32B para MiniMax H3. Codifica el prompt en incrustaciones de condicionamiento utilizadas para guiar el movimiento, los detalles de la escena y las señales de audio. Los pesos se distribuyen con el conjunto de modelos oficial en Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. Decodifica latentes de video a fotogramas RGB en la resolución objetivo especificada por las entradas. Ver Comfy-Org/MiniMax-H3.
  • MiniMax H3 Audio VAE. Decodifica latentes de audio en audio de forma de onda que se mezcla con los fotogramas generados. Ver Comfy-Org/MiniMax-H3.

Cómo usar ComfyUI FastH3 8-Step V2 ComfyUI Workflow#

El gráfico sigue el patrón oficial de imagen a video de FastH3 y ensambla tu toma de izquierda a derecha. Proporcionas dos imágenes de referencia y un prompt de texto, el flujo de trabajo calcula el condicionamiento y el muestreo necesarios en ocho pasos con atención dispersa, luego decodifica video y audio sincronizados y guarda un archivo listo para publicar.

Entradas de Imagen/Video (2)

  • Carga tus primeros y últimos fotogramas usando LoadImage (#136) y LoadImage (#161). Elige imágenes de la misma escena y relación de aspecto para que la composición y la identidad se mantengan consistentes a lo largo del clip.
  • El primer fotograma se redimensiona automáticamente con ImageScaleToTotalPixels (#142) para ajustar un presupuesto de cómputo, luego GetImageSize (#141) lee su ancho y alto para que la secuencia generada coincida con esa resolución.
  • Usa fotogramas de referencia naturales y precisos para la escena. El último fotograma ancla la composición final para que la toma se resuelva exactamente donde deseas.

Procesamiento (19)

  • Los pesos principales se cargan con UNETLoader (#151), CLIPLoader (#152) y dos nodos VAELoader (#143 video, #144 audio). El nodo MiniMaxH3ImageToVideo (#155) fusiona tu primer fotograma, último fotograma, prompt y duración objetivo en un solo paquete de condicionamiento e inicial latente.
  • La duración se establece una vez con el control Float (duration) (#157). Una ComfyMathExpression (#156) convierte ese tiempo en un conteo de fotogramas alineado al ritmo del modelo para una atención suave a lo largo de la secuencia.
  • Los ayudantes temporales y de eficiencia incluyen MiniMaxH3SigmaShift (#160) para sesgar el cronograma para MiniMax H3, ModelAttentionBackend (#159) para seleccionar la implementación de atención, y BlockSparseAttention (#158) para reducir el cómputo mientras se preserva la fidelidad en regiones importantes.
  • El núcleo de desruido utiliza BasicGuider (#150) con condicionamiento positivo del nodo de imagen a video, un BasicScheduler de ocho pasos (#148), el muestreador res_multistep elegido en KSamplerSelect (#147), y SamplerCustomAdvanced (#149) para producir latentes de video y audio conjuntos en una pasada.

Salidas (2)

  • Los latentes de video se decodifican a fotogramas a través de VAEDecode (#146) mientras que los latentes de audio se decodifican a través de VAEDecodeAudio (#145). CreateVideo (#154) luego mezcla la secuencia de imágenes y audio en un solo clip.
  • SaveVideo (#92) escribe el archivo. Establece un prefijo de nombre de archivo y elige un formato y códec que coincidan con tu plataforma de entrega o flujo de edición.

Nodos clave en ComfyUI FastH3 8-Step V2 ComfyUI Workflow#

MiniMaxH3ImageToVideo (#155)

  • Construye el condicionamiento a partir de tus primeros y últimos fotogramas de referencia más el prompt, y genera un latente inicial para la generación conjunta de video y audio. Ajusta el prompt de texto para describir el movimiento, la cámara, la atmósfera y cualquier señal de sonido deseada. Mantén las identidades y elementos de la escena consistentes con las referencias para obtener los resultados más estables. Ajusta el control de duración en el grupo izquierdo para cambiar la longitud del clip sin tocar la configuración del muestreador.

BlockSparseAttention (#158)

  • Aplica atención dispersa al modelo cargado para acelerar el muestreo mientras se preserva la atención donde más importa. Si ves pérdida de detalles en escenas ocupadas, aumenta la fracción mantenida o reserva tokens adicionales para sujetos en primer plano. Para escenas simples, una mayor dispersión puede acelerar significativamente las representaciones.

MiniMaxH3SigmaShift (#160)

  • Desplaza el cronograma de ruido para video y audio para que la estructura temporal y el sonido permanezcan coherentes a lo largo de la corta trayectoria de ocho pasos. Si el movimiento parece tembloroso, aumenta el desplazamiento del video; si la alineación del audio se desvía, ajusta ligeramente el desplazamiento del audio. Usa cambios pequeños y prueba vistas previas cortas para encontrar un equilibrio.

SamplerCustomAdvanced (#149)

  • Ejecuta el desruido de ocho pasos con el muestreador res_multistep y el cronograma de BasicScheduler (#148). Mantén la semilla fija en RandomNoise (#153) para reproducibilidad, luego varíala para explorar alternativas una vez que te guste el movimiento. La guía fuerte del BasicGuider (#150) ayuda a adherirse al prompt cuando las composiciones son complejas.

CreateVideo (#154)

  • Mezcla fotogramas decodificados y audio en un clip final. Establece fotogramas por segundo para controlar el ritmo, elige un espacio de color para tu flujo de trabajo, y si planeas editar más tarde, elige un códec que equilibre el tamaño y la calidad para tu NLE.

Extras opcionales#

  • Selección de referencia: elige dos fotogramas desde el mismo lente y perspectiva, con exposición y balance de blancos coincidentes. Las referencias más nítidas suelen producir texturas más limpias.
  • Propuesta: escribe lo que hace el sujeto, cómo se comporta la cámara y cómo suena el entorno. Mantén la redacción consistente con tus referencias para evitar el desvío de identidad.
  • Resolución vs velocidad: si alcanzas límites de memoria, baja el presupuesto de píxeles objetivo en ImageScaleToTotalPixels (#142). Para tomas importantes, súbelo y renderiza menos variaciones.
  • Duración y fps: ajusta la duración para el ritmo, luego establece fps en CreateVideo (#154) para controlar la sensación. El flujo de trabajo alinea automáticamente el conteo de fotogramas para una atención estable.
  • Semillas e iteración: bloquea la semilla de ruido para refinar prompts y referencias, luego prueba nuevas semillas para alternativas una vez que la composición y el tiempo estén bloqueados.
  • Paridad de plantilla: el gráfico sigue la estructura oficial de FastH3 I2V, por lo que los consejos de la plantilla de referencia en Comfy-Org/workflow_templates se transfieren directamente.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a FastVideo por el modelo FastH3 8-Step V2 y los pesos de ComfyUI, a Comfy-Org por la plantilla de flujo de trabajo FastH3 I2V, y a RunningHub.ai por la fuente del flujo de trabajo por sus contribuciones y mantenimiento. Para detalles autorizados, consulte la documentación original y los repositorios enlazados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y códigos referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.