FastH3 8-Step V2 ComfyUI Workflow : vidéo MiniMax H3 conditionnée sur deux images avec audio#
FastH3 8-Step V2 ComfyUI Workflow transforme une image de référence de début et de fin en une vidéo MiniMax H3 continue avec audio généré synchronisé. Il utilise le checkpoint FastVideo FastH3 V2 INT8 avec un calendrier en huit étapes, une attention éparse et une condition explicite sur la première/dernière image pour offrir des résultats rapides et contrôlés.
Ce workflow est idéal pour les transitions cinématographiques, le mouvement des personnages, les concepts de vidéos sociales et les prises de vue narratives courtes nécessitant une composition d'ouverture et de clôture définie. Si vous souhaitez des sujets stables, un cadrage verrouillé et un mouvement naturel tout en gardant une vitesse élevée, le FastH3 8-Step V2 ComfyUI Workflow est fait pour vous.
Modèles clés dans ComfyUI FastH3 8-Step V2 ComfyUI Workflow#
- FastVideo FastH3 8-Step V2 (INT8). L'épine dorsale de diffusion qui génère des latents vidéo et audio en seulement huit étapes d'échantillonnage pour une itération rapide. Checkpoints : FastVideo/FastVideo-FastH3-8-Step-V2 et poids prêts pour ComfyUI dans FastVideo/FastVideo-FastH3-Comfy.
- Qwen3-VL 32B encodeur de texte pour MiniMax H3. Encode le prompt en embeddings de conditionnement utilisés pour guider le mouvement, les détails de la scène et les indices audio. Les poids sont distribués avec le modèle officiel à Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE. Décode les latents vidéo en images RVB à la résolution cible spécifiée par les entrées. Voir Comfy-Org/MiniMax-H3.
- MiniMax H3 Audio VAE. Décode les latents audio en audio de forme d'onde qui est multiplié avec les images générées. Voir Comfy-Org/MiniMax-H3.
Comment utiliser ComfyUI FastH3 8-Step V2 ComfyUI Workflow#
Le graphe suit le modèle officiel FastH3 image-to-video et assemble votre prise de vue de gauche à droite. Vous fournissez deux images de référence et un prompt textuel, le workflow calcule le conditionnement et l'échantillonnage nécessaires en huit étapes avec attention éparse, puis décode la vidéo et l'audio synchronisés et enregistre un fichier prêt à être publié.
Entrées Image/Vidéo (2)
- Chargez vos premières et dernières images en utilisant
LoadImage(#136) etLoadImage(#161). Choisissez des images de la même scène et du même format afin que la composition et l'identité restent cohérentes tout au long du clip. - La première image est automatiquement redimensionnée par
ImageScaleToTotalPixels(#142) pour respecter un budget de calcul, puisGetImageSize(#141) lit sa largeur et sa hauteur afin que la séquence générée corresponde à cette résolution. - Utilisez des images de référence naturelles et précises pour la scène. La dernière image ancre la composition finale afin que la prise de vue se termine exactement où vous le souhaitez.
Traitement (19)
- Les poids de base sont chargés avec
UNETLoader(#151),CLIPLoader(#152) et deux nœudsVAELoader(#143 vidéo, #144 audio). Le nœudMiniMaxH3ImageToVideo(#155) fusionne votre première image, dernière image, prompt, et durée cible en un seul paquet de conditionnement et latent initial. - La durée est définie une fois avec le contrôle pratique
Float (duration)(#157). UneComfyMathExpression(#156) convertit ce temps en un nombre de frames aligné sur la foulée du modèle pour une attention fluide à travers la séquence. - Les aides temporelles et d'efficacité incluent
MiniMaxH3SigmaShift(#160) pour biaiser le calendrier pour MiniMax H3,ModelAttentionBackend(#159) pour sélectionner l'implémentation de l'attention, etBlockSparseAttention(#158) pour réduire le calcul tout en préservant la fidélité dans les régions importantes. - Le cœur de débruitage utilise
BasicGuider(#150) avec un conditionnement positif du nœud image-to-video, unBasicScheduleren huit étapes (#148), le samplerres_multistepchoisi dansKSamplerSelect(#147), etSamplerCustomAdvanced(#149) pour produire des latents vidéo et audio conjointement en une seule passe.
Sorties (2)
- Les latents vidéo décodent en images via
VAEDecode(#146) tandis que les latents audio décodent viaVAEDecodeAudio(#145).CreateVideo(#154) multiplexe ensuite la séquence d'images et l'audio en un seul clip. SaveVideo(#92) écrit le fichier. Définissez un préfixe de nom de fichier et choisissez un format et un codec qui correspondent à votre plateforme de diffusion ou à votre pipeline de montage.
Nœuds clés dans ComfyUI FastH3 8-Step V2 ComfyUI Workflow#
MiniMaxH3ImageToVideo (#155)
- Construit le conditionnement à partir de vos premières et dernières images de référence plus le prompt, et produit un latent initial pour la génération conjointe vidéo-et-audio. Ajustez le prompt textuel pour décrire le mouvement, la caméra, l'atmosphère et les indices sonores souhaités. Gardez les identités et les éléments de la scène cohérents avec les références pour les résultats les plus stables. Ajustez le contrôle de la durée dans le groupe de gauche pour changer la longueur du clip sans toucher aux réglages du sampler.
BlockSparseAttention (#158)
- Applique une attention éparse au modèle chargé pour accélérer l'échantillonnage tout en préservant l'attention là où elle est la plus nécessaire. Si vous constatez une perte de détail dans les scènes chargées, augmentez la fraction conservée ou réservez des tokens supplémentaires pour les sujets au premier plan. Pour les scènes simples, une plus forte parcimonie peut accélérer considérablement les rendus.
MiniMaxH3SigmaShift (#160)
- Décale le calendrier du bruit pour la vidéo et l'audio afin que la structure temporelle et le son restent cohérents tout au long de la courte trajectoire en huit étapes. Si le mouvement semble saccadé, augmentez légèrement le décalage vidéo ; si l'alignement audio dérive, ajustez légèrement le décalage audio. Utilisez de petits changements et testez de courtes prévisualisations pour trouver un équilibre.
SamplerCustomAdvanced (#149)
- Exécute le débruitage en huit étapes avec le sampler
res_multistepet le calendrier deBasicScheduler(#148). Gardez la graine fixe dansRandomNoise(#153) pour la reproductibilité, puis variez-la pour explorer des alternatives une fois que vous aimez le mouvement. Une forte orientation duBasicGuider(#150) aide à adhérer au prompt lorsque les compositions sont complexes.
CreateVideo (#154)
- Multiplexe les images décodées et l'audio en un clip final. Réglez les frames par seconde pour contrôler le rythme, choisissez un espace colorimétrique pour votre workflow, et si vous prévoyez de monter plus tard, choisissez un codec qui équilibre taille et qualité pour votre NLE.
Extras facultatifs#
- Sélection de référence : choisissez deux images du même objectif et perspective, avec exposition et balance des blancs correspondantes. Des références plus nettes donnent généralement des textures plus propres.
- Prompting : décrivez ce que fait le sujet, comment se comporte la caméra, et quel est le son de l'environnement. Gardez la formulation cohérente avec vos références pour éviter la dérive d'identité.
- Résolution vs vitesse : si vous atteignez des limites de mémoire, réduisez le budget de pixels cible dans
ImageScaleToTotalPixels(#142). Pour les prises de vue principales, augmentez-le et rendez moins de variations. - Durée et fps : ajustez la durée pour le rythme, puis définissez le fps dans
CreateVideo(#154) pour contrôler l'impression. Le workflow aligne automatiquement le nombre de frames pour une attention stable. - Graines et itération : verrouillez la graine de bruit pour affiner les prompts et les références, puis essayez de nouvelles graines pour des alternatives une fois que la composition et le timing sont verrouillés.
- Parité de modèle : le graphe suit la structure officielle FastH3 I2V, donc les conseils du modèle de référence à Comfy-Org/workflow_templates se transfèrent directement.
Remerciements#
Ce workflow implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement FastVideo pour le modèle FastH3 8-Step V2 et les poids ComfyUI, Comfy-Org pour le modèle de workflow FastH3 I2V, et RunningHub.ai pour la source du workflow pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.
Ressources#
- RunningHub.ai/Source du workflow
- Docs / Notes de version : RunningHub.ai post
- FastVideo/FastVideo-FastH3-8-Step-V2
- GitHub : hao-ai-lab/FastVideo
- Hugging Face : FastVideo/FastVideo-FastH3-8-Step-V2
- arXiv : 2405.14867
- FastVideo/FastVideo-FastH3-Comfy
- Hugging Face : FastVideo/FastVideo-FastH3-Comfy
- Comfy-Org/workflow_templates (modèle FastH3 I2V)
- GitHub : Comfy-Org/workflow_templates
Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

