FastH3 4-Step ComfyUI Workflow#
Ce graphe prêt pour RunComfy offre une conversion rapide de texte-à-vidéo et image-à-vidéo MiniMax H3 avec audio synchronisé. Le FastH3 4-Step ComfyUI Workflow suit le chemin en 4 étapes FastVideo VSA-DataFree tout en conservant un planificateur en 8 étapes dans ComfyUI pour une stabilité visuelle pratique. Il est bien adapté pour des scènes cinématiques, des moments centrés sur les personnages, des prises de produits et des clips riches en atmosphère où l'itération rapide est importante.
Le workflow auto-mixe les cadres et l'audio en un MP4 et prend en charge une branche I2V première image facultative. Connectez une image de départ pour des prises sensibles à la continuité, ou laissez-la vide pour une génération pure T2V. Les invites peuvent être longues et structurées, vous permettant de maintenir la continuité visuelle et sonore à travers les clips.
Modèles clés dans Comfyui FastH3 4-Step ComfyUI Workflow#
- Modèle de diffusion MiniMax H3 (FL2VA). Conduit la génération vidéo et audio cross-modale avec un design latent unifié. Référence de la famille de modèles : MiniMaxAI/MiniMax-H3.
- Poids FastVideo FastH3 4-step VSA-DataFree. Permet le chemin ultra-court en 4 étapes utilisé ici pour un brouillon orienté vitesse. Référence des poids : FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree.
- Encodeur de texte Qwen3-VL 32B AWQ pour MiniMax H3. Fournit une compréhension d'invite à haute capacité pour le style, la composition et les indices audio. Distribué avec les ressources Comfy-Org MiniMax H3 : Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE (FP16). Décode la vidéo latente en cadres RGB avec le codec natif de H3. Référence d'actif : Comfy-Org/MiniMax-H3.
- MiniMax H3 Audio VAE (FP32). Décode la piste audio latente alignée sur les cadres générés. Référence d'actif : Comfy-Org/MiniMax-H3.
Comment utiliser Comfyui FastH3 4-Step ComfyUI Workflow#
À un niveau élevé, les entrées utilisateur définissent la résolution, la durée et l'invite. Le graphe prépare les composants MiniMax H3, construit le conditionnement pour T2V ou I2V, puis effectue un passage d'échantillonnage concis réglé pour le chemin en 4 étapes FastH3. Enfin, il décode la vidéo et l'audio et les combine dans un MP4 prêt à être partagé.
Entrée utilisateur#
Définissez votre apparence et votre timing cibles dans le groupe d'entrée utilisateur. Utilisez ResolutionSelector (#115) pour choisir l'aspect et le budget de pixels ; les résolutions sont quantifiées à des multiples de 32 pour la compatibilité avec le décodeur. Choisissez le nombre d'images par seconde via (input:FPS) PrimitiveFloat (#5986) et la longueur du clip en secondes via (input:Duration) Seconds (#221). L'expression dans ComfyMathExpression (#220) convertit la durée en un nombre de cadres et le fixe à un multiple adapté à la foulée, donnant une planification stable et des longueurs de clip cohérentes. Ajoutez votre invite longue dans (input:prompt) Text Prompt PrimitiveStringMultiline (#6005) ; un assistant StringConcatenate (#6115) vous permet de conserver des ancres de style ou de continuité réutilisables.
Modèles#
Le groupe de modèles charge les composants principaux de H3 et les ajustements d'attention facultatifs. UNETLoader (#215) sélectionne les poids FL2VA FastVideo VSA-DataFree qui rendent le chemin en 4 étapes viable pour la vitesse tout en maintenant la cohérence sous un planificateur en 8 étapes. CLIPLoader (#216) intègre l'encodeur de texte Qwen3-VL 32B AWQ pour un ancrage linguistique riche. Deux nœuds VAELoader gèrent les branches vidéo et audio pour un décodage fidèle à la fin. PathchSageAttentionKJ (#223) applique une modification légère de l'attention avant la planification qui peut améliorer la rétention des détails dans des plannings très courts.
Conditionnement#
Le conditionnement est assemblé par MiniMaxH3ImageToVideo (#219), qui agit également comme point d'entrée pour T2V ou première image I2V. Si vous connectez une image à first_frame, le nœud conditionne le mouvement à partir de ce cadre ; sinon, il fonctionne purement en texte-à-vidéo à partir de votre invite. Largeur, hauteur et longueur proviennent du groupe d'entrée utilisateur afin que vous puissiez évoluer rapidement sans toucher les nœuds en aval. Get_duration (#6067) et Get_strPrompt (#6069) gèrent les valeurs partagées proprement afin que l'invite et le timing s'appliquent de manière cohérente. La sortie fournit un conditionnement positif et un latent préparé que l'échantillonneur affinera.
Échantillonnage#
L'échantillonnage est compact et réglé pour FastH3. RandomNoise (#217) sème la trajectoire, BasicGuider (#214) construit l'orientation à partir de votre conditionnement, et KSamplerSelect (#211) choisit un échantillonneur multi-étapes optimisé pour les chemins courts. MiniMaxH3SigmaShift (#6007) ajuste le calendrier de bruit de H3 pour les poids FL2VA, tandis que BasicScheduler (#212) maintient le flux de travail sauvegardé à 8 étapes pour un équilibre pratique entre vitesse et fidélité. SamplerCustomAdvanced (#213) conduit ensuite le débruitage pour produire un flux latent unique contenant à la fois le contenu vidéo et audio.
Décodage et création de vidéo#
Une fois l'échantillonnage terminé, VAEDecode (#210) transforme la vidéo latente en cadres et VAEDecodeAudio (#209) reconstruit l'audio synchronisé. VHS_VideoCombine (#6104) de Video Helper Suite mixe la séquence en MP4 avec le taux de trame du projet. Vous pouvez prévisualiser la sortie et le nœud écrira un fichier unique dans le répertoire de sortie, prêt pour examen. Parce que la largeur, la hauteur et le nombre de cadres sont déjà validés en amont, cette étape est sans intervention et rapide. Si vous avez fourni une première image, le mouvement en découlera ; sinon, le clip proviendra entièrement de l'invite.
Nœuds clés dans Comfyui FastH3 4-Step ComfyUI Workflow#
MiniMaxH3ImageToVideo (#219)#
Hub de conditionnement central pour T2V et première image I2V. Fournissez vos entrées d'invite et de timing, et connectez éventuellement first_frame pour des prises sensibles à la continuité. Ajustez la largeur et la hauteur pour l'échelle et l'aspect tout en les gardant comme multiples de 32. La longueur provient de la logique durée-à-cadres, vous n'avez donc rarement besoin de la définir manuellement.
MiniMaxH3SigmaShift (#6007)#
Applique un décalage sigma adapté à l'horaire FL2VA de MiniMax H3 afin que l'échantillonneur de chemin court reste stable. Laissez-le tel quel pour la route FastH3 ; c'est principalement une sauvegarde de compatibilité et de qualité. Envisagez de changer uniquement si vous échangez des poids ou des planificateurs H3.
BasicScheduler (#212)#
Fournit un plan en 8 étapes qui s'associe bien avec le chemin de poids en 4 étapes pour une base de qualité pratique. Vous pouvez réduire les étapes pour des brouillons plus rapides ou les élever légèrement pour plus de stabilité, en notant le compromis entre détail et vitesse. Le nombre d'étapes interagit avec le décalage sigma et le choix de l'échantillonneur, alors faites des changements de manière réfléchie.
SamplerCustomAdvanced (#213) avec KSamplerSelect (#211)#
Exécute la trajectoire de débruitage courte utilisée par FastH3. L'échantillonneur sélectionné est réglé pour l'efficacité multi-étapes et la cohérence avec très peu de mises à jour. Conservez cet appariement à moins que vous n'expérimentiez avec des échantillonneurs alternatifs validés pour H3.
ResolutionSelector (#115)#
Contrôle de haut niveau pour l'aspect et le budget de pixels. Utilisez-le pour échelonner l'apparence sans toucher aux internes du modèle, et préférez les résolutions qui se traduisent par environ 0,7–1,0 mégapixels pour des brouillons très rapides, puis évoluez lorsque vous verrouillez les prises finales. Les sorties sont quantifiées pour maintenir les décodeurs efficaces.
VHS_VideoCombine (#6104)#
Combine les cadres décodés et l'audio en un seul MP4. La qualité et la taille peuvent être équilibrées via ses contrôles de compression et de taux de trame. Il fait partie de Video Helper Suite, que vous pouvez explorer ici : Kosinkadink/ComfyUI-VideoHelperSuite.
Extras optionnels#
- Première image I2V : connectez une image à
first_framesurMiniMaxH3ImageToVideo(#219) pour la continuité à partir d'un tableau de conception, d'une photo ou d'une prise précédente. - Invitation : conservez une bible de style réutilisable dans
StringConcatenate(#6115) et mettez uniquement des directions spécifiques à la scène dans l'invite principale pour la cohérence à travers les clips. - Timing : ajustez uniquement les secondes ; le graphe fixe le nombre de cadres à un multiple adapté à la foulée pour éviter les saccades et maintient l'audio aligné automatiquement.
- Vitesse versus qualité : ébauchez à des mégapixels inférieurs dans
ResolutionSelector(#115), puis augmentez la résolution et, si nécessaire, le nombre d'étapes dansBasicScheduler(#212) pour finaliser. - Références : explorez les poids et les ressources utilisés par ce workflow à MiniMaxAI/MiniMax-H3, FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree, et l'adaptation Comfy à barelymining/ComfyUI-MiniMax-H3-FastVideo.
Remerciements#
Ce workflow implémente et s'appuie sur les travaux et ressources suivants. Nous remercions sincèrement MiniMaxAI pour MiniMax-H3, FastVideo pour les poids FastH3 4-step VSA-DataFree, et barelymining pour ComfyUI-MiniMax-H3-FastVideo pour leurs contributions et leur maintenance. Pour des détails autorisés, veuillez vous référer à la documentation originale et aux référentiels liés ci-dessous.
Ressources#
- AI Future Tech/Source et référence du workflow
- Docs / Notes de version : Patreon post
- barelymining/ComfyUI-MiniMax-H3-FastVideo
- Hugging Face : barelymining/ComfyUI-MiniMax-H3-FastVideo
- FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree
- Hugging Face : FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree
- MiniMaxAI/MiniMax-H3
- Hugging Face : MiniMaxAI/MiniMax-H3
- Comfy.org/Tutoriel MiniMax H3
- Docs / Notes de version : Comfy.org tutorial
Note : L'utilisation des modèles, ensembles de données et codes référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

