MiniMax H3 Latent Upscaler : Workflow de génération vidéo BUNNY en deux passes#
Ce workflow ComfyUI transforme des prompts textuels et des images de référence optionnelles en vidéos cinématiques courtes avec audio synchronisé. Il utilise un design BUNNY en deux passes : la première étape établit le mouvement et la composition à une résolution de base modeste, puis le MiniMax H3 Latent Upscaler agrandit le latent vidéo-audio 3D avant que la deuxième étape ne reconstruise les détails à haute fréquence et décode les images finales et le son. Le MiniMax H3 Latent Upscaler est intégré à la génération, il n'est donc pas un amplificateur générique pour des vidéos préexistantes ; il est conçu spécifiquement pour des coupes publicitaires et des scènes cinématiques stylisées où vous souhaitez une clarté supplémentaire sans perdre l'intention de mouvement.
Le résultat est un clip à haute résolution dont l'apparence est régie par votre prompt, vos références et un petit ensemble de LoRAs, tandis que la stabilité du mouvement est protégée par le pipeline d'échantillonnage en deux passes, puis reconstruction. La deuxième étape est obligatoire et effectue toujours la reconstruction détaillée après que le latent a été suréchantillonné.
Modèles clés dans le workflow Comfyui MiniMax H3 Latent Upscaler#
- Modèle vidéo-audio MiniMax H3 et nœuds personnalisés T8. Fournit le générateur principal, le conditionnement, la planification en deux passes et les utilitaires de décodage utilisés dans tout le pipeline. Voir la suite de nœuds dans le référentiel T8 pour les comportements et interfaces spécifiques au modèle. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Video VAE. Encode et décode les latents vidéo que la deuxième étape transforme finalement en images. Inclus et consommé par les nœuds T8 ci-dessus. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Audio VAE. Encode et décode les latents audio pour garder le son ambiant cohérent avec le plan de mouvement visuel. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Latent Upscaler 3D. Un suréchantillonneur latent 3D appris qui agrandit le latent vidéo-audio conjoint en largeur et hauteur avant la reconstruction des détails, préservant mieux la structure temporelle que l'interpolation post-processus. Utilisez le checkpoint officiel 3D fp16. Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- SageAttention patch d'attention mémoire-efficace pour H3. Sert de seul patch d'attention utilisé par ce workflow pour une inférence stable et conviviale en mémoire. GitHub: ComfyUI-h3_sage_amd
Comment utiliser le workflow Comfyui MiniMax H3 Latent Upscaler#
Le workflow a sept groupes étiquetés qui coopèrent pour produire le clip final. La première étape planifie le mouvement à la résolution de base, le MiniMax H3 Latent Upscaler agrandit le latent, et la deuxième étape reconstruit les détails à la plus grande taille avant le décodage en vidéo et audio.
01 · Entrées, Suréchantillonnage & Références#
Utilisez la boîte de prompt BUNNY pour décrire la scène, le mouvement, l'ambiance et le paysage sonore. Ajoutez éventuellement jusqu'à quatre images de référence pour orienter l'identité, la palette ou le design de la prise de vue ; laissez-les déconnectées pour une génération uniquement textuelle. Définissez votre durée cible ; le nombre d'images est calculé automatiquement pour correspondre à la grille d'échantillonnage du modèle. Choisissez une résolution de base pour la première étape qui convient à votre matériel, puis ajustez l'échelle de suréchantillonnage pour déterminer dans quelle mesure le MiniMax H3 Latent Upscaler augmente la largeur et la hauteur dans l'espace latent. Rappelez-vous que la surface en pixels augmente avec le carré du facteur d'échelle, de sorte que la VRAM et le temps de rendu augmentent avec un suréchantillonnage plus élevé.
02 · Modèle de base · Sage seulement#
Ce groupe charge le modèle de base MiniMax H3, applique l'option Turbo LoRA pour la vitesse, et active le patch SageAttention comme seule modification d'attention. Les VAEs vidéo et audio MiniMax H3 et le codeur de texte H3 sont chargés pour assurer un conditionnement et un décodage cohérents. Gardez cette section telle quelle sauf si vous avez une raison spécifique de changer un fichier de modèle compatible ; il est déconseillé de mélanger les backends d'attention.
03 · LoRAs des étapes 1 & 2 BUNNY#
Les LoRAs de la première étape influencent la logique de mouvement, la composition et les schémas d'interaction ; les LoRAs de la deuxième étape se concentrent sur la reconstruction de la structure agrandie et des détails fins. Vous pouvez remplacer les fichiers LoRA par ceux adaptés à votre sujet et ajuster leur poids avec parcimonie. Si la deuxième étape commence à changer l'intention du mouvement, réduisez la force des LoRAs de la deuxième étape avant de toucher à la première. Ne routez jamais les LoRAs de la deuxième étape vers la première et ne contournez pas la deuxième étape.
04 · Mouvement de l'Étape 1#
Stage 1 Conditioning · AUTO (#7) analyse votre prompt et vos références, sélectionne le mode de génération approprié et assemble une toile latente vidéo-audio conjointe. Stage 1 Dual Clock (#8) pilote des calendriers d'échantillonnage séparés mais synchronisés pour la vidéo et l'audio afin que le mouvement et le son évoluent de manière cohérente. Le nœud de planification en deux passes alloue un petit budget à la première étape pour la structure du mouvement et réserve plus pour les détails de la deuxième étape. Stage 1 · Motion Structure effectue le débruitage grossier qui établit la composition et le timing ; la sortie est un latent raffiné, pas des images finales.
05 · Suréchantillonnage Latent 3D H3#
H3 3D Learned Latent Upscale (#13) applique le MiniMax H3 Latent Upscaler au latent de la première étape, agrandissant la largeur et la hauteur directement dans l'espace latent 3D. Parce que le suréchantillonnage se produit avant la reconstruction des détails, la cohérence temporelle est mieux préservée qu'avec les suréchantillonneurs d'espace d'image. Utilisez uniquement le checkpoint officiel 3D fp16 et ajustez l'échelle ici si vous souhaitez une résolution finale différente. Le nœud rapporte également les nouvelles dimensions, qui sont transmises automatiquement à la deuxième étape.
06 · Reconstruction HQ de l'Étape 2 (OBLIGATOIRE)#
Stage 2 Conditioning · AUTO (#14) réutilise votre prompt, vos références et les dimensions suréchantillonnées pour aligner les directives avec la plus grande toile. Stage 2 Reconcile · Size & Audio (#15) verrouille ces dimensions et la politique audio afin que la vidéo et le son restent synchronisés. Stage 2 Detail Mixer · Fixed 5 Steps (#16) effectue la passe de reconstruction décisive qui ajoute une texture nette tout en respectant le mouvement de la première étape. Stage 2 · 5-Step HQ Reconstruction débruite à partir de bruit initialisé dans le latent final, et Stage 2 AV Decode (#20) le convertit en images et audio généré pour la sortie.
07 · Sortie Finale#
CreateVideo emballe les images décodées et l'audio en un flux vidéo à la fréquence d'images choisie. Clean VRAM After Generation libère de la mémoire entre les rendus. BUNNY HQ · Save Final Video écrit le fichier final avec votre préfixe de nom de fichier, format et codec. Enregistrez toujours à partir du décodage de la deuxième étape ; les aperçus de la première étape ne sont pas finaux.
Nœuds clés dans le workflow Comfyui MiniMax H3 Latent Upscaler#
Stage 1 Conditioning · AUTO(#7). Entrée centrale pour le texte, les références et le routage des modes. Ajustez le prompt et, si nécessaire, le mode qui régit comment les références sont utilisées. Gardez ceci sur AUTO sauf si vous avez une raison claire de forcer un mode, et assurez-vous que les références correspondent à l'histoire que vous décrivez.Stage 1 Dual Clock · Video 12 / Audio 3(#8). Orchestration de calendriers d'échantillonnage séparés pour la vidéo et l'audio pour garder les temps forts du mouvement et les événements sonores alignés. Si vous devez retimer, faites-le doucement et gardez les deux calendriers cohérents avec votre rythme cible.H3 3D Learned Latent Upscale(#13). Applique le MiniMax H3 Latent Upscaler en utilisant le checkpoint officiel 3D fp16. Le seul paramètre que la plupart des utilisateurs devraient toucher est le facteur d'échelle ; l'augmenter augmente la largeur et la hauteur dans l'espace latent, et le nombre total de pixels augmente avec le carré de ce facteur. Utilisez le checkpoint validé de l'upscaler depuis la fiche modèle pour éviter les latents corrompus. Hugging FaceStage 2 Reconcile · Size & Audio(#15). Assure que le latent de la deuxième étape porte la taille suréchantillonnée et la politique audio sélectionnée avant la reconstruction. Si vous expérimentez avec les paramètres audio, gardez la réconciliation activée pour que le timing et les dimensions restent cohérents.Stage 2 Detail Mixer · Fixed 5 Steps(#16). Le cœur de la reconstruction haute résolution qui ajoute des détails sans réécrire la logique de mouvement. Si le résultat semble trop affûté ou dérive dans l'animation, réduisez d'abord les forces des LoRAs de la deuxième étape, puis ajustez les équilibres des mixeurs uniquement si nécessaire.Stage 2 AV Decode(#20). Décode le latent reconstruit en images et audio synchronisé. Routez toujours les sorties de ce nœud dansCreateVideoetSave Final Videopour assurer que l'espace colorimétrique et l'audio sont traités correctement.
Extras optionnels#
- Pour une génération uniquement textuelle, déconnectez toutes les entrées d'images de référence pour qu'AUTO sélectionne un chemin purement texte-à-vidéo.
- Lors du changement de suréchantillonnage, rappelez-vous que le coût de rendu augmente avec le carré du facteur ; préférez augmenter la résolution de base de la première étape uniquement après que l'échelle du MiniMax H3 Latent Upscaler est définie.
- Pour améliorer la cohérence entre les essais, fixez la graine dans
Seeded Noiseet variez-la intentionnellement lors de l'exploration d'alternatives. - Si la deuxième étape altère les temps forts du mouvement, baissez les poids des LoRAs de la deuxième étape avant de toucher aux échantillonneurs ou aux paramètres des mixeurs.
- Gardez SageAttention comme le seul patch d'attention ; évitez d'empiler des backends d'attention supplémentaires pour la stabilité. GitHub
- Utilisez le checkpoint officiel du MiniMax H3 Latent Upscaler pour éviter les tenseurs invalides et les clés non correspondantes. Hugging Face
Remerciements#
Ce workflow implémente et s'appuie sur les travaux et ressources suivants. Nous remercions sincèrement RunningHub.ai pour la source du workflow, LBH-123-AI pour le modèle Minimax H3 Latent Upscaler, et T8mars pour les nœuds personnalisés MiniMax H3 pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation et aux référentiels originaux liés ci-dessous.
Ressources#
- Source du Workflow RunningHub.ai
- Docs / Notes de version : runninghub.ai post
- LBH-123-AI/Minimax_h3_latent_Upscaler
- GitHub : LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler
- Hugging Face : LBH-123-AI/Minimax_h3_latent_Upscaler
- T8mars/comfyui-minimax-h3-audio-T8
- GitHub : T8mars/comfyui-minimax-h3-audio-T8
Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.


