MiniMax H3 Fun Control : génération d'image de référence à vidéo contrôlable dans ComfyUI#
Ce canevas prêt pour RunComfy amène MiniMax H3 Fun Control à ComfyUI pour une image-à-vidéo précise et prompte. Il suit votre passage de structure (profondeur, canny, pose, HED ou MLSD) tout en respectant soit une référence d'image du premier cadre soit des références complètes de personnage/style. La mise en page par défaut est livrée avec trois branches prêtes à fonctionner pour que vous puissiez commencer simplement et augmenter le contrôle selon vos besoins.
Graph 1 exécute un flux de contrôle unique et est activé par défaut. Graph 2 ajoute une configuration enchaînée profondeur-plus-pose avec des références de personnage/style et des incitations négatives véritables. Graph 3 reflète le Graph 2 mais inclut un patch d'accélération SolAttn en option. Vous pouvez activer ou contourner toute branche préparée après le chargement du flux de travail.
Modèles clés dans le flux de travail Comfyui MiniMax H3 Fun Control#
- MiniMax H3 base UNet (fl2va) et UNet de référence à vidéo (ref2va). Ce sont les structures vidéo qui synthétisent le mouvement soit à partir d'une invite et du premier cadre (fl2va) soit à partir de références d'image persistantes (ref2va). Les poids emballés par la communauté pour ComfyUI sont disponibles dans le set expérimental MiniMax H3 sur Hugging Face : MiniMax-H3-experimental.
- MiniMax H3 Vidéo VAE et Audio VAE. Ceux-ci encodent et décodent les flux vidéo et audio latents utilisés par H3 afin que le pipeline puisse échantillonner efficacement, puis convertir les résultats en pixels et en son. Voir le même pack de modèles : MiniMax-H3-experimental.
- Encodeur de texte famille Qwen-VL. Le flux de travail utilise une variante MiniMax-tuned de la série Qwen-VL pour analyser les invites et alimenter le conditionnement de texte dans H3. Pour des informations de base sur cette famille de modèles, voir le dépôt officiel : Qwen2-VL.
- MiniMax H3 Fun ControlNet Union (forme de courbe). Ce ControlNet unique prend en charge plusieurs passages de contrôle (profondeur, canny, HED, pose, MLSD) et vous permet de diriger la structure de la scène à travers les cadres. Utilisez le point de contrôle en forme de courbe de la version officielle : MiniMax-H3-Fun-Controlnet-Union.
Comment utiliser le flux de travail Comfyui MiniMax H3 Fun Control#
Le canevas contient trois branches préparées. Graph 1 (contrôle unique) est activé, Graph 2 (profondeur+pose avec références) et Graph 3 (accélération SolAttn) sont contournés. Activez une branche lorsque vous êtes prêt ; seule la branche activée sera exécutée.
01 · Contrôle Unique · ACTIVÉ PAR DÉFAUT#
01 · Modèles Ce groupe charge le MiniMax H3 base UNet, l'encodeur de texte Qwen-VL, et les H3 VAEs pour la vidéo et l'audio. Il charge également le MiniMax H3 Fun ControlNet Union en forme de courbe pour qu'un flux de contrôle unique puisse guider la structure. Vous n'avez pas besoin de changer quoi que ce soit ici à moins que vous ne vouliez échanger les poids d'un autre ensemble de points de contrôle.
01 · CONTRÔLE : ceci est le nœud Chargez une vidéo de contrôle qui correspond à votre largeur, hauteur et nombre de cadres de sortie souhaités ; le nœud vérifie et augmentera les deux nombres s'ils ne correspondent pas. Choisissez l'un des passages pris en charge (profondeur, canny, pose, HED, MLSD) en fonction de ce qui capture le mieux votre mouvement et vos silhouettes. La force agit comme un budget d'adhérence ; 1.0 est le point de départ correct pour un contrôle unique, et pousser plus haut a tendance à saturer le détail. La fenêtre du calendrier de contrôle définit quand le contrôle est actif pendant l'échantillonnage ; terminer la fenêtre autour de 0.6 verrouille souvent la structure tôt tout en libérant les étapes tardives pour ajouter une texture fine. Utilisez le point de contrôle ControlNet en forme de courbe ; la variante pleine largeur ne se chargera pas dans ce nœud.
01 · Conditionnement Écrivez votre invite et fournissez éventuellement un premier cadre. Avec un premier cadre, le modèle s'initialise à partir de cette image et tend à préserver la composition ; sans cela, c'est uniquement l'invite qui conduit l'apparence. Définissez la largeur, la hauteur, et la longueur ici ; MiniMax H3 ajuste la longueur à sa grille valide à 24 fps (17n + 5), alors planifiez votre montage autour de ces comptes. Garder les premiers et derniers cadres non définis utilise le début et la fin naturels du modèle ; ajouter un dernier cadre n'est pas nécessaire pour cette branche.
01 · Échantillonnage L'échantillonneur fonctionne avec un guideur de base qui n'a pas de CFG ni d'entrée négative, ce qui signifie que les négatifs dans votre texte sont ignorés ici ; utilisez Graph 2 ou passez à un guideur CFG si vous avez besoin de négatifs. Un décalage de sigma est appliqué pour équilibrer les calendriers de diffusion vidéo et audio pour un décodage stable plus tard. Le choix du calendrier et de l'échantillonneur dans cette branche est ajusté pour un compromis qualité-vitesse raisonnable ; une fois que vous avez une base, n'hésitez pas à expérimenter.
01 · Sortie Les latents échantillonnés sont décodés avec le H3 Video VAE et, le cas échéant, l'Audio VAE. Les cadres et l'audio sont multiplexés dans une vidéo et enregistrés dans vos sorties. Utilisez le résultat enregistré comme vérification de style et revenez à la force de contrôle, à la fenêtre de calendrier ou à l'invite si nécessaire.
02 · Référence Profondeur + Pose · CONTREPASSÉ PAR DÉFAUT#
02 · Modèles Cette branche charge le H3 UNet de référence à vidéo, qui est conçu pour maintenir l'identité et le style à partir d'images fixes à travers chaque cadre. Il partage l'encodeur de texte Qwen-VL et les H3 VAEs. Le MiniMax H3 Fun ControlNet Union en forme de courbe est réutilisé ici pour conduire la structure.
02 · CONTRÔLE : enchaîné, les forces SOMMENT à environ 1.0 Deux nœuds Apply sont enchaînés pour que chaque flux de contrôle apporte sa propre contribution, d'abord la profondeur puis la pose. Traitez la force comme un budget : les deux forces s'additionnent, et pousser le total bien au-dessus de 1.0 effacera les détails et étalera le sujet. La profondeur est excellente pour la géométrie grossière et le placement de la caméra ; la pose verrouille les membres et l'articulation. Réglez en fixant une force à zéro et en écoutant l'autre, puis réunissez-les près d'un total de 1.0.
02 · Conditionnement et références Utilisez MiniMaxH3ReferenceToVideo pour alimenter de vraies images de référence avec votre invite afin que l'identité et le style persistent à travers tous les cadres. ref_image_size de max donne la plus forte identité (plus grands tokens de référence) à un coût de calcul ; match est plus rapide et souvent suffisant pour un contrôle de style plus lâche. Ajoutez une branche négative avec les mêmes références et votre texte négatif pour que le guideur CFG puisse soustraire ce que vous ne voulez pas. La longueur, la taille, et le nombre de cadres suivent les mêmes règles que Graph 1.
02 · Échantillonnage Passe à un CFGGuider pour que le conditionnement négatif soit effectivement appliqué ; la guidance ajoute un coût car le modèle évalue à la fois le positif et le négatif à chaque étape. Les étapes sont définies plus haut ici pour donner aux contrôles enchaînés et aux références un espace pour se résoudre ; vous pouvez réduire pour la vitesse une fois que vous aimez l'apparence. Le contrôle des graines assure la reproductibilité ; gardez-le fixe pendant que vous équilibrez le budget de profondeur et de pose.
02 · Sortie Le décodage et l'assemblage vidéo reflètent Graph 1. Si la sortie correspond à la structure mais semble trop lisse, réduisez la fin de la fenêtre de contrôle vers 0.6 ou abaissez légèrement la force totale de contrôle. Si l'identité glisse, augmentez ref_image_size ou ajoutez une seconde image de référence.
03 · Accélération Sol-Attn Optionnelle · CONTREPASSÉ PAR DÉFAUT#
03 · Modèles Cette branche reflète les modèles et contrôles de Graph 2 mais ajoute un patch d'accélération à attention clairsemée. Il nécessite l'extension SolAttn Triton. Si vous n'avez pas Triton ou le pack de nœuds installé, laissez cette branche contournée.
03 · CONTRÔLE : enchaîné, les forces SOMMENT à environ 1.0 La même chaîne profondeur-plus-pose s'applique ; gardez la force combinée près de 1.0 pour des résultats nets. Utilisez la même approche de réglage que Graph 2 pour trouver la répartition qui convient le mieux à votre prise de vue et à la taille de votre sujet.
03 · Conditionnement et références Identique à Graph 2. Gardez les références cohérentes sur les branches positives et négatives pour que CFG soustrait les bonnes caractéristiques. Si vous voulez une identité maximale, combinez ref_image_size: max avec un nombre d'étapes légèrement plus élevé.
03 · OPTIONNEL : attention clairsemée SolAttnPatch accélère les blocs lourds en attention tout en préservant la qualité là où elle compte le plus. Laissez morton désactivé, car réorganiser les tokens vidéo en ordre Z désaligne là où le ControlNet applique ses décalages par ligne et supprime effectivement le contrôle. Garder les premiers et derniers blocs de transformateur exacts est un paramètre par défaut sûr lorsque vous voulez de la vitesse sans perdre d'adhérence. Attendez-vous à des exécutions plus rapides après que Triton compile ses noyaux ; le premier passage mesure principalement le temps de compilation.
03 · Échantillonnage et Sortie L'échantillonnage, le décodage, et l'enregistrement suivent Graph 2. Comparez SolAttn activé par rapport à désactivé avec une graine fixe pour juger de la qualité et de l'adhérence pour votre contenu. Si le contrôle semble plus faible avec SolAttn, vérifiez que morton est désactivé avant d'ajuster les forces.
Nœuds clés dans le flux de travail Comfyui MiniMax H3 Fun Control#
Apply H3 Fun ControlNet (#23) Ajoute un flux de contrôle au modèle actuel et prend un lot de cadres de contrôle extraits de votre vidéo de contrôle. Utilisez strength comme un budget d'adhérence : pour un contrôle unique commencez à 1.0 ; lorsque vous enchaînez des contrôles, gardez la somme près de 1.0 pour éviter les détails effacés. La fenêtre du calendrier (start_percent, end_percent) détermine quand le contrôle est actif ; terminer près de 0.6 préserve souvent les textures que le contrôle ne peut pas décrire.
Prompt + premier cadre -> conditionnement (#31) Construit le conditionnement à partir de votre invite de texte et d'un premier cadre optionnel pour que le modèle puisse respecter la composition initiale. Si vous omettez le premier cadre, l'invite seule dirige le contenu. La largeur, la hauteur, et la longueur vivent ici ; H3 accepte les longueurs sur sa grille 17n + 5 à 24 fps, alors planifiez les montages à ces durées.
Positif : références + invite (#1031) Alimente des références d'image persistantes et un texte d'invite dans H3 afin que l'identité et le style perdurent à travers chaque cadre. ref_image_size de max utilise des tokens plus grands pour une identité plus forte à un coût plus élevé ; match est plus rapide avec une pression d'identité plus légère. Associez ceci à une branche négative et à un CFGGuider si vous avez besoin d'exclusions fortes.
CFGGuider : le négatif fonctionne uniquement ici (#1040) Active la guidance sans classification pour que le conditionnement négatif ait un effet. Une guidance plus élevée renforce l'adhérence à l'invite et aux références mais augmente le calcul car chaque étape exécute à la fois le positif et le négatif. Pour des briefs de style longs et spécifiques, un cfg modéré peut améliorer considérablement l'adhérence ; testez côte à côte avec une graine fixe.
Déplacement Sigma (vidéo 12 / audio 3) (#24) Ajuste les calendriers de diffusion pour donner aux chemins vidéo et audio des profils sigma appropriés avant l'échantillonnage. Gardez cela dans la chaîne lorsque vous prévoyez de décoder l'audio afin que l'Audio VAE reçoive une distribution latente compatible.
Sol-Attn (OPTIONNEL, nécessite le pack de nœuds SolAttn + Triton) (#2060) Applique des noyaux à attention clairsemée pour accélérer H3 sans modifier le graphe. Laissez morton désactivé ; l'activer réorganise les tokens et fait que la contribution de ControlNet rate les lignes prévues, ce qui ressemble à une sortie parfaite qui ignore simplement le contrôle. Pour des accélérations conservatrices, gardez les premiers et derniers blocs de transformateur exacts et profilez après la compilation Triton.
Planificateur de Base (#42) Fournit le calendrier sigma et le nombre d'étapes pour l'échantillonnage. Pour des prises de vue étroitement contrôlées, quelques étapes supplémentaires peuvent aider à stabiliser la structure avant que le contrôle ne s'estompe ; pour des passages de style rapides, réduisez les étapes pour gagner du temps. Combinez les ajustements du planificateur avec la fenêtre de contrôle pour équilibrer l'adhérence et la texture.
Extras optionnels#
- La vidéo de contrôle doit correspondre exactement à la largeur, la hauteur et le nombre de cadres de génération ; le nœud vérifie et augmente les deux nombres s'ils diffèrent.
- Utilisez le point de contrôle ControlNet en forme de courbe ; la version originale en pleine largeur ne se chargera pas dans
H3FunControlLoader. - Si votre passage de contrôle a de grandes zones sans caractéristiques, terminez la fenêtre de contrôle près de 0.6 pour que les étapes tardives puissent ajouter de la texture à partir de l'invite.
- Pour les clips critiques pour l'identité, préférez Graph 2 ou Graph 3 avec
MiniMaxH3ReferenceToVideoet considérezref_image_size: max. - Besoin de négatifs dans Graph 1 ? Remplacez par un
CFGGuiderou passez à Graph 2/3 où la branche négative est déjà câblée. - Ressources du projet : nœud personnalisé ComfyUI-H3-FunControl, ControlNet en forme de courbe MiniMax-H3-Fun-Controlnet-Union, poids communautaires H3 MiniMax-H3-experimental, accélération optionnelle ComfyUI-SolAttn_triton.
Remerciements#
Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement wyzborrero pour le nœud personnalisé ComfyUI-H3-FunControl, alibaba-pai pour le modèle MiniMax H3 Fun ControlNet Union, Kijai pour les fichiers de modèle expérimentaux MiniMax H3, kijai pour le nœud d'accélération optionnel SolAttn Triton, et RunComfy pour le flux de travail Cloud Save pour leurs contributions et leur maintenance. Pour des détails autoritatifs, veuillez vous référer à la documentation et aux dépôts originaux liés ci-dessous.
###json Resources
- wyzborrero/ComfyUI-H3-FunControl
- GitHub: wyzborrero/ComfyUI-H3-FunControl
- alibaba-pai/MiniMax-H3-Fun-Controlnet-Union
- Hugging Face: alibaba-pai/MiniMax-H3-Fun-Controlnet-Union
- Kijai/MiniMax-H3-experimental
- Hugging Face: Kijai/MiniMax-H3-experimental
- kijai/ComfyUI-SolAttn_triton
- GitHub: kijai/ComfyUI-SolAttn_triton
- RunComfy/Cloud Save workflow
- Docs / Release Notes: RunComfy Cloud Save workflow
Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.


