VDN H3 MiniMax ComfyUI Text To Video#
VDN H3 ComfyUI Text To Video transforme des consignes en langage naturel en vidéos courtes et cinématiques avec un audio synchronisé. Il combine la famille MiniMax H3 avec l'attention hybride de Video DeltaNet et un échantillonnage en 8 étapes pour générer vidéo et audio à partir d'une seule consigne. Il est bien adapté aux storyboards, clips produits et scènes stylisées telles que la fantasy cinématique, la conduite de rallye et les combats à l'épée blindée.
Le graphe inclut deux branches sélectionnables indépendamment. La branche VDN-H3 applique le patch Video DeltaNet et a été utilisée pour produire les exemples inclus. La branche FastVideo est fournie pour comparer la sortie et le temps de génération avec le chemin VDN. Les deux branches rendent les MP4 avec audio à votre taux de rafraîchissement choisi.
Construit sur des composants ouverts : VDN pour MiniMax H3 GitHub et Hugging Face, nœuds VDN-H3 ComfyUI par Saganaki22 GitHub, et poids et VAE de base MiniMax H3 Hugging Face.
Modèles clés dans le flux de travail Comfyui VDN H3 ComfyUI Text To Video#
- Modèle de diffusion MiniMax-H3 (UNet). Conduit le processus de débruitage qui transforme le bruit en latents vidéo et audio spatio-temporels cohérents. Les poids sont fournis dans le bundle MiniMax H3 sur Hugging Face.
- Encodeur de texte Qwen3-VL 32B MiniMax-H3. Convertit votre consigne en conditionnement pour la génération de vidéo et d'audio, ajusté pour la famille H3. Inclus dans la version MiniMax H3 sur Hugging Face.
- VAE Vidéo MiniMax-H3. Décode les latents vidéo en trames RGB. Disponible dans la section VAE de Hugging Face.
- VAE Audio MiniMax-H3. Reconstruit l'audio d'onde à partir des latents audio. Également fourni sur Hugging Face.
- Poids du patch VDN-H3. Video DeltaNet applique une attention hybride à MiniMax H3. Obtenez les checkpoints sur Hugging Face.
- Variante FastVideo UNet. La branche de comparaison utilise
minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensorsde Kijai/MiniMax-H3-experimental.
Comment utiliser le flux de travail Comfyui VDN H3 MiniMax ComfyUI Text To Video#
Commencez par définir votre consigne, résolution, durée et taux de rafraîchissement. Sélectionnez la branche VDN-H3 ou la branche FastVideo pour une exécution individuelle. Queue All peut exécuter les deux branches activées et produire deux MP4 ; les branches de graphes séparées ne garantissent pas une exécution simultanée du GPU. Les deux branches sont configurées pour 8 étapes d'échantillonnage.
Saisie utilisateur#
Utilisez le panneau (input:prompt) Text Prompt pour décrire à la fois les visuels et le son en langage simple. Pour l'audio, ajoutez une ligne finale commençant par Audio: pour demander un effet sonore ou une ambiance spécifique, par exemple "Audio: battement de sabots rythmique, vent, rugissement lointain." Contrôlez la taille visuelle avec (input:Resolution) Megapixels qui alimente le ResolutionSelector pour produire une largeur et une hauteur adaptées aux calculs. Réglez (input:Duration) Seconds et (input:FPS) pour définir la durée et la fluidité du clip. Le flux de travail convertit la durée et le FPS en un nombre de trames valide et l'ajuste discrètement à une longueur de séquence qui fonctionne bien avec les internes de H3.
Modèles#
Le CLIPLoader fournit l'encodeur de texte ajusté MiniMax utilisé pour le conditionnement. Deux nœuds VAELoader intègrent le VAE Vidéo MiniMax-H3 et le VAE Audio pour que les trames et le son décodés correspondent à l'espace latent du modèle. Ces chargeurs sont partagés par les deux branches pour garantir des résultats A/B comparables.
Conditionnement#
MiniMaxH3ImageToVideo (#219) transforme votre consigne plus la taille et la longueur en le latent vidéo-et-audio initial avec le conditionnement positif. Des entrées d'images optionnelles peuvent être utilisées pour verrouiller la première ou la dernière trame lorsque vous avez besoin d'une pose d'entrée ou de sortie spécifique. Cette étape est celle où vos décisions narratives comptent le plus : mouvement de la caméra, action du sujet, éclairage, et la ligne Audio: deviennent toutes des orientations pour l'échantillonneur en aval.
Patch VDN-H3#
La branche VDN applique la mise à jour Video DeltaNet avec ApplyVDNH3Advanced (#6126). Elle applique le patch d'attention hybride sélectionné. MiniMaxChunkFeedForward et ModelPatchTorchSettings configurent les paramètres de mémoire et d'exécution. MiniMaxH3SigmaShift ajuste le calendrier de bruit pour la vidéo et l'audio avant le début de l'échantillonnage.
Échantillonnage (VDN-H3)#
L'échantillonnage VDN commence à partir de RandomNoise (#6141), fusionne les orientations avec BasicGuider (#6134), choisit le solveur dans KSamplerSelect (#6137), et programme un nombre compact d'étapes de diffusion dans BasicScheduler (#6136). SamplerCustomAdvanced (#6135) effectue le débruitage sur toute la séquence pour produire des latents vidéo et audio affinés. Gardez la graine fixe pour la répétabilité ou changez-la pour de nouvelles variations avec la même consigne.
Décodage et création de vidéo (VDN-H3)#
VAEDecode (#6146) reconstruit les trames tandis que VAEDecodeAudio (#6145) reconstruit la bande sonore. VHS_VideoCombine (#6170) multiplexe les trames et l'audio en un MP4, respectant le taux de rafraîchissement que vous avez défini précédemment et enregistrant un fichier prêt pour l'aperçu. La sortie VDN est enregistrée avec un préfixe de nom de fichier distinct pour qu'il soit facile de la comparer au résultat FastVideo.
Branche de comparaison FastVideo#
Le chemin FastVideo charge un MiniMax H3 UNet optimisé pour la vitesse et applique un patch d'attention léger avant l'échantillonnage. Il réutilise votre consigne, taille et nombre de trames pour que vous puissiez comparer directement le timing et l'apparence. L'échantillonnage reflète la structure de la branche VDN et est également configuré pour 8 étapes. Les trames et l'audio sont décodés et combinés avec VHS_VideoCombine (#6104) pour produire un second MP4. Utilisez ces sorties côte à côte pour décider quelle branche convient le mieux à votre scène.
Nœuds clés dans le flux de travail Comfyui VDN H3 ComfyUI Text To Video#
ApplyVDNH3Advanced(#6126). Active Video DeltaNet sur MiniMax H3 en utilisant le checkpoint sélectionné de la version VDN-H3. Ajustez uniquement lorsque vous souhaitez changer le checkpoint VDN ou basculer les backends d'attention ; gardez les paramètres d'attention hybride par défaut pour un usage général. Implémentation de référence : Saganaki22/ComfyUI-VDN-H3.MiniMaxH3ImageToVideo(#219). Point de contrôle central pour l'histoire et le timing, acceptant la consigne textuelle, la largeur et la hauteur calculées, et le nombre de trames dérivé. Pour l'audio, ajoutez une seule ligneAudio:à la consigne pour diriger les effets sonores et l'ambiance tout en évitant la parole sauf demande explicite.MiniMaxH3SigmaShift(#6131, #6007). Rééquilibre le calendrier sigma pour les flux vidéo et audio, ce qui peut aider à réduire les tremblements et à préserver les détails à faible nombre d'étapes. Envisagez de petits ajustements uniquement si vous changez de variantes de modèle ou remarquez une instabilité de mouvement.VHS_VideoCombine(#6170, #6104). Multiplexe les trames décodées et l'audio en MP4 avec votre taux de rafraîchissement et préfixe de nom de fichier choisis. Options utiles incluent le découpage à la longueur de l'audio et la sélection du format de pixel H.264 désiré. Page du projet : ComfyUI-VideoHelperSuite.
Extras optionnels#
- Conseils de consigne : commencez par une seule phrase qui définit le sujet, l'action et le mouvement de la caméra, puis ajoutez des indices de look-and-feel et une ligne
Audio:pour les effets sonores. - Pour les clips plus longs, préférez des mégapixels modestes à une haute résolution pour maintenir la stabilité du mouvement et la consommation de mémoire sous contrôle.
- Fixez la graine dans
RandomNoiselorsque vous souhaitez des itérations cohérentes ; changez-la pour explorer des variations. - Comparez les deux branches sur votre propre scène pour évaluer la qualité de sortie et le temps de génération.
- Si vous atteignez les limites de mémoire, réduisez les mégapixels ou la durée d'abord ; le feed-forward en morceaux aide déjà avec les séquences plus longues.
Remerciements#
Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement OpenVDN pour le modèle vdn-minimax-h3, les poids et le dépôt, Saganaki22 pour les nœuds ComfyUI-VDN-H3, et Benji (AI Future Tech) pour le flux de travail VDN-H3 pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.
Ressources#
- OpenVDN/vdn-minimax-h3
- GitHub: OpenVDN/vdn-minimax-h3
- Hugging Face: OpenVDN/vdn-minimax-h3
- Saganaki22/ComfyUI-VDN-H3
- GitHub: Saganaki22/ComfyUI-VDN-H3
- Benji (AI Future Tech)/VDN-H3 Workflow
- Docs / Release Notes: AI Future Tech Patreon post
Remarque : L'utilisation des modèles, ensembles de données et codes référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

