MiniMax H3 Accélération en 8 étapes : Génération vidéo multimodale tout-en-un avec audio natif#
MiniMax H3 Accélération en 8 étapes est un flux de travail ComfyUI tout-en-un pour créer des vidéos cinématographiques avec audio natif synchronisé. Grâce au nœud unifié MiniMaxH3Unified, il prend en charge les références d'images, les références vidéo, les vidéos avec audio accompagnant et les références audio autonomes dans un flux de travail rationalisé.
L'exemple prêt à l'emploi utilise une seule image et une invite textuelle orientée vers le mouvement, mais la conversion de référence en vidéo n'est qu'une des façons d'utiliser le flux de travail. Son design multimodal unifié prend en charge différentes combinaisons de guidage visuel et audio sans nécessiter de graphiques de flux de travail séparés pour chaque type d'entrée.
Le flux de travail combine l'épine dorsale MiniMax H3 FL2VA avec le LightX2V Turbo LoRA et un programme d'échantillonnage compact en 8 étapes, à deux passages. Il est conçu pour les plans de personnages cinématographiques, les scènes de dialogue, les micro-histoires atmosphériques et d'autres tâches vidéo multimodales qui bénéficient d'une itération plus rapide et d'un audio natif synchronisé.
Modèles clés dans le flux de travail ComfyUI MiniMax H3 Accélération en 8 étapes#
- Poids officiels MiniMax-H3. L'épine dorsale de diffusion audiovisuelle qui génère des vidéos et de l'audio natif à partir d'invites et de références multimodales. MiniMaxAI/MiniMax-H3
- MiniMax H3 Video VAE et Audio VAE. Encodeurs et décodeurs jumelés utilisés pour passer entre l'espace pixel, les formes d'onde audio et les latents H3. Inclus dans la distribution Comfy-Org. Comfy-Org/MiniMax-H3
- Encodeur de texte Qwen3-VL 32B (AWQ, MiniMax-tuned). Fournit une base linguistique et visuelle pour les invites et les références lors de la conduite de MiniMax H3. Distribué avec le package Comfy-Org MiniMax H3. Comfy-Org/MiniMax-H3
- LightX2V MiniMax H3 Turbo LoRA. Un LoRA orienté vers la vitesse qui resserre les trajectoires pour que H3 puisse converger efficacement sous un programme en 8 étapes. lightx2v/Minimax-h3-Turbo
- MiniMax H3 Latent Upscaler 3D. Un amplificateur latent natif H3 utilisé entre les passages pour augmenter les détails spatiaux sans rompre l'alignement audio.
Comment utiliser le flux de travail ComfyUI MiniMax H3 Accélération en 8 étapes#
À un niveau élevé, le flux de travail collecte les invites et les références multimodales via un nœud d'entrée unifié, construit un programme compact en 8 étapes et exécute un passage rapide à haut sigma pour établir le mouvement et la structure de la scène. Il peut ensuite mettre à l'échelle le latent vidéo en 3D avant d'exécuter un passage de raffinement à faible sigma, de décoder l'audio et la vidéo synchronisés, et d'exporter le résultat en MP4.
Entrées et dimensionnement#
Utilisez Resolution Selector (Size) (#115) pour choisir la largeur et la hauteur cibles. Entrez votre description de scène dans Input Text (Prompt) (#217); vous pouvez inclure des dialogues entre guillemets si vous souhaitez des mots parlés dans le clip généré.
Le nœud tout-en-un MiniMaxH3Unified (#212) agit comme le hub de référence multimodale du flux de travail. Il prend en charge les références d'images, les références vidéo, les vidéos avec audio et les références audio autonomes, avec des contrôles d'invite, de dimensionnement et de durée.
L'exemple inclus est configuré avec une image de référence et une invite de mouvement pour une utilisation immédiate. Vous pouvez remplacer cette image ou configurer un autre type de référence pris en charge à l'intérieur du même nœud unifié sans reconstruire les étapes d'échantillonnage, de mise à l'échelle, de décodage ou d'exportation.
Vous pouvez définir duration dans MiniMaxH3Unified, ou basculer auto_length_from_audio lors de l'utilisation d'une référence audio externe pour guider le timing.
Configuration du modèle et correctifs d'accélération#
UNETLoader (#127) importe le point de contrôle MiniMax H3 FL2VA. MiniMaxH3MemoryEfficientSageAttentionPatch (#160) et ModelAttentionBackend (#168) activent ensuite un backend d'attention compatible VRAM.
MiniMaxH3SigmaShift (#207) aligne les horizons de débruitage vidéo et audio pour des programmes courts. LoraLoaderModelOnly (#167) applique le LightX2V Turbo LoRA qui permet l'Accélération en 8 étapes MiniMax H3 sans nécessiter un graphique d'accélération séparé.
Constructeur de programme en 8 étapes#
BasicScheduler (#163) construit une trajectoire compacte, qui est affinée par ExtendIntermediateSigmas (#220) et H3SigmaRefiner (#209) pour les dynamiques audiovisuelles de H3.
SplitSigmas (#197) divise le programme en un bloc à haut sigma pour la structure et un bloc à faible sigma pour les détails. Une seule graine RandomNoise (#129) alimente les deux passages pour aider à maintenir la cohérence du mouvement et de l'audio.
Échantillonneur de premier passage : hauts sigmas#
Le bloc à haut sigma s'écoule dans SamplerCustomAdvanced (#125), guidé par BasicGuider (#126) avec le conditionnement positif de MiniMaxH3Unified (#212).
Ce passage établit la composition, le rythme du mouvement et un lit audio grossier à l'intérieur d'un latent audiovisuel unifié. Sa sortie débruitée est ensuite préparée pour l'amélioration en cours de pipeline.
Mise à l'échelle dans l'espace latent#
LTXVSeparateAVLatent (#199) divise le latent audiovisuel pour que seuls les canaux vidéo soient mis à l'échelle par MinimaxH3LatentUpscaler3D (#226). Le latent audio reste intact pour préserver la synchronisation.
LTXVConcatAVLatent (#198) recombine ensuite le latent vidéo amélioré avec le latent audio original, créant un latent audiovisuel plus net mais toujours synchronisé pour le raffinement.
Échantillonneur de second passage : bas sigmas#
Le latent recombiné est affiné dans SamplerCustomAdvanced (#177) en utilisant le bloc à faible sigma et BasicGuider (#178).
Ce passage ajoute des détails de surface, nettoie les traits du visage et polit les textures audio tout en maintenant le mouvement et le timing établis lors du premier passage.
Décodage et exportation#
VAEDecode (#186) convertit les latents vidéo en images, tandis que VAEDecodeAudio (#185) reconstruit la piste audio native.
VHS_VideoCombine (#189) multiplexe les résultats en un MP4 à la fréquence d'images sélectionnée—24 fps par défaut—produisant un clip audiovisuel prêt à être partagé.
Nœuds clés dans le flux de travail ComfyUI MiniMax H3 Accélération en 8 étapes#
MiniMaxH3Unified(#212). Le hub central tout-en-un de référence multimodale pour MiniMax H3. Il réunit références d'images, vidéos, vidéos-audio, audio autonome, invite, dimensionnement et contrôles de durée en un seul nœud, permettant à différentes tâches de référence H3 d'utiliser le même pipeline de génération accélérée.H3SigmaRefiner(#209). Ajuste le programme pour favoriser les parties de la trajectoire où H3 bénéficie le plus. Si vous avez besoin de détails plus nets à la même vitesse, ajoutez un peu de raffinement ; si vous privilégiez le débit maximal, gardez-le léger.SplitSigmas(#197). Divise le programme compact en un plan à deux passages. Avec un programme en 8 étapes, la division au milieu équilibre vitesse et qualité ; déplacer la division alloue plus d'étapes soit à la structure soit aux détails.MiniMaxH3SigmaShift(#207). Décale les plages de sigma pour que la vidéo et l'audio convergent proprement sous des programmes courts. Laissez les décalages fournis inchangés sauf si vous comprenez leur effet sur la synchronisation et la stabilité.LoraLoaderModelOnly(#167). Applique le LightX2V Turbo LoRA. Une force plus faible adoucit l'effet Turbo pour un mouvement plus doux ; une force plus élevée peut augmenter le snap mais peut sur-accentuer les textures.MinimaxH3LatentUpscaler3D(#226). Augmente les détails spatiaux entre les passages tout en gardant le latent audio intact. Utilisez unmode.scalemodeste pour des sorties de type 720p ou un multiplicateur plus grand pour 1080p lorsque la VRAM le permet.VHS_VideoCombine(#189). Gère le multiplexage final et l'exportation. Ajustezframe_rate, définissez un préfixe de nom de fichier et utilisez éventuellement le découpage ou la boucle ping-pong pour les aperçus.
Extras optionnels#
- Références multimodales. Utilisez le nœud H3 unifié pour travailler avec des références d'images, des références vidéo, des vidéos avec audio ou des références audio autonomes sans passer à un graphique de génération séparé.
- Invites de démarrage rapide. MiniMax H3 réagit bien aux verbes cinématographiques et au langage de la caméra. Des indices courts et spécifiques tels que "slow push-in", "handheld sway", ou une ligne de dialogue citée produisent généralement un mouvement plus fort et un discours plus clair.
- Raccourcis de résolution. 0,4 MP avec une mise à l'échelle latente de 1,6x se situe près de 720p. Un premier passage de 0,5 MP avec une mise à l'échelle de 2x se situe près de 1080p. Si vous atteignez les limites de VRAM, réduisez les mégapixels avant de changer le programme d'étapes.
- Conseils de stabilité. Gardez la même graine pour des prises reproductibles. Changez seulement la graine pour des variations rapides tout en préservant le reste du timing et de la direction de la scène.
- Quand contourner l'amplificateur. Si vous privilégiez la vitesse ou la mémoire, réglez le multiplicateur de l'amplificateur latent sur 1 pour effectivement sauter l'étape d'amélioration.
- Scénarios adaptés. Ce flux de travail MiniMax H3 Accélération en 8 étapes fonctionne bien pour les plans de personnages en plan moyen, le dialogue avec son ambiant, les références de scène audiovisuelle, les courts battements atmosphériques et les tâches vidéo multimodales où l'itération rapide est importante.
Remerciements#
Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement RunningHub pour la référence du flux de travail, MiniMaxAI pour le modèle officiel MiniMax-H3, Comfy-Org pour les poids du modèle MiniMax-H3, et lightx2v pour le MiniMax H3 Turbo LoRA.
Pour des détails autorisés, des informations de licence et des conditions d'utilisation du modèle, référez-vous à la documentation originale et aux référentiels liés ci-dessous.
Ressources#
- Source et référence du flux de travail RunningHub
- Docs / Notes de version : Source et référence du flux de travail
- MiniMaxAI/MiniMax-H3
- Hugging Face : MiniMaxAI/MiniMax-H3
- Comfy-Org/MiniMax-H3
- Hugging Face : Comfy-Org/MiniMax-H3
- lightx2v/Minimax-h3-Turbo
- Hugging Face : lightx2v/Minimax-h3-Turbo
Remarque : L'utilisation des modèles, jeux de données et codes référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.



