ComfyUI>Workflows>MiniMax H3 ComfyUI Image to Video Turbo 4 Étapes

MiniMax H3 ComfyUI Image to Video Turbo 4 Étapes

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1484
Transformez une image fixe en une courte vidéo Hailuo H3. Vous guidez le mouvement et le dialogue avec une invite. Un audio stéréo natif est généré avec les visuels. Un Turbo LoRA en 4 étapes accélère les brouillons. Vous pouvez animer des personnages, des produits ou la nature. Exécutez et affinez tout sur RunComfy.

MiniMax H3 ComfyUI Image to Video 4-step Turbo Workflow

MiniMax H3 ComfyUI I2V | 4-Step Turbo Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Image to Video 4-step Turbo Examples

MiniMax H3 ComfyUI Image to Video Turbo 4 Étapes#

MiniMax H3 ComfyUI Image to Video Turbo 4 Étapes est un flux de travail prêt pour RunComfy qui transforme une seule image fixe en une courte vidéo avec audio stéréo natif, directement dans ComfyUI. Il exécute le pipeline image-à-vidéo MiniMax H3 (Hailuo) et applique un Turbo LoRA pour que vous puissiez prévisualiser le mouvement et le dialogue en bien moins d'étapes d'échantillonnage que le programme par défaut.

Ce graphique est conçu pour les créateurs qui veulent des brouillons I2V rapides sans quitter la toile de ComfyUI : personnages parlants, rotations rapides de produits ou scènes ambiantes avec son synchronisé. Fournissez une image de départ et une invite de mouvement/dialogue ; le flux de travail génère des images vidéo et un audio stéréo ensemble, puis les multiplexe en un clip fini que vous pouvez télécharger.

Modèles clés dans le flux de travail Comfyui MiniMax H3 ComfyUI Image to Video Turbo 4 Étapes#

  • Modèle vidéo multimodal MiniMaxAI/MiniMax-H3. Le modèle H3 officiel produit des vidéos avec audio stéréo synchronisé et prend en charge la première image I2V ; ce flux de travail utilise le reconditionnement Comfy-Org pour ComfyUI. MiniMaxAI/MiniMax-H3 et Comfy-Org/MiniMax-H3
  • MiniMax H3 Video VAE. Code/décode les latents vidéo utilisés par le backend de diffusion H3. Inclus dans le reconditionnement Comfy-Org. Comfy-Org/MiniMax-H3
  • MiniMax H3 Audio VAE. Décode les latents audio du modèle en formes d'onde stéréo natives alignées avec les images. Inclus dans le reconditionnement Comfy-Org. Comfy-Org/MiniMax-H3
  • Encodeur de texte Qwen3-VL 32B (variante MiniMax H3). Analyse votre invite de mouvement et de dialogue en conditionnement pour H3. Emballé avec la version Comfy-Org sous text_encoders. Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo LoRA (4 étapes). Un LoRA qui accélère l'échantillonnage H3 pour que des prévisualisations nettes soient possibles avec un très faible nombre d'étapes. larryvrh/MiniMax-H3-Turbo-Lora et le papier concept LoRA LoRA: Low-Rank Adaptation

Comment utiliser le flux de travail Comfyui MiniMax H3 ComfyUI Image to Video Turbo 4 Étapes#

Flux global. Le graphique redimensionne votre image téléchargée, convertit votre durée en un nombre d'images H3 valide, puis alimente l'image de départ et l'invite dans H3 avec le Turbo LoRA appliqué. Le sampler produit des latents vidéo et audio conjoints, qui sont décodés et multiplexés en un clip téléchargeable.

Téléchargez l'image. Utilisez LoadImage (#114) pour fournir la première image que vous souhaitez animer. L'image est automatiquement redimensionnée par LayerUtility: ImageScaleByAspectRatio V2 (#167) à un côté long cible tout en préservant l'aspect ; la largeur/hauteur dérivée alimente le nœud central H3. Le letterboxing est utilisé si nécessaire pour éviter la distorsion. Cela maintient votre composition intacte tout en correspondant à la grille préférée de H3.

Paramètres et invite. Définissez la longueur du clip à l'aide du contrôle de durée (étiquette "Durée (sec)") qui alimente un petit nœud mathématique, ComfyMathExpression (#134), qui convertit les secondes en images à la cadence du film et s'aligne sur la grille valide de H3. Entrez votre mouvement et dialogue dans le nœud d'invite vert easy positive (#152) ; vous pouvez écrire des phrases naturelles et des discours entre guillemets. L'invite est encodée par l'encodeur de texte Qwen3-VL via CLIPLoader (#130), préparant le conditionnement pour le modèle.

Génération principale. UNETLoader (#129) charge le backend de diffusion MiniMax H3 et VAELoader (#121, #122) charge les VAE vidéo et audio. Le Turbo LoRA est fusionné au moment de l'exécution par LoraLoaderModelOnly (#171), et un patch d'attention efficace en mémoire (MiniMaxH3MemoryEfficientSageAttentionPatch (#170)) aide à réduire la VRAM. Le nœud principal, MiniMaxH3ImageToVideo (#133), reçoit votre image de départ, l'invite, et la largeur/hauteur/longueur calculées, puis produit des latents vidéo et audio synchronisés.

Échantillonnage et décodage. Une pile de sampler compacte (KSamplerSelect (#125), BasicScheduler (#126), BasicGuider (#128), SamplerCustomAdvanced (#127), RandomNoise (#131)) effectue le débruitage en très peu d'itérations grâce au Turbo LoRA. VAEDecode (#124) transforme les latents vidéo en images, et VAEDecodeAudio (#123) produit un audio stéréo aligné avec ces images. Vous n'avez pas besoin de modifier les paramètres de décodage ; ils sont câblés pour des prévisualisations propres.

Sortie. CreateVideo (#132) multiplexe les images et l'audio en un seul clip à la cadence de travail, et SaveVideo (#92) l'écrit avec le préfixe de nom de fichier configuré pour que vous puissiez le télécharger immédiatement depuis RunComfy. Le résultat est une courte vidéo synchronisée qui reflète votre image de départ, votre invite de mouvement et de dialogue.

Nœuds clés dans le flux de travail Comfyui MiniMax H3 ComfyUI Image to Video Turbo 4 Étapes#

MiniMaxH3ImageToVideo (#133). Le cœur du graphique : il consomme l'image de départ, l'invite encodée, et votre taille/longueur cible et produit des latents vidéo et audio conjoints. Ajustez uniquement les quelques entrées exposées dans ce flux de travail : fournissez une invite forte et descriptive (incluez des dialogues entre guillemets) et définissez une durée réaliste ; le nœud gère le reste en utilisant le modèle H3 et les VAE du reconditionnement Comfy-Org. Comfy-Org/MiniMax-H3

LoraLoaderModelOnly (#171). Injecte le MiniMax-H3 Turbo LoRA pour que le sampler puisse atteindre une grande netteté en très peu d'étapes. Si vous devez échanger des artefacts contre de la vitesse, réduisez légèrement la force du LoRA ; si vous voyez des traînées de mouvement, augmentez-la légèrement. Le LoRA est conçu pour fonctionner sur les variantes de base communes H3, y compris les reconditionnements élagués et quantifiés. larryvrh/MiniMax-H3-Turbo-Lora

BasicScheduler (#126) et SamplerCustomAdvanced (#127). Ensemble, ils contrôlent le programme de débruitage et le comportement de l'échantillonnage. Avec le Turbo LoRA en place, vous pouvez fonctionner avec un très faible nombre d'étapes pour des prévisualisations rapides ; augmenter les étapes améliorera modérément la stabilité si vous pouvez vous permettre le temps. Gardez les choix de planificateur et d'échantillonneur conventionnels à moins que vous n'ayez un look spécifique en tête.

LayerUtility: ImageScaleByAspectRatio V2 (#167). Assure que l'image fixe téléchargée est redimensionnée à une résolution propre et conviviale pour le modèle tout en préservant l'aspect. Utilisez cela lors du changement d'images source pour éviter les recadrages ou déformations inattendus ; le nœud sort exactement la largeur/hauteur que le nœud central H3 consomme. ComfyUI_LayerStyle

ComfyMathExpression (#134). Convertit les secondes en images et aligne le compte sur la grille d'images valide de H3 pour que l'audio reste verrouillé en phase avec la vidéo. Vous pouvez le considérer comme un "gardien de sécurité" qui évite les comptes d'images que H3 ne prend pas en charge, empêchant des désynchronisations subtiles lors de l'étape de multiplexage. L'entrée est la durée en anglais simple que vous définissez en haut de la toile.

MiniMaxH3MemoryEfficientSageAttentionPatch (#170). Applique une optimisation expérimentale de l'attention qui réduit le pic de VRAM pendant l'échantillonnage sur H3. Activez-le lors du travail à des tailles plus grandes ou sur des GPU avec une mémoire limitée ; il préserve l'intention créative tout en améliorant l'ajustement. ComfyUI-KJNodes

Extras optionnels#

  • Invite pour synchronisation labiale : écrivez la ligne réelle entre guillemets (par exemple, "Le dîner est prêt — essayez cette carbonara.") et décrivez l'ambiance et les mouvements de caméra en langage simple.
  • Composition d'abord : choisissez une image de départ qui cadre déjà votre sujet à la distance souhaitée ; l'animation respectera cette composition.
  • Vitesse contre finition : le réglage Turbo 4 étapes MiniMax H3 ComfyUI Image to Video est optimisé pour des prévisualisations rapides ; si une prise compte, ajoutez quelques étapes supplémentaires ou réduisez légèrement la force du LoRA pour apprivoiser le grain trop net.
  • Espace mémoire d'exécution : si vous atteignez les limites de VRAM, essayez de réduire la longueur maximale du côté de l'image, raccourcissez la durée, ou activez le patch d'attention efficace en mémoire.
  • Explorer les bases : le flux de travail est compatible avec les variantes de reconditionnement H3 Comfy-Org (bf16, int8 convrot, élagué). Si vous changez la base, gardez le Turbo LoRA connecté entre le chargeur de modèle et l'échantillonneur pour le même effet d'accélération. Comfy-Org/MiniMax-H3

Remerciements#

Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions MiniMax pour le modèle MiniMax H3, Comfy.org pour le tutoriel de flux de travail MiniMax H3 ComfyUI, Comfy-Org pour les poids du modèle MiniMax-H3, et larryvrh pour le MiniMax-H3 Turbo LoRA pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.

Ressources#

Note: L'utilisation des modèles, jeux de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.