ComfyUI>Workflows>MiniMax H3 ComfyUI Texte-à-Vidéo Turbo 4 étapes

MiniMax H3 ComfyUI Texte-à-Vidéo Turbo 4 étapes

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1483
Transformez une seule invite cinématographique en une courte vidéo. Vous obtenez un son stéréo natif dans le même passage. Créez un dialogue clair, du chant et des scènes ambiantes. Hailuo H3 Turbo utilise un échantillonnage en quatre étapes pour des brouillons plus rapides. Vous pouvez tester des idées rapidement. Exportez le mouvement et l'audio ensemble.

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Workflow

MiniMax H3 ComfyUI Text-to-Video | 4-Step Turbo
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Examples

MiniMax H3 ComfyUI Texte-à-Vidéo Turbo 4 étapes : invite-à-clip avec audio natif en un seul passage#

Ce workflow transforme une seule invite cinématographique en une courte vidéo avec un audio stéréo généré conjointement en utilisant MiniMax H3. Il applique une accélération Turbo 4 étapes LoRA pour itérer rapidement sur le dialogue, le chant et les scènes ambiantes tout en gardant le mouvement et le son étroitement couplés.

Conçu pour les créateurs qui souhaitent des brouillons uniquement à partir d'invites, le workflow MiniMax H3 ComfyUI Texte-à-Vidéo Turbo 4 étapes produit des discours ou des voix clairs, un son environnemental cohérent et une cinématographie cohérente sans assemblage audio manuel. Le graphe gère automatiquement l'alignement de la durée, l'échantillonnage latent, le décodage et le multiplexage, afin que vous puissiez vous concentrer sur la narration et les indices de performance.

Modèles clés dans le workflow Comfyui MiniMax H3 ComfyUI Texte-à-Vidéo Turbo 4 étapes#

  • Modèle de diffusion MiniMax H3 (FL2VA UNet). Générateur audiovisuel principal qui apprend un latent partagé pour l'image et le son, permettant un mouvement et un audio synchronisés à partir du même passage d'échantillonnage. Poids : Comfy-Org/MiniMax-H3.
  • Encodeur de texte Qwen3-VL 32B pour H3 (variante AWQ/NVFP4). Encode des invites riches et multi-phrases en conditionnement qui pilote la disposition des scènes, la performance et les événements audio. Emballé dans Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. Décode le latent vidéo échantillonné en images avec un ton et des détails cinématographiques. Fichier : minimax_h3_video_vae_fp16.safetensors.
  • MiniMax H3 Audio VAE. Décode le latent partagé en audio stéréo aligné dans le temps pour le discours, le chant et l'ambiance. Fichier : minimax_h3_audio_vae_fp32.safetensors.
  • MiniMax H3 Turbo 4-step LoRA. Applique la recette d'accélération qui préserve la fidélité de la scène tout en permettant un échantillonnage très rapide. Fichier : minimax_h3_turbo_4step_pruned_comfyui.safetensors.

Comment utiliser le workflow Comfyui MiniMax H3 ComfyUI Texte-à-Vidéo Turbo 4 étapes#

À un niveau élevé, votre invite est encodée, un modèle H3 augmenté par Turbo échantillonne un latent audiovisuel unique, et les VAE vidéo et audio décodent ce latent avant que le clip ne soit multiplexé en un fichier lisible.

1) Rédigez l'invite cinématographique et définissez la durée#

Utilisez le champ de texte easy positive (#147) pour décrire l'apparence, l'action et la performance. Pour guider la voix ou la musique, incluez des indices clairs comme "Audio : voix masculine d'âge moyen livre la ligne... ambiance de pluie... basse sous-tension thriller." Le contrôleur Float (duration) (#133) définit la longueur du clip en secondes. Un nœud mathématique convertit votre durée en images et aligne tranquillement le décompte sur la cadence requise par H3, de sorte que vous n'avez pas besoin de gérer les mathématiques des images.

2) Chargez H3, l'encodeur de texte, les VAE et Turbo LoRA#

UNETLoader (#127) charge le modèle de diffusion MiniMax H3, et CLIPLoader (#128) charge l'encodeur de texte Qwen3‑VL adapté pour H3. Deux nœuds VAELoader apportent le VAE vidéo (#119) et le VAE audio (#120). LoraLoaderModelOnly (#153) applique le Turbo 4-step LoRA au modèle afin que le planificateur et l'échantillonneur fonctionnent dans un régime rapide sans perdre la cohérence audiovisuelle.

3) Construisez le conditionnement et le latent audiovisuel initial#

MiniMaxH3ImageToVideo (#131) transforme votre invite en conditionnement positif et prépare un latent initial aligné à votre largeur, hauteur et nombre d'images choisis. Les entrées optionnelles first_frame et last_frame existent pour ancrer une image de début ou de fin si vous choisissez d'étendre le graphe plus tard. Le nœud produit le conditionnement et le latent que l'échantillonnage en aval affinera.

4) Échantillonnez avec Turbo#

BasicGuider (#126) associe le modèle à votre conditionnement, KSamplerSelect (#123) choisit l'algorithme d'échantillonnage, et BasicScheduler (#124) définit le programme d'étapes qui fonctionne avec le Turbo LoRA. RandomNoise (#129) ensemence la génération pour la reproductibilité. SamplerCustomAdvanced (#125) effectue le passage de débruitage pour produire le latent partagé final qui encode à la fois la vidéo et l'audio.

5) Décodez et exportez le clip final#

VAEDecode (#122) reconstruit les images à partir du latent tandis que VAEDecodeAudio (#121) reconstruit l'audio stéréo synchronisé. CreateVideo (#130) multiplexe les images et l'audio en un seul flux, puis SaveVideo (#92) écrit le fichier sur le disque en utilisant le préfixe de nom de fichier que vous avez défini.

Nœuds clés dans le workflow Comfyui MiniMax H3 ComfyUI Texte-à-Vidéo Turbo 4 étapes#

MiniMaxH3ImageToVideo (#131)#

Produit le conditionnement positif et initialise le latent audiovisuel à partir de votre invite, résolution et durée. Ajuster width, height ou length change à la fois l'échelle du mouvement et combien d'action peut tenir à l'écran. Si vous étendez le graphe plus tard, first_frame et last_frame vous permettent de verrouiller la continuité entre les plans.

LoraLoaderModelOnly (#153)#

Applique le Turbo 4-step LoRA au modèle H3 chargé. Gardez le planificateur dans un régime de faible étape pour bénéficier de Turbo ; augmenter substantiellement les étapes éloigne l'apparence du comportement d'itération rapide prévu. Ce LoRA est spécialement conçu pour MiniMax H3 et se trouve aux côtés des poids principaux dans le référentiel H3.

BasicScheduler (#124)#

Contrôle le programme de débruitage que l'échantillonneur suit. Utilisez-le pour équilibrer la vitesse et la fidélité tout en restant compatible avec le Turbo LoRA. Si vous changez l'algorithme d'échantillonnage, revisitez le choix du programme pour maintenir un mouvement stable et un son clair.

SamplerCustomAdvanced (#125)#

Exécute le débruitage réel donné le bruit, le guide, l'échantillonneur, les sigmas et le latent initial. C'est l'arbitre final de la texture, du timing et de la netteté audiovisuelle. Utilisez la même graine lors de la comparaison des ajustements d'invite pour pouvoir attribuer les différences aux changements de texte plutôt qu'au bruit.

PathchSageAttentionKJ (#150)#

Applique une optimisation de l'attention avant l'injection LoRA pour améliorer le débit sur de grandes résolutions. Fournie par KJNodes, qui offre des aides à la performance pour ComfyUI. Référentiel : ComfyUI-KJNodes.

CreateVideo (#130)#

Combine les images décodées avec l'audio décodé en un clip synchronisé. Vous pouvez changer le taux d'images ou la profondeur de bits ici si vous avez besoin de correspondre aux spécifications de livraison. Le nœud maintient la synchronisation audio-vidéo dérivée du latent partagé.

SaveVideo (#92)#

Écrit le clip rendu sur le disque avec le préfixe de nom de fichier, le conteneur et le codec que vous avez choisis. Utilisez un nommage cohérent pour suivre les itérations pour la même scène et graine.

Extras optionnels#

  • Incitation pour le discours : mettez la ligne exacte après "Audio :" et décrivez l'âge, le sexe, le ton et le rythme de la voix. Pour le chant, spécifiez le style et le tempo. Pour l'ambiance, listez les sources, l'intensité et si vous souhaitez uniquement un fond sonore.
  • Compromis de résolution et de durée : des comptes de pixels plus élevés et des clips plus longs coûtent plus de temps d'échantillonnage. Si vous avez besoin de nombreuses prises, commencez plus petit, puis mettez à l'échelle ou prolongez une fois que le timing et la livraison semblent corrects.
  • Reproductibilité : conservez la même graine lors de l'ajustement du texte uniquement pour pouvoir comparer les petites modifications d'invite.
  • L'alignement de la durée est automatique : le graphe convertit les secondes en images et aligne le décompte sur la cadence interne de H3 pour une synthèse audiovisuelle stable.
  • Options de continuité : le nœud de modèle expose les options first_frame et last_frame. Si vous étendez le workflow plus tard, connectez des images là pour correspondre aux débuts ou fins de plans à travers les modifications.
  • Sécurité : évitez les personnages protégés par le droit d'auteur, les ressemblances de personnes réelles sans consentement, et les logos ou sous-titres à l'écran dans votre invite.

Remerciements#

Ce workflow implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement MiniMax pour le modèle de génération multimodale MiniMax H3 et l'annonce, Comfy.org pour le tutoriel de workflow ComfyUI MiniMax H3, et Comfy-Org pour les poids du modèle MiniMax-H3 pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation et aux référentiels originaux liés ci-dessous.

Ressources#

Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences respectives et aux conditions fournies par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.