ComfyUI>Workflows>MiniMax H3 T2V ComfyUI - Générateur AI Text-to-Video

MiniMax H3 T2V ComfyUI - Générateur AI Text-to-Video

Workflow Name: RunComfy/MiniMax-H3-T2V
Workflow ID: 0000...1472
Transformez un seul prompt en une scène vidéo complète. Vous obtenez un mouvement cinématographique et un son stéréo natif ensemble. Créez des dialogues, du chant ou des plans conceptuels. Le graph text-to-video MiniMax H3 garde l'audio synchronisé. Vous pouvez tester des idées plus rapidement. Exécutez-le prêt à l'emploi sur RunComfy.

MiniMax H3 T2V ComfyUI Workflow

MiniMax H3 T2V ComfyUI - Video and Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 T2V ComfyUI Examples

MiniMax H3 T2V ComfyUI : prompt-à-vidéo avec audio stéréo natif#

MiniMax H3 T2V ComfyUI transforme un seul prompt en une vidéo cinématographique courte avec audio stéréo synchronisé. Construit à partir du modèle officiel de Comfy.org et des poids ouverts MiniMax-H3 de Comfy-Org, il suit le chemin FL2VA pour que le mouvement et le son soient générés ensemble, sans être assemblés après coup. Il est idéal pour des explorations rapides de scènes basées sur des prompts, des clips de dialogue ou de chant, et des plans conceptuels nécessitant à la fois des visuels et du son en une seule passe.

Décrivez les plans, la caméra, la performance et les indications audio en un bloc, choisissez la taille et la durée, puis mettez en file d'attente le graph. Le workflow charge les composants MiniMax-H3 corrects, échantillonne les latents audio-visuels conjoints, les décode en images et audio stéréo, multiplexe le résultat, et enregistre un fichier vidéo terminé.

Modèles clés dans le workflow Comfyui MiniMax H3 T2V ComfyUI#

  • Modèle de diffusion MiniMax-H3 FL2VA. Le cœur UNet qui effectue le débruitage audio-vidéo conjoint pour que le mouvement et le son restent alignés en phase. Poids fournis par Comfy-Org sous diffusion_models. Fichiers du modèle
  • MiniMax-H3 Video VAE. Encode et décode les latents visuels en images RGB, préservant le détail cinématographique et la continuité du mouvement. minimax_h3_video_vae_fp16.safetensors
  • MiniMax-H3 Audio VAE. Encode et décode les latents audio en une onde stéréo alignée dans le temps pour chaque clip. minimax_h3_audio_vae_fp32.safetensors
  • Encodeur de texte Qwen3-VL 32B (AWQ pour MiniMax-H3). Interprète le prompt en conditionnement couvrant la sémantique de la scène, le timing et l'intention audio. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Si vous souhaitez comparer le modèle original sur lequel ce graph se base, consultez la référence Comfy.org. Template JSON

Comment utiliser le workflow Comfyui MiniMax H3 T2V ComfyUI#

À un niveau élevé, vous définissez la résolution cible et la durée, écrivez un seul prompt qui inclut à la fois des visuels et de l'audio, ajoutez éventuellement les premières et dernières images, puis exécutez. À l'intérieur du sous-graph, MiniMax-H3 crée des latents vidéo et audio synchronisés, qui sont décodés, joints en un film de 24 fps, et enregistrés.

ResolutionSelector (#115)#

Choisissez un rapport d'aspect et une échelle pour définir width et height. Le sélecteur arrondit à des multiples efficaces de 32 et transmet ces valeurs au sous-graph MiniMax-H3, vous n'avez donc pas besoin de calculer les dimensions manuellement. Commencez avec des tailles modérées pour une itération plus rapide, puis augmentez lorsque votre prompt est correct. Changer le rapport d'aspect est un levier créatif puissant pour les bandes-annonces, les clips verticaux, et les aperçus carrés.

Image to Video (MiniMax H3) (#105)#

Ce sous-graph orchestre le pipeline MiniMax H3 T2V ComfyUI. Collez un prompt cohérent qui décrit ensemble les plans, les montages, et la bande sonore, et fournissez éventuellement les images first_frame et last_frame pour ancrer l'entrée et la sortie. Définissez une duration conviviale et le graph la convertit en un nombre de frames valide pour le modèle. Le sous-graph renvoie des latents audio-visuels synchronisés qui procèdent au décodage et au multiplexage.

Groupe de modèles#

Le groupe de modèles charge les composants MiniMax-H3 exacts pour ce workflow. UNETLoader (#6) tire le modèle de diffusion FL2VA, CLIPLoader (#13) charge l'encodeur Qwen3-VL, et deux nœuds VAELoader (#11 vidéo, #24 audio) préparent les décodeurs. Ceux-ci sont pointés vers les fichiers MiniMax-H3 de Comfy-Org afin que vous puissiez fonctionner sans câblage manuel. Garder les modèles centralisés ici rend les échanges ou mises à niveau futurs simples.

Groupe de conditionnement#

MiniMaxH3ImageToVideo (#104) transforme votre prompt, les first_frame et last_frame optionnels, et les width, height, et length sélectionnés en conditionnement MiniMax-H3 plus un latent initial. L'idée est de laisser le modèle lire à la fois le contenu de la scène et l'intention audio en même temps, ce qui conduit à une synchronisation plus serrée. Si vous fournissez des frames de référence, l'entrée et la sortie sont guidées pour la continuité ; si vous les laissez vides, la génération commence à froid.

Groupe d'échantillonnage#

L'échantillonnage est géré par RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16), et le principal SamplerCustomAdvanced (#14). Ensemble, ils débruitent le latent conjoint afin que le mouvement de l'image et les événements sonores se développent en synchronisation. Vous pouvez relancer avec une nouvelle graine pour des prises alternatives tout en gardant la même direction créative. Une fois à l'aise, expérimenter avec le choix de l'échantillonneur ou le programme peut légèrement changer l'énergie du mouvement et la texture sonore.

Décodage et création de groupe vidéo#

VAEDecode (#10) reconstruit la séquence d'images à partir du latent vidéo, et VAEDecodeAudio (#23) reconstruit une onde stéréo à partir du latent audio. CreateVideo (#91) multiplexe les images et l'audio en un clip fini à 24 fps. C'est là que les coupes nettes et les rythmes spécifiés dans le prompt se conjuguent dans la chronologie. La sortie procède à l'enregistrement.

SaveVideo (#92)#

Écrit la vidéo finale dans votre sortie ComfyUI sous video/MiniMax_H3. Le nœud utilise un nommage automatique pour que vous puissiez itérer rapidement, et vous pouvez changer le chemin pour garder différents projets séparés. La sortie contient à la fois l'image générée et l'audio stéréo.

Nœuds clés dans le workflow Comfyui MiniMax H3 T2V ComfyUI#

MiniMaxH3ImageToVideo (#104)#

Nœud de conditionnement central pour MiniMax-H3 qui accepte prompt, les first_frame et last_frame optionnels, plus width, height, et length. Gardez les prompts concis mais cinématographiques, et incluez des indices audio comme l'ambiance, les SFX, le dialogue, et les hits musicaux dans le même bloc de texte. Utilisez des frames de référence lorsque vous avez besoin d'une entrée ou d'une sortie spécifique ; omettez-les pour une mise en scène plus libre.

ComfyMathExpression (#107)#

Mappe une duration lisible par l'humain en secondes à la length entière que le modèle attend, en s'alignant sur la grille de frames du modèle pour un timing propre. Réglez le flottant sur votre longueur de clip prévue et laissez le nœud gérer la conversion. Les clips légèrement plus courts tendent à préserver un mouvement net et une synchronisation sonore à des résolutions plus élevées.

SamplerCustomAdvanced (#14)#

Conduit le processus de débruitage basé sur l'échantillonneur sélectionné et le programme. Utilisez une noise_seed fixe pour verrouiller une prise pour comparaison, puis changez uniquement la graine pour explorer de nouvelles variations. Si le mouvement semble trop chaotique ou trop rigide, essayez un échantillonneur différent dans KSamplerSelect (#17) ou ajustez le programme dans BasicScheduler (#9).

CreateVideo (#91)#

Combine les frames décodées et l'audio stéréo en un seul flux vidéo à votre fréquence d'image choisie. Pour les montages rythmés, réglez le fps pour correspondre à la cadence décrite dans le prompt. Le nœud est également l'endroit où vous changeriez le fps si vous voulez une sensation plus lente ou plus rapide.

ResolutionSelector (#115)#

Un contrôle pour à la fois le rapport d'aspect et le nombre total de pixels, avec un arrondi automatique à des tailles adaptées au modèle. Choisissez d'abord l'aspect, puis ajustez l'échelle pour équilibrer vitesse et fidélité. Les plus grands canevas récompensent les prompts soigneux et les durées plus courtes.

SaveVideo (#92)#

Finalise le clip sur disque. Pointez-le vers un sous-dossier de projet pour garder les expérimentations organisées et renommez judicieusement lorsque vous atteignez une prise réussie.

Extras optionnels#

  • Écrivez les prompts comme de mini storyboards avec des indices temporels et des beats audio explicites pour une synchronisation fiable.
  • Incluez des mots d'intention audio comme vent, pas, foule, réverbération, ou instruments spécifiques pour orienter la bande sonore.
  • Ajoutez des lignes pour le dialogue ou le chant directement dans le prompt et notez le ton du locuteur.
  • Verrouillez une noise_seed lors de la comparaison de modifications de prompt, changez uniquement la graine lors de l'exploration de prises alternatives.
  • Utilisez first_frame et last_frame pour encadrer le mouvement lorsque vous avez besoin de continuité à travers les coupes ou d'une pose finale précise.

Remerciements#

Ce workflow implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Comfy-Org pour le modèle de workflow MiniMax H3 T2V et les poids du modèle MiniMax-H3, Comfy.org pour le tutoriel MiniMax H3, et MiniMax pour l'annonce officielle de MiniMax H3 pour leurs contributions et leur maintenance. Pour des détails autoritatifs, veuillez vous référer à la documentation et aux référentiels originaux liés ci-dessous.

Ressources#

Note : L'utilisation des modèles, ensembles de données, et du code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.