ComfyUI>Workflows>MiniMax H3 Référence à Vidéo ComfyUI | Stéréo

MiniMax H3 Référence à Vidéo ComfyUI | Stéréo

Workflow Name: RunComfy/MiniMax-H3-Ref2Video
Workflow ID: 0000...1473
Transformez deux références en un clip cinématographique. Maintenez la cohérence de vos personnages. Générez de l'audio stéréo natif avec la vidéo. Utilisez des balises d'image exactes pour le contrôle des invites. Testez rapidement des scènes stylisées. Créez des concepts audio-visuels polis avec un graphe MiniMax H3 Ref2VA.

MiniMax H3 Reference to Video ComfyUI Workflow

MiniMax H3 Ref to Video in ComfyUI | Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 Reference to Video ComfyUI Examples

MiniMax H3 Référence à Vidéo ComfyUI : workflow audio stéréo natif Ref2VA#

Ce workflow MiniMax H3 Référence à Vidéo ComfyUI prêt à l'emploi dans RunComfy transforme des images de référence connectées en une courte vidéo cinématographique avec audio stéréo natif généré conjointement. Construit à partir du modèle Référence-à-Vidéo de Comfy.org et vérifié avec les poids MiniMax-H3 ouverts de Comfy-Org, il est idéal pour des prises de vue cohérentes avec les personnages, des tests de scènes stylisées et des clips conceptuels où le libellé des invites et les balises comme <Picture 1> et <Picture 2> sont importants.

Prêt à l'emploi, le graphe connecte deux références d'image et une invite libre pour produire une vidéo avec son synchronisé en une seule passe. Le nœud principal expose également des entrées facultatives pour plus d'images de référence, des vidéos de référence avec leur audio, et des références audio autonomes, afin que vous puissiez ajuster la force du conditionnement selon vos besoins. Si vous souhaitez un point de départ aligné avec le design original, consultez le fichier modèle Comfy.org sur GitHub video_minimax_h3_r2v.json.

Modèles clés dans le workflow MiniMax H3 Référence à Vidéo ComfyUI#

  • Poids de diffusion Comfy-Org/MiniMax-H3 (Ref2VA) : Le cœur génératif spécialisé pour la référence-à-vidéo-et-audio, utilisé via UNETLoader. Il apprend à partir de références textuelles et visuelles/audio pour produire un seul latent qui transporte à la fois la vidéo et l'audio stéréo. Carte du modèle et fichiers
  • VAE Vidéo MiniMax H3 (FP16) : Décode la moitié vidéo du latent conjoint en images avec une haute fidélité visuelle. minimax_h3_video_vae_fp16.safetensors
  • VAE Audio MiniMax H3 (FP32) : Décode la moitié audio du latent conjoint en onde stéréo native. minimax_h3_audio_vae_fp32.safetensors
  • Encodeur texte-image Qwen3-VL 32B MiniMax-H3 (AWQ) : Encode votre invite plus les balises de référence et les tokens visuels pour le conditionnement. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Comment utiliser le workflow MiniMax H3 Référence à Vidéo ComfyUI#

Ce workflow dirige vos références et invite dans le cœur Ref2VA de MiniMax H3, échantillonne un seul latent qui contient à la fois la vidéo et l'audio, puis décode et fusionne le résultat dans un MP4 avec son synchronisé. Les groupes ci-dessous sont mappés au graphe pour que vous puissiez voir quoi changer et pourquoi.

Entrées Utilisateur#

Utilisez LoadImage (#137) et LoadImage (#139) pour fournir deux références visuelles. L'invite va dans Input Text (Prompt) (#138); référez-vous à chaque entrée explicitement par balise dans l'ordre où vous les avez connectées, par exemple <Picture 1> et <Picture 2>, avant de décrire la scène, le mouvement et le son. Définissez votre aspect cible et le nombre de pixels dans Resolution Selector (Size) (#115). Choisissez la durée de la vidéo en secondes avec Float (Duration) (#132); elle est automatiquement convertie en une longueur de trame valide par ComfyMathExpression (#131) pour que l'audio et la vidéo restent alignés.

Modèles#

UNETLoader (#127) charge les poids de diffusion MiniMax H3 Ref2VA qui pilotent la génération. CLIPLoader (#128) charge l'encodeur Qwen3-VL 32B utilisé pour tokeniser votre texte et vos balises de référence. Deux nœuds VAELoader (#119 vidéo, #120 audio) fournissent les décodeurs appariés qui décompresseront plus tard le latent conjoint en images et audio stéréo. Ces modèles sont les seuls actifs que vous devez échanger lors de la migration vers différentes variantes MiniMax H3 au sein de la même famille de tâches.

Conditionnement#

MiniMaxH3ReferenceToVideo (#136) est le cœur du pipeline. Il accepte votre invite textuelle, largeur, hauteur, et la longueur calculée (images), plus toutes les ref_images, ref_videos connectées et les références audio facultatives. Le nœud émet un flux de conditionnement positif pour le guidage et un latent initialisé qui ancre l'identité, la composition, le mouvement, et le design sonore selon vos références et balises. Pour la fidélité d'identité à partir d'images, connectez des références bien éclairées, sur-modèle et référencez-les précisément dans l'invite; pour le mouvement ou le rythme, vous pouvez ajouter des références vidéo avec ou sans leur audio.

Échantillonnage#

RandomNoise (#129) initialise le processus, tandis que KSamplerSelect (#123) choisit la variante d'échantillonneur et BasicScheduler (#124) définit le calendrier des étapes. BasicGuider (#126) applique le conditionnement produit par le nœud MiniMax H3, et SamplerCustomAdvanced (#125) effectue les étapes de débruitage réelles pour faire évoluer le latent audio+vidéo conjoint. Les choix ici échangent principalement la vitesse contre la fidélité et l'adhérence à la référence; gardez les valeurs par défaut pour commencer, puis expérimentez une fois que vous avez un aspect et un son de base.

Décodage et création de vidéo#

Le latent conjoint de l'échantillonneur va à VAEDecode (#122) pour les images et VAEDecodeAudio (#121) pour le son stéréo. CreateVideo (#130) fusionne les images et l'audio décodés en un flux lisible, et SaveVideo (#92) écrit le fichier final dans votre dossier de sortie. Comme la vidéo et l'audio ont été générés ensemble, le timing est cohérent sans aucun alignement postérieur ou TTS externe.

Nœuds clés dans le workflow MiniMax H3 Référence à Vidéo ComfyUI#

MiniMaxH3ReferenceToVideo (#136) Ce nœud compose des références textuelles, visuelles et audio facultatives dans le conditionnement Ref2VA de MiniMax H3 et un latent initial qui "connaît" déjà l'identité, le style, le mouvement, et le son. Utilisez des balises de référence exactes dans votre invite qui correspondent à l'ordre de connexion, et choisissez ref_image_size en fonction de votre objectif : itérations plus rapides lors de la correspondance de la résolution de génération, identité plus forte en gardant des tokens de référence plus grands. Pour des prises de vue plus longues, privilégiez des descriptions claires de scène et d'action afin que le modèle puisse maintenir la continuité.

Resolution Selector (Size) (#115) Contrôle l'aspect cible et le nombre de pixels que tout le graphe respectera. Choisissez une forme qui correspond à la manière dont vous présenterez le clip et équilibrez le détail avec le débit afin que vous puissiez itérer rapidement. Des résolutions plus élevées augmentent la VRAM et le temps mais préservent mieux les caractéristiques fines de vos références.

ComfyMathExpression (#131) Convertit une durée en secondes visible par l'utilisateur en un nombre d'images que l'échantillonneur et le décodeur apprécient. L'expression se fixe à un minimum raisonnable et s'aligne sur une étape conviviale en interne pour que la vidéo et l'audio restent synchronisés. Ne modifiez que l'entrée en secondes; le nœud gère les calculs.

KSamplerSelect (#123) et BasicScheduler (#124) Ensemble, ils déterminent le chemin de débruitage. Commencez avec l'échantillonneur et le calendrier fournis pour une adhérence robuste à la référence; si votre prise de vue dérive ou semble peu détaillée, testez un calendrier alternatif ou une famille d'échantillonneurs légèrement différente et comparez les résultats côte à côte.

Extras optionnels#

  • Gardez les invites concrètes et axées sur la référence : commencez par des balises comme <Picture 1> et <Picture 2>, puis décrivez le type de prise de vue, le mouvement, l'éclairage, et les sons attendus.
  • Pour une identité plus forte à partir d'images, augmentez la fidélité de référence en utilisant le mode de taille de référence plus grande; pour un développement plus rapide du look, utilisez le mode de taille assortie.
  • Si vous ne connectez aucune référence audio, MiniMax H3 synthétisera l'audio stéréo natif uniquement à partir de l'invite; décrivez l'ambiance, le bruitage, et le ton de la voix pour le guider.
  • Ajoutez une courte vidéo de référence lorsque vous vous souciez le plus du rythme du mouvement ou du comportement de la caméra; ajoutez son audio associé lorsque vous souhaitez que ce caractère sonore soit intégré dans la génération.
  • Itérez d'abord à une résolution et une durée modestes, puis augmentez une fois que le timing, l'identité, et la composition tiennent ensemble.

Références#

Remerciements#

Ce workflow implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Comfy-Org pour le modèle de workflow MiniMax H3 R2V ComfyUI et le tutoriel MiniMax H3, MiniMax pour le modèle MiniMax H3 et l'annonce officielle, et Comfy-Org pour les poids du modèle MiniMax-H3 pour leurs contributions et leur maintenance. Pour des détails faisant autorité, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.

Ressources#

Note : L'utilisation des modèles, ensembles de données, et du code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.