Rendu 3D IA avec MINIMAX H3 : Flux de travail ComfyUI d'argile à cinéma#
Ce graphique ComfyUI par Mickmumpitz transforme un rendu 3D "d'argile" gris en vidéo cinématographique entièrement texturée avec audio synchronisé optionnel. Il utilise l'animation originale comme structure, de sorte que la composition, la géométrie et le mouvement restent verrouillés tandis que le modèle ajoute des matériaux, de l'éclairage, des environnements et des détails photoréalistes.
Conçu pour les artistes 3D, les animateurs et les cinéastes, le rendu 3D IA avec MINIMAX H3 relie l'animation DCC et la génération de vidéos IA. Fournissez un passage d'argile à 24 fps pour le mouvement, une ou plusieurs "plaques de style" fixes pour le style, puis guidez le résultat avec un prompt concis et une chronologie. Le flux de travail produit une prise de vue polie et une comparaison côte à côte optionnelle pour un examen rapide.
Modèles clés dans le flux de travail ComfyUI 3D IA Rendering with MINIMAX H3#
- Modèle de diffusion MiniMax‑H3 ref2va. Le générateur vidéo principal qui suit une vidéo de référence pour la structure tout en synthétisant les images et l'audio ensemble. Utilisez la variante ref2va fournie pour ComfyUI : minimax_h3_ref2va_pruned_int8_convrot.safetensors. Model
- Encodeur de texte Qwen‑VL 32B pour MiniMax H3. Encode le prompt, les balises et la chronologie en un conditionnement compris par H3. Utilisez le fichier optimisé MiniMax qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors. Encoder
- MiniMax‑H3 Video VAE (fp16). Décode les latents vidéo en images RGB. VAE video
- MiniMax‑H3 Audio VAE (fp32). Décode les latents audio en son qui suit les visuels générés. VAE audio
- MiniMax‑H3 FL2VA 4‑step Turbo LoRA (optionnel). Accélère l'inférence et ajoute des détails percutants si désiré. LoRA
- MiniMax‑H3 pruned w4a8 mixed (base plus petite optionnelle). Une alternative de taille réduite si vous devez économiser de la VRAM. Alternative base
Comment utiliser le flux de travail ComfyUI 3D IA Rendering with MINIMAX H3#
En un coup d'œil, la vidéo d'argile définit le mouvement, les images fixes définissent les matériaux et l'éclairage, et le prompt les relie ensemble. Le groupe de rendu alimente ces signaux dans MiniMax H3, puis le groupe de sortie décode les images et l'audio et enregistre vos résultats, y compris un comparateur côte à côte.
Groupe 1 — CHARGER LES MODÈLES MINIMAX H3#
Ce groupe prépare la pile de modèles pour le rendu 3D IA avec MINIMAX H3. UNETLoader (#8) charge les poids de diffusion MiniMax‑H3 ref2va, CLIPLoader (#9) charge l'encodeur de texte Qwen‑VL 32B, et deux nœuds VAELoader (#11 pour la vidéo, #13 pour l'audio) fournissent des décodeurs. Les petits assistants Set_* et Get_* mettent en cache ces composants pour réutilisation dans l'ensemble du graphique. Gardez les deux VAE actifs car MiniMax‑H3 peut produire image et son en une seule passe. Si vous passez à la variante plus petite Kijai, changez uniquement le fichier du modèle de diffusion.
Groupe 2 — VITESSE#
Cette zone accélère l'itération tout en préservant le verrouillage structurel de votre passage d'argile. LoraLoaderModelOnly (#16) applique le Turbo LoRA 4 étapes pour des aperçus plus rapides et plus nets. MiniMaxH3SigmaShift (#17) ajuste le calendrier pour convenir au LoRA et EasyCache (#18) évite le travail redondant entre les exécutions. Utilisez le LoRA pour un développement rapide ; si vous souhaitez une fidélité maximale ou une finition plus douce, contournez-le et rendez avec un calendrier multi-étapes dans le Groupe 5.
Groupe 3 — PARAMÈTRES#
Ici, le flux de travail dérive la toile la plus sûre pour le rendu 3D IA avec MINIMAX H3. MinimaxH3Resolution (#121) lit une image de référence pour proposer la largeur et la hauteur sur la grille native de H3, évitant les déformations et le scintillement temporel. Des contrôles légers maintiennent les étapes et la graine, tandis que PreviewAny (#122) reflète la résolution active pour une vérification rapide. La longueur est calculée une fois et stockée pour que l'image et l'audio restent alignés tout au long du pipeline. Pour des reprises reproductibles, gardez une graine fixe.
Groupe 4 — ENTRÉE#
Importez votre rendu d'argile à 24 fps avec VHS_LoadVideo (#30). Le flux de travail ajuste la longueur de la prise de vue à la grille de trames interne de H3 pour que le timing reste stable ; coupez ou complétez votre source à la longueur valide la plus proche si vous avez besoin de chaque trame. Ajoutez une à trois plaques de style avec LoadImage (#36, #38, #40). Une plaque de style est une photo ou une image conceptuelle représentant les matériaux, la couleur et l'éclairage finaux ; ce n'est pas une trame de la vidéo d'argile et cela ne change pas la mise en page. Chargez éventuellement un fichier audio externe avec LoadAudio (#34) si vous souhaitez que la voix ou le bruitage soient intégrés dans la génération. Si vous prévoyez de générer de la parole, vous connecterez cet audio au nœud de rendu dans le Groupe 5.
Groupe 5 — RENDU#
Exprimez votre intention dans le PROMPT (#44). Conservez les balises <Video 1> pour le passage d'argile et <Picture 1> pour la première plaque de style, puis écrivez un texte de type instruction clair avec une Timeline: qui couvre l'ensemble du clip. Le cœur du rendu 3D IA avec MINIMAX H3 est MiniMaxH3ReferenceToVideo (#45), qui fusionne le prompt, les plaques de style, la vidéo d'argile et la voix optionnelle en conditionnement et un latent de départ. Ce latent passe à travers BasicGuider (#57), BasicScheduler (#58), KSamplerSelect (#59), RandomNoise (#60) et SamplerCustomAdvanced (#61) pour produire le latent vidéo final. La largeur, la hauteur et la longueur du Groupe 3 sont passées automatiquement afin que le mouvement généré et tout audio restent synchronisés avec votre référence.
Groupe 6 — SORTIE#
VAEDecode (#67) transforme le latent vidéo en images, et VAEDecodeAudio (#68) émet du son. AudioAdjustVolume (#69) fournit un simple réglage de niveau, puis CreateVideo (#70) multiplexe image et audio pour le fichier maître que SaveVideo (#71) écrit sur le disque. En parallèle, une branche de révision coupe et met à l'échelle le passage d'argile avec ImageFromBatch (#76) et ImageScale (#124), le coud côte à côte avec le résultat IA via ImageStitch (#77), puis exporte un clip de comparaison par CreateVideo (#78) et SaveVideo (#79). Cela facilite la validation que la géométrie, le cadrage et l'animation sont restés fidèles.
Nœuds clés dans le flux de travail ComfyUI 3D IA Rendering with MINIMAX H3#
MiniMaxH3Resolution (#121)#
Détermine une largeur et une hauteur sûres et natives à partir de votre référence afin que H3 atterrisse sur sa grille d'aspect. Changez le ratio d'aspect en changeant votre entrée d'argile plutôt qu'en forçant des tailles personnalisées. Si vous devez dévier, tenez-vous-en à des valeurs alignées sur la grille pour éviter le scintillement.
VHS_LoadVideo (#30)#
Ingeste le passage d'argile qui pilote la structure. Pour un verrouillage de mouvement fiable, fournissez une source à 24 fps et évitez le rééchantillonnage à l'intérieur du nœud. Si une dérive temporelle apparaît, réexportez votre passage d'argile à 24 fps et assurez-vous que la longueur ajustée du flux de travail correspond au clip.
MiniMaxH3ReferenceToVideo (#45)#
Le rendu central qui fusionne le prompt, les plaques de style, la vidéo de référence et la voix optionnelle en latents vidéo et audio. Gardez les balises <Video 1> et <Picture 1> dans le prompt pour que le modèle se lie aux bonnes entrées. Pour le dialogue, routez votre piste vocale dans l'entrée audio de la vidéo de référence du nœud afin que les mouvements des lèvres s'alignent avec la parole.
LoraLoaderModelOnly (#16)#
Applique le Turbo LoRA 4 étapes pour des aperçus rapides et nets. Utilisez-le pour l'exploration et les quotidiens. Lorsque vous avez besoin d'un look plus doux ou de l'ajustement le plus proche du passage d'argile, désactivez le LoRA et rendez avec un calendrier multi-étapes dans BasicScheduler (#58) et KSamplerSelect (#59).
BasicScheduler (#58) et KSamplerSelect (#59)#
Contrôle comment le bruit est supprimé au fil du temps, ce qui affecte la netteté de la texture, la fluidité du mouvement et la fidélité au passage d'argile. Les calendriers à faible nombre d'étapes se marient bien avec le Turbo LoRA pour la vitesse, tandis que les calendriers multi-étapes sans le LoRA mettent l'accent sur la précision et une finition plus douce. Si un résultat semble trop net, essayez une stratégie d'échantillonnage différente et plus d'étapes.
VAEDecodeAudio (#68)#
Décode le latent audio généré. Associez-le à AudioAdjustVolume (#69) si votre mix a besoin d'un changement de niveau rapide avant le multiplexage dans CreateVideo (#70). Pour un dialogue clair, complétez votre voix source à la longueur exacte du clip pour éviter les répétitions.
Extras optionnels#
- Plaques de style : Utilisez des images fixes de haute qualité qui capturent les matériaux, l'éclairage et la couleur. Elles sont des références de style, pas de mise en page. Ne pas utiliser une trame du passage d'argile comme plaque de style.
- Prompting : Écrivez des instructions, pas des interdictions. Des phrases comme "une prise continue" fonctionnent mieux que "pas de mouvement de caméra". Incluez une
Timeline:qui atteint la dernière trame pour que l'image et le son ne se terminent pas en queue de poisson. - Conseils audio : Pour la parole, connectez votre voix à l'entrée audio de la vidéo de référence du nœud de rendu. Complétez l'enregistrement avec du silence pour correspondre à la longueur ajustée du clip. Mettez la phrase parlée entre guillemets dans le prompt et mentionnez "une fois et une seule fois".
- Fréquence d'images : Exportez le passage d'argile à 24 fps. Un taux différent sera compressé dans le temps et le mouvement pourra dériver de votre animation originale.
- Grille de longueur : Le flux de travail ajuste la longueur à la grille de trames fixe de H3 pour la stabilité. Si vous avez besoin d'une durée exacte, coupez votre passage d'argile à la prochaine valeur de grille valide ou complétez votre audio en conséquence.
- Itération plus rapide : Gardez le Turbo LoRA activé pour le développement de style, utilisez l'exportation côte à côte intégrée pour évaluer la structure, puis passez à un calendrier multi-étapes pour les finales si vous préférez un rendu plus doux et plus fidèle.
- Nœuds utiles utilisés dans ce flux de travail : ComfyUI‑KJNodes, ComfyUI‑VideoHelperSuite, et ComfyUI‑Mickmumpitz‑Nodes.
Avec ces éléments en place, le rendu 3D IA avec MINIMAX H3 vous offre un chemin rapide et contrôlable de l'animation non texturée à des plans cinématographiques finis tout en préservant la mise en scène et le mouvement que vous avez créés dans votre outil 3D.
Remerciements#
Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Mickmumpitz pour le flux de travail du rendu 3D IA avec MINIMAX H3 et le guide pour leurs contributions et leur maintenance. Pour des détails autoritatifs, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.
Ressources#
- Mickmumpitz/3D AI Rendering with MINIMAX H3 Workflow Source
- Hugging Face: Comfy-Org/MiniMax-H3
- Docs / Release Notes: 3D AI Rendering with MINIMAX H3 Workflow Source
Note: L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

