Minimax H3 I2V Dual Clock 8-Step Haute Qualité Ultra-Rapide#
Ce flux de travail ComfyUI prêt pour RunComfy transforme une image de référence unique et une invite combinée de mouvement et d'audio en une vidéo courte synchronisée avec un son stéréo natif. Construit autour du conditionnement MiniMax H3 Ref2VA et d'un échantillonneur Dual Clock en 8 étapes, il offre une animation d'image rapide et un son étroitement couplé sans sacrifier la cohérence visuelle.
Utilisez le flux de travail Minimax H3 I2V Dual Clock 8-Step Haute Qualité Ultra-Rapide pour l'animation d'images cinématographiques, les performances de personnages, les prises de produits, les scènes atmosphériques qui bénéficient d'un mouvement synchronisé et d'un audio généré. Le graphe intègre SageAttention pour une inférence efficace en mémoire et le MiniMax-H3 Turbo LoRA pour une génération accélérée tout en gardant l'expérience I2V facile à utiliser.
Modèles clés dans le flux de travail Comfyui Minimax H3 I2V Dual Clock 8-Step Haute Qualité Ultra-Rapide#
- Modèle de Fondation MiniMax-H3 AV. Le transformateur audiovisuel principal qui alimente le conditionnement de l'image de référence, la génération de mouvement et la synthèse audio native. Voir la carte modèle officielle sur Hugging Face : MiniMaxAI/MiniMax-H3.
- MiniMax-H3 Turbo LoRA V4 step600. Un adaptateur léger qui accélère et stabilise MiniMax-H3 pour l'échantillonnage en 8 étapes tout en préservant la fidélité. Carte modèle : larryvrh/MiniMax-H3-Turbo-Lora.
- MiniMax-H3 Video VAE et Audio VAE. Décodeurs jumelés qui convertissent les latents audiovisuels en images RGB et en formes d'onde stéréo. Ils assurent un transport latent efficace pendant l'échantillonnage et un décodage de haute qualité à la fin.
Comment utiliser le flux de travail Comfyui Minimax H3 I2V Dual Clock 8-Step Haute Qualité Ultra-Rapide#
Ce flux de travail fonctionne de gauche à droite en trois étapes groupées : configuration du modèle et des actifs, échantillonnage à double horloge, et décodage plus multiplexage MP4. Vous fournissez une image de référence et une seule invite qui comprend à la fois la direction visuelle et une section "Audio:" décrivant le son souhaité.
Chargeurs H3 + Turbo LoRA (EMA)#
Ce groupe prépare la pile MiniMax-H3 et applique le Turbo LoRA pour la vitesse. Chargez votre image de référence dans LoadImage, puis écrivez une invite de mouvement descriptive qui se termine par une clause "Audio: ..." dans CR Prompt Text. Choisissez votre taille de sortie à l'aide de ResolutionSelector, qui maintient les dimensions alignées sur des multiples de 32 pour la stabilité vidéo. Définissez votre durée cible en secondes avec le contrôle Float (duration) ; le calcul interne du graphe la convertit en un nombre de frames aligné sur le timing du modèle pour que l'échantillonneur fonctionne sans accroc. Un patch SageAttention est appliqué au modèle pour réduire l'utilisation de la VRAM et améliorer le débit sans changer l'apparence finale.
STABLE : vidéo 4 / audio 4#
Ce groupe effectue le cœur de la génération avec un échantillonneur MiniMax H3 Dual Clock en 8 étapes. Le bloc de conditionnement utilise Ref2VA pour fusionner votre image de référence et votre texte d'invite en un latent AV, qui ancre l'identité, la composition et les indices sonores de haut niveau. L'échantillonneur Dual Clock avance la vidéo et l'audio avec des horloges séparées mais synchronisées pour que le mouvement et le son semblent naturellement verrouillés. Si vous devez corriger un décalage perçu, ajustez les décalages d'horloge vidéo et audio pour avancer ou reculer l'un ou l'autre flux jusqu'à ce que la performance s'enclenche en synchronisation. Un guide de style CFG de base équilibre la fidélité à votre invite avec les acquis du modèle pour un mouvement cinématographique propre.
Décoder + MP4 synchronisé#
Le décodeur convertit le latent AV final en une séquence de frames et une piste audio stéréo à l'aide des VAE MiniMax-H3 dédiés. L'étape VHS_VideoCombine emballe les frames et l'audio en un seul MP4 H.264 à votre fréquence d'images choisie, enregistrant une vidéo prête à être partagée. Si vous apportez votre propre audio plus tard, vous pouvez ajuster à la longueur audio ou exporter uniquement l'image pour un montage externe. Le résultat est un clip compact et synchronisé qui préserve l'apparence de votre image de référence tout en ajoutant un mouvement et un son réalistes.
Nœuds clés dans le flux de travail Comfyui Minimax H3 I2V Dual Clock 8-Step Haute Qualité Ultra-Rapide#
MiniMaxH3AudioConditioningT8 (#6)#
Ce nœud implémente le conditionnement Ref2VA, prenant votre invite, image de référence, largeur cible, hauteur et longueur pour créer un latent audiovisuel et un conditionnement positif. Utilisez-le pour définir l'intention créative : décrivez le mouvement, le comportement de la caméra et la continuité de la scène, puis ajoutez un segment "Audio:" qui spécifie les instruments, le timbre, l'ambiance et la dynamique. Gardez la largeur et la hauteur cohérentes avec l'aspect de votre image de référence pour les mises en page les plus cohérentes. Le contrôle de la longueur mappe votre durée en frames alignées avec le timing interne de l'échantillonneur, ce qui aide à maintenir un mouvement fluide et un audio stable. Fourni par le projet ComfyUI MiniMax H3 Turbo : Larryvrh/ComfyUI-MiniMax-H3-Turbo.
MiniMaxH3DualClockSamplerT8 (#7)#
Un échantillonneur en 8 étapes conçu spécifiquement pour la génération AV MiniMax-H3 avec des horloges vidéo et audio séparées. Il produit des résultats rapides et de haute qualité en coordonnant les deux lignes de temps tout en respectant vos contraintes Ref2VA. Si les visuels semblent légèrement en avance ou en retard par rapport au rythme ou à l'action, ajustez les décalages d'horloge vidéo et audio par petits incréments pour recentrer la synchronisation. Gardez le nombre d'étapes à huit pour l'équilibre Haute Qualité Ultra-Rapide prévu. Implémenté dans le même plugin : Larryvrh/ComfyUI-MiniMax-H3-Turbo.
LoraLoaderBypassModelOnly (#2)#
Injecte le MiniMax-H3 Turbo LoRA dans le modèle de base pour accélérer la convergence et améliorer la stabilité à faible nombre d'étapes. Si vous remarquez un sur-affinement ou une dérive d'identité sur certaines images, réduisez légèrement la force du LoRA pour retrouver de la neutralité. Pour des détails plus percutants ou un verrouillage temporel plus fort, augmentez la force avec modération. Référence LoRA : larryvrh/MiniMax-H3-Turbo-Lora.
MiniMaxH3MemoryEfficientSageAttentionPatch (#17)#
Applique une implémentation d'attention efficace en mémoire au modèle MiniMax-H3 pour un meilleur débit sur les GPU typiques. Utilisez-le tel quel pour réduire la pression sur la VRAM à des résolutions plus grandes et des durées plus longues. Le patch fait partie de la suite KJNodes pour ComfyUI : kijai/ComfyUI-KJNodes.
MiniMaxH3AVDecodeT8 (#11)#
Décode le latent audiovisuel en frames RGB et audio stéréo à l'aide des VAE MiniMax-H3 jumelés. C'est là que la fidélité finale est réalisée, donc gardez les choix de résolution réalistes pour votre GPU afin d'éviter les goulots d'étranglement de décodage. Le nœud produit des frames et un signal audio qui sont alignés dans le temps avec les horloges de l'échantillonneur, prêts pour le multiplexage. Fourni par le plugin MiniMax H3 Turbo : Larryvrh/ComfyUI-MiniMax-H3-Turbo.
VHS_VideoCombine (#12)#
Combine les frames décodées et l'audio stéréo en un seul MP4 à l'aide de Video Helper Suite. Définissez votre fréquence d'images préférée et activez la découpe si vous remplacez plus tard l'audio personnalisé. Ce nœud finalise la livraison pour que vous puissiez prévisualiser et exporter rapidement. Référence du projet : Kosinkadink/ComfyUI-VideoHelperSuite.
Extras optionnels#
- Le prompt fonctionne mieux lorsque vous séparez la direction visuelle et le design sonore. Écrivez d'abord la scène, puis ajoutez "Audio:" avec des instruments, un style, un type de pièce et une intensité.
- Commencez avec des tailles modérées qui correspondent à l'aspect de votre image. Augmentez une fois que vous aimez le mouvement et le timing.
- Si la synchronisation semble décalée, ajustez le décalage d'horloge vidéo ou audio au lieu de changer la durée. De petits ajustements peuvent verrouiller la performance au rythme.
- Pour les prises de personnages, choisissez des images avec une séparation nette du sujet et un éclairage cohérent pour préserver l'identité à travers le mouvement.
- Re-semez pour explorer les micro-variations dans les formulations et le timing tout en gardant la même configuration.
Remerciements#
Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement RunningHub pour le modèle de flux de travail Source, MiniMaxAI pour les poids de modèle MiniMax-H3, et Larryvrh pour MiniMax-H3 Turbo LoRA et le projet ComfyUI MiniMax H3 Turbo pour leurs contributions et maintenances. Pour des détails autorisés, veuillez vous référer à la documentation originale et aux référentiels ci-dessous.
Ressources#
- Modèle de flux de travail RunningHub/Source
- Docs / Notes de version : Modèle de flux de travail Source
- Poids de modèle MiniMaxAI/MiniMax H3
- Hugging Face : MiniMaxAI/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- Hugging Face : larryvrh/MiniMax-H3-Turbo-Lora
- Projet Larryvrh/ComfyUI MiniMax H3 Turbo
- GitHub : Larryvrh/ComfyUI-MiniMax-H3-Turbo
Note : L'utilisation des modèles, ensembles de données et codes référencés est soumise aux licences et termes respectifs fournis par leurs auteurs et mainteneurs.


