ComfyUI>Workflows>MiniMax H3 Referenz zu Video ComfyUI | Stereo

MiniMax H3 Referenz zu Video ComfyUI | Stereo

Workflow Name: RunComfy/MiniMax-H3-Ref2Video
Workflow ID: 0000...1473
Verwandeln Sie zwei Referenzen in einen filmischen Clip. Halten Sie Ihre Charaktere konsistent. Erzeugen Sie natives Stereo-Audio mit dem Video. Verwenden Sie genaue Bild-Tags für die Prompt-Steuerung. Testen Sie stilisierte Szenen schnell. Erstellen Sie polierte Audio-Video-Konzepte mit einem MiniMax H3 Ref2VA-Graphen.

MiniMax H3 Reference to Video ComfyUI Workflow

MiniMax H3 Ref to Video in ComfyUI | Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 Reference to Video ComfyUI Examples

MiniMax H3 Referenz zu Video ComfyUI: native Stereo-Audio Ref2VA Workflow#

Dieser RunComfy-bereite MiniMax H3 Referenz zu Video ComfyUI-Workflow verwandelt verbundene Referenzbilder in ein kurzes filmisches Video mit gemeinsam erzeugtem nativem Stereo-Audio. Basierend auf der Comfy.org Referenz-zu-Video-Vorlage und verifiziert anhand der offenen Comfy-Org MiniMax-H3 Gewichte, ist es ideal für charakterkonsistente, referenzgetriebene Aufnahmen, stilisierte Szenentests und Konzeptclips, bei denen die Wortwahl und Tags wie <Picture 1> und <Picture 2> wichtig sind.

Out of the box, verdrahtet der Graph zwei Bildreferenzen und ein Freiform-Prompt, um ein Video mit synchronisiertem Sound in einem Durchgang zu erzeugen. Der Kernknoten bietet auch optionale Eingänge für mehr Referenzbilder, Referenzvideos mit ihrem Audio und eigenständige Audio-Referenzen, sodass Sie die Konditionierungsstärke nach Bedarf skalieren können. Wenn Sie einen Ausgangspunkt im Einklang mit dem Originaldesign wünschen, sehen Sie sich die Comfy.org-Vorlagendatei auf GitHub video_minimax_h3_r2v.json an.

Schlüsselmodelle im MiniMax H3 Referenz zu Video ComfyUI Workflow#

  • Comfy-Org/MiniMax-H3 Diffusionsgewichte (Ref2VA): Der generative Kern, spezialisiert auf Referenz-zu-Video-und-Audio, verwendet via UNETLoader. Es lernt aus Text- und visuellen/Audio-Referenzen, um ein einzelnes Latent zu erzeugen, das sowohl Video als auch Stereo-Audio trägt. Model card and files
  • MiniMax H3 Video VAE (FP16): Dekodiert die Videohälfte des gemeinsamen Latents zu Frames mit hoher visueller Treue. minimax_h3_video_vae_fp16.safetensors
  • MiniMax H3 Audio VAE (FP32): Dekodiert die Audiohälfte des gemeinsamen Latents zu nativem Stereo-Wellenform. minimax_h3_audio_vae_fp32.safetensors
  • Qwen3-VL 32B MiniMax-H3 Text-Bild-Encoder (AWQ): Kodiert Ihr Prompt plus Referenztags und visuelle Tokens für die Konditionierung. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Verwendung des MiniMax H3 Referenz zu Video ComfyUI Workflows#

Dieser Workflow leitet Ihre Referenzen und das Prompt in MiniMax H3’s Ref2VA-Kern, sampelt ein einzelnes Latent, das sowohl Video als auch Audio enthält, und dekodiert und muxed das Ergebnis zu einem MP4 mit synchronisiertem Sound. Die untenstehenden Gruppen entsprechen dem Graphen, sodass Sie sehen können, was zu ändern ist und warum.

Benutzereingaben#

Verwenden Sie LoadImage (#137) und LoadImage (#139), um zwei visuelle Referenzen bereitzustellen. Das Prompt geht in Input Text (Prompt) (#138); referenzieren Sie jeden Eingang explizit nach Tag in der Reihenfolge, in der Sie sie verbunden haben, zum Beispiel <Picture 1> und <Picture 2>, bevor Sie die Szene, Bewegung und den Sound beschreiben. Legen Sie Ihr Zielaspekt und die Pixelanzahl im Resolution Selector (Size) (#115) fest. Wählen Sie die Videodauer in Sekunden mit Float (Duration) (#132); es wird automatisch in eine gültige Bildlänge von ComfyMathExpression (#131) umgewandelt, sodass Audio und Video synchron bleiben.

Modelle#

UNETLoader (#127) lädt die MiniMax H3 Ref2VA Diffusionsgewichte, die die Erzeugung antreiben. CLIPLoader (#128) lädt den Qwen3-VL 32B Encoder, der verwendet wird, um Ihren Text und Referenztags zu tokenisieren. Zwei VAELoader-Knoten (#119 Video, #120 Audio) liefern die gepaarten Dekodierer, die später das gemeinsame Latent wieder in Frames und Stereo-Audio entpacken. Diese Modelle sind die einzigen Assets, die Sie austauschen müssen, wenn Sie zu anderen MiniMax H3-Varianten innerhalb derselben Aufgabenfamilie migrieren.

Konditionierung#

MiniMaxH3ReferenceToVideo (#136) ist das Herz der Pipeline. Es akzeptiert Ihr Text-Prompt, Breite, Höhe und die berechnete length (Frames), sowie alle verbundenen ref_images, ref_videos und optionalen Audio-Referenzen. Der Knoten gibt einen positiven Konditionierungsstrom für die Führung und ein initialisiertes Latent aus, das Identität, Komposition, Bewegung und Sounddesign gemäß Ihren Referenzen und Tags verankert. Für Identitätstreue aus Bildern verbinden Sie gut beleuchtete, modellgetreue Referenzen und referenzieren Sie sie genau im Prompt; für Bewegung oder Tempo können Sie Video-Referenzen mit oder ohne deren Audio hinzufügen.

Sampling#

RandomNoise (#129) setzt den Prozess in Gang, während KSamplerSelect (#123) die Sampler-Variante auswählt und BasicScheduler (#124) den Schrittplan festlegt. BasicGuider (#126) wendet die vom MiniMax H3-Knoten erzeugte Konditionierung an, und SamplerCustomAdvanced (#125) führt die eigentlichen Denoising-Schritte durch, um das gemeinsame Audio+Video-Latent zu entwickeln. Die hier getroffenen Entscheidungen tauschen hauptsächlich Geschwindigkeit gegen Treue und Referenztreue; behalten Sie die Standardeinstellungen bei, um zu beginnen, und experimentieren Sie dann, sobald Sie einen Basislook und -sound haben.

Dekodierung und Videoerstellung#

Das gemeinsame Latent des Samplers geht zu VAEDecode (#122) für Frames und VAEDecodeAudio (#121) für Stereo-Sound. CreateVideo (#130) muxed die dekodierten Bilder und das Audio in einen abspielbaren Stream, und SaveVideo (#92) schreibt die endgültige Datei in Ihren Ausgabeordner. Da Video und Audio zusammen erzeugt wurden, bleibt das Timing ohne Nachabgleich oder externe TTS konsistent.

Schlüsselnoten im MiniMax H3 Referenz zu Video ComfyUI Workflow#

MiniMaxH3ReferenceToVideo (#136) Dieser Knoten komponiert Text-, visuelle und optionale Audio-Referenzen in MiniMax H3’s Ref2VA-Konditionierung und ein initiales Latent, das bereits über Identität, Stil, Bewegung und Sound "Bescheid weiß". Verwenden Sie genaue Referenztags in Ihrem Prompt, die der Verbindungsreihenfolge entsprechen, und wählen Sie ref_image_size basierend auf Ihrem Ziel: schnellere Iterationen bei passender Generierungsauflösung, stärkere Identität bei Beibehaltung größerer Referenztokens. Für längere Aufnahmen bevorzugen Sie klare Szenen- und Aktionsbeschreibungen, damit das Modell die Kontinuität aufrechterhalten kann.

Resolution Selector (Size) (#115) Steuert das Zielaspekt und die Pixelanzahl, die der gesamte Graph einhält. Wählen Sie eine Form, die zu Ihrer Präsentation des Clips passt, und balancieren Sie Detail mit Durchsatz aus, sodass Sie schnell iterieren können. Höhere Auflösungen erhöhen VRAM und Zeit, bewahren aber besser feine Merkmale Ihrer Referenzen.

ComfyMathExpression (#131) Wandelt eine benutzerfreundliche Dauer in Sekunden in eine Bildanzahl um, die der Sampler und Dekodierer mögen. Der Ausdruck klemmt auf ein sinnvolles Minimum und schnappt zu einem intern-freundlichen Schritt, sodass Video und Audio im Einklang bleiben. Passen Sie nur den Sekunden-Eingang an; der Knoten übernimmt die Mathematik.

KSamplerSelect (#123) und BasicScheduler (#124) Gemeinsam bestimmen sie den Denoising-Pfad. Beginnen Sie mit dem bereitgestellten Sampler und Zeitplan für robuste Referenztreue; wenn Ihre Aufnahme abweicht oder unterdetailliert erscheint, testen Sie einen alternativen Zeitplan oder eine etwas andere Sampler-Familie und vergleichen Sie die Ergebnisse Seite an Seite.

Optionale Extras#

  • Halten Sie Prompts konkret und referenzorientiert: beginnen Sie mit Tags wie <Picture 1> und <Picture 2>, dann beschreiben Sie Aufnahmetyp, Bewegung, Beleuchtung und die erwarteten Geräusche.
  • Für stärkere Identität aus Bildern erhöhen Sie die Referenztreue, indem Sie den Modus mit größerer Referenzgröße verwenden; für schnellere Look-Entwicklung verwenden Sie den Modus mit passender Größe.
  • Wenn Sie keine Audio-Referenzen anschließen, synthetisiert MiniMax H3 natives Stereo-Audio nur aus dem Prompt; beschreiben Sie Ambiente, Geräuscheffekte und Stimmton, um es zu leiten.
  • Fügen Sie ein kurzes Referenzvideo hinzu, wenn Ihnen die Bewegungskadenz oder das Kameraverhalten am wichtigsten ist; fügen Sie sein gepaartes Audio hinzu, wenn Sie diesen Klangcharakter in die Erzeugung einbringen möchten.
  • Iterieren Sie zuerst bei moderater Auflösung und Dauer, dann skalieren Sie auf, sobald Timing, Identität und Komposition zusammenhalten.

Referenzen#

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Comfy-Org für die MiniMax H3 R2V ComfyUI-Workflow-Vorlage und das MiniMax H3-Tutorial, MiniMax für das MiniMax H3-Modell und die offizielle Ankündigung sowie Comfy-Org für die MiniMax-H3-Modellgewichte für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die originale Dokumentation und die unten verlinkten Repositories.

Ressourcen#

Hinweis: Die Verwendung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.