ComfyUI>Workflows>MiniMax H3 T2V ComfyUI - KI-Text-zu-Video-Generator

MiniMax H3 T2V ComfyUI - KI-Text-zu-Video-Generator

Workflow Name: RunComfy/MiniMax-H3-T2V
Workflow ID: 0000...1472
Verwandle einen Prompt in eine vollständige Videoszene. Sie erhalten kinoreife Bewegungen und nativen Stereo-Sound zusammen. Erstellen Sie Dialoge, Gesang oder Konzeptaufnahmen. Der MiniMax H3 Text-zu-Video-Graph hält den Ton synchron. Sie können Ideen schneller testen. Führen Sie es fertig auf RunComfy aus.

MiniMax H3 T2V ComfyUI Workflow

MiniMax H3 T2V ComfyUI - Video and Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 T2V ComfyUI Examples

MiniMax H3 T2V ComfyUI: Prompt-zu-Video mit nativem Stereo-Audio#

MiniMax H3 T2V ComfyUI verwandelt einen einzigen Prompt in ein kurzes Kinovideo mit synchronisiertem Stereo-Audio. Basierend auf der offiziellen Comfy.org-Vorlage und den offenen Comfy-Org MiniMax-H3 Gewichten folgt es dem FL2VA-Pfad, sodass Bewegung und Ton zusammen generiert werden und nicht nachträglich zusammengesetzt werden. Es ist ideal für schnelle Erkundungen von reinen Prompt-Szenen, Dialog- oder Gesangsclips und Konzeptaufnahmen, die sowohl visuelle als auch akustische Elemente in einem Durchgang benötigen.

Beschreiben Sie die Aufnahmen, Kamera, Performance und Audiohinweise in einem Block, wählen Sie Größe und Dauer, und stellen Sie dann den Graph in die Warteschlange. Der Workflow lädt die richtigen MiniMax-H3-Komponenten, sampelt gemeinsame audio-visuelle Latenten, dekodiert sie zu Frames und Stereo-Audio, muxed das Ergebnis und speichert eine fertige Videodatei.

Schlüsselmodelle im Comfyui MiniMax H3 T2V ComfyUI-Workflow#

  • MiniMax-H3 FL2VA Diffusionsmodell. Der Kern-UNet, der die gemeinsame Audio-Video-Denoising durchführt, sodass Bewegung und Ton phasensynchron bleiben. Gewichte von Comfy-Org unter diffusion_models bereitgestellt. Model files
  • MiniMax-H3 Video VAE. Kodiert und dekodiert visuelle Latenten zu RGB-Frames und bewahrt kinoreiche Details und Bewegungskontinuität. minimax_h3_video_vae_fp16.safetensors
  • MiniMax-H3 Audio VAE. Kodiert und dekodiert Audio-Latenten zu einer zeitsynchronen Stereo-Wellenform für jeden Clip. minimax_h3_audio_vae_fp32.safetensors
  • Qwen3-VL 32B Text-Encoder (AWQ für MiniMax-H3). Interpretiert den Prompt in eine Konditionierung, die Szenensemantik, Timing und Audio-Intention abdeckt. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Wenn Sie die ursprüngliche Vorlage vergleichen möchten, auf der dieser Graph basiert, siehe die Comfy.org-Referenz. Template JSON

So verwenden Sie den Comfyui MiniMax H3 T2V ComfyUI-Workflow#

Auf hoher Ebene setzen Sie die Zielauflösung und Dauer, schreiben einen einzigen Prompt, der sowohl visuelle als auch akustische Elemente enthält, fügen optional erste und letzte Frames hinzu und führen dann aus. Innerhalb des Subgraphs erstellt MiniMax-H3 synchronisierte Video- und Audiolatenten, die dekodiert, zu einem 24 fps-Film zusammengefügt und gespeichert werden.

ResolutionSelector (#115)#

Wählen Sie ein Seitenverhältnis und eine Skalierung, um width und height festzulegen. Der Selektor rundet auf effiziente Vielfache von 32 und speist diese Werte in den MiniMax-H3-Subgraph ein, sodass Sie die Dimensionen nicht manuell berechnen müssen. Beginnen Sie mit moderaten Größen für schnellere Iterationen, dann skalieren Sie nach oben, sobald Ihr Prompt korrekt gelesen wird. Das Ändern des Seitenverhältnisses ist ein mächtiger kreativer Hebel für Trailer, vertikale Clips und quadratische Vorschauen.

Image to Video (MiniMax H3) (#105)#

Dieser Subgraph orchestriert die MiniMax H3 T2V ComfyUI-Pipeline. Fügen Sie einen kohärenten Prompt ein, der Aufnahmen, Bearbeitungen und den Soundtrack zusammen beschreibt, und geben Sie optional first_frame und last_frame Bilder an, um den Ein- und Ausstieg zu verankern. Setzen Sie eine benutzerfreundliche duration und der Graph konvertiert sie in eine gültige Frame-Anzahl für das Modell. Der Subgraph gibt synchronisierte audio-visuelle Latenten zurück, die zur Dekodierung und Muxing übergehen.

Modelgruppe#

Die Modelgruppe lädt die genauen MiniMax-H3-Komponenten für diesen Workflow. UNETLoader (#6) zieht das FL2VA-Diffusionsmodell, CLIPLoader (#13) lädt den Qwen3-VL-Encoder, und zwei VAELoader Knoten (#11 Video, #24 Audio) bereiten Dekoder vor. Diese sind auf die Comfy-Org MiniMax-H3-Dateien ausgerichtet, sodass Sie ohne manuelle Verkabelung ausführen können. Die Modelle hier zentral zu halten, vereinfacht zukünftige Austausche oder Upgrades.

Konditionierungsgruppe#

MiniMaxH3ImageToVideo (#104) wandelt Ihren Prompt, optionale first_frame und last_frame, und die ausgewählte width, height und length in MiniMax-H3-Konditionierung plus ein initiales Latent um. Die Idee ist, das Modell sowohl Szeneninhalt als auch Audio-Intention gleichzeitig lesen zu lassen, was zu engerer Synchronisation führt. Wenn Sie Referenzframes bereitstellen, werden Eintritt und Austritt für Kontinuität geleitet; wenn Sie sie leer lassen, beginnt die Generation kalt.

Samplinggruppe#

Sampling wird von RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16) und dem Haupt-SamplerCustomAdvanced (#14) gehandhabt. Zusammen entstören sie das gemeinsame Latent, sodass Bildbewegungen und Tonevents im Gleichschritt entstehen. Sie können mit einem neuen Seed für alternative Aufnahmen erneut ausführen und dabei die gleiche kreative Richtung beibehalten. Sobald Sie sich wohlfühlen, kann das Experimentieren mit der Samplerauswahl oder dem Zeitplan die Bewegungsenergie und den klanglichen Charakter leicht verändern.

Dekodierung und Videoerstellung#

VAEDecode (#10) rekonstruiert die Frame-Sequenz aus dem Video-Latent, und VAEDecodeAudio (#23) rekonstruiert eine Stereo-Wellenform aus dem Audio-Latent. CreateVideo (#91) multiplexiert Frames und Audio zu einem fertigen Clip mit 24 fps. Hier kommen saubere Schnitte und im Prompt spezifizierte Beats in der Zeitleiste zusammen. Die Ausgabe geht zum Speichern über.

SaveVideo (#92)#

Schreibt das endgültige Video in Ihren ComfyUI-Ausgang unter video/MiniMax_H3. Der Knoten verwendet automatische Benennung, sodass Sie schnell iterieren können, und Sie können den Pfad ändern, um verschiedene Projekte getrennt zu halten. Die Ausgabe enthält sowohl das generierte Bild als auch Stereo-Audio.

Schlüsselnoten im Comfyui MiniMax H3 T2V ComfyUI-Workflow#

MiniMaxH3ImageToVideo (#104)#

Kernkonditionierungsknoten für MiniMax-H3, der prompt, optionale first_frame und last_frame, sowie width, height und length akzeptiert. Halten Sie Prompts prägnant, aber kinoreif, und fügen Sie Audiohinweise wie Ambiente, SFX, Dialog und musikalische Hits im gleichen Textblock ein. Verwenden Sie Referenzframes, wenn Sie einen bestimmten Eintritt oder Austritt benötigen; lassen Sie sie weg für freiere Inszenierung.

ComfyMathExpression (#107)#

Mappt eine menschenlesbare duration in Sekunden auf die Ganzzahl length, die das Modell erwartet, und schnappt sich zur Frame-Rasterung des Modells für sauberes Timing. Setzen Sie die Fließkommazahl auf Ihre beabsichtigte Clip-Länge und lassen Sie den Knoten die Umwandlung übernehmen. Etwas kürzere Clips neigen dazu, klare Bewegungen und Tonsynchronisation bei höheren Auflösungen zu bewahren.

SamplerCustomAdvanced (#14)#

Steuert den Denoising-Prozess basierend auf dem ausgewählten Sampler und Zeitplan. Verwenden Sie einen festen noise_seed, um eine Aufnahme zum Vergleich zu sperren, und ändern Sie dann nur den Seed, um neue Variationen zu erkunden. Wenn sich die Bewegung zu chaotisch oder zu steif anfühlt, versuchen Sie einen anderen Sampler in KSamplerSelect (#17) oder passen Sie den Zeitplan in BasicScheduler (#9) an.

CreateVideo (#91)#

Kombiniert dekodierte Frames und Stereo-Audio zu einem einzigen Videostream mit Ihrer gewählten Bildrate. Für rhythmusgesteuerte Bearbeitungen setzen Sie fps, um dem im Prompt beschriebenen Rhythmus zu entsprechen. Der Knoten ist auch der Ort, an dem Sie fps ändern würden, wenn Sie ein langsameres oder schnelleres Gefühl wünschen.

ResolutionSelector (#115)#

Eine Steuerung für sowohl Seitenverhältnis als auch gesamte Pixelanzahl, mit automatischem Runden auf modellfreundliche Größen. Wählen Sie zuerst das Seitenverhältnis, dann schieben Sie die Skala, um Geschwindigkeit und Detailtreue auszubalancieren. Größere Leinwände belohnen sorgfältiges Prompting und kürzere Dauern.

SaveVideo (#92)#

Finalisiert den Clip auf der Festplatte. Zeigen Sie ihn auf einen Projektunterordner, um Experimente organisiert zu halten, und benennen Sie ihn weise um, wenn Sie einen Treffer landen.

Optionale Extras#

  • Schreiben Sie Prompts als Mini-Storyboards mit Zeitvorgaben und expliziten Audiobeats für zuverlässige Synchronisation.
  • Fügen Sie Audio-Intent-Wörter wie Wind, Schritte, Menge, Nachhall oder spezifische Instrumente hinzu, um den Soundtrack zu lenken.
  • Fügen Sie Zeilen für Dialog oder Gesang direkt im Prompt hinzu und notieren Sie den Ton des Sprechers.
  • Sperren Sie einen noise_seed, wenn Sie Änderungen am Prompt vergleichen, ändern Sie nur den Seed, wenn Sie alternative Aufnahmen erkunden.
  • Verwenden Sie first_frame und last_frame, um Bewegungen zu begrenzen, wenn Sie Kontinuität über Schnitte oder eine präzise Endpose benötigen.

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir bedanken uns herzlich bei Comfy-Org für die MiniMax H3 T2V Workflow-Vorlage und die MiniMax-H3 Modellgewichte, Comfy.org für das MiniMax H3 Tutorial, und MiniMax für die offizielle MiniMax H3 Ankündigung für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die originale Dokumentation und die unten verlinkten Repositories.

Ressourcen#

Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen der Autoren und Betreuer.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.