ComfyUI>Workflows>MiniMax H3 ComfyUI Text-to-Video 4-Schritt Turbo

MiniMax H3 ComfyUI Text-to-Video 4-Schritt Turbo

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1483
Verwandeln Sie ein filmisches Prompt in ein kurzes Video. Sie erhalten in einem Durchgang nativen Stereoton. Erstellen Sie klare Dialoge, Gesang und Umgebungszenen. Hailuo H3 Turbo verwendet eine Vier-Schritt-Abtastung für schnellere Entwürfe. Sie können Ideen schnell testen. Exportieren Sie Bewegung und Audio zusammen.

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Workflow

MiniMax H3 ComfyUI Text-to-Video | 4-Step Turbo
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Examples

MiniMax H3 ComfyUI Text-to-Video 4-Schritt Turbo: Prompt-zu-Clip mit nativem Audio in einem Durchgang#

Dieser Workflow verwandelt ein einziges filmisches Prompt in ein kurzes Video mit gemeinsam generiertem Stereo-Audio unter Verwendung von MiniMax H3. Es wird eine Turbo 4-Schritt Beschleunigung LoRA angewendet, sodass Sie schnell bei Dialogen, Gesang und Umgebungszenen iterieren können, während Bewegung und Ton eng gekoppelt bleiben.

Entwickelt für Kreative, die nur Entwürfe auf Prompt-Basis wünschen, produziert der MiniMax H3 ComfyUI Text-to-Video 4-Schritt Turbo-Workflow saubere Sprache oder Gesang, kohärenten Umgebungsklang und konsistente Kinematografie ohne manuelle Audiozusammenstellung. Der Graph kümmert sich automatisch um Längenausrichtung, latente Abtastung, Dekodierung und Muxing, sodass Sie sich auf Storytelling und Performance-Hinweise konzentrieren können.

Schlüsselmodelle im Comfyui MiniMax H3 ComfyUI Text-to-Video 4-Schritt Turbo-Workflow#

  • MiniMax H3 Diffusionsmodell (FL2VA UNet). Kern Audiovisueller Generator, der ein gemeinsames Latent für Bild und Ton lernt, wodurch synchronisierte Bewegung und Audio aus demselben Abtastdurchgang ermöglicht werden. Gewichte: Comfy-Org/MiniMax-H3.
  • Qwen3-VL 32B Text-Encoder für H3 (AWQ/NVFP4 Variante). Kodiert reichhaltige, mehrsätzige Prompts in Konditionierungen, die Szenenlayout, Performance und Audioereignisse steuern. Verpackt in Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. Dekodiert das abgetastete Video-Latent in Frames mit filmischem Ton und Detail. Datei: minimax_h3_video_vae_fp16.safetensors.
  • MiniMax H3 Audio VAE. Dekodiert das gemeinsame Latent in zeitlich abgestimmtes Stereo-Audio für Sprache, Gesang und Ambiente. Datei: minimax_h3_audio_vae_fp32.safetensors.
  • MiniMax H3 Turbo 4-Schritt LoRA. Wendet das Beschleunigungsrezept an, das die Szenentreue bewahrt und gleichzeitig sehr schnelle Abtastung ermöglicht. Datei: minimax_h3_turbo_4step_pruned_comfyui.safetensors.

So verwenden Sie den Comfyui MiniMax H3 ComfyUI Text-to-Video 4-Schritt Turbo-Workflow#

Auf hoher Ebene wird Ihr Prompt kodiert, ein Turbo-augmented H3 Modell tastet ein einziges Audiovisuelles Latent ab, und die Video- und Audio-VAEs dekodieren dieses Latent, bevor der Clip zu einer abspielbaren Datei gemuxt wird.

1) Schreiben Sie das filmische Prompt und legen Sie die Dauer fest#

Verwenden Sie das easy positive (#147) Textfeld, um Aussehen, Aktion und Performance zu beschreiben. Um Stimme oder Musik zu leiten, fügen Sie klare Hinweise wie "Audio: mittlerer männlicher Stimme liefert die Zeile... Regenambiente... niedriger Thriller-Untermalung." hinzu. Der Float (duration) Controller (#133) legt die Clip-Länge in Sekunden fest. Ein Math-Node konvertiert Ihre Dauer in Frames und richtet die Anzahl leise auf die erforderliche Kadenz von H3 aus, sodass Sie sich nicht um Frame-Mathematik kümmern müssen.

2) Laden Sie H3, Text-Encoder, VAEs und Turbo LoRA#

UNETLoader (#127) lädt das MiniMax H3 Diffusionsmodell, und CLIPLoader (#128) lädt den Qwen3-VL Text-Encoder, der speziell für H3 angepasst ist. Zwei VAELoader Nodes bringen das Video VAE (#119) und das Audio VAE (#120) herein. LoraLoaderModelOnly (#153) wendet die MiniMax H3 Turbo 4-Schritt LoRA auf das Modell an, sodass der Scheduler und Sampler in einem schnellen Regime arbeiten, ohne die audiovisuelle Kohärenz zu verlieren.

3) Erstellen Sie die Konditionierung und das initiale audiovisuelle Latent#

MiniMaxH3ImageToVideo (#131) verwandelt Ihr Prompt in positive Konditionierung und bereitet ein initiales Latent vor, das auf Ihre gewählte Breite, Höhe und Frameanzahl abgestimmt ist. Optionale first_frame und last_frame Eingaben existieren zum Verankern eines Start- oder Endbildes, wenn Sie den Graph später erweitern möchten. Der Node gibt die Konditionierung und das Latent aus, das die nachgeschaltete Abtastung verfeinern wird.

4) Abtastung mit Turbo#

BasicGuider (#126) paart das Modell mit Ihrer Konditionierung, KSamplerSelect (#123) wählt den Abtastalgorithmus, und BasicScheduler (#124) setzt den Schrittplan, der mit der Turbo LoRA funktioniert. RandomNoise (#129) führt die Generation für Reproduzierbarkeit an. SamplerCustomAdvanced (#125) führt den Entstörungsdurchgang aus, um das endgültige gemeinsame Latent zu produzieren, das sowohl Video als auch Audio kodiert.

5) Dekodieren und exportieren Sie den finalen Clip#

VAEDecode (#122) rekonstruiert die Bildframes aus dem Latent, während VAEDecodeAudio (#121) synchronisiertes Stereo-Audio rekonstruiert. CreateVideo (#130) muxt Frames und Audio in einen einzigen Stream und SaveVideo (#92) schreibt die Datei auf die Festplatte mit dem von Ihnen festgelegten Dateinamen-Präfix.

Schlüssel-Nodes im Comfyui MiniMax H3 ComfyUI Text-to-Video 4-Schritt Turbo-Workflow#

MiniMaxH3ImageToVideo (#131)#

Produziert die positive Konditionierung und initialisiert das audiovisuelle Latent aus Ihrem Prompt, Ihrer Auflösung und Länge. Das Anpassen von width, height oder length ändert sowohl den Bewegungsskalierung als auch, wie viel Bildschirmaktion passt. Wenn Sie den Graph später erweitern, lassen Sie first_frame und last_frame die Kontinuität über Aufnahmen hinweg sichern.

LoraLoaderModelOnly (#153)#

Wendet die Turbo 4-Schritt LoRA auf das geladene H3 Modell an. Halten Sie den Scheduler in einem niedrigen Schritt-Regime, um vom Turbo zu profitieren; das Erhöhen der Schritte verschiebt das Erscheinungsbild von der vorgesehenen schnellen Iterationsverhalten. Diese LoRA ist speziell für MiniMax H3 entwickelt und lebt neben den Hauptgewichten im H3 Repository.

BasicScheduler (#124)#

Steuert den Entstörungszeitplan, dem der Sampler folgt. Verwenden Sie ihn, um Geschwindigkeit und Treue zu balancieren, während Sie mit der Turbo LoRA kompatibel bleiben. Wenn Sie den Sampler-Algorithmus ändern, überprüfen Sie die Auswahl des Zeitplans erneut, um stabile Bewegung und sauberen Ton zu gewährleisten.

SamplerCustomAdvanced (#125)#

Führt das eigentliche Entstören mit Rauschen, Guider, Sampler, Sigmas und dem initialen Latent durch. Es ist der endgültige Schiedsrichter für Textur, Timing und audiovisuelle Schärfe. Verwenden Sie denselben Seed, wenn Sie Prompt-Änderungen vergleichen, damit Sie Unterschiede auf Textänderungen und nicht auf Rauschen zurückführen können.

PathchSageAttentionKJ (#150)#

Wendet eine Aufmerksamkeitsoptimierung vor der LoRA-Injektion an, um den Durchsatz bei großen Auflösungen zu verbessern. Bereitgestellt von KJNodes, die Leistungshelfer für ComfyUI anbieten. Repository: ComfyUI-KJNodes.

CreateVideo (#130)#

Kombiniert dekodierte Frames mit dem dekodierten Audio zu einem synchronisierten Clip. Sie können hier die Bildrate oder Bittiefe ändern, wenn Sie die Lieferungsspezifikationen anpassen müssen. Der Node hält die Audio-Video-Synchronisierung, die aus dem gemeinsamen Latent abgeleitet wird.

SaveVideo (#92)#

Schreibt den gerenderten Clip mit Ihrem gewählten Dateinamen-Präfix, Container und Codec auf die Festplatte. Verwenden Sie konsistente Benennungen, um Iterationen für dieselbe Szene und denselben Seed zu verfolgen.

Optionale Extras#

  • Prompting für Sprache: Geben Sie die genaue Zeile nach "Audio:" ein und beschreiben Sie Alter, Geschlecht, Ton und Tempo der Stimme. Für Gesang spezifizieren Sie Stil und Tempo. Für Ambiente listen Sie Quellen, Intensität und ob nur Untermalung gewünscht wird.
  • Auflösungs- und Dauertausch: Höhere Pixelzahlen und längere Clips kosten mehr Abtastzeit. Wenn Sie viele Takes benötigen, beginnen Sie kleiner und skalieren dann hoch oder verlängern Sie, sobald Timing und Lieferung stimmen.
  • Reproduzierbarkeit: Halten Sie denselben Seed, wenn Sie nur Text optimieren, damit Sie A/B kleine Prompt-Änderungen vergleichen können.
  • Längenausrichtung ist automatisch: Der Graph konvertiert Sekunden in Frames und richtet die Anzahl auf die interne Kadenz von H3 aus für stabile audiovisuelle Synthese.
  • Kontinuitätsoptionen: Der Modell-Node bietet optionale first_frame und last_frame. Wenn Sie den Workflow später erweitern, verbinden Sie dort Bilder, um Aufnahmeanfänge oder -enden über Bearbeitungen hinweg zu sichern.
  • Sicherheit: Vermeiden Sie urheberrechtlich geschützte Charaktere, reale Personendarstellungen ohne Zustimmung und On-Screen-Logos oder Untertitel in Ihrem Prompt.

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken MiniMax für das MiniMax H3 Multimodale Generationsmodell und die Ankündigung, Comfy.org für das ComfyUI MiniMax H3 Workflow-Tutorial und Comfy-Org für die MiniMax-H3 Modellgewichte für ihre Beiträge und Wartung. Für autoritative Details beziehen Sie sich bitte auf die Originaldokumentation und die unten verlinkten Repositories.

Ressourcen#

Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen der Autoren und Wartungspersonen.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.