ComfyUI>Workflows>MiniMax H3 8-Schritt-Beschleunigung | All-in-One Video-Workflow

MiniMax H3 8-Schritt-Beschleunigung | All-in-One Video-Workflow

Workflow Name: RunComfy/MiniMax-H3-8-Step
Workflow ID: 0000...1505
MiniMax H3 8-Schritt-Beschleunigung ist ein All-in-One ComfyUI-Workflow zur Erstellung filmischer Videos mit synchronisiertem nativem Audio. Sein einheitlicher Referenzknoten unterstützt Bilder, Videos, gepaarte Video-Audio und eigenständiges Audio, während die einsatzbereite Standardeinstellung ein Bild und eine Bewegungsaufforderung verwendet. Ein Turbo LoRA und 8-Schritt-Sampling beschleunigen die Erstellung, mit getesteten Einstellungen, die zuverlässig auf einer 48-GB-GPU laufen sollen.

ComfyUI MiniMax H3 8-Step Acceleration Workflow

MiniMax H3 8-Step Acceleration All-in-One Video Workflow in ComfyUI
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 8-Step Acceleration Examples

MiniMax H3 8-Schritt-Beschleunigung: All-in-One multimodale Videogenerierung mit nativem Audio#

MiniMax H3 8-Schritt-Beschleunigung ist ein All-in-One ComfyUI-Workflow zur Erstellung filmischer Videos mit synchronisiertem nativem Audio. Durch den einheitlichen MiniMaxH3Unified-Knoten unterstützt er Bildreferenzen, Videoreferenzen, Videos mit begleitendem Audio und eigenständige Audioreferenzen in einem schlanken Workflow.

Das einsatzbereite Beispiel verwendet ein einzelnes Bild und eine bewegungsorientierte Textaufforderung, aber Referenz-zu-Video ist nur eine Möglichkeit, den Workflow zu nutzen. Sein einheitliches multimodales Design unterstützt verschiedene Kombinationen aus visueller und auditiver Führung, ohne separate Workflow-Grafiken für jeden Eingabetyp zu benötigen.

Der Workflow kombiniert das MiniMax H3 FL2VA-Rückgrat mit dem LightX2V Turbo LoRA und einem kompakten 8-Schritt, zwei-Pass-Sampling-Plan. Er ist für filmische Charakteraufnahmen, Dialogszenen, atmosphärische Mikrogeschichten und andere multimodale Videotasks konzipiert, die von schnellerer Iteration und synchronisiertem nativem Audio profitieren.

Schlüsselmodelle im ComfyUI MiniMax H3 8-Schritt-Beschleunigungs-Workflow#

  • MiniMax-H3 offizielle Gewichte. Das audiovisuelle Diffusions-Rückgrat, das Video und natives Audio aus Aufforderungen und multimodalen Referenzen generiert. MiniMaxAI/MiniMax-H3
  • MiniMax H3 Video VAE und Audio VAE. Gepaarte Encoder und Decoder, die verwendet werden, um zwischen Pixelraum, Audio-Wellenformen und H3-Latenten zu wechseln. In der Comfy-Org-Verteilung enthalten. Comfy-Org/MiniMax-H3
  • Qwen3-VL 32B Text-Encoder (AWQ, MiniMax-abgestimmt). Bietet sprachliche und visuelle Verankerung für Aufforderungen und Referenzen, wenn MiniMax H3 angetrieben wird. Wird mit dem Comfy-Org MiniMax H3-Paket verteilt. Comfy-Org/MiniMax-H3
  • LightX2V MiniMax H3 Turbo LoRA. Ein geschwindigkeitsorientiertes LoRA, das Trajektorien strafft, sodass H3 effektiv unter einem 8-Schritt-Plan konvergieren kann. lightx2v/Minimax-h3-Turbo
  • MiniMax H3 Latent Upscaler 3D. Ein H3-nativer latenter Upscaler, der zwischen den Durchläufen verwendet wird, um räumliche Details zu erhöhen, ohne die Audioausrichtung zu brechen.

So verwenden Sie den ComfyUI MiniMax H3 8-Schritt-Beschleunigungs-Workflow#

Auf hoher Ebene sammelt der Workflow Aufforderungen und multimodale Referenzen durch einen einheitlichen Eingabeknoten, erstellt einen kompakten 8-Schritt-Plan und führt einen schnellen Hoch-Sigma-Durchlauf aus, um Bewegung und Szenenstruktur zu etablieren. Er kann dann das Video-Latent in 3D hochskalieren, bevor ein Niedrig-Sigma-Verfeinerungsdurchlauf durchgeführt wird, das synchronisierte Audio und Video dekodiert und das Ergebnis als MP4 exportiert.

Eingaben und Größenanpassung#

Verwenden Sie Resolution Selector (Size) (#115), um Ihre Zielbreite und -höhe auszuwählen. Geben Sie Ihre Szenenbeschreibung in Input Text (Prompt) (#217) ein; Sie können zitierten Dialog einschließen, wenn Sie gesprochene Worte im generierten Clip wünschen.

Der All-in-One MiniMaxH3Unified-Knoten (#212) fungiert als multimodaler Referenzknoten des Workflows. Er unterstützt Bildreferenzen, Videoreferenzen, Videos mit Audio und eigenständige Audioreferenzen zusammen mit Aufforderungs-, Größen- und Dauersteuerungen.

Das enthaltene Beispiel ist mit einem Referenzbild und einer Bewegungsaufforderung für den sofortigen Einsatz konfiguriert. Sie können dieses Bild ersetzen oder einen anderen unterstützten Referenztyp innerhalb desselben einheitlichen Knotens konfigurieren, ohne die Sampling-, Upscaling-, Dekodierungs- oder Exportstufen neu zu erstellen.

Sie können die duration in MiniMaxH3Unified festlegen oder auto_length_from_audio umschalten, wenn Sie eine externe Audioreferenz verwenden, um das Timing zu steuern.

Modellsetup und Beschleunigungspatches#

UNETLoader (#127) bringt den MiniMax H3 FL2VA-Checkpoint ein. MiniMaxH3MemoryEfficientSageAttentionPatch (#160) und ModelAttentionBackend (#168) aktivieren dann ein VRAM-freundliches Attention-Backend.

MiniMaxH3SigmaShift (#207) richtet die Video- und Audio-Entstörungshorizonte für kurze Pläne aus. LoraLoaderModelOnly (#167) wendet das LightX2V Turbo LoRA an, das MiniMax H3 8-Schritt-Beschleunigung ermöglicht, ohne ein separates Beschleunigungsdiagramm zu benötigen.

8-Schritt-Plan-Ersteller#

BasicScheduler (#163) konstruiert eine kompakte Trajektorie, die von ExtendIntermediateSigmas (#220) und H3SigmaRefiner (#209) für die audiovisuelle Dynamik von H3 feinabgestimmt wird.

SplitSigmas (#197) teilt den Plan in einen Hoch-Sigma-Block für Struktur und einen Niedrig-Sigma-Block für Details. Ein einzelner RandomNoise (#129) Seed speist beide Durchläufe, um Bewegung und Audio kohärent zu halten.

Erst-Durchlauf-Sampler: hohe Sigmas#

Der Hoch-Sigma-Block fließt in SamplerCustomAdvanced (#125), geleitet von BasicGuider (#126) mit der positiven Konditionierung von MiniMaxH3Unified (#212).

Dieser Durchlauf etabliert Komposition, Bewegungskadenz und ein grobes Audiobett innerhalb eines einheitlichen audiovisuellen Latenten. Sein entrauschtes Ergebnis wird dann für die Verbesserung in der Mitte der Pipeline vorbereitet.

Latent-Raum-Hochskalierung#

LTXVSeparateAVLatent (#199) trennt das audiovisuelle Latent, sodass nur die Video-Kanäle von MinimaxH3LatentUpscaler3D (#226) hochskaliert werden. Das Audio-Latent bleibt unberührt, um die Synchronisation zu bewahren.

LTXVConcatAVLatent (#198) kombiniert dann das verbesserte Video-Latent mit dem ursprünglichen Audio-Latent, um ein schärferes, aber weiterhin synchronisiertes audiovisuelles Latent für die Verfeinerung zu erstellen.

Zweit-Durchlauf-Sampler: niedrige Sigmas#

Das neu kombinierte Latent wird in SamplerCustomAdvanced (#177) unter Verwendung des Niedrig-Sigma-Blocks und BasicGuider (#178) verfeinert.

Dieser Durchlauf fügt Oberflächendetails hinzu, reinigt Gesichtszüge und poliert Audio-Texturen, während die während des ersten Durchlaufs etablierte Bewegung und das Timing beibehalten werden.

Dekodierung und Export#

VAEDecode (#186) konvertiert die Video-Latenten in Frames, während VAEDecodeAudio (#185) den nativen Audiotrack rekonstruiert.

VHS_VideoCombine (#189) mischt die Ergebnisse in eine MP4 bei der ausgewählten Bildrate—standardmäßig 24 fps—und erzeugt einen sofort teilbaren audiovisuellen Clip.

Schlüssel-Knoten im ComfyUI MiniMax H3 8-Schritt-Beschleunigungs-Workflow#

  • MiniMaxH3Unified (#212). Der zentrale All-in-One multimodale Referenzknoten für MiniMax H3. Er bringt Bild-, Video-, Video-Audio-, eigenständige Audio-, Aufforderungs-, Größen- und Dauersteuerungen in einen Knoten und ermöglicht es, dass verschiedene H3-Referenzaufgaben dieselbe beschleunigte Generierungspipeline verwenden.
  • H3SigmaRefiner (#209). Passt den Plan an, um die Teile der Trajektorie zu bevorzugen, von denen H3 am meisten profitiert. Wenn Sie schärfere Details bei gleicher Geschwindigkeit benötigen, fügen Sie etwas Verfeinerung hinzu; wenn Sie maximale Durchsatzleistung priorisieren, halten Sie es schlank.
  • SplitSigmas (#197). Teilt den kompakten Plan in einen Zwei-Pass-Plan. Bei einem 8-Schritt-Plan balanciert die Mittelpunktsaufteilung Geschwindigkeit und Qualität; das Verschieben der Aufteilung weist mehr Schritte entweder der Struktur oder den Details zu.
  • MiniMaxH3SigmaShift (#207). Versetzt Sigma-Bereiche für Video und Audio, sodass sie sauber unter kurzen Plänen konvergieren. Lassen Sie die bereitgestellten Verschiebungen unverändert, es sei denn, Sie verstehen ihre Auswirkungen auf Synchronisation und Stabilität.
  • LoraLoaderModelOnly (#167). Wendet das LightX2V Turbo LoRA an. Niedrigere Stärke mildert den Turbo-Effekt für sanftere Bewegung; höhere Stärke kann den Schnapp erhöhen, aber Texturen überbetonen.
  • MinimaxH3LatentUpscaler3D (#226). Erhöht räumliche Details zwischen den Durchläufen, während das Audio-Latent intakt bleibt. Verwenden Sie einen bescheidenen mode.scale für 720p-ähnliche Ausgaben oder einen größeren Multiplikator für 1080p, wenn VRAM dies zulässt.
  • VHS_VideoCombine (#189). Handhabt die endgültige Muxing und den Export. Passen Sie die frame_rate an, legen Sie ein Dateinamenpräfix fest und verwenden Sie optional Trimmen oder Ping-Pong-Schleifen für Vorschauen.

Optionale Extras#

  • Multimodale Referenzen. Verwenden Sie den einheitlichen H3-Knoten, um mit Bildreferenzen, Videoreferenzen, Videos mit Audio oder eigenständigen Audioreferenzen zu arbeiten, ohne zu einem separaten Generationsgrafen wechseln zu müssen.
  • Schnellstart-Aufforderungen. MiniMax H3 reagiert gut auf filmische Verben und Kamerasprache. Kurze, spezifische Hinweise wie "langsames Hereinzoomen", "handheld Schwanken" oder eine zitierte Dialogzeile erzeugen normalerweise stärkere Bewegungen und klarere Sprache.
  • Auflösungskurzbefehle. 0,4 MP mit einem 1,6x latenten Upscale landet nahe bei 720p. Ein 0,5 MP erster Durchlauf mit 2x Upscaling landet nahe bei 1080p. Wenn Sie VRAM-Grenzen erreichen, reduzieren Sie Megapixel, bevor Sie den Schrittplan ändern.
  • Stabilitätstipps. Behalten Sie denselben Seed für reproduzierbare Aufnahmen. Ändern Sie nur den Seed für schnelle Variationen, während der Rest des Timings und der Szenenrichtung erhalten bleibt.
  • Wann der Upscaler umgangen werden sollte. Wenn Sie Geschwindigkeit oder Speicher priorisieren, setzen Sie den Multiplikator des latenten Upscalers auf 1, um die Verbesserung effektiv zu überspringen.
  • Gut passende Szenarien. Dieser MiniMax H3 8-Schritt-Beschleunigungs-Workflow funktioniert gut für mittelnahe Charakteraufnahmen, Dialoge mit Umgebungsgeräuschen, audiovisuelle Szenenreferenzen, kurze atmosphärische Beats und multimodale Videotasks, bei denen schnelle Iteration wichtig ist.

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken RunningHub für die Workflow-Referenz, MiniMaxAI für das offizielle MiniMax-H3-Modell, Comfy-Org für die MiniMax-H3-Modellgewichte und lightx2v für das MiniMax H3 Turbo LoRA.

Für autoritative Details, Lizenzinformationen und Modellnutzungsbedingungen siehe die originale Dokumentation und die unten verlinkten Repositories.

Ressourcen#

Hinweis: Die Verwendung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.