ComfyUI>Workflows>FastH3 8-Schritt V2 ComfyUI Workflow | Schnelles MiniMax H3 I2V

FastH3 8-Schritt V2 ComfyUI Workflow | Schnelles MiniMax H3 I2V

Workflow Name: RunComfy/FastH3-8-Step-V2
Workflow ID: 0000...1518
Sie wählen die ersten und letzten Frames. FastH3 V2 erstellt ein kontinuierliches MiniMax H3 Video dazwischen. Sie erhalten generiertes Audio und flüssige Bewegungen. Die achtstufige INT8-Inferenz spart Zeit. Sparse Attention steigert die Effizienz. Erstellen Sie filmische Übergänge und Kurzgeschichten mit definierten Start- und Endaufnahmen.

FastH3 8-Step V2 ComfyUI Workflow Workflow

FastH3 8-Step V2 ComfyUI Workflow | INT8 Video + Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

FastH3 8-Step V2 ComfyUI Workflow Examples

FastH3 8-Schritt V2 ComfyUI Workflow: Zwei-Frame-bedingtes MiniMax H3 Video mit Audio#

Der FastH3 8-Schritt V2 ComfyUI Workflow verwandelt einen ersten und letzten Referenz-Frame in ein kontinuierliches MiniMax H3 Video mit synchronisiertem generiertem Audio. Er verwendet den FastVideo FastH3 V2 INT8 Checkpoint mit einem achtstufigen Zeitplan, sparse attention und expliziter erster/letzter Frame-Bedingung, um schnelle, kontrollierte Ergebnisse zu liefern.

Dieser Workflow ist ideal für filmische Übergänge, Charakterbewegungen, soziale Videokonzepte und kurze narrative Aufnahmen, die eine definierte Eröffnungs- und Schlusskomposition benötigen. Wenn Sie stabile Subjekte, fixierte Rahmung und natürliche Bewegungen bei hoher Geschwindigkeit wünschen, ist der FastH3 8-Schritt V2 ComfyUI Workflow für Sie gemacht.

Schlüsselmodelle im ComfyUI FastH3 8-Schritt V2 ComfyUI Workflow#

  • FastVideo FastH3 8-Schritt V2 (INT8). Das Diffusions-Backbone, das Video- und Audio-Latents in nur acht Abtastschritten für schnelle Iterationen generiert. Checkpoints: FastVideo/FastVideo-FastH3-8-Step-V2 und ComfyUI-fertige Gewichte in FastVideo/FastVideo-FastH3-Comfy.
  • Qwen3-VL 32B Text-Encoder für MiniMax H3. Kodiert das Prompt in Konditionierungs-Embeddings, die zur Steuerung von Bewegung, Szenendetails und Audio-Hinweisen verwendet werden. Gewichte werden mit dem offiziellen Modellset unter Comfy-Org/MiniMax-H3 verteilt.
  • MiniMax H3 Video VAE. Dekodiert Video-Latents zu RGB-Frames in der vom Input spezifizierten Zielauflösung. Siehe Comfy-Org/MiniMax-H3.
  • MiniMax H3 Audio VAE. Dekodiert Audio-Latents in Wellenform-Audio, das mit den generierten Frames gemischt wird. Siehe Comfy-Org/MiniMax-H3.

Verwendung des ComfyUI FastH3 8-Schritt V2 ComfyUI Workflow#

Der Graph folgt dem offiziellen FastH3 Image-to-Video-Muster und baut Ihre Aufnahme von links nach rechts zusammen. Sie stellen zwei Referenzbilder und ein Text-Prompt bereit, der Workflow berechnet die notwendige Konditionierung und Abtastung in acht Schritten mit sparse attention, dekodiert dann synchronisiertes Video und Audio und speichert eine veröffentlichungsbereite Datei.

Bild/Video-Eingaben (2)

  • Laden Sie Ihre ersten und letzten Frames mit LoadImage (#136) und LoadImage (#161). Wählen Sie Bilder aus derselben Szene und im gleichen Seitenverhältnis, damit Komposition und Identität im Clip konsistent bleiben.
  • Der erste Frame wird automatisch von ImageScaleToTotalPixels (#142) auf ein Berechnungsbudget skaliert, dann liest GetImageSize (#141) seine Breite und Höhe, damit die generierte Sequenz dieser Auflösung entspricht.
  • Verwenden Sie natürliche, szenengenaue Referenz-Frames. Der letzte Frame verankert die endgültige Komposition, sodass die Aufnahme genau dort endet, wo Sie es beabsichtigen.

Verarbeitung (19)

  • Kerngewichte werden mit UNETLoader (#151), CLIPLoader (#152) und zwei VAELoader-Knoten (#143 Video, #144 Audio) geladen. Der MiniMaxH3ImageToVideo (#155) Knoten fusioniert Ihren ersten Frame, letzten Frame, das Prompt und die Zieldauer zu einem einzigen Konditionierungspaket und anfänglichen Latent.
  • Die Dauer wird einmal mit der praktischen Float (duration) Steuerung (#157) festgelegt. Ein ComfyMathExpression (#156) konvertiert diese Zeit in eine Bildanzahl, die mit der Schrittweite des Modells für flüssige Aufmerksamkeit über die Sequenz hinweg ausgerichtet ist.
  • Temporale und Effizienzhelfer umfassen MiniMaxH3SigmaShift (#160) zur Beeinflussung des Zeitplans für MiniMax H3, ModelAttentionBackend (#159) zur Auswahl der Attention-Implementierung und BlockSparseAttention (#158) zur Reduzierung der Berechnung bei gleichzeitiger Erhaltung der Wiedergabetreue in wichtigen Regionen.
  • Der Denoising-Kern verwendet BasicGuider (#150) mit positiver Konditionierung vom Image-to-Video-Knoten, einen achtstufigen BasicScheduler (#148), den res_multistep Sampler ausgewählt in KSamplerSelect (#147) und SamplerCustomAdvanced (#149) zur Erzeugung gemeinsamer Video- und Audio-Latents in einem Durchgang.

Ausgaben (2)

  • Video-Latents dekodieren zu Frames über VAEDecode (#146), während Audio-Latents über VAEDecodeAudio (#145) dekodieren. CreateVideo (#154) mischt dann die Bildsequenz und das Audio in einen einzigen Clip.
  • SaveVideo (#92) schreibt die Datei. Legen Sie ein Dateinamenpräfix fest und wählen Sie ein Format und einen Codec, der zu Ihrer Auslieferungsplattform oder Ihrem Bearbeitungspipeline passt.

Schlüssel-Knoten im ComfyUI FastH3 8-Schritt V2 ComfyUI Workflow#

MiniMaxH3ImageToVideo (#155)

  • Erstellt die Konditionierung aus Ihren ersten und letzten Referenz-Frames sowie dem Prompt und gibt ein anfängliches Latent für die gemeinsame Video- und Audioerzeugung aus. Passen Sie das Text-Prompt an, um Bewegung, Kamera, Atmosphäre und gewünschte Klanghinweise zu beschreiben. Halten Sie Identitäten und Szenenelemente konsistent mit den Referenzen für die stabilsten Ergebnisse. Passen Sie die Dauersteuerung in der linken Gruppe an, um die Clip-Länge zu ändern, ohne die Samplereinstellungen zu berühren.

BlockSparseAttention (#158)

  • Wendet sparse attention auf das geladene Modell an, um die Abtastung zu beschleunigen, während die Aufmerksamkeit dort erhalten bleibt, wo sie am wichtigsten ist. Wenn Sie Detailverluste in belebten Szenen sehen, erhöhen Sie den beibehaltenen Bruchteil oder reservieren Sie zusätzliche Tokens für Vordergrundobjekte. Für einfache Szenen kann stärkere Sparsität die Renderzeiten erheblich beschleunigen.

MiniMaxH3SigmaShift (#160)

  • Verschiebt den Rauschzeitplan für Video und Audio, damit die zeitliche Struktur und der Klang über die kurze achtstufige Trajektorie kohärent bleiben. Wenn die Bewegung ruckelig aussieht, erhöhen Sie die Video-Verschiebung; wenn die Audioausrichtung abweicht, passen Sie die Audio-Verschiebung leicht an. Verwenden Sie kleine Änderungen und testen Sie kurze Vorschauen, um ein Gleichgewicht zu finden.

SamplerCustomAdvanced (#149)

  • Führt das achtstufige Denoising mit dem res_multistep Sampler und dem Zeitplan von BasicScheduler (#148) aus. Halten Sie den Seed in RandomNoise (#153) für Reproduzierbarkeit fest, dann variieren Sie ihn, um Alternativen zu erkunden, sobald Ihnen die Bewegung gefällt. Starke Führung durch den BasicGuider (#150) hilft, sich an das Prompt zu halten, wenn Kompositionen komplex sind.

CreateVideo (#154)

  • Mischt dekodierte Frames und Audio in einen endgültigen Clip. Legen Sie die Frames pro Sekunde fest, um das Tempo zu steuern, wählen Sie einen Farbraum für Ihren Workflow aus, und wenn Sie später bearbeiten möchten, wählen Sie einen Codec, der Größe und Qualität für Ihr NLE ausbalanciert.

Optionale Extras#

  • Referenzauswahl: Wählen Sie zwei Frames aus derselben Linse und Perspektive, mit übereinstimmender Belichtung und Weißabgleich. Schärfere Referenzen führen in der Regel zu saubereren Texturen.
  • Prompting: Schreiben Sie, was das Subjekt tut, wie sich die Kamera verhält und wie die Umgebung klingt. Halten Sie die Formulierung konsistent mit Ihren Referenzen, um Identitätsdrift zu vermeiden.
  • Auflösung vs. Geschwindigkeit: Wenn Sie auf Speichergrenzen stoßen, senken Sie das Ziel-Pixelbudget in ImageScaleToTotalPixels (#142). Für Heldenaufnahmen erhöhen Sie es und rendern weniger Variationen.
  • Dauer und fps: Passen Sie die Dauer für das Tempo an, dann stellen Sie fps in CreateVideo (#154) ein, um das Gefühl zu steuern. Der Workflow richtet die Bildanzahl automatisch für stabile Aufmerksamkeit aus.
  • Seeds und Iteration: Sperren Sie den Rausch-Seed, um Prompts und Referenzen zu verfeinern, dann versuchen Sie neue Seeds für Alternativen, sobald die Komposition und das Timing festgelegt sind.
  • Template-Parität: Der Graph folgt der offiziellen FastH3 I2V Struktur, sodass Tipps aus der Referenzvorlage unter Comfy-Org/workflow_templates direkt übertragen werden können.

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken FastVideo für das FastH3 8-Step V2 Modell und die ComfyUI-Gewichte, Comfy-Org für die FastH3 I2V Workflow-Vorlage und RunningHub.ai für die Workflow-Quelle für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die Originaldokumentation und Repositories, die unten verlinkt sind.

Ressourcen#

Hinweis: Die Verwendung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Wartenden bereitgestellt werden.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.