ComfyUI>Workflows>MiniMax H3 Latent Upscaler | BUNNYH3 Zwei-Pass Workflow

MiniMax H3 Latent Upscaler | BUNNYH3 Zwei-Pass Workflow

Workflow Name: RunComfy/MiniMax-H3-Upscaler
Workflow ID: 0000...1512
Der MiniMax H3 Latent Upscaler erzeugt hochauflösende Videos mit Audio aus Textanweisungen und optionalen Referenzbildern. Dieser BUNNYH3 Zwei-Pass ComfyUI-Workflow generiert zuerst die Szene und Bewegung in niedrigerer Auflösung, skaliert dann die latente Darstellung des Videos hoch und führt einen zweiten Abtastungspass durch, um das vergrößerte Ergebnis vor der Dekodierung zu verfeinern. Verwenden Sie ihn, um kurze Produktwerbungen und filmische Szenen mit einstellbarer Ausgabeauflösung zu erstellen. Upscaling ist in die Videoerzeugung integriert; dies ist kein allgemeines Werkzeug zur Wiederherstellung hochgeladener Videos.

ComfyUI MiniMax H3 Latent Upscaler Workflow

MiniMax H3 Latent Upscaler BUNNYH3 ComfyUI graph showing two-pass video generation with latent upscaling
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Latent Upscaler Examples

MiniMax H3 Latent Upscaler: BUNNY Zwei-Pass Videoerzeugungs-Workflow#

Dieser ComfyUI-Workflow verwandelt Textanweisungen und optionale Referenzbilder in kurze, filmische Videos mit synchronisiertem Audio. Er verwendet ein BUNNY Zwei-Pass-Design: Stufe 1 legt Bewegung und Komposition in einer bescheidenen Basisauflösung fest, dann vergrößert der MiniMax H3 Latent Upscaler das 3D-Video-Audio-Latent, bevor Stufe 2 hochfrequente Details rekonstruiert und die endgültigen Frames und den Ton dekodiert. Der MiniMax H3 Latent Upscaler ist in die Erzeugung integriert, daher ist er kein generischer Verstärker für bestehende Videos; er ist speziell für Werbeschnitte und stilisierte filmische Szenen entwickelt, bei denen Sie zusätzliche Klarheit ohne Verlust der Bewegungsabsicht wünschen.

Das Ergebnis ist ein hochauflösender Clip, dessen Aussehen durch Ihre Eingabeaufforderung, Referenzen und eine kleine Anzahl von LoRAs bestimmt wird, während die Bewegungsstabilität durch die Zwei-Pass-Upsampling-dann-Rekonstruktions-Pipeline geschützt wird. Stufe 2 ist obligatorisch und führt immer die tatsächliche Detailrekonstruktion durch, nachdem das Latent hochskaliert wurde.

Schlüsselmodelle im Comfyui MiniMax H3 Latent Upscaler Workflow#

  • MiniMax H3 Video-Audio-Modell und T8 benutzerdefinierte Knoten. Bietet den Kern-Generator, die Konditionierung, die Zwei-Pass-Planung und die Dekodierungsdienstprogramme, die im gesamten Workflow verwendet werden. Siehe die Knoten-Suite im T8-Repository für modellspezifische Verhaltensweisen und Schnittstellen. GitHub: comfyui-minimax-h3-audio-T8
  • MiniMax H3 Video VAE. Kodiert und dekodiert Video-Latents, die Stufe 2 schließlich in Frames umwandelt. Enthalten und von den oben genannten T8-Knoten genutzt. GitHub: comfyui-minimax-h3-audio-T8
  • MiniMax H3 Audio VAE. Kodiert und dekodiert Audio-Latents, um den Umgebungsgeräusch kohärent mit dem visuellen Bewegungsplan zu halten. GitHub: comfyui-minimax-h3-audio-T8
  • MiniMax H3 Latent Upscaler 3D. Ein erlerntes 3D-latentes Upscaler, das das gemeinsame Video-Audio-Latent in Breite und Höhe vergrößert, bevor die Detailrekonstruktion erfolgt und die zeitliche Struktur besser als die Nachbearbeitungsinterpolation bewahrt. Verwenden Sie das offizielle 3D fp16 Checkpoint. Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
  • SageAttention speichereffiziente Aufmerksamkeits-Patch für H3. Dient als der einzige Aufmerksamkeits-Patch, der von diesem Workflow für stabile, speicherfreundliche Inferenz verwendet wird. GitHub: ComfyUI-h3_sage_amd

Verwendung des Comfyui MiniMax H3 Latent Upscaler Workflows#

Der Workflow hat sieben gekennzeichnete Gruppen, die zusammenarbeiten, um den endgültigen Clip zu produzieren. Stufe 1 plant Bewegung in Basisauflösung, der MiniMax H3 Latent Upscaler vergrößert das Latent, und Stufe 2 rekonstruiert Details in der größeren Größe, bevor sie in Video und Audio dekodiert werden.

01 · Eingaben, Upscale & Referenzen#

Verwenden Sie das BUNNY-Eingabefeld, um die Szene, Bewegung, Stimmung und Klanglandschaft zu beschreiben. Fügen Sie optional bis zu vier Referenzbilder hinzu, um Identität, Palette oder Shot-Design zu steuern; lassen Sie sie getrennt für reine Textgenerierung. Legen Sie Ihre Zieldauer fest; die Bildanzahl wird automatisch berechnet, um das Abtastraster des Modells zu entsprechen. Wählen Sie eine Basisauflösung für Stufe 1, die zu Ihrer Hardware passt, und passen Sie die Upscale-Skala an, um zu bestimmen, wie stark der MiniMax H3 Latent Upscaler Breite und Höhe im Latenten Raum vergrößert. Denken Sie daran, dass die Pixelanzahl mit dem Quadrat des Skalierungsfaktors skaliert, sodass VRAM und Renderzeit mit höherem Upscaling steigen.

02 · Modellbasis · Nur Sage#

Diese Gruppe lädt das MiniMax H3-Basismodell, wendet das optionale Turbo LoRA für Geschwindigkeit an und aktiviert den SageAttention-Patch als einzige Aufmerksamkeitsänderung. Übereinstimmende MiniMax H3 Video- und Audio VAEs und der H3-Text-Encoder werden geladen, um eine konsistente Konditionierung und Dekodierung sicherzustellen. Belassen Sie diesen Abschnitt unverändert, es sei denn, Sie haben einen spezifischen Grund, eine kompatible Modelldatei auszutauschen; das Mischen von Aufmerksamkeits-Backends wird nicht empfohlen.

03 · BUNNY Stufe 1 & Stufe 2 LoRAs#

LoRAs in Stufe 1 beeinflussen Bewegungslogik, Komposition und Interaktionsmuster; LoRAs in Stufe 2 konzentrieren sich auf die Rekonstruktion vergrößerter Strukturen und feiner Details. Sie können die LoRA-Dateien durch solche ersetzen, die zu Ihrem Thema passen, und ihre Gewichte sparsam anpassen. Wenn Stufe 2 beginnt, die Bewegungsabsicht zu ändern, reduzieren Sie die LoRA-Stärke von Stufe 2, bevor Sie Stufe 1 berühren. Leiten Sie niemals LoRAs von Stufe 2 zurück in Stufe 1 und umgehen Sie Stufe 2 nicht.

04 · Stufe 1 Bewegung#

Stufe 1 Konditionierung · AUTO (#7) analysiert Ihre Eingabeaufforderung und Referenzen, wählt den geeigneten Erzeugungsmodus und montiert eine gemeinsame Video-Audio-Latent-Leinwand. Stufe 1 Dual Clock (#8) treibt separate, aber synchronisierte Video- und Audio-Zeitpläne an, sodass sich Bewegung und Ton kohärent entwickeln. Der Zwei-Pass-Plan-Knoten weist Stufe 1 ein kleines Budget für Bewegungsstruktur zu und reserviert mehr für Stufe 2 Details. Stufe 1 · Bewegungsstruktur führt das grobe Denoising durch, das Komposition und Timing festlegt; das Ergebnis ist ein verfeinertes Latent, keine endgültigen Frames.

05 · H3 3D Latent Upscale#

H3 3D Erlerntes Latent Upscale (#13) wendet den MiniMax H3 Latent Upscaler auf das Latent von Stufe 1 an und vergrößert Breite und Höhe direkt im 3D Latenten Raum. Da das Upscaling vor der Detailrekonstruktion erfolgt, wird die zeitliche Konsistenz besser bewahrt als mit Frame-Space-Upscalern. Verwenden Sie nur das offizielle 3D fp16 Checkpoint und passen Sie die Skala hier an, wenn Sie eine andere endgültige Auflösung wünschen. Der Knoten meldet auch die neuen Dimensionen, die automatisch an Stufe 2 übergeben werden.

06 · Stufe 2 HQ Rekonstruktion (OBLIGATORISCH)#

Stufe 2 Konditionierung · AUTO (#14) verwendet Ihre Eingabeaufforderung, Referenzen und die hochskalierten Dimensionen erneut, um die Führung mit der größeren Leinwand in Einklang zu bringen. Stufe 2 Versöhnen · Größe & Audio (#15) fixiert diese Dimensionen und die Audiopolitik, sodass Video und Ton synchron bleiben. Stufe 2 Detail Mixer · Fixierte 5 Schritte (#16) führt den entscheidenden Rekonstruktionspass durch, der scharfe Texturen hinzufügt und dabei die Bewegungslogik von Stufe 1 respektiert. Stufe 2 · 5-Schritt HQ Rekonstruktion denoised aus gesätem Rauschen in das endgültige Latent, und Stufe 2 AV Dekodierung (#20) konvertiert es in Frames und generiertes Audio für die Ausgabe.

07 · Endausgabe#

CreateVideo verpackt dekodierte Frames und Audio in einen Videostream mit Ihrer gewählten Bildrate. VRAM nach der Erzeugung bereinigen gibt Speicher zwischen den Rendern frei. BUNNY HQ · Endgültiges Video speichern schreibt die endgültige Datei mit Ihrem Dateinamenpräfix, Format und Codec. Speichern Sie immer von der Stufe 2 Dekodierung; Stufe 1 Vorschauen sind nicht endgültig.

Schlüssel-Knoten im Comfyui MiniMax H3 Latent Upscaler Workflow#

  • Stufe 1 Konditionierung · AUTO (#7). Zentrale Eingabe für Text, Referenzen und Modusleitung. Passen Sie die Eingabeaufforderung an und, wenn nötig, den Modus an, der bestimmt, wie Referenzen verwendet werden. Belassen Sie dies auf AUTO, es sei denn, Sie haben einen klaren Grund, einen Modus zu erzwingen, und stellen Sie sicher, dass die Referenzen die Geschichte, die Sie beschreiben, widerspiegeln.
  • Stufe 1 Dual Clock · Video 12 / Audio 3 (#8). Orchestriert separate Abtastuhren für Video und Audio, um Bewegungsrhythmen und klangliche Ereignisse abzustimmen. Wenn Sie die Zeit neu einstellen müssen, tun Sie dies vorsichtig und halten Sie beide Uhren konsistent mit Ihrem Zieltempo.
  • H3 3D Erlerntes Latent Upscale (#13). Wendet den MiniMax H3 Latent Upscaler unter Verwendung des offiziellen 3D fp16 Checkpoints an. Der einzige Parameter, den die meisten Benutzer ändern sollten, ist der Skalierungsfaktor; durch Erhöhen wird die Breite und Höhe im latenten Raum erhöht, und die Gesamtanzahl der Pixel steigt mit dem Quadrat dieses Faktors. Verwenden Sie das validierte Checkpoint des Upscalers aus der Modellkarte, um beschädigte Latents zu vermeiden. Hugging Face
  • Stufe 2 Versöhnen · Größe & Audio (#15). Stellt sicher, dass das Stufe 2 Latent die hochskalierte Größe und die ausgewählte Audiopolitik trägt, bevor die Rekonstruktion erfolgt. Wenn Sie mit den Audioeinstellungen experimentieren, halten Sie die Versöhnung aktiviert, damit Timing und Dimensionen konsistent bleiben.
  • Stufe 2 Detail Mixer · Fixierte 5 Schritte (#16). Das Herzstück der hochauflösenden Rekonstruktion, das Details hinzufügt, ohne die Bewegungslogik umzuschreiben. Wenn das Ergebnis überscharf wirkt oder in der Animation abweicht, reduzieren Sie zuerst die LoRA-Stärken von Stufe 2, und passen Sie dann die Mixer-Balancen nur bei Bedarf an.
  • Stufe 2 AV Dekodierung (#20). Dekodiert das rekonstruierte Latent in Frames und synchronisiertes Audio. Leiten Sie die Ausgaben immer von diesem Knoten in CreateVideo und Endgültiges Video speichern, um sicherzustellen, dass Farbraum und Audio korrekt behandelt werden.

Optionale Extras#

  • Für reine Textgenerierung trennen Sie alle Referenzbildeingänge, sodass AUTO einen reinen Text-zu-Video-Pfad auswählt.
  • Beim Ändern des Upscales, denken Sie daran, dass die Renderkosten mit dem Quadrat des Faktors skaliert; bevorzugen Sie die Erhöhung der Basisauflösung von Stufe 1 nur nach dem Einstellen der MiniMax H3 Latent Upscaler-Skala.
  • Um die Konsistenz über Wiederholungen hinweg zu verbessern, fixieren Sie den Seed in Gesätes Rauschen und variieren Sie ihn absichtlich, wenn Sie Alternativen erkunden.
  • Wenn Stufe 2 Bewegungsrhythmen ändert, reduzieren Sie die LoRA-Gewichte von Stufe 2, bevor Sie Sampler oder Mixer-Einstellungen berühren.
  • Halten Sie SageAttention als den einzigen Aufmerksamkeits-Patch; vermeiden Sie die Stapelung zusätzlicher Aufmerksamkeits-Backends für Stabilität. GitHub
  • Verwenden Sie das offizielle MiniMax H3 Latent Upscaler-Checkpoint, um ungültige Tensoren und nicht übereinstimmende Schlüssel zu vermeiden. Hugging Face

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken RunningHub.ai für die Workflow-Quelle, LBH-123-AI für das Minimax H3 Latent Upscaler-Modell und T8mars für die MiniMax H3 benutzerdefinierten Knoten für ihre Beiträge und Wartung. Für autoritative Details, beachten Sie bitte die ursprüngliche Dokumentation und die unten verlinkten Repositories.

Ressourcen#

Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Wartungspersonen bereitgestellt werden.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.