ComfyUI>Workflows>MiniMax H3 Multi-Referenzen zu Video 4 Schritte Turbo

MiniMax H3 Multi-Referenzen zu Video 4 Schritte Turbo

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1485
Verwandeln Sie Referenzbilder in ein kurzes Hailuo H3-Video. Halten Sie Gesichter und Garderobe über mehrere Motive hinweg konsistent. Führen Sie Kamerabewegungen und Dialoge in einem Prompt aus. Erzeugen Sie natives Stereo-Audio mit dem Clip. Der 4-Schritte Turbo LoRA verkürzt die Renderzeit. Erstellen Sie Duette, Produktszenen und Charakter-Beats schneller.

MiniMax H3 ComfyUI Reference to Video 4-step Turbo Workflow

MiniMax H3 ComfyUI - 4-Step Reference-to-Video Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Reference to Video 4-step Turbo Examples

MiniMax H3 ComfyUI Referenz zu Video 4-Schritte Turbo#

MiniMax H3 ComfyUI Referenz zu Video 4-Schritte Turbo ist ein RunComfy-bereiter Referenz-zu-Video-Workflow, der eine oder mehrere Charakteridentitäten aus Standbildern sperrt und einen kurzen Clip mit nativem Stereo-Audio in einem einzigen beschleunigten Durchgang generiert. Es ist für Kreative konzipiert, die konsistente Gesichter, Garderobe und Inszenierung in einer Szene benötigen, während die Kamerabewegung, der Dialog und die Lippen-Synchronisation kohärent bleiben.

Dieser Graph verwendet MiniMax H3s ref2va-Pipeline plus einen Turbo LoRA, sodass Multi-Subjekt-Identität, Bewegung und Sprache ohne den längeren Standardzeitplan einheitlich bleiben. Markieren Sie Ihre Standbilder mit <Picture N> im Prompt, bringen Sie optional Referenzvideo und -audio mit und rendern Sie einen sauberen Clip direkt in ComfyUI auf RunComfy.

Wichtige Modelle im Comfyui MiniMax H3 ComfyUI Referenz zu Video 4-Schritte Turbo Workflow#

  • MiniMax-H3 Referenz-zu-Video Diffusionsmodell (ref2va). Bietet das Kern-Generationsgerüst für die Konditionierung auf Standbilder, optionales Video und Text, um kohärente Shots zu synthetisieren. Gewichte sind im Comfy-Org-Paket von MiniMax-H3 auf Hugging Face verfügbar. Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE. Codiert und decodiert Video-Latente, auf denen der Sampler operiert, und bewahrt dabei zeitliche Glätte und Detail. Wird mit demselben Paket verteilt. Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE. Handhabt den nativen Stereo-Audiotrack gemeinsam mit dem Video, sodass Sprache und Ambiente mit dem Shot erstellt werden. Wird zusammen mit den Videokomponenten mitgeliefert. Comfy-Org/MiniMax-H3
  • Qwen-VL 32B Text-Encoder abgestimmt auf MiniMax-H3. Übersetzt den Prompt, einschließlich <Picture N> Markierungen und Bühnenanweisungen, in Konditionierungssignale, die von H3 verwendet werden. Verpackt in der Comfy-Org-Veröffentlichung. Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-Schritte LoRA. Ein Beschleunigungs-LoRA, das den Zeitplan komprimiert, sodass der Shot in einem schnellen Durchgang generiert werden kann, während Identität und Bewegungs-Konsistenz erhalten bleiben. larryvrh/MiniMax-H3-Turbo-Lora

Wie man den Comfyui MiniMax H3 ComfyUI Referenz zu Video 4-Schritte Turbo Workflow verwendet#

Der Workflow bewegt sich von Referenzen und Timing zu Modell-Setup, Konditionierung, Sampling und finalem Mux. Sie können ihn nur mit Standbildern ausführen oder Standbilder mit optionalem Referenzvideo und -audio kombinieren.

Phase 1 — Referenzen, Prompt und Timing#

Laden Sie ein oder mehrere Standbilder über die LoadImage-Knoten und planen Sie, sie als <Picture 1>, <Picture 2> usw. in Ihrem Prompt zu referenzieren. Wenn Sie einen Leitclip haben, geben Sie ihn über die VHS_LoadVideo-Knoten ein; deren Audio kann ebenfalls weitergegeben werden, um Rhythmus und Energie zu leiten. Um maßgeschneiderten Dialog oder Ambiente bereitzustellen, verwenden Sie die LoadAudio-Knoten zusätzlich oder anstelle von Referenzvideo-Audio. Geben Sie Ihre vollständige Shot-Beschreibung in Input Text (Prompt) mit allen Charakter-Sperren, Kamerabewegungen und Dialogen ein. Der Workflow konvertiert Ihre gewünschte Dauer automatisch in eine stabile Bildanzahl und richtet die Zeitleiste auf MiniMax H3s interne Schrittweite aus.

Phase 2 — Modell-Setup und Turbo-Beschleunigung#

Das Kern-H3 ref2va UNet, der Text-Encoder und die Video- und Audio-VAEs werden im „Core Workspace“ geladen. Der speichereffiziente Attention-Patch ermöglicht größere Shots oder höhere Auflösungen auf typischen GPUs, ohne Ihre Nutzung zu ändern. Der Turbo 4-Schritte LoRA wird durch LoraLoaderModelOnly (#164) angewendet, sodass Sie die Schrittanzahl niedrig halten können, während die Identitäts- und Bewegungs-Sperre erhalten bleibt. Keine manuelle Verkabelung erforderlich; der Graph ist für RunComfy vorverbunden. Wenn Sie einige Eingaben nicht verwenden, schalten Sie ungenutzte Load Image / Load Video / Load Audio-Knoten mit Strg+B aus, um den Lauf schlank zu halten.

Phase 3 — Konditionierung und latente Montage#

MiniMaxH3ReferenceToVideo (#136) nimmt Ihren Prompt, Standbilder und eventuell optionale Video- oder Audioreferenzen auf, um die Konditionierung und eine initialisierte latente Zeitleiste zu erstellen. Verwenden Sie <Picture N>-Tags, um jede Person oder jedes Objekt klar an ein bestimmtes Standbild zu binden; die Reihenfolge folgt den Referenzslots, die Sie ausgefüllt haben. Sie können Kameraverhalten, Lippen-Synchronisation und Ambiente in natürlicher Sprache lenken. Breite, Höhe und Dauer fließen in diesen Knoten ein, sodass das Framing und Timing Ihrer Absicht entsprechen. Wenn Sie viele Standbilder haben, behalten Sie nur die, die wirklich Identität und Garderobe für den aktuellen Beat definieren.

Phase 4 — Sampling#

Der Graph leitet das Latente durch einen minimalen Zeitplan und einen schnellen Sampler, der von KSamplerSelect (#123) ausgewählt wird, geführt von BasicGuider (#126). BasicScheduler (#124) liefert das Schrittmuster, das der Turbo LoRA erwartet, wobei Geschwindigkeit und Treue ausbalanciert werden. SamplerCustomAdvanced (#125) löst die Zeitleiste in einem effizienten Durchgang mit gesätem Rauschen zur Reproduzierbarkeit auf. In den meisten Fällen können Sie diese Komponenten so belassen, wie sie konfiguriert sind, und sich auf den Prompt, die Referenzen und das Framing konzentrieren.

Phase 5 — Dekodieren, Muxen und Speichern#

Nach dem Sampling stellt VAEDecode die Videoframes wieder her und VAEDecodeAudio stellt den Stereo-Track wieder her. CreateVideo (#130) multiplexiert die Bilder und das Audio in eine abspielbare Datei mit der von Ihnen gewählten Rate und Bittiefe. Schließlich schreibt SaveVideo (#92) das Ergebnis mit dem ausgewählten Container und Codec auf die Festplatte. Das Ergebnis ist ein kurzer Clip mit identitätsgesperrten Charakteren, Kamerabewegung und nativem Stereo-Audio, erstellt von MiniMax H3 ComfyUI Referenz zu Video 4-Schritte Turbo.

Wichtige Knoten im Comfyui MiniMax H3 ComfyUI Referenz zu Video 4-Schritte Turbo Workflow#

MiniMaxH3ReferenceToVideo (#136)#

Dies ist das Herzstück des Workflows, das Prompt-Text, Standreferenzen und optionales Video/Audio in Konditionierung und ein initialisiertes Latentes fusioniert. Passen Sie prompt an, um <Picture N>-Markierungen und klare Bühnenanweisungen für Kamera, Dialog und Ambiente einzufügen. Stimmen Sie width, height und length ab, um Framing und Dauer für den Shot festzulegen. Wenn Sie Details gegen Geschwindigkeit auf Standbildern abwägen müssen, wechseln Sie ref_image_size zwischen Modi wie dem Anpassen der Rendergröße oder dem Verkleinern für leichtere Läufe. Halten Sie Ihr Referenzset fokussiert auf die Identitäten, die Sie tatsächlich in der Szene benötigen.

LoraLoaderModelOnly (#164)#

Wendet den MiniMax-H3 Turbo 4-Schritte LoRA auf das ref2va-Modell an, sodass der Zeitplan für schnelles Inference komprimiert werden kann. Die strength steuert, wie stark der LoRA das Rückgrat beeinflusst; höhere Werte begünstigen Geschwindigkeit und den Turbo-Look, während niedrigere Werte sich wieder mehr an der Basis H3 orientieren. Wenn Sie bei extremer Beschleunigung einen Verlust an feinen Details bemerken, reduzieren Sie die LoRA-Stärke leicht oder verlängern Sie den Zeitplan im Scheduler, um die Treue wiederherzustellen. Siehe die LoRA-Modellkarte für Versionshinweise und beabsichtigte Verwendung. MiniMax-H3 Turbo LoRA

MiniMaxH3MemoryEfficientSageAttentionPatch (#163)#

Ermöglicht eine speichereffiziente Attention-Implementierung, die mit MiniMax H3 kompatibel ist, sodass Sie höhere Auflösungen oder längere Shots auf begrenztem VRAM ausführen können. Es ist in diesem Graphen parameterlos; einfach aktiviert lassen für beste Kapazität. Der Knoten ist Teil der KJNodes für ComfyUI. kijai/ComfyUI-KJNodes

BasicScheduler (#124)#

Definiert den Diffusionszeitplan, der während des Samplings verwendet wird. Mit aktiviertem Turbo LoRA halten Sie die Schrittanzahl kompakt für Geschwindigkeit und passen sie nur an, wenn Sie zusätzliche Schärfe oder Stabilität benötigen. denoise ermöglicht eine stärkere Neuinterpretation von Referenzen, wenn Ihr Prompt größere Änderungen erfordert. Änderungen hier interagieren mit LoRA-Stärke und dem gewählten Sampler, daher in kleinen Schritten anpassen.

KSamplerSelect (#123)#

Wählt den Samplings-Algorithmus für den Durchgang aus. Ein einfacher, stabiler Sampler passt gut zu Turbo-Zeitplänen und hilft, Identität über Frames hinweg zu bewahren. Wenn Sie Stilisierung oder sehr schnelle Kamerabewegung betonen, probieren Sie alternative Sampler, die möglicherweise Bewegungstextur hinzufügen, auf Kosten einer leichten Variabilität.

CreateVideo (#130) und SaveVideo (#92)#

CreateVideo setzt dekodierte Frames und Audio zu einem finalen Stream zusammen, wobei Sie fps und bit_depth an Ihre Lieferbedürfnisse anpassen können. SaveVideo wählt den Container und Codec für den Export; verwenden Sie eine weit unterstützte Kombination für allgemeine Freigabe oder eine hochwertige Variante für die Nachbearbeitung. Wenn Sie schnell iterieren, halten Sie die Einstellungen leicht und wechseln Sie dann zu Produktionseinstellungen für das endgültige Rendern.

Optionale Extras#

  • Bei mehreren Charakteren platzieren Sie die klarsten, frontal orientierten Standbilder zuerst und referenzieren Sie sie als <Picture 1>, <Picture 2> usw. Verwenden Sie ein oder zwei zusätzliche Standbilder pro Subjekt für Winkel- oder Garderobenabdeckung.
  • Wenn Sie ein Referenzvideo mitbringen, fügen Sie im Prompt eine kurze Beschreibung des gewünschten Kameraverhaltens hinzu, damit H3 weiß, was zu bewahren und was neu zu interpretieren ist.
  • Die Dauersteuerung schnallt sich intern auf eine sichere Bildanzahl für H3; wenn Sie Ihre Zielbildrate in CreateVideo ändern, überprüfen Sie die Timing-Notizen in Ihrem Prompt erneut.
  • Die Video- und Audio-Hilfsknoten stammen aus dem Video Helper Suite; sie bieten robustes Medien-I/O innerhalb von ComfyUI. Kosinkadink/ComfyUI-VideoHelperSuite
  • Suchen Sie einen Basisvergleichs-Workflow für MiniMax H3 Referenz-zu-Video in ComfyUI? Überprüfen Sie die offizielle Vorlage und passen Sie Ideen nach Bedarf an. Comfy-Org Workflow-Vorlage

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken MiniMax Research für das MiniMax H3 Modell, Comfy.org für die MiniMax H3 ComfyUI Workflow-Beispiele, Comfy-Org für die MiniMax-H3 Modellgewichte und larryvrh für den MiniMax-H3 Turbo LoRA für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die originale Dokumentation und die unten verlinkten Repositories.

Ressourcen#

Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen der Autoren und Wartenden.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.