MiniMax H3 Hochwertiger Dual-Sampling-Workflow: Multi-Referenzvideo mit synchronisiertem nativen Audio#
Der MiniMax H3 Hochwertiger Dual-Sampling-Workflow ist ein RunComfy-fähiges Referenz-zu-Video-Diagramm, um mehrere Bildreferenzen und optionale Video- oder Audiocues in kurze Kinoclips mit nativem Audio zu verwandeln, das im selben Durchgang generiert wird. Er balanciert Identitätsbewahrung, stabile Bewegungen und scharfe Details, indem er einen Dual-Sampling-Zeitplan, speichereffiziente H3-Aufmerksamkeit, dedizierte Video- und Audio-VAEs und einen Turbo-4-Schritte-LoRA-Pfad kombiniert.
Entwickelt für Kreative, die Kontinuität über Produkte oder Charaktere hinweg benötigen, ermöglicht dieser MiniMax H3 Hochwertiger Dual-Sampling-Workflow, Subjekte, Szenen und Sound in einem Prompt zu definieren und dann polierte H3-Videoausgaben zu produzieren, ohne ein Diagramm neu zu erstellen. Geben Sie ihm eine Reihe von Standbildern, fügen Sie einen Audiostil-Referenz hinzu und exportieren Sie eine gebrauchsfertige MP4.
Schlüsselmodelle im Comfyui MiniMax H3 Hochwertiger Dual-Sampling-Workflow#
- MiniMax H3 Referenz-zu-Video-Diffusionsmodell (Ref2VA). Kern-Generator, der Referenzen plus Text in ein audiovisuelles Latent umwandelt, das sowohl Frames als auch native Audios antreibt. Siehe Modellpaket und Gewichte in den offiziellen Repositories: MiniMaxAI/MiniMax-H3 und Comfy-Org/MiniMax-H3.
- Qwen3-VL 32B Textencoder, abgestimmt für MiniMax H3. Interpretiert strukturierte Prompts, die Subjekte, Aufnahmen und Sound beschreiben, und konditioniert dann das H3 UNet über CLIP-Style-Embeddings, die im Comfy-Org-Modellpaket enthalten sind: Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE. Komprimiert und dekodiert Videolatente für effiziente hochwertige Frame-Generierung, ausgeliefert mit der Comfy-Org-Veröffentlichung: Comfy-Org/MiniMax-H3.
- MiniMax H3 Audio VAE. Kodiert und dekodiert native Audiolatente, sodass Sprache und Ambiente innerhalb derselben Pipeline erzeugt und synchronisiert werden: Comfy-Org/MiniMax-H3.
- MiniMax H3 Turbo 4-Schritte LoRA. Ein leichter Verfeinerungspfad, der Details und zeitliche Stabilität verbessert und dabei die Laufzeit kurz hält. Er stapelt sich auf das Basis-H3-Ref2VA-Modell in diesem Workflow.
Verwendung des Comfyui MiniMax H3 Hochwertiger Dual-Sampling-Workflows#
Dieses Diagramm ist in klare Gruppen organisiert, die Arbeit von Referenzen und Prompts über H3-Sampling bis zur Dekodierung und MP4-Export übergeben. Dual-Sampling stellt zuerst Bewegung und Struktur her, verfeinert dann Details und Audio, während Identitäten bewahrt werden.
Referenzbereich#
Laden Sie bis zu neun Standbilder für Personen, Objekte oder Umgebungen. Diese speisen den H3-Ref-zu-Video-Knoten, damit das Modell auf Identität, Garderobe und Szenenelemente fokussieren kann. Sie können auch einen kurzen Clip als visuelle Referenz einfügen, wenn gewünscht. Verwenden Sie Referenzen, die bereits die Zielperspektive oder Beleuchtung widerspiegeln, um die beste Bewahrung zu gewährleisten. Wenn Sie eine Charge oder ein Sprite-Sheet einbringen, kann GetImageRangeFromBatch (#40) die Frames extrahieren, die Sie nach unten verwenden möchten.
Videoreferenzbereich#
Wenn Sie lieber von einem Referenzvideo aus starten möchten, verwenden Sie den Videolader, um Frames zu ziehen und optional die Dauer zu begrenzen. GetImageRangeFromBatch (#40) wählt einen durchgehenden Ausschnitt, sodass der Workflow leicht bleibt. Diese Frames fungieren als strukturelle oder Bewegungsleitung für den ersten H3-Durchgang. Sie können Video mit Standbildern mischen; der H3-Encoder fusioniert sie vor dem Sampling.
Audioreferenzbereich#
Laden Sie ein bis drei kurze Audioausschnitte, um die Stimme, Kadenz oder das Ambiente zu leiten. Diese werden nicht wortwörtlich kopiert; stattdessen formen sie das Audiolatent, sodass die endgültige Sprache oder Klanglandschaft demselben Stil folgt. Für gesprochene Zeilen funktionieren kurze, saubere Sprachclips mit minimalem Hintergrund am besten. Wenn Sie auf Audio verzichten, generiert der Workflow dennoch plausibles Ambiente aus dem Prompt.
Modell#
Diese Gruppe verdrahtet das H3 UNet, den Qwen-basierten Textencoder und beide VAEs und wendet dann einen speichereffizienten Aufmerksamkeitspatch an. Der Lora Loader Stack (rgthree) (#118) fügt den Turbo-4-Schritte-LoRA hinzu, sodass Sie höhere Details ohne lange Zeitpläne erhalten. Der Aufmerksamkeitspatch-Knoten reduziert den VRAM-Druck, was bei größeren Auflösungen hilfreich ist. Zusammen bereiten sie den Konditionierungsstapel vor, den die Sampler verwenden werden.
Sampling#
MiniMaxH3ReferenceToVideo (#56) ist, wo Ihr Prompt, Ihre Referenzen und Ihre Auflösung zusammenkommen, um Konditionierung und ein anfängliches audiovisuelles Latent zu erzeugen. Der Knoten liest die strukturierten Prompt-Abschnitte wie subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape und non_diegetic_music. Ein grundlegender Guider und Sampler-Auswahl werden hier festgelegt, um die Konfiguration einfach zu halten, während dennoch starke Kontrolle ermöglicht wird. Betrachten Sie dies als die Bühne, bevor die Dual-Sampling-Verfeinerer übernehmen.
Sigmas#
Ein kurzer Scheduler erzeugt den Sigma-Zeitplan, der dann geteilt wird, um die Dual-Sampling-Struktur anzutreiben. Ein Zweig betont Stabilität und grobe Bewegung, während der andere hohe Frequenzdetails und Schärfe betont. Ein kleiner Boolescher Schalter lässt Sie eine Zwischenregion erweitern oder umgehen, wenn Sie mehr Bereinigung bei schwierigen Aufnahmen benötigen. Sie müssen hier keine Zahlen abstimmen; wählen Sie einfach, ob Sie den erweiterten Bereich aktivieren möchten, wenn Gesichter oder Logos zusätzliche Treue benötigen.
SamplerCustomAdvanced#
Der erste SamplerCustomAdvanced (#108) Durchgang läuft auf einem niedrigeren Sigma-Bereich, um Layout, Identitäten und Bewegungsrhythmus zu etablieren. Das Latent wird dann in Video und Audio getrennt, und das Videolatent kann im Latentenraum leicht hochskaliert werden, um Spielraum für Details zu schaffen. Der zweite SamplerCustomAdvanced (#103) Durchgang verwendet einen höheren Sigma-Ausschnitt, um Kanten und Texturen zu schärfen, während der Guider aus dem ersten Durchgang respektiert wird. Ein Begleitdurchgang SamplerCustomAdvanced (#106) kann selektiv Rauschen reduzieren oder Bereiche bewahren, und ein Schaltknoten entscheidet über das beste endgültige Latent vor der Dekodierung. Dieser Zwei-Pass-Tanz verleiht dem MiniMax H3 Hochwertiger Dual-Sampling-Workflow seine zuverlässige Mischung aus Stabilität und scharfen Details.
Beschleunigungsknoten#
Für GPUs mit engerem VRAM hilft UniBlockSwap, indem vorübergehend UNet-Blöcke in den Systemspeicher ausgelagert werden, und VRAMReserver hält genug Spielraum für Dekodierung und endgültiges Muxing. Diese Geschwindigkeits- und Speicherhelfer haben minimale Qualitätsauswirkungen und können eingeschaltet werden, wenn Sie Out-of-Memory-Warnungen sehen. Halten Sie sie in der Nähe des UNet-Pfads, wie im Diagramm verdrahtet.
Video speichern#
Das endgültige Latent wird von den dedizierten Video- und Audio-VAEs dekodiert, dann muxen PixaromaSaveMp4 (#115) Frames und Audio in eine MP4. Stellen Sie hier Ihre Zielbildrate ein und wählen Sie, ob das Video auf die generierte Audiolänge zugeschnitten werden soll. Das Dateinamenpräfix und der Unterordner machen es einfach, Takes nachzuhalten. Wenn Sie mit einem neuen Seed oder Referenzen erneut ausführen, werden die Ausgaben im selben Ordner gestapelt.
Schlüsselnoten im Comfyui MiniMax H3 Hochwertiger Dual-Sampling-Workflow#
MiniMaxH3ReferenceToVideo (#56)#
Verschmilzt Text, Bild und optionale Video- oder Audioreferenzen zu Konditionierung und einem anfänglichen audiovisuellen Latent für H3. Passen Sie prompt an, um Subjekte, Szenenkontinuität, Aufnahmezeitpunkt und Sounddesign zu definieren, und setzen Sie width, height und length auf das Zielaspekt- und die Dauer. Verwenden Sie mehrere Referenzbilder, um Identität und Garderobe zu sichern, wenn Kontinuität wichtig ist.
Lora Loader Stack (rgthree) (#118)#
Wendet den MiniMax H3 Turbo 4-Schritte LoRA auf das Basismodell an, um Details bei kurzen Zeitplänen zu verbessern. Passen Sie die LoRA-Stärke an, wenn Kanten zu scharf werden oder wenn der Stil des Basismodells überschrieben wird. Halten Sie LoRA-Schichtung minimal, wenn die Referenzen bereits starke Texturen tragen.
MiniMaxH3MemoryEfficientSageAttentionPatch (#70)#
Ermöglicht speichereffiziente Aufmerksamkeit für das H3 UNet, sodass Sie höhere Auflösungen oder längere Clips auf bescheidenen GPUs ausführen können. Schalten Sie es für 8 bis 12 GB Karten ein oder wenn Sie VRAM-Spitzen sehen. Deaktivieren Sie es nur, wenn Sie den rohen Durchsatz auf GPUs mit hohem Speicher testen.
SplitSigmas (#99)#
Teilt den Scheduler in komplementäre Sigma-Bänder, die die beiden Sampler-Durchgänge speisen. Wenn Ihre Szene stabil ist, aber Biss fehlt, verschieben Sie mehr Gewicht auf den hohen Sigma-Zweig. Wenn Bewegungen zittern oder Identitäten driften, bevorzugen Sie den niedrigen Sigma-Zweig und halten Sie den erweiterten Zwischenschalter aus.
SamplerCustomAdvanced (#108)#
Erster Pass-Sampler, der Struktur, Bewegung und Identität festlegt. Halten Sie den Guider konsistent mit Ihrem Prompt und Ihren Referenzen, damit der zweite Durchgang eine saubere Basis hat. Verwenden Sie diesen Durchgang, um Samen und Rahmen schnell zu testen, bevor Sie sich auf Verfeinerung festlegen.
SamplerCustomAdvanced (#103)#
Verfeinerungssampler, der einen höheren Sigma-Ausschnitt verwendet, um Details zu verbessern und Kanten zu reparieren. Funktioniert am besten nach einem soliden ersten Durchgang; vermeiden Sie Übersteuerung, wenn Gesichter oder Logos zu scharf werden. Kombinieren Sie es mit latentem Upscaling nur, wenn Sie zusätzlichen Texturspielraum benötigen.
ComfySwitchNode (#107)#
Wählt zwischen alternativen Latentverfeinerungen nach Dual-Sampling. Umschalten, wenn Sie Ergebnisse aus dem zusätzlichen Entstörungszweig im Vergleich zum direkten Verfeinerungszweig vergleichen. Notieren Sie sich, welcher Pfad die Identität für Ihr Subjekt-Set besser bewahrt.
PixaromaSaveMp4 (#115)#
Muxed dekodierte Frames und Audio zu MP4. Stellen Sie fps ein, um das Gefühl Ihrer Bewegung anzupassen, und verwenden Sie trim_to_audio für enge audiovisuelle Synchronisierung. Aktualisieren Sie das filename_prefix, um Takes nach Aufnahmen oder Subjekten organisiert zu halten.
Optionale Extras#
- Starten Sie vom offiziellen H3 R2V-Template, um das Kernmuster zu lernen, bevor Sie dieses Diagramm anpassen: Comfy-Org workflow template.
- Verwenden Sie
ResolutionSelector(#73), um einen Aspekt- und Megapixel-Ziel auszuwählen, den Ihre GPU verarbeiten kann, und erhöhen Sie ihn allmählich, sobald das Framing richtig aussieht. - Prompt in strukturierten Abschnitten, die das Modell versteht: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music. Dieser Stil gibt H3 klarere Einschränkungen.
- Für identitätskritische Aufnahmen liefern Sie 3 bis 5 hochwertige Standbilder desselben Subjekts in passender Beleuchtung und Winkel. Vermeiden Sie starke Filter auf Referenzen.
- Stellen Sie einen sauberen 1 bis 5 Sekunden langen Sprachstilclip als Audioreferenz für konsistente Klangfarbe über Charaktere hinweg bereit. Halten Sie Geräusche und Musik niedrig.
- Wenn Sie VRAM-Grenzen erreichen, aktivieren Sie den Aufmerksamkeitspatch und die Acceleration Nodes-Gruppe. Senken Sie zuerst die Auflösung und dann die Länge.
- Wenn die Bewegung stimmt, aber die Texturen weich sind, halten Sie den ersten Durchgang wie er ist und erhöhen Sie die Abhängigkeit von dem zweiten Sampler-Zweig, anstatt die gesamten Schritte zu verlängern.
- Speichern Sie oft Versionen. Kleine Prompt-Änderungen haben große Auswirkungen, da der MiniMax H3 Hochwertiger Dual-Sampling-Workflow sowohl Video als auch Audio zusammen konditioniert.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken MiniMaxAI für das MiniMax-H3-Modell, Comfy-Org/Comfy.org für die ComfyUI-Templates, Gewichte und das Tutorial für MiniMax H3, und RunningHub.ai für die Workflow-Referenz für ihre Beiträge und Wartung. Für autoritative Details verweisen Sie bitte auf die Originaldokumentation und die unten verlinkten Repositories.
Ressourcen#
- RunningHub.ai/Workflow-Quelle und Referenz
- Docs / Release Notes: Workflow-Quelle und Referenz
- MiniMaxAI/MiniMax-H3 (offizielles Modell)
- Hugging Face: MiniMaxAI/MiniMax-H3
- Comfy-Org/MiniMax-H3 (Modellgewichte)
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org/MiniMax H3 Tutorial
- Docs / Release Notes: Tutorial
- Comfy-Org/ComfyUI MiniMax H3 R2V Template
- GitHub: Comfy-Org/workflow_templates
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.


