All-in-One MiniMax H3 ComfyUI Multi References Beschleunigt: multi‑reference Ref2VA Video mit synchronisiertem Stereo-Audio#
Dieser All-in-One MiniMax H3 ComfyUI Multi References Beschleunigter Workflow verwandelt bis zu neun visuelle Referenzen plus optionale Video- und Audiohinweise in einen kurzen filmischen Clip mit einem nativen Stereo-Soundtrack. Er ist für Kreative konzipiert, die charakterkonsistente Aufnahmen wünschen, die mehrere Identitäten, Requisiten oder Orte zusammenführen und dabei Aufforderungs-Tags wie <Picture 1> korrekt auf die Referenz abstimmen.
Aufgebaut um den offenen Comfy‑Org MiniMax‑H3 Ref2VA Stack, ermöglicht der Graph SageAttention-Beschleunigung für schnelleres Sampling auf unterstützten GPUs und verwendet ein int8‑pruned Modell, um den VRAM im Griff zu behalten, ohne die Kohärenz zu opfern. Das Ergebnis ist eine einzelne RunComfy-bereite Leinwand für MiniMax H3, bei der Multi-Referenz-Führung, Timing, Auflösung und Export von Anfang bis Ende verkabelt sind.
Wichtige Modelle im Comfyui All-in-One MiniMax H3 ComfyUI Multi References Beschleunigten Workflow#
- MiniMax‑H3 Ref2VA Diffusionsmodell (pruned int8 convrot). Core-Generator, der Ihre Referenzen und Aufforderung in gemeinsame Video- und Audio-Latents verschmilzt. Gewichte: Comfy‑Org/MiniMax‑H3.
- Qwen3‑VL 32B Text‑Bild‑Sprach-Encoder (AWQ, verpackt mit dem MiniMax‑H3 Release). Interpretiert Ihre Aufforderung, einschließlich Tags wie <Picture 1>, und konditioniert den Generator. Gewichte sind enthalten in Comfy‑Org/MiniMax‑H3.
- MiniMax H3 Video VAE (FP16). Dekodiert Video-Latents zu Frames mit hoher Wiedergabetreue. Gewichte: Comfy‑Org/MiniMax‑H3.
- MiniMax H3 Audio VAE (FP32). Dekodiert Audio-Latents zu einer sauberen, stereo Wellenform, die bereit für Muxing ist. Gewichte: Comfy‑Org/MiniMax‑H3.
Verwendung des Comfyui All-in-One MiniMax H3 ComfyUI Multi References Beschleunigten Workflows#
Auf hohem Niveau laden Sie Modelle, liefern Referenzen und eine Aufforderung, der Workflow baut MiniMax‑H3-Konditionierung auf, führt einen beschleunigten Sampler aus, dann dekodiert und kombiniert Video-Frames mit dem generierten Stereo-Audio. Gruppen arbeiten in Sequenz: Benutzereingaben speisen Konditionierung, die das Sampling antreibt; die dekodierten Ergebnisse gehen zum Export.
Benutzereingaben#
Verwenden Sie die LoadImage-Knoten, um bis zu neun Referenzen zu verbinden. Halten Sie eine konsistente Reihenfolge, damit Aufforderungs-Tags wie <Picture 1>, <Picture 2> und so weiter den beabsichtigten Bildern entsprechen. Schreiben Sie Ihre Szene und Ihren Dialog im Feld Input Text (Prompt), indem Sie Identitäten oder Assets explizit den nummerierten Tags am Anfang der Aufforderung zuordnen. Wählen Sie Aspekt und Größe im Resolution Selector (Size); er gibt Breite und Höhe aus, die auf ein 32-Pixel-Multiple für Stabilität gerundet sind. Legen Sie die Clip-Dauer in Sekunden fest; ein interner Ausdruck konvertiert sie in eine Bildanzahl nahe 24 fps und stimmt sie auf ein modellfreundliches Vielfaches für reibungsloses Sampling ab.
Modelle#
Diese Gruppe lädt das MiniMax‑H3 UNet, den Qwen3‑VL 32B Text-Encoder und beide VAEs. Das int8‑pruned Ref2VA Modell reduziert den Speicher, während die Bewegungs- und Lippen-Synchronisationsqualität erhalten bleibt. Der Text-Encoder ist für MiniMax‑H3 initialisiert, sodass visuelle Tags in Ihrer Aufforderung an die richtigen Referenzen gebunden werden. Separate VAEs für Video und Audio halten das Dekodieren genau und effizient. Die Modelle gehören zur gleichen Familie, die von der offiziellen Ref2VA-Vorlage verwendet wird, hier für Multi-Referenz-Steuerung und gemeinsame Audioanpassung adaptiert. Referenz: MiniMax‑H3 R2V template.
Konditionierung#
MiniMaxH3ReferenceToVideo baut die tatsächliche H3-Konditionierung und einen Starter-Latent-Clip. Es nimmt Ihr CLIP, VAEs, alle verbundenen Referenzbilder, die Aufforderung sowie die gewählte Breite, Höhe und Länge auf. Der Knoten respektiert Platzhalter-Tags, sodass Identitäten, Orte und Requisiten an den richtigen Referenzen hängen bleiben. Verwenden Sie den Referenzgrößenmodus, um die Komposition im Maßstab relativ zu Ihrem Ausgang zu halten. Der Knoten gibt einen positiven Konditionierungsstrom und einen Latent-Clip aus, die zusammen den Sampler antreiben.
Sampling#
Vor dem Sampling umwickelt der Graph das Modell mit PathchSageAttentionKJ, um SageAttention-Beschleunigung zu ermöglichen, und leitet es dann durch einen VRAM-Manager, damit große Clips besser passen. BasicGuider, BasicScheduler und KSamplerSelect definieren die Führungsstrategie, den Schrittzeitplan und den Sampler-Algorithmus. RandomNoise setzt den Prozess in Gang und SamplerCustomAdvanced führt die Denoising-Pässe gegen das Modell und die Konditionierung aus, wodurch verfeinerte Video- und Audio-Latents entstehen. Das Layout balanciert Geschwindigkeit und Qualität für MiniMax‑H3, während die Einstellungen zugänglich bleiben.
Export#
VAEDecode und VAEDecodeAudio wandeln die endgültigen Latents in Frames und eine Stereo-Wellenform um. VHS_VideoCombine mischt dann Frames und Audio in eine einzelne MP4 bei Ihrer gewählten Bildrate, mit einer Qualitätskontrolle über CRF und einem einfachen Dateinamenpräfix zur Organisation. Sie können das Ergebnis sofort in der Vorschau anzeigen und in Ihrem Ausgabeverzeichnis speichern. Wenn Sie später eine externe Referenz-Audio einspeisen, kann der Exporter auf diese Tracklänge trimmen, um eine perfekte Ausrichtung zu erreichen. Der Exporter stammt aus der weit verbreiteten Video Helper Suite für ComfyUI: ComfyUI‑VideoHelperSuite.
Wichtige Knoten im Comfyui All-in-One MiniMax H3 ComfyUI Multi References Beschleunigten Workflow#
MiniMaxH3ReferenceToVideo (#136) Dies ist das Herzstück des Workflows, wo Referenzen, Aufforderung, Größe und Länge in MiniMax‑H3-Konditionierung und einen latenten Clip verschmolzen werden. Passen Sie den prompt-Text mit expliziten Tag-Zuordnungen wie <Picture 1> = character A an, um Identitäten zu sperren. Passen Sie width, height und length an, um Komposition und Laufzeit festzulegen; der Upstream-Selektor und die Dauersteuerung kümmern sich um sichere Vielfache. Verwenden Sie den Referenzgrößenmodus, um den Maßstab des Subjekts gegenüber dem Ausgabeframe auszugleichen. Der Knoten unterstützt den offiziellen Ref2VA-Pfad und ist hier für Multi-Referenz-Steuerung maßgeschneidert.
PathchSageAttentionKJ (#144) Umschließt das Modell mit SageAttention, um Aufmerksamkeits-Schichten zu beschleunigen und den Speicherbedarf auf unterstützten GPUs zu reduzieren. Lassen Sie den Beschleunigungsmodus für die meisten Karten auf auto; aktivieren Sie die Modellkompilierung nur, wenn Ihre Umgebung davon profitiert. Wenn Sie Instabilität beobachten, schalten Sie den Modus aus, um die Leistung zu vergleichen. Quelle: ComfyUI‑KJNodes.
BasicScheduler (#124) Definiert den Sigma-Zeitplan und die gesamten Schritte, die während des Denoising verwendet werden. Das Erhöhen der Schritte kann Details hinzufügen, aber die Renderzeit verlängern; paaren Sie jede Änderung hier mit einem kompatiblen Samplertyp. Halten Sie denoise nahe voll für reine Generierung und erwägen Sie, es nur zu senken, wenn Sie eine stärkebegrenzte Verfeinerung durchführen.
SamplerCustomAdvanced (#125) Führt die Diffusionsschleife mit dem gewählten Sampler, Zeitplan und Führungsmechanismus aus. Der Standard-Sampler balanciert zeitliche Stabilität und Bewegungsflüssigkeit für MiniMax‑H3. Wenn Sie die Scheduler-Familie ändern, wählen Sie einen Sampler, der dafür ausgelegt ist, um Artefakte zu vermeiden.
Resolution Selector (Size) (#115) Gibt Breite und Höhe aus, die auf ein 32-Pixel-Multiple für GPU-freundliche Formen gerundet sind. Setzen Sie megapixels für einen schnellen Qualitäts-gegen-Geschwindigkeit-Abgleich, und wählen Sie ein Seitenverhältnis wie 16:9 für Breitbildaufnahmen. Verwenden Sie bescheidene Größen für Entwurfsvorschauen, dann skalieren Sie hoch, sobald Timing und Rahmung gesperrt sind.
ComfyMathExpression (#131) Transformiert die angeforderten Sekunden in eine Bildanzahl nahe 24 fps und stimmt sie auf ein Vielfaches ab, das mit dem Sampler und Modell kooperiert. Dies hilft, zeitliche Zittereffekte und Off-by-One-Timing-Probleme zu vermeiden. Sie müssen es selten berühren; steuern Sie das Timing von der Sekundeneingabe aus.
VHS_VideoCombine (#143) Mischt Frames und das generierte Stereo-Audio in ein endgültiges Ergebnis. Setzen Sie frame_rate, um Ihre Ziel-Timeline zu erreichen, und passen Sie crf für Qualität an. Verwenden Sie trim_to_audio, wenn Sie einen externen Track bereitstellen und einen perfekten Schnitt auf Länge wünschen.
Optionale Extras#
- Schnelle 16:9-Größen, die schnell rendern und sauber aussehen: 1056×608 (0.6 MP), 1216×672 (0.8 MP), 1344×768 (0.98 MP), 1664×928 (1.5 MP), 1920×1088 (2.0 MP).
- Halten Sie Aufforderungen explizit: beginnen Sie mit einem Mapping-Block, der
<Picture 1..9>an Identitäten, Outfits, Requisiten oder Orte bindet, bevor Sie die Aufnahme beschreiben. - Für konsistente Gesichter verwenden Sie scharfe, frontale Bilder und variieren nur Beleuchtung oder Winkel leicht über die Referenzen.
- Dialog und Geräuscheffekte funktionieren gut, wenn sie als kurze, natürliche Sätze geschrieben sind; der Audio VAE wird eine saubere Stereo-Spur aus dem Ref2VA Latent synthetisieren.
- Wenn VRAM knapp ist, rendern Sie zuerst einen kürzeren Clip oder reduzieren Sie Megapixel, dann skalieren oder erweitern Sie, sobald Sie mit Bewegung und Rahmung zufrieden sind.
- Dieses Layout folgt der offiziellen Ref2VA-Vorlagenlinie, angepasst für Multi-Referenz-Steuerung und Beschleunigung. Siehe die Basistemplate für Kontext: MiniMax‑H3 R2V template.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken MiniMax für MiniMax H3, Comfy-Org für die MiniMax-H3 Modellgewichte und die MiniMax H3 R2V Workflow-Vorlage, und Comfy.org für das MiniMax H3 Tutorial für ihre Beiträge und Wartung. Für autoritative Details, lesen Sie bitte die Originaldokumentation und Repositories, die unten verlinkt sind.
Ressourcen#
- MiniMax H3 offizielle Ankündigung
- Docs / Release Notes: MiniMax H3 Ankündigung
- Comfy-Org MiniMax-H3 Modellgewichte
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org MiniMax H3 Tutorial
- Docs / Release Notes: Comfy.org Tutorial
- Comfy.org MiniMax H3 R2V Vorlage
- GitHub: Comfy-Org/workflow_templates
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen der Autoren und Betreuer.

