VDN H3 MiniMax ComfyUI Text To Video#
VDN H3 ComfyUI Text To Video verwandelt natürliche Sprachaufforderungen in kurze, kinoreife Videos mit synchronisiertem Audio. Es kombiniert die MiniMax H3 Familie mit Video DeltaNet hybrider Aufmerksamkeit und 8-Schritt-Sampling, um Video und Audio aus einer einzigen Eingabeaufforderung zu erzeugen. Es eignet sich gut für Storyboards, Produktclips und stilisierte Szenen wie kinoreife Fantasy, Rallyefahrten und gepanzerte Schwertkämpfe.
Das Diagramm enthält zwei unabhängig wählbare Zweige. Der VDN-H3-Zweig wendet den Video DeltaNet-Patch an und wurde verwendet, um die enthaltenen Beispiele zu produzieren. Der FastVideo-Zweig wird zum Vergleich von Ausgabe und Generierungszeit mit dem VDN-Pfad bereitgestellt. Beide Zweige rendern MP4 mit Audio in Ihrer gewählten Bildrate.
Aufgebaut auf offenen Komponenten: VDN für MiniMax H3 GitHub und Hugging Face, VDN-H3 ComfyUI-Knoten von Saganaki22 GitHub, und MiniMax H3 Basisgewichte und VAEs Hugging Face.
Hauptmodelle im Comfyui VDN H3 ComfyUI Text To Video Workflow#
- MiniMax-H3 Diffusionsmodell (UNet). Treibt den Entrauschungsprozess an, der Rauschen in kohärente raumzeitliche Video- und Audiolatenten verwandelt. Gewichte sind im MiniMax H3 Paket auf Hugging Face enthalten.
- Qwen3-VL 32B MiniMax-H3 Text-Encoder. Wandelt Ihre Eingabeaufforderung in Konditionierung für die Video- und Audiogenerierung um, abgestimmt auf die H3 Familie. Im MiniMax H3 Release auf Hugging Face enthalten.
- MiniMax-H3 Video VAE. Dekodiert Videolatenten zu RGB-Frames. Verfügbar im VAEs-Bereich von Hugging Face.
- MiniMax-H3 Audio VAE. Rekonstruiert Wellenform-Audio aus Audiolatenten. Ebenfalls auf Hugging Face bereitgestellt.
- VDN-H3 Patch-Gewichte. Video DeltaNet wendet hybride Aufmerksamkeit auf MiniMax H3 an. Holen Sie sich die Checkpoints von Hugging Face.
- FastVideo UNet Variante. Der Vergleichszweig verwendet
minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensorsvon Kijai/MiniMax-H3-experimental.
Wie man den Comfyui VDN H3 MiniMax ComfyUI Text To Video Workflow verwendet#
Beginnen Sie mit dem Einstellen Ihrer Eingabeaufforderung, Auflösung, Dauer und Bildrate. Wählen Sie den VDN-H3-Zweig oder den FastVideo-Zweig für einen individuellen Lauf. Queue All kann beide aktivierten Zweige ausführen und zwei MP4s produzieren; separate Diagrammzweige garantieren keine gleichzeitige GPU-Ausführung. Beide Zweige sind für 8 Sampling-Schritte konfiguriert.
Benutzereingabe#
Verwenden Sie das (input:prompt) Text Prompt-Panel, um sowohl visuelle als auch akustische Elemente in einfacher Sprache zu beschreiben. Für Audio fügen Sie eine abschließende Zeile hinzu, die mit Audio: beginnt, um spezifische Geräusche oder Umgebungen anzufordern, zum Beispiel "Audio: rhythmische Hufschläge, Wind, entferntes Brüllen." Kontrollieren Sie die visuelle Größe mit (input:Resolution) Megapixels, das den ResolutionSelector speist, um eine Breite und Höhe zu erzeugen, die rechenfreundlich sind. Setzen Sie (input:Duration) Seconds und (input:FPS) fest, um zu definieren, wie lang und fließend der Clip wirken soll. Der Workflow konvertiert Dauer und FPS in eine gültige Bildanzahl und passt sie leise an eine Sequenzlänge an, die gut mit den internen Abläufen von H3 harmoniert.
Modelle#
Der CLIPLoader stellt den MiniMax-abgestimmten Text-Encoder bereit, der für die Konditionierung verwendet wird. Zwei VAELoader-Knoten bringen den MiniMax-H3 Video VAE und Audio VAE ein, sodass dekodierte Frames und Sounds mit dem latenten Raum des Modells übereinstimmen. Diese Loader werden von beiden Zweigen geteilt, um vergleichbare A/B-Ergebnisse sicherzustellen.
Konditionierung#
MiniMaxH3ImageToVideo (#219) verwandelt Ihre Eingabeaufforderung sowie Größe und Länge in das anfängliche Video- und Audiolatenz sowie die positive Konditionierung. Optionale Bildeingaben können verwendet werden, um den ersten oder letzten Frame zu fixieren, wenn Sie eine bestimmte Eingangs- oder Ausgangsposition benötigen. In diesem Stadium zählen Ihre narrativen Entscheidungen am meisten: Kamerabewegung, Subjektaktion, Beleuchtung und die Audio:-Zeile werden alle zu einer Anleitung für den Sampler stromabwärts.
VDN-H3 Patch#
Der VDN-Zweig wendet das Video DeltaNet-Upgrade mit ApplyVDNH3Advanced (#6126) an. Es wendet den ausgewählten hybriden Aufmerksamkeits-Patch an. MiniMaxChunkFeedForward und ModelPatchTorchSettings konfigurieren Speicher- und Ausführungseinstellungen. MiniMaxH3SigmaShift passt den Rausch-Zeitplan für Video und Audio an, bevor das Sampling beginnt.
Sampling (VDN-H3)#
Das VDN-Sampling beginnt mit RandomNoise (#6141), vereint Anleitung mit BasicGuider (#6134), wählt den Löser in KSamplerSelect (#6137) und plant eine kompakte Anzahl von Diffusionsschritten in BasicScheduler (#6136). SamplerCustomAdvanced (#6135) führt das Entrauschen über die gesamte Sequenz durch, um verfeinerte Video- und Audiolatenten zu erzeugen. Halten Sie den Seed für Wiederholbarkeit fest oder ändern Sie ihn für frische Variationen mit derselben Eingabeaufforderung.
Dekodierung und Videoerstellung (VDN-H3)#
VAEDecode (#6146) rekonstruiert Frames, während VAEDecodeAudio (#6145) den Soundtrack neu erstellt. VHS_VideoCombine (#6170) mischt Frames und Audio zu einem MP4, das die zuvor eingestellte Bildrate respektiert und eine vorschaufertige Datei speichert. Die VDN-Ausgabe wird mit einem eindeutigen Dateinamen-Präfix gespeichert, sodass sie leicht mit dem FastVideo-Ergebnis verglichen werden kann.
FastVideo Vergleichszweig#
Der FastVideo-Pfad lädt einen auf Geschwindigkeit abgestimmten MiniMax H3 UNet und wendet einen leichten Aufmerksamkeits-Patch vor dem Sampling an. Es verwendet Ihre Eingabeaufforderung, Größe und Bildanzahl, damit Sie Timing und Aussehen direkt vergleichen können. Das Sampling spiegelt die Struktur des VDN-Zweigs wider und ist ebenfalls für 8 Schritte konfiguriert. Frames und Audio werden dekodiert und mit VHS_VideoCombine (#6104) zu einem zweiten MP4 kombiniert. Verwenden Sie diese nebeneinander liegenden Ausgaben, um zu entscheiden, welcher Zweig am besten zu Ihrer Szene passt.
Schlüssel-Knoten im Comfyui VDN H3 ComfyUI Text To Video Workflow#
ApplyVDNH3Advanced(#6126). Aktiviert Video DeltaNet auf MiniMax H3 mit dem ausgewählten Checkpoint aus dem VDN-H3 Release. Passen Sie es nur an, wenn Sie den VDN-Checkpoint ändern oder Aufmerksamkeits-Backends wechseln möchten; behalten Sie die hybriden Aufmerksamkeits-Standardeinstellungen für den allgemeinen Gebrauch bei. Referenzimplementierung: Saganaki22/ComfyUI-VDN-H3.MiniMaxH3ImageToVideo(#219). Zentrale Steuerstelle für Geschichte und Timing, akzeptiert die Texteinladung, berechnete Breite und Höhe sowie die abgeleitete Bildanzahl. Für Audio fügen Sie eine einzelneAudio:-Zeile zur Eingabeaufforderung hinzu, um Geräusche und Umgebungen zu steuern, während Sie Sprache vermeiden, es sei denn, sie wird ausdrücklich angefordert.MiniMaxH3SigmaShift(#6131, #6007). Balanciert den Sigma-Zeitplan für Video- und Audio-Streams neu aus, was helfen kann, Zittern zu reduzieren und Details bei niedrigen Schrittzahlen zu bewahren. Erwägen Sie kleine Anpassungen nur, wenn Sie Modellvarianten ändern oder Bewegungsinstabilität bemerken.VHS_VideoCombine(#6170, #6104). Mischt dekodierte Frames und Audio zu MP4 mit Ihrer gewählten Bildrate und Dateinamen-Präfix. Nützliche Optionen umfassen das Trimmen auf Audiolänge und die Auswahl des gewünschten H.264-Pixelformats. Projektseite: ComfyUI-VideoHelperSuite.
Optionale Extras#
- Hinweise zur Eingabeaufforderung: Beginnen Sie mit einem einzelnen Satz, der Subjekt, Aktion und Kamerabewegung festlegt, fügen Sie dann Aussehen- und Gefühlhinweise hinzu und eine
Audio:-Zeile für Geräusche. - Für längere Clips bevorzugen Sie bescheidene Megapixel gegenüber hoher Auflösung, um Bewegung stabil zu halten und den Speicherverbrauch in Schach zu halten.
- Fixieren Sie den Seed in
RandomNoise, wenn Sie konsistente Iterationen wünschen; ändern Sie ihn, um Variationen zu erkunden. - Vergleichen Sie die beiden Zweige in Ihrer eigenen Szene, um die Ausgabequalität und die Generierungszeit zu bewerten.
- Wenn Sie auf Speichergrenzen stoßen, reduzieren Sie zuerst Megapixel oder Dauer; das gechunkte Feed-Forward hilft bereits bei längeren Sequenzen.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken OpenVDN für das vdn-minimax-h3 Modell, die Gewichte und das Repository, Saganaki22 für die ComfyUI-VDN-H3 Knoten und Benji (AI Future Tech) für den VDN-H3 Workflow für ihre Beiträge und Pflege. Für verbindliche Details, beziehen Sie sich bitte auf die Originaldokumentation und Repositories unten verlinkt.
Ressourcen#
- OpenVDN/vdn-minimax-h3
- GitHub: OpenVDN/vdn-minimax-h3
- Hugging Face: OpenVDN/vdn-minimax-h3
- Saganaki22/ComfyUI-VDN-H3
- GitHub: Saganaki22/ComfyUI-VDN-H3
- Benji (AI Future Tech)/VDN-H3 Workflow
- Docs / Release Notes: AI Future Tech Patreon post
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Pflegern bereitgestellt werden.


