MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigung#
Dieser RunComfy-fähige Workflow verwandelt zwei Porträt-Standbilder und einen kurzen Sprach- oder Gesangstrack in ein einziges lippensynchrones Video, in dem beide Charaktere die Szene teilen. Basierend auf MiniMax H3 Referenz-zu-Video mit dem offiziellen Turbo LoRA liefert er eine Generation in wenigen Schritten, während er beide Identitäten stabil hält und die Mundbewegung an Ihr Quell-Audio anpasst.
MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigung ist ideal für Duette, Zwei-Personen-Dialoge, Trailer oder schnelle Performance-Vorschauen. Sie bringen zwei Bilder und eine Audiodatei, fügen eine kurze Eingabeaufforderung hinzu, wählen eine Größe aus, und der Graph rendert eine mp4 mit dem originalen Soundtrack.
Schlüsselmodelle im Comfyui MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigungs-Workflow#
- MiniMax-H3 Referenz-zu-Video-Rückgrat von Comfy-Org — das generative Modell, das Ihre Referenzen und Texte in ein audiovisuelles Latent für die Videosynthese abbildet. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — kodiert und dekodiert Videolatente, sodass Frames effizient entrauscht und mit hoher Wiedergabetreue rekonstruiert werden können. Im Modellpaket enthalten. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — repräsentiert das treibende Audio im latenten Raum, sodass Lippenbewegungen und Timing von Ihrem Track gelernt werden. Im Modellpaket enthalten. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B Text-Encoder (AWQ/NVFP-Varianten für H3 gepackt) — interpretiert Ihre Eingabeaufforderung, um Szene, Stil und Aufnahmeanliegen für die Doppelcharakter-Komposition festzulegen. Im Modellpaket enthalten. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-Stufen LoRA — beschleunigt das Sampling, sodass Sie mit nur vier Entrauschungsschritten rendern können, während Identität und Lippensynchronisation erhalten bleiben. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
So verwenden Sie Comfyui MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigung#
Dieser Graph fließt von links nach rechts: Sie laden zwei Charakter-Standbilder und einen Audioclip hoch, legen Eingabeaufforderung und Größe fest, dann fusioniert der Kern-H3-Pfad Referenzen und Audio in ein AV-Latent. Eine kurze Audio-Lock-Phase bewahrt Ihren originalen Soundtrack, während die Lippenbewegung gesteuert wird, und der Sampler mit Turbo LoRA führt die wenigen Entrauschungsschritte vor der endgültigen Videozusammenstellung durch.
- Bild hochladen (Charakter A)
- Legen Sie ein klares, frontales Standbild für Charakter A in
LoadImage(#227) ab. Bevorzugen Sie ähnliche Kopfgröße und Beleuchtung wie bei Charakter B für eine stabile Ko-Präsenz. Der Hintergrund kann einfach sein; Identität und Pose haben Vorrang. Der Knoten füttert den H3-Referenzstapel, sodass das Modell lernt, wer der erste Sprecher in der gemeinsamen Szene ist.
- Legen Sie ein klares, frontales Standbild für Charakter A in
- Bild hochladen (Charakter B)
- Stellen Sie Charakter B in
LoadImage(#137) bereit. Halten Sie Rahmung, Orientierung und Ausdruck ungefähr vergleichbar mit Charakter A, um Drift zwischen den Aufnahmen zu reduzieren. Diese zweite Referenz ermöglicht es H3, eine Zweieraufnahme zu synthetisieren, bei der beide Individuen konsistent bleiben, während sie miteinander sprechen oder singen.
- Stellen Sie Charakter B in
- Audio hochladen
- Fügen Sie Ihren Dialog oder Gesang in
LoadAudio(#171) hinzu. Verwenden SieAudioCrop(#177), um Start- und Endzeiten festzulegen, sodass die Clip-Länge mit dem gewünschten Segment übereinstimmt. Sauberes, zentriertes Audio verbessert die Mundartikulation und reduziert Timing-Jitter.
- Fügen Sie Ihren Dialog oder Gesang in
- Eingabeaufforderung
- Beschreiben Sie die Aufnahme in
Input Text (Prompt)(#138). Kurze, filmische Formulierungen funktionieren gut, zum Beispiel die Beschreibung von Kameradistanz, Hintergrund und Stimmung für die beiden Charaktere. Die Eingabeaufforderung lenkt Layout und Stil, ohne die Identitätsführung der Standbilder und das Timing Ihres Tracks zu ersetzen.
- Beschreiben Sie die Aufnahme in
- Auflösungsselektor (Größe)
- Wählen Sie das Seitenverhältnis und die Zielgröße im
Resolution Selector (Size)(#115). Der Selektor gibt Breite und Höhe aus, die bereits an modellfreundliche Vielfache angepasst sind, um Detail und Geschwindigkeit auszugleichen. Eine eingebaute Größennotiz bietet gebrauchsfertige 16:9-Voreinstellungen, sodass Sie eine Megapixel-Stufe auswählen können, die zu Ihrem GPU-Budget passt.
- Wählen Sie das Seitenverhältnis und die Zielgröße im
- Ergebnis
- Die Frames werden dekodiert und mit dem originalen Audio in
VHS_VideoCombine(#142) gemischt, um eine mp4 zu erzeugen. Wenn Ihr Render etwas länger oder kürzer läuft, verwenden Sie den bereitgestellten Schalter in diesem Schritt, um auf die Audiolänge zu trimmen. Dateinamen und Format sind für schnelle Iterationen vorkonfiguriert.
- Die Frames werden dekodiert und mit dem originalen Audio in
- Kern (Nicht Ändern)
- In diesem geschützten Bereich fusioniert
MiniMaxH3ReferenceToVideo(#136) beide Referenzbilder, die Eingabeaufforderung und das zugeschnittene Audio in ein gemeinsames AV-Latent und positive Konditionierung.VRGDG_MiniMaxH3AudioDrive(#172) sperrt das Quell-Audio, sodass die Lippensynchronisation Ihrem Track folgt, während der Soundtrack unverändert durchläuft. Der UNet ist für Speicheroptimierung gepatcht, undLoraLoaderModelOnly(#234) wendet die Turbo 4-Stufen LoRA an, bevor der Sampler entrauscht undVAEDecodedie Frames rekonstruiert. Diese internen Abläufe sind auf Stabilität und Geschwindigkeit abgestimmt, sodass Sie sie in der Regel nicht anpassen müssen.
- In diesem geschützten Bereich fusioniert
Schlüsselnoten im Comfyui MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigungs-Workflow#
MiniMaxH3ReferenceToVideo(#136)- Das Herzstück des Graphen, das beide Charakter-Standbilder, Ihre Eingabeaufforderung, Breite, Höhe und eine automatisch berechnete Cliplänge aufnimmt. Es akzeptiert auch das zugeschnittene Audio als Referenz, sodass Phonem-Timing und Visem-Formen mit dem Soundtrack übereinstimmen. Wenn Sie engere Kontrolle benötigen, können Sie
prompt,width,heightdirekt anpassen oderlengthfür spezielle Timings überschreiben.
- Das Herzstück des Graphen, das beide Charakter-Standbilder, Ihre Eingabeaufforderung, Breite, Höhe und eine automatisch berechnete Cliplänge aufnimmt. Es akzeptiert auch das zugeschnittene Audio als Referenz, sodass Phonem-Timing und Visem-Formen mit dem Soundtrack übereinstimmen. Wenn Sie engere Kontrolle benötigen, können Sie
VRGDG_MiniMaxH3AudioDrive(#172)- Sperrt die Lippenbewegung auf das bereitgestellte Quell-Audio, während sichergestellt wird, dass das endgültige Video denselben Audiotrack verwendet. Verwenden Sie dies, wenn Sie exakte lyrische oder Dialog-Timings ohne generative Audioänderungen wünschen. Füttern Sie es mit klarem Gesang oder Dialog für beste Ergebnisse.
LoraLoaderModelOnly(#234)- Lädt die MiniMax-H3 Turbo 4-Stufen LoRA, sodass der Sampler in sehr wenigen Schritten konvergieren kann. Wenn Sie langsameres, aber potenziell konservativeres Entrauschen bevorzugen, können Sie den LoRA-Einfluss reduzieren; für maximale Geschwindigkeit, behalten Sie die Standardstärke bei. Modellreferenz: MiniMax-H3 Turbo LoRA.
SamplerCustomAdvanced(#125)- Führt das eigentliche Entrauschen mit dem upstream ausgewählten Scheduler und Sampler durch. Mit dem aktiven Turbo LoRA können Sie schnell mit minimalen Schritten rendern; erhöhen Sie die Schritte nur, wenn Sie Bewegungsinstabilitäten feststellen. Seed-Kontrolle kommt von
RandomNoise(#129) für reproduzierbare Aufnahmen.
- Führt das eigentliche Entrauschen mit dem upstream ausgewählten Scheduler und Sampler durch. Mit dem aktiven Turbo LoRA können Sie schnell mit minimalen Schritten rendern; erhöhen Sie die Schritte nur, wenn Sie Bewegungsinstabilitäten feststellen. Seed-Kontrolle kommt von
Resolution Selector (Size)(#115)- Gibt modellangepasste Breite und Höhe aus, sodass Sie keine Vielfachen oder Seitenverhältnismathematik jonglieren müssen. Verwenden Sie es, um zwischen Vorschau-, Mittel- und Endgrößen zu springen, während die Komposition konsistent bleibt. Größere Größen erhöhen das Identitätsdetail, erfordern jedoch mehr VRAM und Zeit.
AudioCrop(#177)- Kürzt das Eingangs-Audio auf das exakte Segment, das Sie animieren möchten. Verwenden Sie dies, um Stille zu schneiden oder einen Vers oder Dialogschlag zu isolieren. Saubere Ein- und Ausstiegspunkte helfen bei der Mundöffnungs- und Schließzeit.
VHS_VideoCombine(#142)- Fügt dekodierte Frames und das Durchgangs-Audio zu einer teilbaren mp4 zusammen. Verwenden Sie die integrierten Optionen, um die Dauer an den Soundtrack anzupassen und Dateinamenskonventionen festzulegen. Dies ist Ihre endgültige Ausgabestufe für MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigungs-Ausgaben.
Optionale Extras#
- Passen Sie die Subjektskala und den Gesichtsbereich in beiden Bildern an, um Identitätsdrift zu minimieren.
- Halten Sie Eingabeaufforderungen prägnant und visuell: Kameradistanz, Umgebung, Stimmung und Beleuchtungshinweise.
- Verwenden Sie Rausch-Samen beim Iterieren, damit Sie Änderungen zuverlässig über Aufnahmen hinweg vergleichen können.
- Wenn der Clip knapp über das Ziel hinausschießt, aktivieren Sie das Zuschneiden im Kombinationsschritt für eine framegenaue Synchronisation.
- Beginnen Sie mit einer mittleren Auflösung und skalieren Sie dann hoch, sobald Blockierung und Timing richtig aussehen.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken MiniMax Research für MiniMax H3, Comfy.org für das ComfyUI MiniMax H3-Tutorial und Comfy-Org und larryvrh für die MiniMax-H3-Modellgewichte und MiniMax-H3 Turbo LoRA für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die originalen Dokumentationen und Repositories, die unten verlinkt sind.
Ressourcen#
- MiniMax Research/MiniMax H3 offizielle Ankündigung
- Docs / Release Notes: MiniMax H3 offizielle Ankündigung
- Comfy.org/MiniMax H3 Tutorial
- GitHub: Comfy-Org/docs
- Docs / Release Notes: Comfy.org MiniMax H3 Tutorial
- Comfy-Org/MiniMax-H3 Modellgewichte
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen der Autoren und Verwalter.


