ComfyUI>Workflows>MiniMax H3 Sprechende & Singende Doppelcharakter | 4-Stufen-Beschleunigung

MiniMax H3 Sprechende & Singende Doppelcharakter | 4-Stufen-Beschleunigung

Workflow Name: RunComfy/MiniMax-H3-Talking-Singing-Dual-Character-4-step-Acceleration
Workflow ID: 0000...1486
Verwandeln Sie zwei Standbilder in eine Sprech- und Gesangsaufführung von Angesicht zu Angesicht. Sie steuern den Dialog oder den Gesang mit einem Audioclip. Hailuo H3 hält beide Identitäten stabil. Audiolock liefert eine enge Lippensynchronisation. Turbo LoRA läuft in vier Schritten. Sie erhalten schnelle Duette ohne separaten Lippensynchronisationsstapel.
Avoid using 2X Large or 2XL Plus for this workflow. These machine types may cause the generated video to contain only noise. Use Medium, Large, or X Large instead.

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Workflow

MiniMax H3 Talking & Singing Dual Character | 4-step Acceleration
Möchtest du diesen Workflow ausführen?
  • Voll funktionsfähige Workflows
  • Keine fehlenden Nodes oder Modelle
  • Keine manuelle Einrichtung erforderlich
  • Beeindruckende Visualisierungen

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Examples

MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigung#

Dieser RunComfy-fähige Workflow verwandelt zwei Porträt-Standbilder und einen kurzen Sprach- oder Gesangstrack in ein einziges lippensynchrones Video, in dem beide Charaktere die Szene teilen. Basierend auf MiniMax H3 Referenz-zu-Video mit dem offiziellen Turbo LoRA liefert er eine Generation in wenigen Schritten, während er beide Identitäten stabil hält und die Mundbewegung an Ihr Quell-Audio anpasst.

MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigung ist ideal für Duette, Zwei-Personen-Dialoge, Trailer oder schnelle Performance-Vorschauen. Sie bringen zwei Bilder und eine Audiodatei, fügen eine kurze Eingabeaufforderung hinzu, wählen eine Größe aus, und der Graph rendert eine mp4 mit dem originalen Soundtrack.

Schlüsselmodelle im Comfyui MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigungs-Workflow#

  • MiniMax-H3 Referenz-zu-Video-Rückgrat von Comfy-Org — das generative Modell, das Ihre Referenzen und Texte in ein audiovisuelles Latent für die Videosynthese abbildet. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE FP16 — kodiert und dekodiert Videolatente, sodass Frames effizient entrauscht und mit hoher Wiedergabetreue rekonstruiert werden können. Im Modellpaket enthalten. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE FP32 — repräsentiert das treibende Audio im latenten Raum, sodass Lippenbewegungen und Timing von Ihrem Track gelernt werden. Im Modellpaket enthalten. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 32B Text-Encoder (AWQ/NVFP-Varianten für H3 gepackt) — interpretiert Ihre Eingabeaufforderung, um Szene, Stil und Aufnahmeanliegen für die Doppelcharakter-Komposition festzulegen. Im Modellpaket enthalten. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-Stufen LoRA — beschleunigt das Sampling, sodass Sie mit nur vier Entrauschungsschritten rendern können, während Identität und Lippensynchronisation erhalten bleiben. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora

So verwenden Sie Comfyui MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigung#

Dieser Graph fließt von links nach rechts: Sie laden zwei Charakter-Standbilder und einen Audioclip hoch, legen Eingabeaufforderung und Größe fest, dann fusioniert der Kern-H3-Pfad Referenzen und Audio in ein AV-Latent. Eine kurze Audio-Lock-Phase bewahrt Ihren originalen Soundtrack, während die Lippenbewegung gesteuert wird, und der Sampler mit Turbo LoRA führt die wenigen Entrauschungsschritte vor der endgültigen Videozusammenstellung durch.

  • Bild hochladen (Charakter A)
    • Legen Sie ein klares, frontales Standbild für Charakter A in LoadImage (#227) ab. Bevorzugen Sie ähnliche Kopfgröße und Beleuchtung wie bei Charakter B für eine stabile Ko-Präsenz. Der Hintergrund kann einfach sein; Identität und Pose haben Vorrang. Der Knoten füttert den H3-Referenzstapel, sodass das Modell lernt, wer der erste Sprecher in der gemeinsamen Szene ist.
  • Bild hochladen (Charakter B)
    • Stellen Sie Charakter B in LoadImage (#137) bereit. Halten Sie Rahmung, Orientierung und Ausdruck ungefähr vergleichbar mit Charakter A, um Drift zwischen den Aufnahmen zu reduzieren. Diese zweite Referenz ermöglicht es H3, eine Zweieraufnahme zu synthetisieren, bei der beide Individuen konsistent bleiben, während sie miteinander sprechen oder singen.
  • Audio hochladen
    • Fügen Sie Ihren Dialog oder Gesang in LoadAudio (#171) hinzu. Verwenden Sie AudioCrop (#177), um Start- und Endzeiten festzulegen, sodass die Clip-Länge mit dem gewünschten Segment übereinstimmt. Sauberes, zentriertes Audio verbessert die Mundartikulation und reduziert Timing-Jitter.
  • Eingabeaufforderung
    • Beschreiben Sie die Aufnahme in Input Text (Prompt) (#138). Kurze, filmische Formulierungen funktionieren gut, zum Beispiel die Beschreibung von Kameradistanz, Hintergrund und Stimmung für die beiden Charaktere. Die Eingabeaufforderung lenkt Layout und Stil, ohne die Identitätsführung der Standbilder und das Timing Ihres Tracks zu ersetzen.
  • Auflösungsselektor (Größe)
    • Wählen Sie das Seitenverhältnis und die Zielgröße im Resolution Selector (Size) (#115). Der Selektor gibt Breite und Höhe aus, die bereits an modellfreundliche Vielfache angepasst sind, um Detail und Geschwindigkeit auszugleichen. Eine eingebaute Größennotiz bietet gebrauchsfertige 16:9-Voreinstellungen, sodass Sie eine Megapixel-Stufe auswählen können, die zu Ihrem GPU-Budget passt.
  • Ergebnis
    • Die Frames werden dekodiert und mit dem originalen Audio in VHS_VideoCombine (#142) gemischt, um eine mp4 zu erzeugen. Wenn Ihr Render etwas länger oder kürzer läuft, verwenden Sie den bereitgestellten Schalter in diesem Schritt, um auf die Audiolänge zu trimmen. Dateinamen und Format sind für schnelle Iterationen vorkonfiguriert.
  • Kern (Nicht Ändern)
    • In diesem geschützten Bereich fusioniert MiniMaxH3ReferenceToVideo (#136) beide Referenzbilder, die Eingabeaufforderung und das zugeschnittene Audio in ein gemeinsames AV-Latent und positive Konditionierung. VRGDG_MiniMaxH3AudioDrive (#172) sperrt das Quell-Audio, sodass die Lippensynchronisation Ihrem Track folgt, während der Soundtrack unverändert durchläuft. Der UNet ist für Speicheroptimierung gepatcht, und LoraLoaderModelOnly (#234) wendet die Turbo 4-Stufen LoRA an, bevor der Sampler entrauscht und VAEDecode die Frames rekonstruiert. Diese internen Abläufe sind auf Stabilität und Geschwindigkeit abgestimmt, sodass Sie sie in der Regel nicht anpassen müssen.

Schlüsselnoten im Comfyui MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigungs-Workflow#

  • MiniMaxH3ReferenceToVideo (#136)
    • Das Herzstück des Graphen, das beide Charakter-Standbilder, Ihre Eingabeaufforderung, Breite, Höhe und eine automatisch berechnete Cliplänge aufnimmt. Es akzeptiert auch das zugeschnittene Audio als Referenz, sodass Phonem-Timing und Visem-Formen mit dem Soundtrack übereinstimmen. Wenn Sie engere Kontrolle benötigen, können Sie prompt, width, height direkt anpassen oder length für spezielle Timings überschreiben.
  • VRGDG_MiniMaxH3AudioDrive (#172)
    • Sperrt die Lippenbewegung auf das bereitgestellte Quell-Audio, während sichergestellt wird, dass das endgültige Video denselben Audiotrack verwendet. Verwenden Sie dies, wenn Sie exakte lyrische oder Dialog-Timings ohne generative Audioänderungen wünschen. Füttern Sie es mit klarem Gesang oder Dialog für beste Ergebnisse.
  • LoraLoaderModelOnly (#234)
    • Lädt die MiniMax-H3 Turbo 4-Stufen LoRA, sodass der Sampler in sehr wenigen Schritten konvergieren kann. Wenn Sie langsameres, aber potenziell konservativeres Entrauschen bevorzugen, können Sie den LoRA-Einfluss reduzieren; für maximale Geschwindigkeit, behalten Sie die Standardstärke bei. Modellreferenz: MiniMax-H3 Turbo LoRA.
  • SamplerCustomAdvanced (#125)
    • Führt das eigentliche Entrauschen mit dem upstream ausgewählten Scheduler und Sampler durch. Mit dem aktiven Turbo LoRA können Sie schnell mit minimalen Schritten rendern; erhöhen Sie die Schritte nur, wenn Sie Bewegungsinstabilitäten feststellen. Seed-Kontrolle kommt von RandomNoise (#129) für reproduzierbare Aufnahmen.
  • Resolution Selector (Size) (#115)
    • Gibt modellangepasste Breite und Höhe aus, sodass Sie keine Vielfachen oder Seitenverhältnismathematik jonglieren müssen. Verwenden Sie es, um zwischen Vorschau-, Mittel- und Endgrößen zu springen, während die Komposition konsistent bleibt. Größere Größen erhöhen das Identitätsdetail, erfordern jedoch mehr VRAM und Zeit.
  • AudioCrop (#177)
    • Kürzt das Eingangs-Audio auf das exakte Segment, das Sie animieren möchten. Verwenden Sie dies, um Stille zu schneiden oder einen Vers oder Dialogschlag zu isolieren. Saubere Ein- und Ausstiegspunkte helfen bei der Mundöffnungs- und Schließzeit.
  • VHS_VideoCombine (#142)
    • Fügt dekodierte Frames und das Durchgangs-Audio zu einer teilbaren mp4 zusammen. Verwenden Sie die integrierten Optionen, um die Dauer an den Soundtrack anzupassen und Dateinamenskonventionen festzulegen. Dies ist Ihre endgültige Ausgabestufe für MiniMax H3 ComfyUI Sprechende und Singende Doppelcharakter 4-Stufen-Beschleunigungs-Ausgaben.

Optionale Extras#

  • Passen Sie die Subjektskala und den Gesichtsbereich in beiden Bildern an, um Identitätsdrift zu minimieren.
  • Halten Sie Eingabeaufforderungen prägnant und visuell: Kameradistanz, Umgebung, Stimmung und Beleuchtungshinweise.
  • Verwenden Sie Rausch-Samen beim Iterieren, damit Sie Änderungen zuverlässig über Aufnahmen hinweg vergleichen können.
  • Wenn der Clip knapp über das Ziel hinausschießt, aktivieren Sie das Zuschneiden im Kombinationsschritt für eine framegenaue Synchronisation.
  • Beginnen Sie mit einer mittleren Auflösung und skalieren Sie dann hoch, sobald Blockierung und Timing richtig aussehen.

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken MiniMax Research für MiniMax H3, Comfy.org für das ComfyUI MiniMax H3-Tutorial und Comfy-Org und larryvrh für die MiniMax-H3-Modellgewichte und MiniMax-H3 Turbo LoRA für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die originalen Dokumentationen und Repositories, die unten verlinkt sind.

Ressourcen#

Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen der Autoren und Verwalter.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.