ComfyUI MiniMax H3 Talking Digital Human: Porträt und Stimme zu einem lippensynchronen Avatar-Video#
Dieser Workflow verwandelt ein einzelnes, frontales Porträt und eine kurze Stimmreferenz in einen hochwertigen sprechenden Kopfclip mit synchronisierter Sprache auf RunComfy. Aufgebaut um MiniMax H3 Referenz-zu-Video-und-Audio mit QwenVL Bilderdung, bewahrt es Identität und Hintergrund, während die Sprechstimme aus Ihrer Probe generiert wird. ComfyUI MiniMax H3 Talking Digital Human ist ideal für Produkterklärer, Präsentator-Avatare, Social-Posts und kurze Sprecher-Videos ohne separates TTS oder Lippensynchronisation.
Sie stellen ein Bild und einen Sprachclip bereit. Der Workflow leitet eine kompakte Beschreibung von Gesicht und Szene ab, konditioniert MiniMax H3 mit dieser Anleitung und co-generiert Videoframes und das passende Audio in einem einheitlichen Latent, sodass Lippen und Stimme synchron bleiben. Das Ergebnis wird in eine einzelne Videodatei gerendert, die Sie herunterladen und teilen können.
Hauptmodelle im Comfyui ComfyUI MiniMax H3 Talking Digital Human Workflow#
- MiniMax H3 Referenz-zu-Video-und-Audio Diffusionsmodell. Kern-Generator, der ein Porträt und optionales Audio als Referenzen verwendet, um einen synchronisierten sprechenden Kopf zu erzeugen. Gehostet von Comfy-Org für einfache Nutzung in ComfyUI. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Video VAE. Kodiert und dekodiert den Videoteil des gemeinsamen Latent-Raums, der von MiniMax H3 verwendet wird, um Identität und Hintergrund stabil zu halten. Im gleichen Modellpaket verteilt. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Audio VAE. Kodiert und dekodiert den Audioteil des gemeinsamen Latent, sodass Sprache im Einklang mit der Mundbewegung erzeugt wird. Ebenfalls im Modellpaket verfügbar. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 4B Instruct. Ein Visions-Sprachmodell, das verwendet wird, um Aufforderungen in visuelle Details des hochgeladenen Porträts zu erden, was die Identitätsbewahrung und Szenenkonsistenz verbessert. Hugging Face: Qwen/Qwen3-VL-4B-Instruct
So verwenden Sie den Comfyui ComfyUI MiniMax H3 Talking Digital Human Workflow#
Dieser Workflow ist in vier Bereiche organisiert: einen Upload- und Bearbeitungsbereich, einen Dauerhelfer, den MiniMax H3 Generationskern und die Ausgabestufe. Arbeiten Sie von links nach rechts, beginnend mit Medieneingaben, dann Aufforderungsanleitung, dann Generierung ausführen und Video speichern.
Upload-/Bearbeitungsbereich: Meistens hier ändern; den Rest standardmäßig lassen#
Verwenden Sie LoadImage (#137), um ein einzelnes, frontales Charakterporträt hochzuladen. Frontal- oder nahezu frontale Rahmen mit sichtbaren Augen und Mund funktionieren am besten für natürliche Lippenbewegungen. Verwenden Sie LoadAudio (#141), um eine saubere Sprachprobe hochzuladen, deren Klangfarbe Sie nachahmen möchten; es kann sich um einige Sekunden Sprechen mit minimalem Hintergrundrauschen handeln. Schneiden Sie die Sprachprobe bei Bedarf mit AudioCrop (#142) zu, indem Sie Anfang und Ende auf das gesprochene Segment setzen, das der Avatar nachahmen soll. Fügen Sie in Prompt (#138) alle Stil- oder Inhaltsanweisungen hinzu; der Workflow wird automatisch bildgeerdete Details für bessere Konsistenz anhängen.
Videodauer (Sekunden):#
Stellen Sie eine Zieldauer mit der numerischen Steuerung oben in der Dauereinstellung ein. Ein Helfer ComfyMathExpression (#131) wandelt Sekunden in eine gültige Frame-Anzahl für das Modell um und passt sie an die Anforderungen des Samplers an. Dies hält das Timing stabil und vermeidet das Abschneiden in der Mitte eines Phonems. Wenn Sie die Dauer später ändern, aktualisieren Sie den Audiotrim, damit die endgültige Sprache und Lippenbewegung übereinstimmen.
MiniMax-H3 Open Source - Image Talking Digital Human#
Dies ist der Kern-Generationspfad, der um MiniMaxH3ReferenceToVideo (#136) aufgebaut ist. Der Knoten erhält Ihr Porträt als Referenzbild und Ihren zugeschnittenen Sprachclip als Referenzaudio sowie Breite, Höhe und Länge von den Selektoren. Eine QwenVL-basierte Beschreibung des Porträts wird mit Ihrem geschriebenen Prompt kombiniert, sodass das Modell sowohl visuelle Erdung als auch Ihre Anweisungen erhält. Das Modell gibt ein einzelnes Latent aus, das sowohl Video als auch Audio enthält, sowie Konditionierung, die vom Sampler-Stack verwendet wird, weshalb die Lippensynchronisation ohne separate Lippensynchronisationsstufe robust ist.
Prompt-Erdung mit QwenVL#
AILab_QwenVL (#152) analysiert das hochgeladene Porträt und gibt eine prägnante, sachliche Beschreibung zurück. Der Workflow verknüpft diese Beschreibung mit Ihrem Anweisungstext über JoinStrings (#150, #148, #144) und erzeugt einen endgültigen Prompt, der dem Modell sagt, den Hintergrund unverändert zu lassen und Ihr Audio für die Sprechstimme zu verwenden. Diese automatische Erdung stärkt die Identitäts- und Hintergrundstabilität spürbar. Sie können Ihren geschriebenen Prompt kurz halten und die Erdung genaue Gesichts- und Szenendetails auffüllen lassen.
Auflösung / Video-Seitenverhältnis#
Wählen Sie das Seitenverhältnis und die Zielauflösung mit ResolutionSelector (#115). Es gibt Breite und Höhe aus, die für das Modell und Ihre GPU geeignet sind, was der Kernknoten direkt verwendet. Für Porträt-Avatare erhalten hohe Seitenverhältnisse mehr vom Subjekt, während sie Raum für natürliche Kopfbewegungen lassen. Wenn Sie das Seitenverhältnis nach dem Testen anpassen, behalten Sie das gleiche Framing in Ihrem Eingabeporträt bei, um konsistente Ergebnisse zu erzielen.
Generiertes Video ausgeben#
Der Sampler-Pfad entstört das gemeinsame Latent, dann verwandelt VAEDecode (#122) es in Frames, während VAEDecodeAudio (#121) es in eine Wellenform verwandelt. CreateVideo (#130) kombiniert Frames und Audio zu einem einzelnen Clip mit Ihrer gewählten Bildrate, und SaveVideo (#92) schreibt die Datei. Das gespeicherte Ergebnis enthält sowohl Bild als auch synchronisierte Stimme aus dem gleichen Generationslauf. Laden Sie es herunter und überprüfen Sie es; wenn das Timing falsch erscheint, passen Sie den Audiotrim oder die Dauer an und führen Sie es erneut aus.
Schlüssel-Knoten im Comfyui ComfyUI MiniMax H3 Talking Digital Human Workflow#
MiniMaxH3ReferenceToVideo (#136)#
Das Herzstück der Pipeline, das ein Referenzporträt und eine Sprachprobe akzeptiert, um Video und Audio gemeinsam zu generieren. Wichtige Steuerungen sind prompt für Inhalt und Stil, width und height für das Framing und length für die Dauer in Frames. Verwenden Sie ein einzelnes, scharfes Porträt als erstes Referenzbild und halten Sie ref_image_size abgestimmt, damit die Gesichtsproportionen korrekt übertragen werden. Wenn Sie Drift oder Hintergrundänderungen feststellen, verstärken Sie Ihren Anweisungstext, um den Hintergrund explizit unverändert zu lassen.
ResolutionSelector (#115)#
Legt das Seitenverhältnis und die Gesamtanzahl der Pixel fest und gibt dann Breite und Höhe aus, die an modellfreundliche Vielfache angepasst sind. Wählen Sie ein Seitenverhältnis, das zu Ihrem Porträt-Zuschnitt passt, um Resampling-Artefakte zu reduzieren. Eine Erhöhung der Gesamtauflösung kann Details verbessern, erhöht jedoch auch den VRAM und die Zeit; testen Sie bei kleineren Einstellungen, bevor Sie hochskalieren. Halten Sie das Framing zwischen den Läufen konsistent, um reproduzierbare Identität zu gewährleisten.
AudioCrop (#142)#
Schneidet die hochgeladene Referenzstimme auf das Segment zu, das der Avatar sprechen soll. Setzen Sie Anfang und Ende auf den gesprochenen Teil und lassen Sie einen kleinen Rand der Stille an den Enden für natürliche Anfänge und Enden. Wenn Sie die getrimmte Audiolänge an Ihre Zielvideodauer anpassen, hilft dies dem Generator, Phoneme an Mundformen anzupassen. Wenn Plosive oder Zischlaute falsch aussehen, versuchen Sie eine sauberere Aufnahme oder verkürzen Sie den getrimmten Bereich.
AILab_QwenVL (#152)#
Erzeugt eine bildgeerdete Beschreibung, die automatisch an Ihren Prompt angehängt wird. Dies fügt konkrete Details über Gesicht, Haare, Kleidung und Hintergrund hinzu, was dem Modell hilft, Identität und Szene zu bewahren. Wenn die geerdete Beschreibung den Stil zu stark einschränkt, halten Sie Ihren geschriebenen Prompt minimal und neutral, damit die Erdung ihre Aufgabe erfüllen kann. Für Bilder mit mehreren Charakteren laden Sie einen engeren Zuschnitt hoch, damit sich die Beschreibung auf ein einzelnes Subjekt konzentriert.
CreateVideo (#130)#
Kombiniert dekodierte Frames und Audio zu einer einzigen abspielbaren Datei. Sie können fps ändern, wenn Sie eine Übereinstimmung mit einer nachgelagerten Timeline benötigen, aber halten Sie es konsistent mit der Dauer-zu-Frame-Umwandlung von früher. Wenn Sie auf bestimmten Plattformen Stottern sehen, exportieren Sie erneut mit einer gängigen Bildrate für diese Plattform. Die Steuerung bit_depth kann für die Web-Bereitstellung auf dem Standardwert belassen werden.
ComfyMathExpression (#131)#
Wandelt Ihre Dauer in Sekunden in eine gültige Frame-Anzahl für den Generator um und passt sie an den Schritt des Samplers an. Dies verhindert Teilstufen, die zu Timing-Drift führen können. Wenn Sie die Bildrate nachgelagert ändern, überprüfen Sie die Dauer erneut, um die Mundbewegung an die Silben anzupassen. Behandeln Sie diesen Knoten als die Timing-Quelle der Wahrheit für den gesamten Lauf.
Optionale Extras#
- Verwenden Sie ein sauberes, gleichmäßig beleuchtetes Porträt mit unbedeckten Augen und Mund für die natürlichste Artikulation.
- Nehmen Sie 5 bis 10 Sekunden klare Sprache in einem ruhigen Raum auf; vermeiden Sie Musik oder starke Kompression im Referenzclip.
- Für reproduzierbare Ergebnisse fixieren Sie den
RandomNoise-Seed inRandomNoise(#129) anstatt zwischen den Läufen zu randomisieren. - Wenn Sie Untertitel benötigen, fügen Sie diese nachträglich hinzu, anstatt sie in den Prompt einzubacken, damit sich das Modell auf Gesicht und Stimme konzentriert.
- Respektieren Sie die Ähnlichkeits- und Stimmrechte, wenn Sie einen ComfyUI MiniMax H3 Talking Digital Human für echte Personen erstellen.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir bedanken uns herzlich bei MiniMax für das MiniMax H3 Modell, Comfy-Org für die MiniMax-H3 Modellgewichte und Comfy.org für das MiniMax H3 Tutorial für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die Originaldokumentation und die unten verlinkten Repositories.
Ressourcen#
- MiniMax/MiniMax H3 offizielle Ankündigung
- Docs / Release Notes: MiniMax H3 offizielle Ankündigung
- Comfy-Org/MiniMax-H3 Modellgewichte
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org/MiniMax H3 Tutorial
- GitHub: comfy-org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- Docs / Release Notes: Comfy.org MiniMax H3 Tutorial
Hinweis: Die Verwendung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.
