MiniMax H3 Charakterersatz ComfyUI#
MiniMax H3 Charakterersatz ComfyUI ist ein referenzgeführter Video-Editing-Workflow zum Austauschen einer Person oder eines Charakters in einem Quellclip, während die ursprüngliche Bewegung, das Kameratiming und das Szenenlayout intakt bleiben. Es kombiniert SAM3-Subjekterkennung und Maskierung mit MiniMax H3 Ref2VA, sodass die Ersatzidentität über die Rahmen hinweg konsistent bleibt, ohne manuelles Inpainting.
Entwickelt für Kreative, die zuverlässige Charakterwechsel, Identitätsersetzungen, Outfit-Variationen oder referenzgesteuerte Bearbeitungen innerhalb von ComfyUI benötigen, akzeptiert dieser Workflow ein Quellvideo, ein oder mehrere Referenzbilder und optionales Referenzaudio. Das Ergebnis ist ein bewegungserhaltender Ersatz, der sich nahtlos in den Schuss einfügt, unterstützt von der MiniMax H3 Charakterersatz ComfyUI-Logik von Anfang bis Ende.
Schlüsselmodelle im Comfyui MiniMax H3 Charakterersatz ComfyUI-Workflow#
- MiniMax H3 Ref2VA Diffusions-Backbone. Bietet Referenz-zu-Audio-Video-Generierung, die Identität und Erscheinungsbild überträgt und dabei Bewegung und Timing respektiert. Sehen Sie die offizielle Modellkarte für Fähigkeiten und Eingabeanleitung hier und die Comfy-bereiten Gewichte und VAEs, die für Workflows verpackt sind hier.
- MiniMax H3 Video VAE und Audio VAE. Kodieren und dekodieren Video- und Audiolatente für effizientes Sampling und getreue Rekonstruktion. Im Comfy-Org MiniMax H3-Bundle oben enthalten.
- Qwen3-VL 32B Text-Encoder. Dient als multimodaler Text-Encoder, der von MiniMax H3 verwendet wird, um Eingabeaufforderungen und Referenzen für eine kohärente Identitätsübertragung zu interpretieren.
- SAM 3.1 Multiplex. Ein hochqualitatives Segmentierungsmodell, das verwendet wird, um das On-Screen-Subjekt zu erkennen und zu maskieren, sodass der Workflow Bewegungshinweise isolieren und eine sauberere Referenz für den Charakterersatz vorbereiten kann. Checkpoint gehostet von Comfy-Org hier.
Verwendung des Comfyui MiniMax H3 Charakterersatz ComfyUI-Workflows#
Der Workflow bewegt sich vom Maskieren und Referenzvorbereitung zur H3-Konditionierung, Sampling und endgültigen Rendering. Gruppen laufen in Folge ab, um einen bewegungserhaltenden Wechsel zu produzieren, der nur den Darsteller ersetzt.
Maskierung#
Diese Gruppe lädt Ihren Quellclip, schneidet ihn optional zu und bereitet pro Frame Masken vor. LoadVideo (#459) versorgt Video Slice (#483), sodass Sie Startzeit und Dauer einstellen können. Frames und Audio werden mit GetVideoComponents (#460, #505) entpackt. SAM3_Detect (#503) verwendet einen kurzen Kategorietext von CLIPTextEncode (#502), wie "Person", um das Subjekt zu finden und Masken auszugeben. Die Maske wird über MaskToImage (#491) in der Vorschau angezeigt, dann bereiten ImageCompositeMasked (#454) und ImageScaleToTotalPixels (#456) eine leichte Bewegungsreferenz vor, die den Darsteller für MiniMax H3 hervorhebt.
Modelle#
Diese Gruppe lädt die Kern-MiniMax H3-Assets, die bei der Inferenz verwendet werden. UNETLoader (#463) initialisiert die H3 Ref2VA-Diffusionsgewichte, CLIPLoader (#465) richtet den Qwen3-VL-Text-Encoder ein, und VAELoader (#470, #474) bringen die Video- und Audio-VAEs ein. Zusammen definieren sie den Modellkontext, den der Sampler für die Identitätsübertragung und -dekodierung verwenden wird.
Konditionierung#
Diese Gruppe wandelt Ihre Referenzen und Eingabeaufforderung in die H3-Konditionierung und ein Startlatenz um. MiniMaxH3ReferenceToVideo (#464) akzeptiert ein Ersatzidentitätsbild, die vorbereitete Bewegungsreferenz aus der Maskierungsgruppe und optionales Referenzaudio aus der Quelle. Breite und Höhe kommen von ResolutionSelector (#501); die Länge in Frames wird automatisch von ComfyMathExpression (#481) aus einer benutzerfreundlichen Dauer berechnet, die mit Float (Duration) (#480) eingestellt wird und auf eine modellfreundliche Frameanzahl schnappt. Eine strukturierte Eingabeaufforderung wird von DapaoH3VideoPromptNode (#517) erzeugt und durch easy showAnything (#515) geleitet, oder Sie können Ihre eigene gemäß dem offiziellen MiniMax H3 Referenz-Video-Leitfaden hier schreiben.
Sampling#
Diese Gruppe führt Denoising mit Ihrem ausgewählten Sampler und Zeitplan durch. RandomNoise (#467) setzt den Prozess für Reproduzierbarkeit. BasicScheduler (#473) und KSamplerSelect (#468) definieren den Schrittplan und Algorithmus, während BasicGuider (#466) das Modell mit der positiven Konditionierung vom H3-Knoten verbindet. SamplerCustomAdvanced (#469) führt die iterative Verfeinerung durch, um die endgültigen Videolatente zu produzieren.
Dekodierung und Video erstellen#
Diese Gruppe wandelt Latente in ein abspielbares Ergebnis um. VAEDecode (#472) rekonstruiert Frames, die mit dem Audio Ihres Clips in CreateVideo (#476) kombiniert werden, um Timing und Ambiente zu bewahren. SaveVideo (#482) schreibt eine Ausgabedatei mit dem gewählten Format und Codec, sodass Ihr MiniMax H3 Charakterersatz ComfyUI-Render bereit zur Überprüfung oder Veröffentlichung ist.
Getestet mit diesen Einstellungen#
Dieser Hilfsbereich enthält Eingabeaufforderungsnotizen und Beispiel-Metadaten, die während der Erstellung verwendet wurden. Er ist nicht für den Betrieb erforderlich, kann jedoch Ihre eigene Eingabeaufforderungsstruktur und Timing-Auswahl inspirieren.
Schlüsselnoten im Comfyui MiniMax H3 Charakterersatz ComfyUI-Workflow#
MiniMaxH3ReferenceToVideo (#464)#
Zentral für die Identitätsübertragung. Es akzeptiert ein Ersatzbild, eine bewegungserhaltende Videoreferenz und optionales Referenzaudio und gibt sowohl die positive Konditionierung als auch ein initiales Latenz aus. Nützliche Parameter, die zu berücksichtigen sind, sind prompt, width, height und length. Wenn Sie mehrere Referenzen bereitstellen, halten Sie sie visuell konsistent, um Identitätsdrift zu vermeiden.
SAM3_Detect (#503)#
Findet und segmentiert das On-Screen-Subjekt, das ersetzt wird. Eine kurze Kategorieaufforderung über CLIPTextEncode (#502) führt die Erkennung. Passen Sie die Maskenqualitätsoptionen nur an, wenn die Standardauswahl das Subjekt verfehlt oder den Hintergrund einbezieht; sauberere Masken führen typischerweise zu stabileren Wechseln.
ImageCompositeMasked (#454)#
Erstellt eine darstellerfokussierte Referenz aus den geschnittenen Frames und der SAM3-Maske. Verwenden Sie x, y und resize_source nur, wenn Sie Überlagerungen ausrichten oder die Skalierung der Frames anpassen müssen, bevor Sie Bilder an den H3-Referenzeingang senden. Das Ziel ist ein Bewegungshinweis, der den Schauspieler isoliert und die Szenengeometrie unberührt lässt.
ResolutionSelector (#501)#
Steuert die Zielrendergröße mit wenigen Klicks. Wählen Sie ein Seitenverhältnis und ein Megapixel-Budget, das zu Ihrer Hardware oder Ihren Umsetzungsanforderungen passt. Beginnen Sie bescheiden, bestätigen Sie die Identitätsstabilität und erhöhen Sie dann die Auflösung für Ihren endgültigen Durchgang.
SamplerCustomAdvanced (#469)#
Führt Denoising unter Verwendung des Schedulers, Samplers, Guiders, Rauschens und des Startlatenz aus. Für schnellere Look-Dev versuchen Sie einen leichteren Zeitplan oder einen Sampler, der auf Geschwindigkeit abgestimmt ist, und wechseln Sie dann zu Ihren bevorzugten Qualitätseinstellungen, sobald Identität und Timing stimmen.
Optionale Extras#
- Referenzauswahl
- Verwenden Sie 1 bis 3 scharfe, gut beleuchtete Bilder, die das Zielgesicht und Outfit klar zeigen. Vermeiden Sie gemischte Identitäten oder extreme Posen.
- Halten Sie Alter, Frisur und Kleidung des Referenzsubjekts konsistent, um Drift während langer Bewegungen zu minimieren.
- Maskierungstipps
- Wenn SAM3 Hintergrund einbezieht, verfeinern Sie Ihren Kategorietext oder führen Sie einen erneuten Versuch mit einem anderen Schwellenwert durch. Saubere Masken reduzieren Heiligenscheine und halten die Szenenbeleuchtung stabil.
- Eingabeaufforderung
- Beschreiben Sie nur Identität und Garderobe im Ersatz, während Sie H3 anweisen, die ursprüngliche Bewegung und Szene zu bewahren. Der offizielle Leitfaden hat prägnante Beispiele hier.
- Vorlagen
- Wenn Sie einen minimalen Ausgangspunkt möchten, vergleichen Sie Ihr Diagramm mit der offiziellen ComfyUI MiniMax H3 R2V-Vorlage hier.
- Rechte und Sicherheit
- Verwenden Sie nur Ähnlichkeiten, Darbietungen und Audio, die Sie das Recht haben zu transformieren. MiniMax H3 Charakterersatz ComfyUI ist mächtig, also wenden Sie es verantwortungsbewusst an.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken herzlich MiniMaxAI für das MiniMax-H3-Modell und den Referenz-Video-Eingabeaufforderungsleitfaden, Comfy-Org für die offizielle ComfyUI MiniMax H3 R2V-Vorlage und RunningHub.ai für die Workflow-Quelle und Referenz für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die Originaldokumentation und -repositories, die unten verlinkt sind.
Ressourcen#
- RunningHub.ai/Workflow-Quelle und Referenz
- Docs / Release Notes: Workflow-Quelle und Referenz
- MiniMaxAI/MiniMax H3 offizielles Modell
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- MiniMaxAI/MiniMax H3 Referenz-Video-Eingabeaufforderungsleitfaden
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Docs / Release Notes: MiniMax H3 Referenz-Video-Eingabeaufforderungsleitfaden
- Comfy-Org/Offizielle ComfyUI MiniMax H3 R2V-Vorlage
- GitHub: Comfy-Org/workflow_templates (video_minimax_h3_r2v.json)
- Hugging Face: Comfy-Org/MiniMax-H3
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Wartenden bereitgestellt werden.


