MiniMax H3 Performance Capture für ComfyUI#
MiniMax H3 Performance Capture verwandelt Ihr Schauspiel in einen neuen Charakter, während Ihr ursprüngliches Audio erhalten bleibt. Der Workflow überträgt Gesichtsausdruck, Mundformen, Blickrichtung und Kopfbewegungen von einem Quellclip auf ein Zielwesen oder einen Ganzkörpercharakter und setzt das Ergebnis dann wieder in die Aufnahme ein. Basierend auf dem MiniMax-H3-Referenzbedingten Video, automatischer Gesichtsmaskierung und optionaler Pose-Anleitung wurde es bei kreativen Tauschvorgängen wie einem Wolf, einem Roboter und einem Alien getestet, während Szene und Soundtrack erhalten bleiben. Workflow von Mickmumpitz.
Dieser ComfyUI MiniMax H3 Performance Capture Workflow ist die einfache „Render“-Edition: eine Kamera standardmäßig, optionale Kopfkamera und manuelle Maske, optionale Pose-Kontrolle und zwei gespeicherte Videos (Endrender mit Audio plus ein Vergleichsschnitt).
Schlüsselmodelle im Comfyui MiniMax H3 Performance Capture Workflow#
- MiniMax-H3 Referenz-zu-Video-Diffusion UNet (minimax_h3_ref2va_pruned_int8_convrot). Kern-Generator, der Referenzen, Eingabeaufforderung und Audio in Video-Latenten fusioniert. Model files
- Qwen3-VL 32B MiniMax-H3 Text-Encoder (qwen3vl_32b_minimax_h3_nvfp4_awq). Kodiert die Eingabeaufforderung, um Identität und Schauspielstil zu lenken. Model file
- MiniMax-H3 Video VAE FP16 und Audio VAE FP32. Video VAE dekodiert Bild-Latenten; Audio VAE bedingt Lippensynchronisation und Performance-Timing. VAEs
- MiniMax-H3 Turbo 8-Schritt 768p LoRA. Beschleunigt H3-Sampling für schnelle, hochwertige Renderings. Model card
- MiniMax-H3 Charaktertausch LoRA. Stärkt robuste Kopf- und Körpertauschs für stilisierte oder Kreatur-Looks. Model card
- FUN ControlNet Union 2.0 Modell-Patch für H3. Fügt optionale Körperpose-Anleitung aus Skeletten hinzu. Model file
- Segment Anything Model 3.1 Multiplex. Erzeugt automatische Masken für den Bereich, der regeneriert werden soll. Checkpoint
- DWPose (über ControlNet Aux). Erkennt Körper- und Handskelette für Pose-Anleitung und Kopfzuschnittslogik. Repository
Wie man den Comfyui MiniMax H3 Performance Capture Workflow verwendet#
Der Workflow läuft von links nach rechts durch acht beschriftete Gruppen. Beginnen Sie, indem Sie Ihren Performance-Clip und optional eine manuelle Maske, eine Kopfkamera-Nahaufnahme und ein Charakterblatt laden. Die Pipeline bereitet dann eine Aufnahme und Maske vor, erstellt eine Schauspielreferenz von Ihrem Gesicht, leitet optional die Körperpose an, rendert mit MiniMax H3 und speichert einen Vergleichsschnitt.
1 MODELLE LADEN#
Diese Gruppe lädt das MiniMax-H3 UNet, den Text-Encoder und die VAEs, dann werden die Turbo- und Charaktertausch-LoRAs angewendet. UNETLoader (#1001) und CLIPLoader (#1006) bieten den Kern-Generator und den Eingabeaufforderungs-Encoder. LoraLoaderModelOnly (#1003, #1004) fügt die Geschwindigkeits- und Austausch-Adapter hinzu. BlockSparseAttention (#1009) und MiniMaxH3SigmaShift (#1002) sind eingebunden, um das Sampling zu beschleunigen und die Audio-Video-Anleitung auszugleichen.
2 IHR SHOT#
Verwenden Sie BODY CLIP (your performance + voice) (#1012), um die Hauptaufnahme mit eingebettetem Mono- oder Stereo-Audio zu laden. Sie können ein CREATURE SHEET über LoadImage (#1016) hinzufügen, um das Aussehen über die Aufnahmen hinweg zu fixieren, und die Eingabeaufforderung in PROMPT (the swap, the creature, its acting) (#1018) festlegen. Optionale Eingaben umfassen eine HEAD-CAM-Nahaufnahme VHS_LoadVideo (#1013) für winzige Gesichter in Weitwinkelaufnahmen und ein MANUAL MASK-Video VHS_LoadVideo (#1014), wenn Sie die automatische Maskierung überschreiben möchten. Schnelle Steuerungen befinden sich hier: WHAT GETS REPLACED (head / person) (#1017), SEED (#1019), GROW MASK px (#1020), FACE CROP (#1021) und PERSON (#1022). Umschaltknoten (NO HEAD-CAM #1227, NO MANUAL MASK #1228, NO CHARACTER SHEET #1229, NO POSE CONTROL #1230) machen gängige Setups mit nur einem Klick möglich.
3 VORBEREITEN#
WORKING SIZE (draft: 896x512) (#1028) normalisiert den Input auf eine stabile Auflösung und length: next 17k+5 up (#1030) begrenzt den Lauf auf eine kurze, knackige Vorschau-Länge. PREPARE (plate + regenerated area) (#1231) erstellt eine saubere Aufnahme, verfolgt, was mit SAM 3 zu ersetzen ist, indem Ihr Text von WHAT GETS REPLACED verwendet wird, und nimmt, falls vorhanden, Ihre manuelle Maske auf. Das Ergebnis ist eine Videoaufnahme plus ein oder zwei Masken, die für die kontrollierte Regeneration bereit sind.
4 REGENERIERTER BEREICH#
REGENERIERTER BEREICH (grow, blocks, hold) (#1233) ist die Maskenlogik, die entscheidet, wo MiniMax H3 malen darf. Es erweitert die Maske, damit Merkmale wie Ohren oder Hörner Platz haben, wandelt sie in zeitliche Blöcke um, um die Bewegung zu stabilisieren, und hält Änderungen ein paar Frames, damit Details nicht flackern. Wenn Sie eine manuelle Maske bereitgestellt haben, wird die [MANUAL MASK]-Kompositierung (#1074 bis #1105) wie gezeichnet durchgeschleift.
5 SCHAUSPIELREFERENZ#
SCHAUSPIELREFERENZ (your face on grey | head-cam) (#1232) findet die ausgewählte Person, schneidet einen Gesichtsbereich mit DWPose aus und erstellt das Referenzvideo, das Ihre Ausdrücke, Blicklinien und Kopfrotationen trägt. Mit aktivierter Kopfkamera wird ein geteiltes Bildschirmbild erstellt, sodass die Kopfrichtung der Weitwinkelkamera folgt, während die feine Gesichtsmimik der Kopfkamera folgt. Die Vorschau PREVIEW: acting reference (<Video 1>) (#1130) ermöglicht es Ihnen, das Tracking zu bestätigen, bevor Sie rendern.
6 POSE-KONTROLLE (optional)#
Für Ganzkörper-Kreaturentauschs extrahiert [POSE] DWPose skeleton (#1131) Körper- und Hand-Schlüsselpunkte von Ihrer Aufnahme. MiniMaxH3FunControlNetApply (#1132) leitet diese Bewegung in H3 als Patch ein, sodass Gliedmaßen und Torso Ihrem Schauspiel folgen, während das Gesicht referenzgesteuert bleibt. Verwenden Sie es, wenn Arme und Beine zwischen den Frames konsistent bleiben müssen; lassen Sie es aus für reine Kopftauschs und für vierbeinige Tiere.
7 RENDERN#
H3 references + prompt MiniMaxH3ReferenceToVideo (#1134) kombiniert die Eingabeaufforderung, das Charakterblatt, die Schauspielreferenz, das Audio und die Arbeitsgröße, um H3-Konditionierung und ein Start-Latent zu erzeugen. H3 RENDER (#1234) injiziert dann das Aufnahme-Latent, wendet die Regenerationsmaske an, sodass nur der maskierte Bereich sich ändert, und sampelt mit dem Turbo-Zeitplan. Das Ergebnis ist ein sauberes Render und eine „Regen gezeigt“-Vorschau; SAVE: H3 render 1344x768 + voice (#1150) schreibt eine MP4 mit Ihrem Originalaudio.
8 VERGLEICHSVIDEO#
VERGLEICHSVIDEO (#1235) stapelt die Aufnahme, das Render, die Schauspielreferenz und (falls verwendet) das Kreaturblatt in einem einzigen Frame zur Überprüfung. SAVE: comparison video + voice (#1158) exportiert eine MP4 mit demselben Soundtrack, sodass Sie das Ergebnis mit Ihrer Performance vergleichen können.
Schlüssel-Knoten im Comfyui MiniMax H3 Performance Capture Workflow#
BODY CLIP (your performance + voice) (#1012)#
Lädt Ihr Schauspiel und Audio, die Lippensynchronisation und Timing treiben. Behalten Sie die Landschaftsrahmung für die beste Komposition und stellen Sie sicher, dass die Datei Audio enthält. Wenn das Gesicht im Rahmen sehr klein ist, fügen Sie die Kopfkamera-Eingabe für schärferes Ausdrucks-Tracking hinzu.
WHAT GETS REPLACED (head / person) (#1017)#
Dieser kurze Text steuert SAM 3.1 in die Region, die H3 regenerieren wird. Verwenden Sie head für Kopftauschs oder person für Ganzkörperersetzungen. Wenn ein Helm oder ein auf dem Kopf montiertes Gerät verschwinden soll, fügen Sie Wörter wie Kopf, Helm oder Kameragerät ein; vermeiden Sie generische Wörter wie Bildschirm, Monitor oder Kabel, es sei denn, Sie möchten ähnliche Objekte im Hintergrund entfernen.
REGENERIERTER BEREICH (grow, blocks, hold) (#1233)#
Definiert, wie viel vom Bild H3 neu malen darf und wie sich dieser Bereich im Laufe der Zeit entwickelt. Erhöhen Sie das Wachstum, um Platz für Ohren, Hörner oder Fell zu schaffen; reduzieren Sie es für Weitwinkelaufnahmen, um zu vermeiden, dass es in den Hintergrund expandiert. Die Block- und Haltestufen stabilisieren die Bewegung, sodass Details nicht zwischen den Frames flimmern.
SCHAUSPIELREFERENZ (your face on grey | head-cam) (#1232)#
Erstellt die Performance-Spur, die MiniMax H3 nachahmen wird. FACE CROP steuert, wie viel vom Kopf und Nacken analysiert wird, und PERSON wählt den Schauspieler aus, wenn mehrere Personen sichtbar sind. Aktivieren Sie die Kopfkamera nur, wenn das Gesicht in der Weitwinkelaufnahme sehr klein ist; eine Kamera folgt normalerweise am besten den Kopfbewegungen.
MiniMaxH3ReferenceToVideo (#1134)#
Der Hub, der Eingabeaufforderung, Referenzen und Audio zusammenführt, um Konditionierung und ein anfängliches Latent zu erzeugen. Halten Sie Breite und Höhe mit der Arbeitsgröße ausgerichtet und lassen Sie die Workflow-Länge für Vorschauen automatisch begrenzen. Die Eingabeaufforderung enthält bereits einen Satz, der H3 sagt, wie die Schauspielreferenz zu verwenden ist.
MiniMaxH3FunControlNetApply (#1132)#
Fügt optionale Körperpose-Anleitung von DWPose hinzu. Nützlich für Ganzkörper-Kreaturen, sodass Torso und Gliedmaßen überzeugend folgen, während das Gesicht der Schauspielreferenz folgt. Lassen Sie es aus für Kopftauschs oder vierbeinige Bewegungen, die nicht mit menschlichen Skeletten übereinstimmen.
H3 RENDER (#1234)#
Wendet die Maske an, sodass nur der ausgewählte Bereich sich ändert, sampelt dann das Video mit dem Turbo-Zeitplan und dekodiert mit gekacheltem VAE für VRAM-Effizienz. Verwenden Sie SEED, um Aussehen und Mikro-Bewegungen zu beeinflussen; ändern Sie es, wenn das Erscheinungsbild des Charakters von Blatt oder Beschreibung abweicht.
Optionale Extras#
- Tipps zum Filmen für MiniMax H3 Performance Capture: Filmen Sie im Querformat, halten Sie die Belichtung stabil, fügen Sie sauberes Produktionsaudio hinzu; wenn Sie HDR auf dem iPhone aufgenommen haben, konvertieren Sie es vor dem Ausführen in SDR.
- Anleitung für das Charakterblatt: Fügen Sie Vorder- und Seitenansichten sowie ein paar kleine Ausdrucksköpfe hinzu; dies fixiert die Identität über die Aufnahmen besser als nur Text.
- Szenen mit mehreren Personen: Setzen Sie
PERSONauf den richtigen Index und beschreiben Sie das Subjekt im SAM-Text, überprüfen Sie dann die Maskenvorschau vor dem Rendern. - Manuelle Maske: Geben Sie ein Schwarz-Weiß-Video an, das mit dem Timing des Körperclips übereinstimmt; malen Sie es etwas größer als die beabsichtigte Kreatur, damit H3 nicht auf das ursprüngliche Gesicht zurückgreift.
- Wann die Pose-Kontrolle aktiviert werden soll: Verwenden Sie es für Ganzkörper-Humanoiden oder Kreaturen mit Armen und Beinen; schalten Sie es aus für Kopftauschs und Vierbeiner.
- Performance-Hinweise: Sparse Attention ist aktiviert, um Renderings zu beschleunigen und den Speicher zu reduzieren; wenn VRAM knapp ist, führen Sie den Text-Encoder auf der CPU in
CLIPLoaderaus. Angepasste Knoten, die verwendet werden, umfassen ComfyUI-VideoHelperSuite, ComfyUI-KJNodes, comfyui_controlnet_aux, ComfyUI-H3-FaceRefine und ComfyUI-Mickmumpitz-Nodes.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir bedanken uns herzlich bei Mickmumpitz für den ComfyUI Performance-Capture-Workflow und Comfy-Org für die MiniMax H3 Modelle für ihre Beiträge und Wartung. Für maßgebliche Details konsultieren Sie bitte die Originaldokumentation und die unten verlinkten Repositories.
Ressourcen#
- Workflow von Mickmumpitz
- GitHub: mickmumpitz/ComfyUI-Mickmumpitz-Nodes
- Docs / Release Notes: NEW VIDEO & FREE WORKFLOW — Turn yourself into ANY creature (MiniMax H3)
- MiniMax H3 Modelle
- Hugging Face: Comfy-Org/MiniMax-H3
Hinweis: Die Verwendung der referenzierten Modelle, Datensätze und des Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.


