ComfyUI>Workflows>MiniMax H3 Fun Control | Präzise Bild-zu-Video

MiniMax H3 Fun Control | Präzise Bild-zu-Video

Workflow Name: RunComfy/MiniMax-H3-Control
Workflow ID: 0000...1506
Verwandeln Sie ein Referenzbild in ein kontrolliertes Video. Bewahren Sie die Identität, das Outfit und die Szene Ihres Subjekts. Führen Sie Bewegungen mit H3 Fun ControlNet. Wählen Sie zwischen Einzelsteuerung oder Tiefen-Plus-Pose-Zweigen. Verwenden Sie optional SolAttn für schnellere Läufe. Erstellen Sie saubere Spaziergänge, Drehungen, Wellen und Ganzkörperbewegungen.

ComfyUI MiniMax H3 Fun Control Workflow

MiniMax H3 Fun Control in ComfyUI | Depth and Pose Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Fun Control Examples

MiniMax H3 Fun Control: kontrollierbare Referenzbild-zu-Video-Generierung in ComfyUI#

Diese RunComfy-bereite Leinwand bringt MiniMax H3 Fun Control zu ComfyUI für präzise, anpassbare Bild-zu-Video-Umwandlungen. Sie folgt Ihrem Strukturpass (Tiefe, Canny, Pose, HED oder MLSD), während sie entweder eine Erstreferenz oder vollständige Charakter-/Stilreferenzen respektiert. Das Standardlayout wird mit drei einsatzbereiten Zweigen geliefert, sodass Sie einfach beginnen und die Kontrolle nach Bedarf ausbauen können.

Graph 1 führt einen Einzelsteuerungsstrom aus und ist standardmäßig aktiviert. Graph 2 fügt eine verkettete Tiefen-Plus-Pose-Konfiguration mit Charakter-/Stilreferenzen und echter negativer Aufforderung hinzu. Graph 3 spiegelt Graph 2 wider, enthält jedoch einen optionalen SolAttn-Beschleunigungspatch. Sie können jeden vorbereiteten Zweig aktivieren oder umgehen, nachdem Sie den Workflow geladen haben.

Schlüsselmodelle im Comfyui MiniMax H3 Fun Control Workflow#

  • MiniMax H3 Basis UNet (fl2va) und Referenz-zu-Video UNet (ref2va). Diese sind die Videorückgrate, die Bewegung entweder aus einer Aufforderung und dem ersten Frame (fl2va) oder aus persistenten Bildreferenzen (ref2va) synthetisieren. Community-verpackte Gewichte für ComfyUI sind im MiniMax H3-Experimentierset auf Hugging Face verfügbar: MiniMax-H3-experimental.
  • MiniMax H3 Video VAE und Audio VAE. Diese kodieren und dekodieren die latenten Video- und Audioströme, die von H3 verwendet werden, sodass die Pipeline effizient sampeln kann, um dann Ergebnisse in Pixel und Ton zurückzuverwandeln. Siehe dasselbe Modellpaket: MiniMax-H3-experimental.
  • Qwen-VL Familie Text-Encoder. Der Workflow verwendet eine MiniMax-abgestimmte Variante der Qwen-VL-Serie, um Aufforderungen zu analysieren und Textkonditionierung in H3 einzuspeisen. Für Hintergrundinformationen zu dieser Modellfamilie siehe das offizielle Repository: Qwen2-VL.
  • MiniMax H3 Fun ControlNet Union (Kurvenform). Dieses einzelne ControlNet unterstützt mehrere Steuerungspässe (Tiefe, Canny, HED, Pose, MLSD) und ermöglicht es Ihnen, die Szenenstruktur über Frames hinweg zu lenken. Verwenden Sie den Kurvenform-Checkpoint aus der offiziellen Veröffentlichung: MiniMax-H3-Fun-Controlnet-Union.

Verwendung des Comfyui MiniMax H3 Fun Control Workflows#

Die Leinwand enthält drei vorbereitete Zweige. Graph 1 (Einzelsteuerung) ist aktiviert, Graph 2 (Tiefe+Pose mit Referenzen) und Graph 3 (SolAttn-Beschleunigung) sind umgangen. Schalten Sie einen Zweig ein, wenn Sie bereit sind; nur der aktivierte Zweig wird ausgeführt.

01 · Einzelsteuerung · STANDARDMÄSSIG AKTIVIERT#

01 · Modelle Diese Gruppe lädt das MiniMax H3 Basis UNet, den Qwen-VL Text-Encoder und die H3 VAEs für Video und Audio. Es lädt auch die Kurvenform MiniMax H3 Fun ControlNet Union, sodass ein einzelner Steuerungsstrom die Struktur leiten kann. Sie müssen hier nichts ändern, es sei denn, Sie möchten Gewichte aus einem anderen Checkpoint-Set austauschen.

01 · STEUERUNG: Dies ist der Knoten Laden Sie ein Kontrollvideo, das die beabsichtigte Ausgabeweite, Höhe und Bildanzahl entspricht; der Knoten überprüft und erhöht beide Zahlen, wenn sie nicht übereinstimmen. Wählen Sie eine der unterstützten Pässe (Tiefe, Canny, Pose, HED, MLSD) basierend darauf, was Ihre Bewegung und Silhouetten am besten erfasst. Stärke fungiert als Adhärenzbudget; 1.0 ist der richtige Ausgangspunkt für eine Einzelsteuerung, und höheres Drücken neigt dazu, Details zu sättigen. Das Steuerungsfenster definiert, wann die Steuerung während des Samplings aktiv ist; das Beenden des Fensters um 0.6 sperrt oft die Struktur früh, während spätere Schritte feine Texturen hinzufügen können. Verwenden Sie den Kurvenform-ControlNet-Checkpoint; die Vollbreitenvariante wird in diesem Knoten nicht geladen.

01 · Konditionierung Schreiben Sie Ihre Aufforderung und geben Sie optional einen ersten Frame an. Mit einem ersten Frame initialisiert das Modell von diesem Bild und neigt dazu, die Komposition beizubehalten; ohne es treibt die Aufforderung allein das Aussehen an. Stellen Sie hier Breite, Höhe und Länge ein; MiniMax H3 passt die Länge an sein gültiges Raster bei 24 fps (17n + 5) an, planen Sie also Ihre Bearbeitung um diese Zählungen herum. Wenn die ersten und letzten Frames nicht gesetzt sind, verwendet das Modell den natürlichen Anfang und das Ende; das Hinzufügen eines letzten Frames ist für diesen Zweig nicht erforderlich.

01 · Sampling Der Sampler läuft mit einem einfachen Führer, der kein CFG und keinen negativen Eingang hat, was bedeutet, dass Negative in Ihrem Text hier ignoriert werden; verwenden Sie Graph 2 oder wechseln Sie zu einem CFG-Führer, wenn Sie Negative benötigen. Sigma-Shift wird angewendet, um Video- und Audio-Diffusionspläne für eine stabile Dekodierung später auszugleichen. Die Auswahl von Plan und Sampler in diesem Zweig ist auf sinnvolle Qualitäts-zu-Geschwindigkeit-Kompromisse abgestimmt; sobald Sie eine Basis haben, können Sie experimentieren.

01 · Ausgabe Die gesampelten Latenten werden mit dem H3 Video VAE und, falls vorhanden, dem Audio VAE dekodiert. Frames und Audio werden in ein Video gemuxt und in Ihren Ausgaben gespeichert. Verwenden Sie das gespeicherte Ergebnis als Stilkontrolle und kehren Sie bei Bedarf zur Steuerungsstärke, zum Zeitplanfenster oder zur Aufforderung zurück.

02 · Tiefe + Pose Referenz · STANDARDMÄSSIG UMGEGANGEN#

02 · Modelle Dieser Zweig lädt das H3 Referenz-zu-Video UNet, das entwickelt wurde, um Identität und Stil von Standbildern über jeden Frame hinweg beizubehalten. Es teilt den Qwen-VL Text-Encoder und die H3 VAEs. Die Kurvenform MiniMax H3 Fun ControlNet Union wird hier wiederverwendet, um die Struktur zu steuern.

02 · STEUERUNG: verkettet, Stärken SUMME zu etwa 1.0 Zwei Anwendungs-Knoten sind verkettet, sodass jeder Steuerungsstrom seinen eigenen Beitrag leistet, zuerst die Tiefe, dann die Pose. Behandeln Sie die Stärke als Budget: Die beiden Stärken summieren sich, und ein Überschreiten des Gesamtwerts von 1.0 wird Details auswaschen und das Subjekt verschmieren. Tiefe ist großartig für grobe Geometrie und Kameraplatzierung; Pose verriegelt Gliedmaßen und Artikulation. Stimmen Sie ab, indem Sie eine Stärke auf null setzen und der anderen zuhören, dann bringen Sie sie zusammen in die Nähe von 1.0.

02 · Konditionierung und Referenzen Verwenden Sie MiniMaxH3ReferenceToVideo, um echte Referenzbilder zusammen mit Ihrer Aufforderung zu füttern, sodass Identität und Stil durch alle Frames erhalten bleiben. ref_image_size von max bietet die stärkste Identität (größere Referenztokens) zu einem Rechenaufwand; match ist schneller und oft ausreichend für lockerere Stilkontrolle. Fügen Sie einen negativen Zweig mit denselben Referenzen und Ihrem negativen Text hinzu, sodass der CFG-Führer das, was Sie nicht möchten, subtrahieren kann. Länge, Größe und Bildanzahl folgen denselben Regeln wie Graph 1.

02 · Sampling Wechselt zu einem CFGGuider, sodass die negative Konditionierung tatsächlich angewendet wird; Guidance erhöht die Kosten, da das Modell bei jedem Schritt sowohl Positives als auch Negatives bewertet. Schritte sind hier höher gesetzt, um den verketteten Steuerungen und Referenzen Raum zur Lösung zu geben; Sie können für Geschwindigkeit kürzen, sobald Ihnen das Aussehen gefällt. Seed steuert die Reproduzierbarkeit; halten Sie es fest, während Sie das Tiefen- und Pose-Budget ausgleichen.

02 · Ausgabe Dekodierung und Videozusammenstellung spiegeln Graph 1. Wenn die Ausgabe die Struktur trifft, aber überglättet aussieht, reduzieren Sie das Steuerungsfensterende auf 0.6 oder senken Sie die Gesamtkontrollstärke leicht. Wenn die Identität rutscht, erhöhen Sie ref_image_size oder fügen Sie ein zweites Referenzbild hinzu.

03 · Optionaler Sol-Attn-Beschleuniger · STANDARDMÄSSIG UMGEGANGEN#

03 · Modelle Dieser Zweig spiegelt die Modelle und Steuerungen von Graph 2 wider, fügt jedoch einen Sparse-Attention-Beschleunigungspatch hinzu. Es erfordert die SolAttn Triton-Erweiterung. Wenn Sie Triton oder das Node-Paket nicht installiert haben, lassen Sie diesen Zweig umgangen.

03 · STEUERUNG: verkettet, Stärken SUMME zu etwa 1.0 Die gleiche Tiefen-Plus-Pose-Kette gilt; halten Sie die kombinierte Stärke nahe 1.0 für scharfe Ergebnisse. Verwenden Sie denselben Abstimmungsansatz wie Graph 2, um die Aufteilung zu finden, die am besten zu Ihrem Shot und der Subjektgröße passt.

03 · Konditionierung und Referenzen Identisch zu Graph 2. Halten Sie die Referenzen über die positiven und negativen Zweige konsistent, sodass CFG die richtigen Merkmale subtrahiert. Wenn Sie maximale Identität wünschen, kombinieren Sie ref_image_size: max mit einer leicht höheren Schrittanzahl.

03 · OPTIONAL: Sparse-Attention SolAttnPatch beschleunigt aufmerksamkeitsschwere Blöcke, während die Qualität dort erhalten bleibt, wo sie am wichtigsten ist. Lassen Sie morton ausgeschaltet, da das Umsortieren von Videotokens in Z-Reihenfolge die Ausrichtung dort, wo das ControlNet seine zeilenweisen Offsets anwendet, verfehlt und die Kontrolle effektiv entfernt. Wenn Sie Geschwindigkeit ohne Adhärenzverlust wünschen, behalten Sie die ersten und letzten Transformer-Blöcke exakt bei. Erwarten Sie schnellere Läufe, nachdem Triton seine Kerne kompiliert hat; der erste Durchlauf misst hauptsächlich die Kompilierungszeit.

03 · Sampling und Ausgabe Sampling, Dekodierung und Speicherung folgen Graph 2. Vergleichen Sie SolAttn ein- und ausgeschaltet mit einem festen Seed, um Qualität und Adhärenz für Ihren Inhalt zu beurteilen. Wenn die Kontrolle mit SolAttn schwächer erscheint, überprüfen Sie, ob morton deaktiviert ist, bevor Sie die Stärken anpassen.

Schlüssel-Knoten im Comfyui MiniMax H3 Fun Control Workflow#

Apply H3 Fun ControlNet (#23) Fügt dem aktuellen Modell einen Steuerungsstrom hinzu und nimmt ein Batch von Steuerungsframes aus Ihrem Kontrollvideo. Verwenden Sie strength als Adhärenzbudget: für eine Einzelsteuerung beginnen Sie bei 1.0; beim Verkettung von Steuerungen halten Sie die Summe nahe 1.0, um ausgewaschene Details zu vermeiden. Das Steuerungsfenster (start_percent, end_percent) bestimmt, wann die Steuerung aktiv ist; das Ende um 0.6 bewahrt oft Texturen, die die Steuerung nicht beschreiben kann.

Prompt + erster Frame -> Konditionierung (#31) Erstellt Konditionierung aus Ihrer Textaufforderung und einem optionalen ersten Frame, sodass das Modell die anfängliche Komposition respektieren kann. Wenn Sie den ersten Frame weglassen, lenkt die Aufforderung allein den Inhalt. Breite, Höhe und Länge befinden sich hier; H3 akzeptiert Längen auf seinem 17n + 5 Raster bei 24 fps, planen Sie also Bearbeitungen zu diesen Dauern.

Positive: Referenzen + Aufforderung (#1031) Füttert persistente Bildreferenzen und Aufforderungstext in H3 ein, sodass Identität und Stil durch jeden Frame getragen werden. ref_image_size von max verwendet größere Tokens für stärkere Identität bei höheren Kosten; match ist schneller mit leichterem Identitätsdruck. Kombinieren Sie dies mit einem negativen Zweig und CFGGuider, wenn Sie starke Ausschlüsse benötigen.

CFGGuider: Das Negative funktioniert nur hier (#1040) Ermöglicht klassifikationsfreie Anleitung, sodass negative Konditionierung Wirkung zeigt. Höhere Anleitung stärkt die Aufforderungs- und Referenzadhärenz, erhöht jedoch den Rechenaufwand, da jeder Schritt sowohl positiv als auch negativ ausgeführt wird. Für lange, spezifische Stilbriefe kann ein moderater cfg die Adhärenz erheblich verbessern; testen Sie Seite an Seite mit einem festen Seed.

Sigma-Shift (Video 12 / Audio 3) (#24) Passt Diffusionspläne an, um dem Videopfad und dem Audiopfad geeignete Sigma-Profile vor dem Sampling zu geben. Behalten Sie dies in der Kette bei, wenn Sie planen, Audio zu dekodieren, sodass die Audio VAE eine kompatible latente Verteilung erhält.

Sol-Attn (OPTIONAL, benötigt das SolAttn Node-Paket + Triton) (#2060) Wendet Sparse-Attention-Kerne an, um H3 zu beschleunigen, ohne das Diagramm zu ändern. Lassen Sie morton deaktiviert; das Aktivieren davon ordnet Tokens neu und lässt den Beitrag des ControlNet die beabsichtigten Reihen verfehlen, was wie perfekte Ausgabe aussieht, die einfach die Kontrolle ignoriert. Für konservative Beschleunigungen halten Sie die frühesten und spätesten Transformer-Blöcke exakt und profilieren Sie nach Triton-Kompilierung.

BasicScheduler (#42) Bietet den Sigma-Plan und die Schrittanzahl für das Sampling. Für eng kontrollierte Aufnahmen können ein paar zusätzliche Schritte helfen, die Struktur zu stabilisieren, bevor die Kontrolle verblasst; für schnelle Stilpässe kürzen Sie Schritte, um Zeit zu sparen. Kombinieren Sie Plananpassungen mit dem Steuerungsfenster, um Adhärenz und Textur auszugleichen.

Optionale Extras#

  • Das Kontrollvideo muss der Generationsbreite, -höhe und -bildanzahl genau entsprechen; der Knoten überprüft und erhöht beide Zahlen, wenn sie unterschiedlich sind.
  • Verwenden Sie den Kurvenform-ControlNet-Checkpoint; die ursprüngliche Vollbreitenveröffentlichung wird in H3FunControlLoader nicht geladen.
  • Wenn Ihr Kontrollpass große merkmalslose Bereiche hat, enden Sie das Steuerungsfenster in der Nähe von 0.6, sodass späte Schritte Texturen aus der Aufforderung hinzufügen können.
  • Für identitätskritische Clips bevorzugen Sie Graph 2 oder Graph 3 mit MiniMaxH3ReferenceToVideo und ziehen ref_image_size: max in Betracht.
  • Benötigen Sie Negative in Graph 1? Wechseln Sie zu einem CFGGuider oder wechseln Sie zu Graph 2/3, wo der negative Zweig bereits verdrahtet ist.
  • Projektressourcen: benutzerdefinierter Knoten ComfyUI-H3-FunControl, Kurvenform-ControlNet MiniMax-H3-Fun-Controlnet-Union, Community H3 Gewichte MiniMax-H3-experimental, optionale Beschleunigung ComfyUI-SolAttn_triton.

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken wyzborrero für den ComfyUI-H3-FunControl benutzerdefinierten Knoten, alibaba-pai für das MiniMax H3 Fun ControlNet Union Modell, Kijai für die MiniMax H3 experimentellen Modellsätze, kijai für den SolAttn Triton optionalen Beschleunigungsknoten und RunComfy für den Cloud Save Workflow für ihre Beiträge und Wartung. Für autoritative Details beziehen Sie sich bitte auf die originalen Dokumentationen und Repositories, die unten verlinkt sind.

Ressourcen#

Hinweis: Die Verwendung der genannten Modelle, Datensätze und des Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.