ComfyUI>Workflows>MiniMax H3 Actionszenen | Geführtes Actionvideo

MiniMax H3 Actionszenen | Geführtes Actionvideo

Workflow Name: RunComfy/MiniMax-H3-Action
Workflow ID: 0000...1527
Verwandeln Sie zwei Charakterbilder und eine Szenenreferenz in ein Actionvideo. Sie erhalten natives Audio und identitätsgeführte Charaktere. Strukturieren Sie Eingabeaufforderungen, um die Choreografie zu steuern. Zwei-Stufen-Sampling verfeinert die Bewegung. Erstellen Sie Schwert-, Box- oder Sci-Fi-Kampfvideos. Überprüfen Sie schnelle Hand- und Waffenberührungen auf Artefakte.

ComfyUI MiniMax H3 Action Scenes Arbeitsablauf

MiniMax H3 Action Scenes | Reference Video + Native Audio
Möchtest du diesen Workflow ausführen?
  • Voll funktionsfähige Workflows
  • Keine fehlenden Nodes oder Modelle
  • Keine manuelle Einrichtung erforderlich
  • Beeindruckende Visualisierungen

ComfyUI MiniMax H3 Action Scenes Beispiele

MiniMax H3 Actionszenen: Referenzgeführter Actionvideo-Generator mit nativem Audio#

MiniMax H3 Actionszenen ist ein ComfyUI-Workflow zur Erstellung von präzise geleiteten, referenzgeführten Actionvideos mit synchronisiertem nativem Audio. Sie stellen zwei Charakterbilder, eine Szenenreferenz und eine strukturierte Eingabeaufforderung bereit. Der Workflow stagt die Bewegung mit MiniMax H3 Turbo, verfeinert dann die Komposition und Lesbarkeit der Kämpfe mit LMS und Combat LoRAs, während das Originalaudio erhalten bleibt. Die Ausgaben umfassen ein schnelles Erstpass-„Basis“-Video und ein hochauflösendes „verfeinertes“ Video.

Dieser Comfyui MiniMax H3 Actionszenen-Workflow ist für Previz, Stunt- und Kampfdesign, Spiel- und VFX-Kinematiken sowie kurze Social-Clips konzipiert. Getestete Beispiele umfassen Schloss-Schwertkämpfe, Box-Gymnastik mit Handschuhen und ein Raumschiff-Baton-Drill. Halten Sie die Charakteridentität und Choreografie in der Eingabeaufforderung explizit und überprüfen Sie schnelle Hand- oder Waffenberührungen auf mögliche Artefakte.

Wichtige Modelle im Comfyui MiniMax H3 Actionszenen-Workflow#

  • Comfy‑Org MiniMax H3 Kernsuite. Stellt den Text-Encoder sowie die Video- und Audio-VAEs bereit, die zum Aufbau, zur Trennung und zum Decodieren des gemeinsamen Audio-Video-Latents verwendet werden. Siehe Modelle und LoRAs in der offiziellen Sammlung. MiniMax‑H3 Modelle
  • Minimax‑h3 Singularity (UNet). Dient als Basis-Ref-to-Video-Generator, der Referenzen und Eingabeaufforderungen in ein Audio-Video-Latent für Actionszenen fusioniert. Minimax‑h3_Singularity
  • MiniMax‑H3 Turbo LoRA. Beschleunigt den ersten Durchlauf, sodass Sie Bewegungsabläufe schnell iterieren können, bevor sie verfeinert werden. In der offiziellen MiniMax H3 Sammlung enthalten. MiniMax‑H3 LoRAs
  • MiniMax‑H3 LMS LoRA. Fügt Layout, Materialien und strukturelle Schärfe hinzu, die für Live-Action-Stil-Ausgaben geeignet sind; wird während des zweiten Durchgangs verwendet. LMS LoRA r64
  • H3 Combat LoRA. Verbessert die Klarheit von Kampfsilhouetten, Klingenberührungen und geerdeter Fußarbeit in Actionszenarien. In der MiniMax H3 Sammlung enthalten. MiniMax‑H3 Modelle
  • H3 Latent Upscaler LMS. Ein temporaler 3D-Upscaler, der das Videolatent zwischen den Durchgängen vergrößert und die Bewegungskontinuität beibehält. Comfyui Minimax H3 Latent Upscaler

Verwendung des Comfyui MiniMax H3 Actionszenen-Workflows#

Die Pipeline läuft in zwei koordinierten Durchgängen. Durchgang 1 etabliert Bewegung und Timing mit Turbo für Geschwindigkeit. Das Videolatent wird dann in Durchgang 2 mit LMS und Combat LoRAs vergrößert und verfeinert, während das native Audio beibehalten wird. Sie erhalten sowohl eine schnelle „Basis“-Vorschau als auch einen polierten „verfeinerten“ Export.

Einstellung#

Verwenden Sie die Einstellungsgruppe, um das Seitenverhältnis, die Arbeitsauflösung, die Clipdauer und die Bildrate auszuwählen. Die Dauerkontrolle wandelt Sekunden in eine Bildanzahl um, die mit der Chunking des Samplers übereinstimmt, was zur Stabilität beiträgt. Beginnen Sie niedriger für schnelle Vorschauen und skalieren Sie dann hoch, sobald das Framing und die Beats richtig aussehen. Höhere Auflösungen und längere Clips erhöhen den VRAM und die Renderzeit.

Referenzen#

Laden Sie drei Referenzen: ein Bild pro Charakter und ein Bild, das die Umgebung definiert. Charakterbilder fungieren als Identitäts- und Kostümanleitungen, nicht als Hintergründe, also wählen Sie saubere Porträts mit lesbaren Gesichtern und wichtigen Garderobenelementen. Die Szenenreferenz setzt Beleuchtung, Palette und Architektur; wählen Sie eine Ansicht, die mit Ihrer beabsichtigten Kamerahöhe übereinstimmt. Sie können Referenzen frei austauschen, um verschiedene Match-Ups und Standorte zu erkunden.

Bedingungen#

Der MiniMaxH3ReferenceToVideo (#56) Knoten fusioniert die strukturierte Eingabeaufforderung mit den Referenzen und den MiniMax H3 Encodern, um ein gemeinsames Audio-Video-Latent und positive Konditionierung zu erzeugen. Die Eingabeaufforderung funktioniert am besten, wenn sie in beschriftete Abschnitte wie subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape und non_diegetic_music aufgeteilt wird. Seien Sie explizit über die Anzahl der Kämpfer, Waffen, Kamerabewegungen und die genaue Anzahl sauberer Kontakte. Vermeiden Sie zusätzliche Charaktere, Teleportationen, übermenschliche Bewegungen oder Effekte, wenn Sie geerdete Ergebnisse wünschen.

LoRAs#

LoRAs werden in zwei Phasen angewendet. Turbo wird für den ersten Durchgang injiziert, um die Bewegungserkundung zu beschleunigen, ohne die Identitätsbeibehaltung zu opfern. Der LMS LoRA fließt durch eine AdaLN-Kompatibilitätskorrektur, dann wird Combat angewendet, sodass der Verfeinerer lesbare Silhouetten und Schlag-Parier-Austausche betont. Sie können die LoRA-Stärken anpassen, um Realismus gegenüber Stilisierung für Ihr Genre auszugleichen.

Patches#

Diese Gruppe konfiguriert Leistungs- und Zeitplananpassungen. PathchSageAttentionKJ (#199) optimiert die Aufmerksamkeit für Speicher und Geschwindigkeit, sodass hochbewegliche Szenen reaktionsfähig bleiben. MiniMaxH3SigmaShift (#297) stimmt die Video- und Audiosigma-Zeitpläne ab, wodurch die Lippen- und Foley-Timing im Verhältnis zur Bewegung verbessert werden. Verwenden Sie diese, wenn Sie Timing-Abweichungen oder kleine Identitätsinstabilitäten feststellen.

1. Sampling#

Der erste Durchgang initialisiert Rauschen, setzt einen kompakten Zeitplan und sampelt mit SamplerCustomAdvanced (#238), geführt von Ihrer positiven Konditionierung. Die Ausgabe wird als Basis-Latent gespeichert und kann in ein schnelles Vorschauvideo mit nativem Audio dekodiert werden, um eine schnelle Überprüfung durchzuführen. In diesem Durchgang beurteilen Sie Blockierung, Kamerafahrt und die Kadenz der Treffer. Wenn die Beat-Map nicht stimmt, überarbeiten Sie die Eingabeaufforderung und Referenzen hier, bevor Sie verfeinern.

2. Sampling + Verfeinerer#

Vor der Verfeinerung werden Audio und Video aus dem ersten Durchgang getrennt, das Videolatent wird mit MinimaxH3LatentUpscaler3D (#124) vergrößert und das Audiolatent bleibt intakt. Der Verfeinerer sampelt dann mit niedrigeren Rausch-Sigmas unter Verwendung von LMS und Combat LoRAs, um Materialdetails, Kantentreue und Kampflesbarkeit hinzuzufügen. Schließlich werden Bilder und das erhaltene Audio dekodiert und in den verfeinerten Export kombiniert. Erwarten Sie schärfere Kanten, sauberere Hände und Klingen sowie stabilere Identität im Vergleich zum Basisdurchlauf.

Wichtige Knoten im Comfyui MiniMax H3 Actionszenen-Workflow#

MiniMaxH3ReferenceToVideo (#56)#

Erstellt ein synchronisiertes Audio-Video-Latent aus Ihrer strukturierten Eingabeaufforderung und Referenzbildern mit dem MiniMax H3 Text-Encoder und VAEs. Passen Sie die prompt, width, height und length an, um Inhalt, Framing und Dauer zu steuern. Für beste Ergebnisse sollten die Subjektdarstellungen und Szenenkonstraints eindeutig sein. Referenz: Comfy‑Org MiniMax‑H3.

MinimaxH3LatentUpscaler3D (#124)#

Zeitlich konsistenter 3D-Latent-Upscaler, der das Videolatent zwischen den Durchgängen vor der Verfeinerung vergrößert. Erhöhen Sie mode.scale maßvoll, um Details zu gewinnen, ohne die Bewegung zu destabilisieren. Nützlich, wenn Ihnen das Timing des ersten Durchgangs gefällt, Sie aber schärfere Kanten und Texturen wünschen. Referenz: Comfyui Minimax H3 Latent Upscaler.

MiniMaxH3SigmaShift (#297)#

Verschiebt die Audio- und Videosigma-Zeitpläne, die von MiniMax H3 verwendet werden, sodass Bewegung, Lippenbewegungen und Foley synchron bleiben. Das Feinabstimmen von shift_video und shift_audio kann Timing-Abweichungen in Dialogen oder bei Einschlägen reduzieren. Lassen Sie kleine Versätze, es sei denn, Sie bemerken eine Desynchronisation beim Cut-In oder Cut-Out. Referenz: MiniMax‑H3 Sammlung.

VHS_VideoCombine (#264)#

Kombiniert dekodierte Frames und Audio in das endgültige MP4 mit den von Ihnen gewählten Bildraten- und Qualitätseinstellungen. Aktivieren Sie das Speichern von Metadaten, um Herkunft und Workflow-Details in den Exporten zu behalten. Verwenden Sie trim_to_audio, wenn Ihr verfeinertes Video über das erhaltene Audio hinausgeht. Referenz: ComfyUI‑VideoHelperSuite.

PathchSageAttentionKJ (#199)#

Aufmerksamkeitsoptimierung, die den Durchsatz und die Stabilität für detailreiche Szenen und größere Auflösungen verbessern kann. Halten Sie es für längere Takes oder komplexe Umgebungen aktiviert. Wenn Sie Leistungsverschlechterungen bei kleineren Clips feststellen, versuchen Sie den automatischen Modus. Referenz: ComfyUI‑KJNodes.

Optionale Extras#

  • Eingabeaufforderungsmuster. Verwenden Sie das bereitgestellte Abschnittsformat und schreiben Sie eine Beat-Map für die Aktion. Geben Sie die genaue Anzahl der Kämpfer und Waffen, die Kamerabewegung und die Anzahl und das Timing der lesbaren Kontakte an.
  • Referenzkuratierung. Wählen Sie Identitätsfotos mit klaren Gesichtern und Garderobe sowie ein Standortbild, das zur beabsichtigten Perspektive und Beleuchtung passt. Vermeiden Sie geschäftige Hintergründe auf Charakterreferenzen, um Konflikte zu reduzieren.
  • Überprüfungsdurchgang. Sehen Sie sich das Basisvideo an, um Blockierung und Timing zu validieren, bevor Sie verfeinern. Wenn Kontakte matschig aussehen, erhöhen Sie die Klarheit in der Eingabeaufforderung und reduzieren Sie die hektische Hand- oder Klingengeschwindigkeit.
  • Typische Probleme und Lösungen. Schnelle Hand- oder Waffenberührungen können kleine Verzerrungen verursachen; vereinfachen Sie die Choreografie um Einschläge herum, verkürzen Sie den Austausch oder erhöhen Sie den Abstand zur Kamera, um dem Modell zu helfen, den Moment sauber darzustellen.
  • Liefergegenstände. Der Workflow schreibt eine schnelle Basisvorschau und einen verfeinerten Export, sodass Sie Bewegung mit dem endgültigen Aussehen vergleichen können. Verwenden Sie den verfeinerten Clip zum Teilen, wenn Identitäten, Umgebung und Beats Ihr Ziel erreichen.

Mit MiniMax H3 Actionszenen können Sie zwei Charakterbilder, eine Szenenreferenz und eine präzise Briefing in geerdete, referenzgetreue Actionclips mit synchronisiertem nativem Audio umwandeln, bereit für redaktionelle, previs oder Veröffentlichungen.

Danksagungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Innovate Futures @ Benji für die AI Video MiniMax H3 ComfyUI-Workflow-Anleitung, WarmBloodAban für Minimax-h3_Singularity und Comfy-Org und RunningHubAI für die MiniMax-H3-Basismodelle und LMS LoRA für ihre Beiträge und Wartung. Für verbindliche Details verweisen wir auf die Originaldokumentation und Repositories unten.

Ressourcen#

Hinweis: Die Verwendung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.