ComfyUI>Workflows>MiniMax Musikvideo | Vollständige Musikvideo-Pipeline mit MiniMax H3 und Music 3

MiniMax Musikvideo | Vollständige Musikvideo-Pipeline mit MiniMax H3 und Music 3

Workflow Name: RunComfy/MiniMax-music-video
Workflow ID: 0000...1502
Verwandeln Sie Ihr gesamtes Lied in eine verbundene KI-Visual-Sequenz. Verwenden Sie MiniMax H3 und MiniMax Music 3, um Szenen an Rhythmus, Gesang und Stimmung anzupassen. Führen Sie Aufnahmen mit Eingabeaufforderungen, Bildern, Audio- oder Video-Referenzen. Halten Sie Charaktere und Stil konsistent. Erstellen Sie schneller Performance- oder Erzählclips. Exportieren Sie ein kohärentes filmisches Ergebnis.

ComfyUI MiniMax music video Workflow

MiniMax Music Video in ComfyUI | Build full pipeline with MiniMax H3 and Music 3
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax music video Examples

MiniMax Musikvideo: Lied-zu-Szene-Generierung in ComfyUI#

Dieser Arbeitsablauf verwandelt ein vollständiges Lied in eine Sequenz von rhythmusbewussten Videoshots unter Verwendung von MiniMax H3, mit optionaler Musikkreation, die von MiniMax Music 3 angetrieben wird. Es mischt Text-Eingabeaufforderungen, Referenzbilder und einen Master-Audiotrack, um filmische Clips zu produzieren, die Gesang, Beat und Stimmung verfolgen. Das Ergebnis ist ein kohärentes MiniMax Musikvideo mit konsistenter Charakteridentität und natürlichen Schnittübergängen.

Entwickelt für Künstler, Editoren und Kreatoren, unterstützt der Arbeitsablauf Performance-Schnitte, textgesteuerte Visuals und narrative Einsätze. Sie können Ihren eigenen Track mitbringen oder zuerst einen erstellen und dann ein MiniMax Musikvideo zusammenstellen, das die visuelle Kontinuität bewahrt, während es sich mit der Struktur des Liedes entwickelt.

Hauptmodelle im Comfyui MiniMax Musikvideo-Arbeitsablauf#

  • MiniMax H3 Diffusionsmodell. Kern-Videogenerator, der Referenzen und Eingabeaufforderungs-Konditionierung verwendet, um Shot-Sequenzen zu synthetisieren, die an Audio ausgerichtet sind. Modellassets werden unter dem Comfy-Org-Namespace auf Hugging Face veröffentlicht, einschließlich des Video VAE und Text-Encoders. Comfy-Org/MiniMax-H3
  • MiniMax H3 Video VAE. Dekodiert latente Frames zu Bildern zur Vorschau und zum Export. minimax_h3_video_vae_fp16.safetensors
  • MiniMax H3 Audio VAE. Dekodiert das Hilfs-Audio-Latente des Modells bei Bedarf. minimax_h3_audio_vae_fp32.safetensors
  • MiniMax H3 Text-Encoder (Qwen3VL 32B Variante, verpackt für H3). Bietet multimodales Eingabeaufforderungsverständnis für Referenz-zu-Video-Generierung. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
  • MiniMax Music 3 Diffusionsmodell. Text-zu-Musik-Generator, der vollständige Lieder aus einer Bildunterschrift und einem Textplan erstellt; hier verwendet, wenn Sie den Track in ComfyUI erstellen möchten. Comfy-Org/MiniMax-Music-3
  • MiniMax Music 3 Text-Encoder. Kodiert Bildunterschrift und Texte in Konditionierung zur Musikgenerierung. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
  • MiniMax Music 3 DAV VAE. Dekodiert Audio-Latente in die endgültige Wellenform. minimax_music3_dav.safetensors

Verwendung des Comfyui MiniMax Musikvideo-Arbeitsablaufs#

Gesamtfluss. Der Graph hat zwei kooperierende Teile: 1) optionale Musikkreation, die einen Mastertrack generiert, und 2) Referenz-zu-Video-Synthese, die visuell kohärente Aufnahmen erstellt, die mit dem Lied synchronisiert sind. Sie können sie zusammen ausführen oder Ihre eigene Audio einfügen und die Musikkreation überspringen. Der letzte Schritt setzt Frames und Audio zu einem gerenderten MiniMax Musikvideo zusammen.

1) Musikkreation (optional)#

Diese Gruppe plant und synthetisiert einen Track mit MiniMax Music 3. Beginnen Sie mit M3SongPlanner (#6171), um eine strukturierte Bildunterschrift und Texte zu entwerfen; beide sind im On-Canvas-Text-Viewer vor der Kodierung bearbeitbar. MiniMaxMusic3TextEncode (#6157) verwandelt diesen Plan in Konditionierung und gibt die Zieldauer an. Ein latenter Audio-Container wird erstellt, der von KSampler (#6162) mit dem MiniMax Music 3 UNet (UNETLoader (#6156)) abgetastet wird, dann durch den DAV VAE dekodiert, entweder mit Standard- oder Kachel-Dekodierung, abhängig von VRAM. Das generierte Audio wird gespeichert und als Quelltrack des Arbeitsablaufs für Video gesetzt.

2) Benutzereingaben#

Liefern oder generieren Sie ein Master-Lied. Laden Sie einen externen Track mit VHS_LoadAudioUpload (#6170) hoch oder verwenden Sie das in Schritt 1 produzierte Lied. Fügen Sie ein oder mehrere Referenzbilder für Aussehen und Identität mit LoadImage (#6110) oder einem Pfad-Loader hinzu; die Bilder werden durch ImageResizeKJv2 (#6090, #6091) für stabile Konditionierung normalisiert. Setzen Sie Ihr kreatives Briefing in (input:prompt) Text Prompt (#138) — diese Eingabeaufforderung unterstützt Subjektdefinitionen, Shot-Notizen und Timing-Hinweise. Wählen Sie Aspekt und ungefähre Dauer über Resolution Selector (Size) (#115) und (input:duration) Duration (#132).

3) Patches#

PathchSageAttentionKJ (#142) aktiviert eine optimierte Aufmerksamkeitsimplementierung, die den Durchsatz und das Speicherverhalten auf einigen GPUs verbessern kann. Dieser Patch arbeitet auf dem geladenen MiniMax H3 Modell, bevor das Sampling beginnt. Lassen Sie es aktiviert, es sei denn, Sie stoßen auf gerätespezifische Probleme.

4) Modelle#

UNETLoader (#127) lädt das MiniMax H3 Rückgrat für Referenz-zu-Video, und eine optionale Turbo LoRA wird mit LoraLoaderModelOnly (#5959) für schnellere, kräftigere Ergebnisse angewendet. Video und Audio VAEs (VAELoader (#119), VAELoader (#120)) werden zur Dekodierung vorbereitet. Diese Assets definieren den Qualitätsrahmen und sollten über alle Aufnahmen konsistent bleiben, um ein einheitliches Aussehen zu bewahren.

5) Konditionierung#

MiniMaxH3ReferenceToVideo (#136) fusioniert Ihre Texteingabeaufforderung, Referenzbilder, Zielgröße und Länge in Konditionierung und ein anfängliches Latent. Es ist die Brücke zwischen dem kreativen Briefing und dem, was der Sampler rendern wird. Sie können zwei Referenzbilder in dieser Vorlage verwenden, um Garderobe, Identität und Palette zu leiten. Die Gruppe berechnet auch eine Shot-Länge aus der angeforderten Dauer, sodass Frames musikalisch ausgerichtet sind.

6) Sampling#

Der Sampling-Stack kombiniert BasicScheduler (#124), BasicGuider (#126) und SamplerCustomAdvanced (#125) mit RandomNoise (#129). MiniMaxH3SigmaShift (#5960) sitzt stromaufwärts, um Sigma-Bereiche für knackigere Videobewegungen und stabile Audioausrichtung zu beeinflussen. Zusammen iterieren sie das Latente in Richtung Bilder, die Ihren Referenzen und dem Beat folgen. Für Reproduzierbarkeit halten Sie Ihre Seeds fixiert, während Sie auf Eingabeaufforderung und Referenzen iterieren.

7) Dekodierung und Videoerstellung#

VAEDecode (#122) verwandelt die abgetasteten Latenten in Frames und Set_video_1 (#5651) bereitet sie für den Export vor. Die endgültige Montage verwendet VHS_VideoCombine (#5645), das Frames mit dem gewählten Quell-Audio zusammenfügt und Ihre Ziel-Bildrate aus dem gespeicherten src_fps-Wert anwendet. Das Ergebnis ist ein bereit zur Freigabe MiniMax Musikvideo-Clip, der mit dem Track synchron bleibt.

8) Referenz zu Video#

Diese Gruppe ist das kreative Herz der Pipeline für den Aufbau von Shot-Sequenzen gegen das Master-Lied. Es erhält das vorbereitete H3-Modell, Ihre Referenzen und die berechnete Shot-Länge, dann führt es einen Sampling-Durchgang pro Clip aus. Verwenden Sie es, um mehrere verbundene Schnitte um dasselbe Thema zu iterieren, sodass Identität, Garderobe und Palette konsistent bleiben. Wiederholen Sie pro Abschnitt des Liedes, um Intros, Verse, Refrains und Brücken mit passenden Visuals abzudecken.

Schlüsselknoten im Comfyui MiniMax Musikvideo-Arbeitsablauf#

MiniMaxH3ReferenceToVideo (#136)#

Erstellt die Konditionierung, die Eingabeaufforderung, Referenzen und Zielgeometrie mit einem Latent für das Sampling verbindet. Verwenden Sie es, um Identität und künstlerische Richtung mit einer kleinen Menge hochwertiger Bilder und klaren Shot-Notizen zu lenken. Wenn ein Shot stärkere Übereinstimmung mit einem Gesicht oder Outfit benötigt, halten Sie die Referenzen stilistisch ähnlich und vermeiden Sie extreme Zuschnitte. Passen Sie die Eingabeaufforderungsformulierung an, bevor Sie die Sampling-Einstellungen ändern, da dieser Knoten am stärksten beeinflusst, wer und was auf dem Bildschirm erscheint.

MiniMaxH3SigmaShift (#5960)#

Versetzt Sigma-Zeitpläne im MiniMax H3 Stack, um temporale Änderung und Audioausrichtung auszugleichen. Erhöhen Sie die Videoschicht, wenn Sie mehr Bewegung und visuelle Entwicklung innerhalb eines Shots wünschen; erhöhen Sie die Audioschicht, um engen Rhythmus und Lippengefühl zu bevorzugen. Verwenden Sie bescheidene Änderungen und testen Sie auf einem kurzen Clip, bevor Sie eine gesamte Szene festlegen.

SamplerCustomAdvanced (#125)#

Führt die Entrauschungsschleife mit dem ausgewählten Scheduler und Guider aus. Hier tauschen Sie Zeit gegen Qualität und Textur. Für schnelles Ideensammeln reduzieren Sie die Schritte und halten Sie die Seeds fixiert; für Endergebnisse geben Sie mehr Schritte und Feinjustierung, um Details zu verfeinern, ohne die Identität zu verlieren. Wenn Ergebnisse Ihr Briefing überschreiten, vereinfachen Sie zuerst die Eingabeaufforderung oder reduzieren Sie widersprüchliche Referenzen.

VHS_VideoCombine (#5645)#

Fügt dekodierte Frames mit dem gewählten Audio zu einer einzigen Videodatei zusammen. Halten Sie die Bildrate konstant über alle Clips, die zusammen bearbeitet werden sollen. Wenn sich die Visuals gegen den Beat verschieben, überprüfen Sie, ob die Shot-Länge und fps mit dem Quelltrack konsistent sind. Schneiden Sie in Ihrem NLE nur, nachdem die Renderings das Tempo und die Text-Hinweise innerhalb des Arbeitsablaufs übereinstimmen.

MiniMaxMusic3TextEncode (#6157)#

Kodiert die Bildunterschrift und Texte, die Struktur, Arrangement und Vokalcharakter für MiniMax Music 3 definieren. Schreiben Sie Bildunterschriften in Abschnitten, die globale Metadaten, Vokaldetails und Arrangement abdecken, damit das Modell die Absicht versteht. Verwenden Sie Textabschnittstags wie [Intro], [Verse] und [Chorus], um Übergänge zu markieren, denen der Generator folgen kann. Für Eingabeaufforderungshilfe siehe die offizielle Repository-Anleitung und Tools. MiniMax-AI/MiniMax-Music3

ComfyMathExpression (#131)#

Berechnet eine interne Frame-Anzahl aus Ihrer Zieldauer und schnappt sie auf ein Kadenz, das der H3 temporale Stack bei der ausgewählten fps bevorzugt. Dies vermeidet subtile Desynchronisation und Stottern. Wenn Sie fps oder Dauer ändern, lassen Sie diesen Knoten die Länge neu berechnen, sodass das Sampling auf den Beat fällt.

Optionale Extras#

  • Schreiben Sie Eingabeaufforderungen mit einer stabilen Struktur: Subjektdefinitionen, eine Ein-Satz-Zusammenfassung, dann 1–3 Shot-Absätze mit Zeitangaben. Halten Sie Zeitform und Stimme konsistent.
  • Verwenden Sie 1–2 saubere Referenzbilder pro Subjekt. Bevorzugen Sie neutrale Beleuchtung und einen mittleren Ausschnitt, der Haar- und Outfit-Details enthält, um die Identitätsbeibehaltung zu verbessern.
  • Ordnen Sie Szenen zuerst dem Lied zu. Rendern Sie kurze Clips pro Abschnitt (Intro, Vers, Refrain) und verketten Sie sie; dies hält das MiniMax Musikvideo kohärent, während lokale Variation ermöglicht wird.
  • Halten Sie Auflösung und Bildrate konsistent über alle Clips, die Sie zusammen bearbeiten möchten. Eine Änderung während des Projekts erschwert die Kontinuität.
  • Auf Maschinen mit niedrigem VRAM aktivieren Sie die gekachelte Audio-Dekodierung für lange Lieder; auf hohem VRAM ist die Standard-Dekodierung normalerweise etwas sauberer.
  • Für zuverlässige Neu-Renderings sperren Sie Seeds sowohl beim Video-Sampler als auch beim Musik-Sampler, bevor Sie Endergebnisse exportieren.

Anerkennungen#

Dieser Arbeitsablauf implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Innovate Futures @ Benji für MiniMax Music VideoWorkflow Source für ihre Beiträge und Pflege. Für autoritative Details, siehe bitte die Originaldokumentation und Repositories, die unten verlinkt sind.

Ressourcen#

Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen ihrer Autoren und Betreuer.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.