MiniMax Music 3 ComfyUI Text-zu-Musik-Workflow für strukturierte Songs#
MiniMax Music 3 ComfyUI verwandelt eine detaillierte Beschriftung und abschnittsmarkierte Liedtexte in einen vollständigen Song innerhalb von ComfyUI auf RunComfy. Das Diagramm ist voreingestellt, um standardmäßig einen 60-sekündigen Track zu erzeugen, und das zugrunde liegende Modell unterstützt Songs bis zu etwa fünf Minuten. Sie leiten Genre, Stimmung, Gesang, Instrumentierung, Tempo, Tonart und Struktur durch Text, wobei das Modell diese als kreative Richtungen behandelt und nicht als strikte Vorgaben.
Dieser MiniMax Music 3 ComfyUI-Workflow ist ideal für Produzenten, Sounddesigner und Kreative, die originale Gesangsspuren oder strukturierte Songkonzepte aus Text entwerfen möchten. Er konzentriert sich auf saubere Text-zu-Musik-Generierung und enthält keine Referenz-Audio-, Cover-, Fortsetzungs- oder Audio-Bearbeitungsmodi.
Schlüsselmodelle im MiniMax Music 3 ComfyUI-Workflow#
- MiniMax Music 3 Diffusion Transformer (DiT). Der Kern-Generator, der den Song im latenten Audioraum aus Textkonditionierung synthetisiert. Verwenden Sie die FP16-Gewichte für beste Qualität oder die INT8 ConvRot-Variante für wenig VRAM. FP16-Gewichte und INT8-Gewichte.
- MiniMax Music 3 Text Encoder. Wandelt Ihre Beschriftung und Liedtexte in eine Konditionierung um, die der Generator versteht, einschließlich Zeitsignalen, die von Ihrer Zieldauer abgeleitet werden. Text-Encoder.
- MiniMax Music 3 DAV (Decoding Audio VAE). Dekodiert latentes Audio zurück zu einer Vollband-Wellenform am Ende des Samplings. VAE.
- Projektressourcen und Beispiele für Eingabeaufforderungen werden von den Autoren hier gepflegt: MiniMax-Music3 auf GitHub.
Verwendung des MiniMax Music 3 ComfyUI-Workflows#
Auf hoher Ebene kodiert der Workflow Ihre Beschriftung und Liedtexte, erstellt eine latente Audio-Zeitleiste für die angeforderte Dauer, sampelt den Song, dekodiert ihn zu Wellenform und speichert dann das Ergebnis. Die Hauptsteuerungen befinden sich auf dem Text to Music (MiniMax Music 3) (#37) Knoten.
Beschriftungs- und Liedtextverfassung#
Schreiben Sie die Beschriftung in drei kurzen Abschnitten: Globale Metadaten, Gesangsdetails und Arrangement. Beschreiben Sie Genre, Stimmung, Tempo, Tonart, Instrumente, Mix-Charakter und Gesangsstil in einfacher Sprache. Verwenden Sie in den Liedtexten Abschnittstags wie [Intro], [Verse], [Chorus], [Bridge], [Outro], um die Struktur zu definieren; die Tags bestimmen die Form, während die Wörter hauptsächlich Stimmung und Phonetik informieren. Halten Sie die Beschriftung prägnant und konkret, um den Stil zu lenken, ohne die Kreativität zu sehr einzuschränken. Für instrumentale Tracks geben Sie in der Beschriftung an, dass kein Gesang gewünscht ist.
MiniMaxMusic3TextEncode (#13)#
Dieser Knoten nimmt die Beschriftung und markierten Liedtexte auf, produziert eine Konditionierung, die Stil, Arrangementabsicht und Gesangspräsenz erfasst. Er gibt auch einen Zeitwert aus, den das Diagramm zur Größenbestimmung der latenten Audio-Zeitleiste verwendet, sodass Ihre max_duration-Einstellung die Songlänge direkt beeinflusst. Setzen Sie einen Seed, wenn Sie reproduzierbare Takes möchten; halten Sie ihn fest, während Sie den Text verfeinern, um dasselbe Arrangement zu iterieren. Der Encoder ist mit einem MiniMax CLIP-Familien-Textmodell gepaart, das an anderer Stelle im Diagramm geladen ist, sodass ein Wechsel der Encoder selten notwendig ist.
EmptyMiniMaxMusic3LatentAudio (#15)#
Erstellt eine leere latente Audio-Leinwand, deren Länge dem Dauer-Signal des Encoders entspricht. Betrachten Sie es als die leere Mehrspur-Zeitleiste, die der Generator mit Schlagzeug, Bass, Harmonie, Melodie und Gesang gemäß Ihrem Text füllen wird. Längere Dauern erhöhen den VRAM-Bedarf und die Renderzeit. Verwenden Sie dies, um zwischen kurzen Ideen und vollständigen Songs zu wechseln, ohne einen anderen Teil der Pipeline zu ändern.
UNETLoader (#6) und KSampler (#9)#
UNETLoader wählt die MiniMax Music 3 DiT-Gewichte aus. KSampler wendet den Diffusionsprozess mit der positiven Konditionierung aus Ihrem Text und einer leeren negativen Konditionierung, die von ConditioningZeroOut (#10) bereitgestellt wird, an. Schritte und Sampler-Wahl beeinflussen Detail und Rhythmusgefühl, während die Führungsskala das Gleichgewicht zwischen Texttreue und kreativer Freiheit steuert. Halten Sie den Seed konstant, um Beschriftungen fair zu vergleichen, und ändern Sie ihn, um neue melodische und strukturelle Alternativen zu erkunden.
Dekodierung und VRAM-Steuerung: VAEDecodeAudio (#12), VAEDecodeAudioTiled (#42), ComfySwitchNode (#43)#
Nach dem Sampling wird das latente Audio von der DAV zu einer Wellenform dekodiert. Für lange Songs oder Low-VRAM-Szenarien aktivieren Sie den tiled_decode-Schalter am Hauptknoten, um über VAEDecodeAudioTiled zu leiten, das überlappende Kacheln verarbeitet, um den Speicherbedarf zu reduzieren. Das gekachelte Dekodieren ist etwas langsamer und kann in Randfällen subtile Randartefakte einführen, daher bevorzugen Sie Standard-Dekodierung, wenn Ressourcen dies zulassen. Der ComfySwitchNode wählt automatisch den geeigneten Pfad basierend auf Ihrem Schalter.
Ausgabe: SaveAudioAdvanced (#35)#
Das endgültige Audio wird auf der Festplatte im gewählten Format wie MP3 oder WAV gespeichert. Verwenden Sie diesen Knoten, um Dateinamenskonventionen und Qualitätseinstellungen festzulegen, die für Entwürfe oder das Teilen geeignet sind. Für die Produktionsnutzung sollten Sie in Betracht ziehen, eine verlustfreie Datei für das nachfolgende Mischen und Mastern zu exportieren.
Schlüssel-Knoten im MiniMax Music 3 ComfyUI-Workflow#
MiniMaxMusic3TextEncode (#13)#
Zentral für Stil und Struktur. Passen Sie max_duration an, um die Ziellänge festzulegen, und seed für die Reproduzierbarkeit. Wenn die Ergebnisse vom Prompt abweichen, verfeinern Sie zuerst die Globalen Metadaten der Beschriftung, dann optimieren Sie Gesangsdetails und Arrangement, um Instrumentierung und Mix-Charakter neu auszubalancieren.
KSampler (#9)#
Steuert Detail, Timing-Gefühl und wie stark der Song dem Text folgt. Erhöhen Sie die Schritte für reichere Texturen auf Kosten der Geschwindigkeit, probieren Sie alternative Sampler für unterschiedliche Groove und Transienten, und passen Sie die Führungsskala an, um Präzision gegen Kreativität zu tauschen. Halten Sie den gleichen Seed beim A/B-Testen von Beschriftungen, um Änderungen der Eingabeaufforderung zu isolieren.
VAEDecodeAudioTiled (#42)#
Verwenden Sie es bei der Erzeugung längerer Tracks oder bei begrenzten GPUs. Es senkt den Spitzenverbrauch an Speicher, indem es die Wellenform in überlappenden Kacheln dekodiert. Aktivieren Sie es nur bei Bedarf, um kleine Naht-Risiken und zusätzliche Renderzeit zu vermeiden.
UNETLoader (#6)#
Wechseln Sie zwischen FP16- und INT8-DiT-Gewichten je nach VRAM. FP16 wird für höchste Wiedergabetreue empfohlen, während die INT8 ConvRot-Variante hilft, längere Songs auf kleineren Karten unterzubringen.
SaveAudioAdvanced (#35)#
Steuert Exportformat und -qualität. Wählen Sie MP3 für schnelles Teilen oder WAV für verlustfreie Stems und Nachbearbeitung. Setzen Sie klare Dateinamenpräfixe, um mehrere Takes organisiert zu halten.
Optionale Extras#
- Verwenden Sie prägnante, konkrete Beschriftungen. Ein starker Globaler Metadatenabsatz mit Genre, BPM-Gefühl, Tonart, Mix-Adjektiven und Produktionsära ist oft wichtiger als lange Prosa.
- Abschnittstags in Liedtexten steuern die Struktur. Halten Sie die Tags einfach, vermeiden Sie Verschachtelungen und lassen Sie instrumentale Abschnitte atmen, indem Sie Wörter zwischen den Tags weglassen.
- Um den Gesang in den Vordergrund zu rücken, betonen Sie die Gesangstimbre und -platzierung in der Beschriftung. Für instrumentale Ausgaben geben Sie ausdrücklich an, dass kein Gesang gewünscht ist.
- Für mehr Variation ändern Sie den Seed. Für gezielte Verfeinerung halten Sie den Seed fest und iterieren Sie über den Text.
- Das Modell behandelt Tempo, Tonart und Instrumentierung als Leitfaden. Erwarten Sie kreative Abweichungen und iterieren Sie zum Ziel hin.
- Dieser MiniMax Music 3 ComfyUI-Workflow enthält keine Referenz-Audio-, Cover-, Fortsetzungs- oder Audio-Bearbeitungsmodi. Für fortgeschrittene Eingabeaufforderungstechniken und Beispiele siehe die offiziellen Projektressourcen: MiniMax-Music3 auf GitHub und die Modelfiles auf Hugging Face.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken ComfyUI für das MiniMax Music 3: Text to Music Workflow-Template, MiniMax-AI für das offizielle MiniMax Music 3-Projekt und Comfy-Org für die MiniMax Music 3 Modellgewichte für ihre Beiträge und Pflege. Für autoritative Details verweisen wir auf die Originaldokumentation und Repositories, die unten verlinkt sind.
Ressourcen#
- Comfy.org/Source Workflow-Template
- Docs / Release Notes: MiniMax Music 3: Text to Music — ComfyUI Workflow
- MiniMax-AI/MiniMax Music 3 offizielles Projekt
- GitHub: MiniMax-AI/MiniMax-Music3
- Hugging Face: MiniMaxAI/MiniMax-Music3
- Comfy-Org/MiniMax Music 3 Modellgewichte
- Hugging Face: Comfy-Org/MiniMax-Music-3
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.


