ComfyUI>ワークフロー>MiniMax Music 3 ComfyUI | 完全なテキストからソングへのAI

MiniMax Music 3 ComfyUI | 完全なテキストからソングへのAI

Workflow Name: RunComfy/MiniMax-Music-3
Workflow ID: 0000...1498
MiniMax Music 3 テキストから音楽へのグラフを使用して、アイデアをフルソングに変換します。ジャンル、ムード、ボーカル、テンポ、キー、楽器をガイドします。セクションを形作るためにタグ付きの歌詞を追加します。プリセットは60秒をレンダリングします。RunComfyでオリジナルのボーカルトラックを迅速に作成できます。

MiniMax Music 3 ComfyUI Workflow

MiniMax Music 3 ComfyUI | Captions and Lyrics to Full Songs
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax Music 3 ComfyUI Examples

MiniMax Music 3 ComfyUI テキストから音楽へのワークフローで構造化されたソング#

MiniMax Music 3 ComfyUI は、詳細なキャプションとセクションタグ付きの歌詞を ComfyUI 上で完全なソングに変換します。グラフはデフォルトで60秒のトラックを生成するようにプリセットされており、基礎となるモデルは約5分までのソングをサポートします。ジャンル、ムード、ボーカル、楽器、テンポ、キー、構造をテキストでガイドし、モデルはそれを創造的な方向性として扱い、厳密な保証ではありません。

このMiniMax Music 3 ComfyUIワークフローは、オリジナルのボーカルトラックや構造化されたソングコンセプトをテキストから草案したいプロデューサー、サウンドデザイナー、クリエイターに最適です。クリーンなテキストから音楽への生成に焦点を当てており、参照オーディオ、カバー、継続、オーディオ編集モードは含まれていません。

MiniMax Music 3 ComfyUI ワークフローの主要モデル#

  • MiniMax Music 3 Diffusion Transformer (DiT)。テキスト条件から潜在オーディオ空間でソングを合成するコアジェネレーター。最高品質を求めるならFP16ウェイトを使用し、低VRAMの場合はINT8 ConvRotバリアントを使用します。 FP16 weightsINT8 weights
  • MiniMax Music 3 Text Encoder。キャプションと歌詞をジェネレーターが理解する条件に変換し、ターゲットの長さから導かれるタイミング信号を含みます。 Text encoder
  • MiniMax Music 3 DAV (Decoding Audio VAE)。サンプリングの最後に潜在オーディオをフルバンドの波形にデコードします。 VAE
  • プロジェクトリソースとプロンプトの例は、著者によってここで管理されています: MiniMax‑Music3 on GitHub

MiniMax Music 3 ComfyUI ワークフローの使用方法#

大まかに言えば、ワークフローはキャプションと歌詞をエンコードし、要求された長さの潜在オーディオタイムラインを作成し、ソングをサンプリングし、波形にデコードし、結果を保存します。主なコントロールは Text to Music (MiniMax Music 3) (#37) ノードにあります。

キャプションと歌詞の作成#

キャプションを3つの短いセクションに分けて書きます: グローバルメタデータ、ボーカルの詳細、アレンジメント。ジャンル、ムード、テンポ、キー、楽器、ミックスのキャラクター、ボーカルスタイルを平易な言葉で説明します。歌詞には [Intro], [Verse], [Chorus], [Bridge], [Outro] のようなセクションタグを使用して構造を定義します; タグが形式を駆動し、単語は主に雰囲気と音韻を知らせます。キャプションを簡潔で具体的に保ち、スタイルを誘導しつつ創造性を過度に制約しないようにします。インストゥルメンタルトラックの場合、キャプションでボーカルが不要であることを明記します。

MiniMaxMusic3TextEncode (#13)#

このノードはキャプションとタグ付き歌詞を取り込み、スタイル、アレンジメントの意図、ボーカルの存在感を捉える条件を生成します。また、グラフが潜在オーディオタイムラインのサイズを決定するために使用する時間値も出力しますので、max_duration 設定がソングの長さを直接形作ります。再現可能なテイクが欲しい場合はシードを設定し、テキストを洗練して同じアレンジメントで反復する間は固定します。エンコーダーはグラフ内の別の場所でロードされたMiniMax CLIPファミリーテキストモデルとペアリングされているため、エンコーダーを切り替える必要はほとんどありません。

EmptyMiniMaxMusic3LatentAudio (#15)#

エンコーダーの持続時間信号に一致する長さの空の潜在オーディオキャンバスを作成します。それをジェネレーターがテキストに従ってドラム、ベース、ハーモニー、メロディ、ボーカルで満たす空のマルチトラックタイムラインとして考えてください。長い持続時間はVRAMの必要性とレンダリング時間を増加させます。他のパイプライン部分を変更せずに短いアイデアとフルレングスのソングの間を移動するためにこれを使用します。

UNETLoader (#6) と KSampler (#9)#

UNETLoader はMiniMax Music 3 DiTウェイトを選択します。KSampler はポジティブコンディショニングを使用して拡散プロセスを適用し、ConditioningZeroOut (#10) によって提供されるブランクのネガティブコンディショニングを使用します。ステップとサンプラーの選択はディテールとリズムの感触に影響を与え、ガイダンススケールはテキストへの忠実度と生成的自由のバランスを取ります。キャプションを公正に比較するためにシードを一定に保ち、新しいメロディックおよび構造的代替を探索するために変更します。

デコードとVRAM制御: VAEDecodeAudio (#12)、VAEDecodeAudioTiled (#42)、ComfySwitchNode (#43)#

サンプリング後、DAVによって潜在オーディオが波形にデコードされます。長いソングや低VRAMシナリオの場合、メインノードの tiled_decode スイッチを有効にして VAEDecodeAudioTiled 経由でルートし、メモリ使用量を削減するためにオーバーラップするタイルを処理します。タイルデコードはわずかに遅く、エッジケースで微細な境界アーティファクトを引き起こす可能性がありますので、リソースが許す場合は標準デコードを優先します。ComfySwitchNode はトグルに基づいて適切なパスを自動的に選択します。

出力: SaveAudioAdvanced (#35)#

最終オーディオは選択した形式(MP3またはWAVなど)でディスクに保存されます。このノードを使用して、ドラフトや共有に適したファイル名の規約と品質設定を設定します。プロダクションで使用する場合は、ダウンストリームミキシングおよびマスタリングのためにロスレスファイルをエクスポートすることを検討してください。

MiniMax Music 3 ComfyUI ワークフローの主要ノード#

MiniMaxMusic3TextEncode (#13)#

スタイルと構造の中心。max_duration を調整してターゲットの長さを設定し、seed を設定して再現性を確保します。結果がプロンプトから外れていると感じた場合は、まずキャプションのグローバルメタデータを洗練し、次にボーカルの詳細とアレンジメントを調整して楽器のバランスとミックスのキャラクターを調整します。

KSampler (#9)#

ディテール、タイミングの感触、そしてソングがテキストにどれだけ強く従うかを管理します。ステップを増やしてリッチなテクスチャーを得る代わりに速度を犠牲にし、異なるグルーブとトランジェントのために代替サンプラーを試し、ガイダンススケールを調整して創造性のために精度をトレードします。キャプションをA/Bテストする際は同じシードを使用してプロンプトの変更を特定します。

VAEDecodeAudioTiled (#42)#

長いトラックを生成する場合や限られたGPUで作業する場合に使用します。波形をオーバーラップするタイルでデコードすることでピークメモリを削減します。小さなシームリスクと追加のレンダリング時間を避けるために必要に応じてのみ有効にします。

UNETLoader (#6)#

VRAMに応じてFP16とINT8 DiTウェイトを切り替えます。FP16は最高の忠実度を推奨し、INT8 ConvRotバリアントは小さいカードで長いソングをフィットさせるのに役立ちます。

SaveAudioAdvanced (#35)#

エクスポート形式と品質を制御します。迅速な共有のためにMP3を選択するか、ロスレスステムと後処理のためにWAVを選択します。複数のテイクを整理するために明確なファイル名プレフィックスを設定します。

オプションの追加#

  • 簡潔で具体的なキャプションを使用します。ジャンル、BPMの感触、キー、ミックス形容詞、制作時代を含む強力なグローバルメタデータ段落は、長い散文よりも重要なことが多いです。
  • 歌詞のセクションタグは構造を駆動します。タグをシンプルに保ち、ネストを避け、タグ間に言葉を省略してインストゥルメンタルセクションを息づかせます。
  • ボーカルを前面に押し出すために、キャプションでボーカルの音色と配置を強調します。インストゥルメンタル出力の場合は、ボーカルが不要であることを明示します。
  • より多様性を求める場合はシードを変更します。焦点を絞った洗練のためには、シードを固定しテキストを反復します。
  • モデルはテンポ、キー、楽器をガイダンスとして扱います。創造的な逸脱を期待し、ターゲットに向かって反復します。
  • このMiniMax Music 3 ComfyUIワークフローには参照オーディオ、カバー、継続、オーディオ編集モードは含まれていません。高度なプロンプト技術と例については、公式プロジェクトリソースを参照してください: MiniMax‑Music3 on GitHub およびモデルファイル Hugging Face

謝辞#

このワークフローは以下の作品とリソースを実装および基にしています。MiniMax Music 3: Text to Music ワークフローテンプレートのための ComfyUI、MiniMax Music 3 公式プロジェクトのための MiniMax-AI、MiniMax Music 3 モデルウェイトのための Comfy-Org に感謝します。公式の詳細については、以下にリンクされた元のドキュメントとリポジトリを参照してください。

リソース#

注: 参照されたモデル、データセット、コードの使用は、それぞれの著者および管理者によって提供されるライセンスと条件に従います。

RunComfy
著作権 2026 RunComfy. All Rights Reserved.

RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。