ComfyUI>ワークフロー>MiniMax ミュージックビデオ | MiniMax H3 と Music 3 でのフルミュージックビデオパイプライン

MiniMax ミュージックビデオ | MiniMax H3 と Music 3 でのフルミュージックビデオパイプライン

Workflow Name: RunComfy/MiniMax-music-video
Workflow ID: 0000...1502
あなたのフルソングを接続されたAIビジュアルシーケンスに変換します。MiniMax H3 と MiniMax Music 3 を使用して、シーンをリズム、ボーカル、ムードに合わせます。プロンプト、画像、オーディオ、またはビデオ参照でショットをガイドします。キャラクターとスタイルを一貫して保ちます。パフォーマンスまたはナラティブクリップを迅速に構築します。統一された映画的な結果をエクスポートします。

ComfyUI MiniMax music video Workflow

MiniMax Music Video in ComfyUI | Build full pipeline with MiniMax H3 and Music 3
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax music video Examples

MiniMax ミュージックビデオ: ComfyUI での曲からシーンへの生成#

このワークフローは、MiniMax H3 を使用して、リズムを意識したビデオショットのシーケンスにフルソングを変換します。オプションの音楽作成は MiniMax Music 3 によって強化されます。テキストプロンプト、参照画像、マスターオーディオトラックを組み合わせて、ボーカル、ビート、ムードを追跡する映画的なクリップを作成します。結果は、キャラクターの一貫性と自然なショットの移行を備えた統一された MiniMax ミュージックビデオです。

アーティスト、編集者、クリエイター向けに構築されたこのワークフローは、パフォーマンスカット、歌詞駆動のビジュアル、ナラティブインサートをサポートします。独自のトラックを持ち込むか、最初に生成してから、曲の構造とともに進化しながらビジュアルの連続性を保つ MiniMax ミュージックビデオを組み立てることができます。

Comfyui MiniMax ミュージックビデオ ワークフローの主要モデル#

  • MiniMax H3 拡散モデル。オーディオに合わせたショットシーケンスを合成するために参照とプロンプト条件付けを使用するコアビデオジェネレーター。モデルアセットは、Hugging Face の Comfy-Org 名前空間の下で公開されており、ビデオ VAE とテキストエンコーダーを含みます。Comfy-Org/MiniMax-H3
  • MiniMax H3 Video VAE。プレビューとエクスポートのために潜在フレームを画像にデコードします。minimax_h3_video_vae_fp16.safetensors
  • MiniMax H3 Audio VAE。必要に応じてモデルの補助オーディオ潜在をデコードします。minimax_h3_audio_vae_fp32.safetensors
  • MiniMax H3 テキストエンコーダー (Qwen3VL 32B バリアント H3 用にパッケージ化)。参照からビデオ生成へのマルチモーダルプロンプト理解を提供します。qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
  • MiniMax Music 3 拡散モデル。キャプションと歌詞プランから完全な曲を作成するテキストから音楽へのジェネレーター。ここでは ComfyUI 内でトラックを作成したい場合に使用されます。Comfy-Org/MiniMax-Music-3
  • MiniMax Music 3 テキストエンコーダー。音楽生成のための条件付けにキャプションと歌詞をエンコードします。minimax_music3_text_encoder_pruned_int8_convrot.safetensors
  • MiniMax Music 3 DAV VAE。オーディオ潜在を最終波形にデコードします。minimax_music3_dav.safetensors

Comfyui MiniMax ミュージックビデオ ワークフローの使用方法#

全体の流れ。このグラフには、協力する2つの部分があります: 1) マスタートラックを生成するオプションの音楽作成と、2) 曲に同期したビジュアル的に一貫性のあるショットを構築する参照からビデオ合成。これらを一緒に実行するか、自分のオーディオをプラグインして音楽作成をスキップすることができます。最終ステップでは、フレームとオーディオをレンダリングされた MiniMax ミュージックビデオに組み立てます。

1) 音楽作成 (オプション)#

このグループは、MiniMax Music 3 を使用してトラックを計画および合成します。M3SongPlanner (#6171) で構造化されたキャプションと歌詞をドラフトし、エンコード前にオンキャンバステキストビューアーで編集可能です。MiniMaxMusic3TextEncode (#6157) は、そのプランを条件付けに変換し、ターゲットの長さを提供します。潜在オーディオコンテナが作成され、MiniMax Music 3 UNet (UNETLoader (#6156)) を使用してサンプルされ、VRAM に応じて標準またはタイルドデコードを使用して DAV VAE を通じてデコードされます。生成されたオーディオは保存され、ビデオのワークフローのソーストラックとして設定されます。

2) ユーザー入力#

マスターソングを提供または生成します。VHS_LoadAudioUpload (#6170) を使用して外部トラックをアップロードするか、ステップ1で生成された曲を使用します。LoadImage (#6110) またはパスローダーを使用して外観とアイデンティティのための参照画像を1つ以上追加します。画像は ImageResizeKJv2 (#6090, #6091) によって安定した条件付けのために正規化されます。(input:prompt) Text Prompt (#138) でクリエイティブブリーフを設定します。このプロンプトは、主題の定義、ショットのメモ、タイミングのヒントをサポートします。Resolution Selector (Size) (#115) と (input:duration) Duration (#132) を使用してアスペクトとおおよその長さを選択します。

3) パッチ#

PathchSageAttentionKJ (#142) は、いくつかのGPUでスループットとメモリ動作を改善できる最適化されたアテンション実装を有効にします。このパッチは、サンプリング前にロードされた MiniMax H3 モデルで動作します。デバイス固有の問題が発生しない限り、有効にしておいてください。

4) モデル#

UNETLoader (#127) は、参照からビデオへの MiniMax H3 バックボーンをロードし、オプションの Turbo LoRA は LoraLoaderModelOnly (#5959) を使用して適用され、より迅速でパンチのある結果を提供します。ビデオとオーディオの VAE (VAELoader (#119), VAELoader (#120)) はデコードのために準備されます。これらのアセットは品質の範囲を定義し、ショット全体で一貫性を保つ必要があります。

5) 条件付け#

MiniMaxH3ReferenceToVideo (#136) は、あなたのテキストプロンプト、参照画像、ターゲットサイズ、長さを条件付けと初期潜在に融合します。クリエイティブブリーフとサンプラーがレンダリングするものの間の架け橋です。このテンプレートで2つの参照画像を供給して、衣装、アイデンティティ、パレットをガイドします。グループは、要求された期間からショットの長さを計算し、フレームが音楽的に整列するようにします。

6) サンプリング#

サンプリングスタックは、BasicScheduler (#124), BasicGuider (#126), SamplerCustomAdvanced (#125) と RandomNoise (#129) を組み合わせます。MiniMaxH3SigmaShift (#5960) は、ビデオモーションをより鮮明にし、オーディオの整合性を安定させるためにシグマ範囲をバイアスします。これらは、あなたの参照とビートに従う画像に潜在を向けて反復します。再現性を確保するために、プロンプトと参照を繰り返す際にはシードを固定してください。

7) デコードとビデオの作成#

VAEDecode (#122) は、サンプルされた潜在をフレームに変換し、Set_video_1 (#5651) はエクスポートのために準備します。最終アセンブリは、VHS_VideoCombine (#5645) を使用して、選択したソースオーディオにフレームをステッチし、保存された src_fps 値から目標フレームレートを適用します。出力は、トラックと同期したシェア可能な MiniMax ミュージックビデオクリップです。

8) 参照からビデオ#

このグループは、マスターソングに対してショットシーケンスを構築するためのパイプラインのクリエイティブな中心です。準備された H3 モデル、参照、計算されたショットの長さを受け取り、クリップごとに1回のサンプリングを実行します。同一の主題の周りに複数の接続されたカットを繰り返して、アイデンティティ、衣装、パレットを一貫して保ちます。イントロ、バース、コーラス、ブリッジを一致するビジュアルでカバーするために、曲の各セクションごとに繰り返します。

Comfyui MiniMax ミュージックビデオ ワークフローの主要ノード#

MiniMaxH3ReferenceToVideo (#136)#

プロンプト、参照、およびターゲットジオメトリをサンプリングのための潜在に結びつける条件付けを作成します。少数の高品質画像と明確なショットメモでアイデンティティとアートディレクションを導きます。ショットが顔や衣装に強い順応を必要とする場合は、参照をスタイリッシュに類似させ、極端なクロップを避けてください。サンプリング設定を変更する前にプロンプトの表現を調整してください。このノードは、画面に表示される人物と物を最も強く影響します。

MiniMaxH3SigmaShift (#5960)#

MiniMax H3 スタックのシグマスケジュールをオフセットして、時間的変化とオーディオの整合性をバランスします。ショット内のモーションとビジュアルの進化を増やしたい場合はビデオシフトを増やし、リズムとリップのフィーリングを厳密にしたい場合はオーディオシフトを増やします。控えめな変更を使用し、シーン全体にコミットする前に短いクリップでテストしてください。

SamplerCustomAdvanced (#125)#

選択したスケジューラーとガイダーでデノイジングループを実行します。ここで、時間を質とテクスチャに交換します。急速なアイデアの創出にはステップを減らし、シードを固定しておきます。ファイナルにはステップを増やし、アイデンティティを失うことなくディテールを洗練するためにガイダンスを少し調整します。結果がブリーフを超えた場合、まずプロンプトを簡素化するか、競合する参照を減らしてください。

VHS_VideoCombine (#5645)#

デコードされたフレームを選択したオーディオと一緒に1つのビデオファイルに組み立てます。すべてのクリップを一緒に編集するためにフレームレートを一定に保ちます。ビジュアルがビートに対して漂う場合は、ショットの長さと fps がソーストラックと一致していることを確認してください。ワークフロー内でレンダリングがテンポと歌詞のキューに一致した後にのみ、NLEでトリムします。

MiniMaxMusic3TextEncode (#6157)#

MiniMax Music 3 の構造、アレンジメント、ボーカルキャラクターを定義するキャプションと歌詞をエンコードします。モデルが意図を理解できるように、グローバルメタデータ、ボーカルの詳細、アレンジメントをカバーするセクションでキャプションを書きます。生成器がフォローできるように [Intro], [Verse], [Chorus] のような歌詞セクションタグを使用して遷移をマークします。プロンプトヘルプについては、公式リポジトリのガイダンスとツールを参照してください。MiniMax-AI/MiniMax-Music3

ComfyMathExpression (#131)#

ターゲット期間から内部フレーム数を計算し、選択した fps で H3 時間スタックが好むケイデンスにスナップします。微妙な同期ズレとスタッターを回避します。fps または期間を変更する場合は、このノードに長さを再計算させて、サンプリングがビートに着地するようにします。

オプションの追加#

  • 安定した構造でプロンプトを書く: 主題の定義、1文の要約、次に時間のキューを含む1〜3のショット段落。時制と声を一貫して保ちます。
  • 主題ごとに1〜2のクリーンな参照画像を使用します。アイデンティティの保持を改善するために、中立的な照明と髪や衣装の詳細が含まれる中程度のクロップを優先します。
  • まず曲にシーンをマップします。セクションごとに短いクリップをレンダリングし、それらを連結します; これにより、MiniMax ミュージックビデオが一貫性を保ちながら局所的な変化を許可します。
  • 編集する予定のすべてのクリップで解像度とフレームレートを一貫して保ちます。プロジェクトの途中でどちらかを変更すると、連続性が難しくなります。
  • 低 VRAM マシンでは、長い曲のためにタイルドオーディオデコードを有効にします; 高 VRAM では、標準のデコードが通常少しクリーンです。
  • 信頼できる再レンダリングのために、ファイナルをエjson

クスポートする前にビデオサンプラーと音楽サンプラーの両方でシードをロックしてください。

謝辞#

このワークフローは、以下の作品とリソースを実装し、拡張しています。MiniMax Music VideoWorkflow Source の貢献とメンテナンスに感謝します。権威ある詳細については、以下にリンクされている元のドキュメントとリポジトリを参照してください。

リソース#

注: 参照されたモデル、データセット、およびコードの使用は、それぞれの著者およびメンテナによって提供されるライセンスおよび条件に従います。

RunComfy
著作権 2026 RunComfy. All Rights Reserved.

RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。