VDN H3 MiniMax ComfyUI Text To Video#
VDN H3 ComfyUI Text To Videoは、自然言語プロンプトを短いシネマティックなビデオに変換し、同期されたオーディオを追加します。それは、MiniMax H3ファミリーとVideo DeltaNetのハイブリッドアテンション、8ステップサンプリングを組み合わせて、単一のプロンプトからビデオとオーディオを生成します。ストーリーボード、製品クリップ、シネマティックファンタジー、ラリードライビング、装甲剣戯などのスタイライズされたシーンに適しています。
グラフには、独立して選択可能な2つのブランチが含まれています。VDN-H3ブランチはVideo DeltaNetパッチを適用し、付属の例を生成するために使用されました。FastVideoブランチは、VDNパスと出力および生成時間を比較するために提供されています。どちらのブランチも、選択したフレームレートでオーディオ付きのMP4をレンダリングします。
オープンコンポーネントに基づいて構築されています:MiniMax H3のためのVDN GitHub および Hugging Face、Saganaki22によるVDN-H3 ComfyUIノード GitHub、およびMiniMax H3の基本ウェイトとVAE Hugging Face。
Comfyui VDN H3 ComfyUI Text To Videoワークフローの主要モデル#
- MiniMax-H3拡散モデル (UNet)。ノイズをコヒーレントな時空間ビデオおよびオーディオ潜在に変換するデノイジングプロセスを駆動します。ウェイトは Hugging Face のMiniMax H3バンドルで提供されています。
- Qwen3-VL 32B MiniMax-H3テキストエンコーダー。プロンプトをH3ファミリーにチューニングされたビデオおよびオーディオ生成のためのコンディションに変換します。 Hugging Face のMiniMax H3リリースに含まれています。
- MiniMax-H3 Video VAE。ビデオ潜在をRGBフレームにデコードします。 Hugging Face のVAEセクションで利用可能です。
- MiniMax-H3 Audio VAE。オーディオ潜在から波形オーディオを再構築します。 Hugging Face でも提供されています。
- VDN-H3パッチウェイト。Video DeltaNetはMiniMax H3にハイブリッドアテンションを適用します。 Hugging Face からチェックポイントを取得します。
- FastVideo UNetバリアント。比較ブランチは、
minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensorsを使用します Kijai/MiniMax-H3-experimental。
Comfyui VDN H3 MiniMax ComfyUI Text To Videoワークフローの使用方法#
プロンプト、解像度、持続時間、フレームレートを設定することから始めます。VDN-H3ブランチまたはFastVideoブランチを個別に選択して実行します。Queue Allは、両方の有効なブランチを実行し、2つのMP4を生成することがあります。別々のグラフブランチは、同時のGPU実行を保証しません。どちらのブランチも8サンプリングステップに設定されています。
ユーザー入力#
(input:prompt) Text Promptパネルを使用して、視覚と音声の両方を簡単な言葉で説明します。オーディオの場合は、Audio:で始まる最後の行を追加して、特定のフォーリーまたはアンビエンスを要求します。例えば、「Audio: rhythmic hoofbeats, wind, distant roar」。視覚サイズは、(input:Resolution) Megapixelsを使用して制御し、コンピューティングに適した幅と高さを生成します。(input:Duration) Secondsと(input:FPS)を設定して、クリップの長さと滑らかさを定義します。ワークフローは、持続時間とFPSを有効なフレーム数に変換し、H3の内部と適合するシーケンス長に静かにスナップします。
モデル#
CLIPLoaderは、MiniMaxにチューニングされたテキストエンコーダーを提供し、コンディショニングに使用されます。2つのVAELoaderノードは、MiniMax-H3 Video VAEとAudio VAEを取り込み、デコードされたフレームとサウンドがモデルの潜在空間と一致するようにします。これらのローダーは、どちらのブランチでも共有され、A/B結果の一貫性を確保します。
コンディショニング#
MiniMaxH3ImageToVideo (#219) は、プロンプトとサイズ、長さを初期のビデオおよびオーディオ潜在と正のコンディショニングに変換します。必要な場合は、特定のエントランスまたはエグジットポーズを必要とする場合に最初または最後のフレームをロックするためのオプションの画像入力を使用できます。この段階は、カメラの動き、被写体のアクション、照明、Audio:行がサンプラーの下流でのガイダンスとなるため、物語の決定が最も重要です。
VDN-H3パッチ#
VDNブランチは、ApplyVDNH3Advanced (#6126)を使用してVideo DeltaNetアップグレードを適用します。選択されたハイブリッドアテンションパッチを適用します。MiniMaxChunkFeedForwardとModelPatchTorchSettingsは、メモリと実行設定を構成します。MiniMaxH3SigmaShiftは、サンプリングが始まる前にビデオとオーディオのノイズスケジュールを調整します。
サンプリング (VDN-H3)#
VDNサンプリングは、RandomNoise (#6141)から始まり、BasicGuider (#6134)でガイダンスをマージし、KSamplerSelect (#6137)でソルバーを選択し、BasicScheduler (#6136)でコンパクトなディフュージョンステップ数をスケジュールします。SamplerCustomAdvanced (#6135)は、フルシーケンスにわたってデノイジングを行い、洗練されたビデオおよびオーディオ潜在を生成します。シードを固定して再現性を保つか、同じプロンプトで新しいバリエーションを探索するために変更します。
デコードとビデオ作成 (VDN-H3)#
VAEDecode (#6146)はフレームを再構築し、VAEDecodeAudio (#6145)はサウンドトラックを再構築します。VHS_VideoCombine (#6170)は、設定したフレームレートを尊重し、プレビュー可能なファイルを保存しながら、フレームとオーディオをMP4にマックスします。VDN出力は、FastVideo結果と比較しやすいように明確なファイル名プレフィックスで保存されます。
FastVideo比較ブランチ#
FastVideoパスは、速度に最適化されたMiniMax H3 UNetをロードし、サンプリング前に軽量なアテンションパッチを適用します。プロンプト、サイズ、フレーム数を再利用して、タイミングとルックを直接比較できます。サンプリングはVDNブランチの構造を反映し、8ステップに設定されています。フレームとオーディオはデコードされ、VHS_VideoCombine (#6104)で結合され、2番目のMP4を生成します。これらのサイドバイサイド出力を使用して、シーンに最適なブランチを決定します。
Comfyui VDN H3 ComfyUI Text To Videoワークフローの主要ノード#
ApplyVDNH3Advanced(#6126)。VDN-H3リリースから選択されたチェックポイントを使用してMiniMax H3にVideo DeltaNetを有効にします。VDNチェックポイントを変更するか、アテンションバックエンドを切り替えたいときにのみ調整してください。一般的な使用にはハイブリッドアテンションのデフォルトを維持してください。参考実装: Saganaki22/ComfyUI-VDN-H3。MiniMaxH3ImageToVideo(#219)。ストーリーとタイミングの中心制御ポイントで、テキストプロンプト、計算された幅と高さ、導出されたフレーム数を受け入れます。オーディオの場合、プロンプトに単一のAudio:行を追加して、フォーリーとアンビエンスを誘導し、明示的に要求されない限りスピーチを避けます。MiniMaxH3SigmaShift(#6131, #6007)。ビデオおよびオーディオストリームのシグマスケジュールを再バランスし、低ステップ数でのジッターを軽減し、詳細を維持します。モデルバリアントを変更する場合や動きの不安定性に気付いた場合にのみ、小さな調整を検討してください。VHS_VideoCombine(#6170, #6104)。デコードされたフレームとオーディオをMP4にマックスし、選択したフレームレートとファイル名プレフィックスを使用します。便利なオプションには、オーディオの長さにトリミングし、希望のH.264ピクセル形式を選択することが含まれます。プロジェクトページ: ComfyUI-VideoHelperSuite。
オプションの追加機能#
- プロンプトのヒント: 主題、アクション、カメラの動きを設定する単一の文で始め、ルックアンドフィールのキューと1つの
Audio:行をフォーリーのために追加します。 - より長いクリップの場合は、メモリ使用量を抑え、動きを安定させるために、高解像度よりも控えめなメガピクセルを優先してください。
RandomNoiseでシードを固定し、一貫したイテレーションを望む場合は変更し、バリエーションを探索します。- 自分のシーンで2つのブランチを比較して、出力品質と生成時間を評価します。
- メモリ制限に達した場合は、メガピクセルまたは持続時間を最初に減少させてください。チャンク化されたフィードフォワードは、より長いシーケンスで既に役立っています。
謝辞#
このワークフローは、以下の作品とリソースを実装し、構築しています。我々は、vdn-minimax-h3モデル、ウェイト、リポジトリのためにOpenVDN、ComfyUI-VDN-H3ノードのためにSaganaki22、VDN-H3ワークフローのためにBenji (AI Future Tech) の貢献とメンテナンスに感謝します。権威ある詳細については、以下のリンクされた元のドキュメントとリポジトリを参照してください。
リソース#
- OpenVDN/vdn-minimax-h3
- GitHub: OpenVDN/vdn-minimax-h3
- Hugging Face: OpenVDN/vdn-minimax-h3
- Saganaki22/ComfyUI-VDN-H3
- GitHub: Saganaki22/ComfyUI-VDN-H3
- Benji (AI Future Tech)/VDN-H3 Workflow
- Docs / Release Notes: AI Future Tech Patreon post
注: 参照されたモデル、データセット、およびコードの使用は、著者およびメンテナーによって提供されるそれぞれのライセンスおよび条件に従います。


