MiniMax H3 アクションシーン: リファレンスガイド付きアクションビデオジェネレーターとネイティブオーディオ#
MiniMax H3 アクションシーンは、同期されたネイティブオーディオを備えた、緻密に指示されたリファレンスガイド付きアクションビデオを作成するための ComfyUI ワークフローです。2つのキャラクター画像、1つのシーンリファレンス、および構造化されたプロンプトを提供します。ワークフローは MiniMax H3 Turbo で動きを段階的に行い、LMS と Combat LoRAs で構図と戦闘の読みやすさを洗練しながら、元のオーディオを保持します。出力には、迅速なファーストパス「ベース」ビデオと高精細な「洗練された」ビデオが含まれます。
この Comfyui MiniMax H3 アクションシーンワークフローは、プレビズ、スタントおよび戦闘デザイン、ゲームおよび VFX シネマティクス、短いソーシャルクリップのために設計されています。テストされた例には、城の剣のスパーリング、ボクシングジムのミットワーク、宇宙船のバトンドリルが含まれます。プロンプトでキャラクターのアイデンティティと振り付けを明示し、アーティファクトの可能性がある素早い手や武器の接触を確認します。
Comfyui MiniMax H3 アクションシーンワークフローの主要モデル#
- Comfy‑Org MiniMax H3 コアスイート。テキストエンコーダーと、ジョイントオーディオビデオ潜在を構築、分離、デコードするために使用されるビデオとオーディオの VAE を提供します。公式コレクションでモデルと LoRAs を参照してください。 MiniMax‑H3 models
- Minimax‑h3 Singularity (UNet)。リファレンスとプロンプトをオーディオビデオ潜在に融合するベースのリファレンス‑トゥ‑ビデオジェネレーターとして機能します。 Minimax‑h3_Singularity
- MiniMax‑H3 Turbo LoRA。最初のパスを高速化し、動きのビートを迅速に反復できます。公式の MiniMax H3 コレクションに含まれています。 MiniMax‑H3 LoRAs
- MiniMax‑H3 LMS LoRA。ライブアクションスタイルの出力に適したレイアウト、素材、構造的なシャープネスを追加します。第二のパスで使用されます。 LMS LoRA r64
- H3 Combat LoRA。戦闘シナリオでの戦闘シルエット、刃の接触、および地に足の着いたフットワークの明確さを向上させます。 MiniMax H3 コレクションに含まれています。 MiniMax‑H3 models
- H3 Latent Upscaler LMS。パス間でビデオ潜在を拡大しながら動きの連続性を維持する時間的 3D アップスケーラー。 Comfyui Minimax H3 Latent Upscaler
Comfyui MiniMax H3 アクションシーンワークフローの使用方法#
パイプラインは2つの協調されたパスで実行されます。パス1は速度のために Turbo で動きとタイミングを確立します。次に、ビデオ潜在をアップスケールして、LMS と Combat LoRAs で洗練しながらネイティブオーディオを保持します。迅速な「ベース」プレビューと洗練された「エクスポート」を受け取ります。
設定#
設定グループを使用してアスペクト比、作業解像度、クリップの長さ、フレームレートを選択します。持続時間制御は秒をフレーム数に変換し、サンプラーのチャンク化と一致するため、安定性を助けます。クイックプレビューのために最初に低く設定し、フレーミングとビートが正しく見えるようになったらスケールアップします。高解像度と長いクリップは VRAM とレンダー時間を増加させます。
リファレンス#
3つのリファレンスをロードします: キャラクターごとに1つの画像と環境を定義する1つの画像。キャラクター画像はアイデンティティと衣装のガイドとして機能し、背景ではないため、読みやすい顔とキーワードローブ要素を備えたクリーンなポートレートを選択します。シーンリファレンスは照明、パレット、建築を設定し、意図したカメラの高さに一致するビューを選択します。異なるマッチアップや場所を探求するためにリファレンスを自由に交換できます。
条件#
MiniMaxH3ReferenceToVideo (#56) ノードは、構造化されたプロンプトをリファレンスと MiniMax H3 エンコーダーと融合させ、ジョイントオーディオビデオ潜在とポジティブコンディショニングを生成します。プロンプトは subject_definitions、summary、retention_analysis、detailed_description、overall_soundscape、non_diegetic_music といったラベル付きセクションに分割すると最適に機能します。ファイターの数、武器、カメラの動き、クリーンな接触の正確な数を明示します。追加のキャラクター、テレポート、超人的な動き、または効果を避けると、地に足の着いた結果を得ることができます。
LoRAs#
LoRAs は2段階で適用されます。最初のパスでは Turbo が注入され、アイデンティティの保持を犠牲にせずに動きの探求を加速します。LMS LoRA は AdaLN 互換性修正を通じて流れ、次に Combat が適用され、リファイナーが読みやすいシルエットとストライクパリーの交換を強調します。リアリズムとスタイリゼーションのバランスを取るために LoRA の強度を調整できます。
パッチ#
このグループはパフォーマンスとスケジュールの形成を構成します。PathchSageAttentionKJ (#199) はメモリと速度のために注意を最適化し、高動きシーンが応答性を維持します。MiniMaxH3SigmaShift (#297) はビデオおよびオーディオのシグマスケジュールを整合させ、動きに対する唇とフォーリーのタイミングを改善します。タイミングのドリフトや小さなアイデンティティの不安定性を見たときに使用します。
1st サンプリング#
最初のパスはノイズを初期化し、コンパクトなスケジュールを設定し、SamplerCustomAdvanced (#238) によってガイドされたポジティブコンディショニングでサンプリングします。出力はベース潜在として保存され、ネイティブオーディオ付きのクイックプレビュー動画にデコードできます。このパスではブロッキング、カメラの移動、ヒットのリズムを判断します。ビートマップがずれている場合は、ここでプロンプトとリファレンスを修正します。
2nd サンプリング + リファイナー#
洗練前に、オーディオとビデオは最初のパスから分離され、ビデオ潜在が MinimaxH3LatentUpscaler3D (#124) で拡大され、オーディオ潜在はそのまま保持されます。リファイナーは LMS と Combat LoRAs を使用して、素材のディテール、エッジの鮮明さ、戦闘の読みやすさを追加するために、低ノイズのシグマでサンプリングします。最後に、画像と保存されたオーディオがデコードされ、洗練されたエクスポートに結合されます。ベースパスと比較して、エッジがよりシャープになり、手や刃がクリーンになり、アイデンティティがより安定しています。
Comfyui MiniMax H3 アクションシーンワークフローの主要ノード#
MiniMaxH3ReferenceToVideo (#56)#
MiniMax H3 テキストエンコーダーと VAE を使用して構造化されたプロンプトとリファレンス画像から同期されたオーディオビデオ潜在を構築します。prompt、width、height、length を調整してコンテンツ、フレーミング、および持続時間を制御します。最良の結果を得るために、サブジェクトの定義とシーンの制約を曖昧にしないようにします。リファレンス: Comfy‑Org MiniMax‑H3。
MinimaxH3LatentUpscaler3D (#124)#
時間的一貫性のある 3D 潜在アップスケーラーで、洗練前にパス間でビデオ潜在を拡大します。mode.scale を控えめに増やして、動きを不安定にすることなくディテールを得ます。パス1のタイミングが好きだが、エッジやテクスチャをよりシャープにしたい場合に有用です。リファレンス: Comfyui Minimax H3 Latent Upscaler。
MiniMaxH3SigmaShift (#297)#
MiniMax H3 によって使用されるオーディオとビデオのシグマスケジュールをシフトし、動き、唇のキュー、フォーリーが整合するようにします。shift_video と shift_audio を調整して、対話や衝撃のタイミングのドリフトを減らします。カットインまたはカットアウトでの同期ずれに気付かない限り、小さなオフセットを残します。リファレンス: MiniMax‑H3 collection。
VHS_VideoCombine (#264)#
デコードされたフレームとオーディオを最終的な MP4 にフレームレートと品質設定で結合します。メタデータの保存を有効にして、エクスポートでの起源とワークフローディテールを保持します。保存されたオーディオを超える場合は trim_to_audio を使用します。リファレンス: ComfyUI‑VideoHelperSuite。
PathchSageAttentionKJ (#199)#
高詳細シーンや大きな解像度に対するスループットと安定性を改善できる注意の最適化。長時間のテイクや複雑な環境で有効にします。小さなクリップでパフォーマンスの低下が発生した場合は、自動モードを試してください。リファレンス: ComfyUI‑KJNodes。
オプションのエクストラ#
- プロンプトパターン。提供されたセクション形式を使用し、アクションのビートマップを書き出します。ファイターと武器の正確な数、カメラの動き、読みやすい接触の数とタイミングを指定します。
- リファレンスキュレーション。クリアな顔と衣装を持つアイデンティティ写真を選択し、意図した視点と照明に一致する場所の画像を選択します。キャラクターリファレンスで忙しい背景を避け、競合を減らします。
- レビューパス。ベースビデオを見て、ブロッキングとタイミングを検証してから洗練します。接触がぼやけて見える場合は、プロンプトで明確さを高め、手や刃の速度を減らします。
- 一般的な問題と修正。素早い手や武器の接触は小さな歪みを引き起こす可能性があります。衝撃周辺の振り付けを簡素化し、交換を短縮するか、カメラからの距離を増やしてモデルが瞬間をクリーンにレンダリングするのを助けます。
- デリバラブル。ワークフローは迅速なベースプレビューと洗練されたエクスポートを書き出し、動きと最終的な見た目を比較できます。アイデンティティ、環境、ビートが目標に達したら、共有のために洗練されたクリップを使用します。
MiniMax H3 アクションシーンを使用すると、2つのキャラクター画像、シーンリファレンス、正確な概要を地に足の着いたリファレンスに忠実なアクションクリップに変換し、同期されたネイティブオーディオで編集、プレビズ、または公開の準備ができます。
謝辞#
このワークフローは、以下の作品とリソースを実装および基にしています。我々は、AI Video MiniMax H3 ComfyUI ワークフローガイダンスのための Innovate Futures @ Benji、Minimax-h3_Singularity の WarmBloodAban、および MiniMax-H3 ベースモデルと LMS LoRA のための Comfy-Org および RunningHubAI に感謝します。詳細については、以下のリンクされたオリジナルの文書とリポジトリを参照してください。
リソース#
- Innovate Futures @ Benji/AI Video MiniMax H3 (ワークフローソース)
- ドキュメント / リリースノート:json
AI Video Minimax H3 Action Scenes Update — New Sampling Settings in ComfyUI
- WarmBloodAban/Minimax-h3_Singularity
- Hugging Face: WarmBloodAban/Minimax-h3_Singularity
- Comfy-Org/MiniMax-H3
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- RunningHubAI/rh-minimax-h3-lms-v1.0-r64-lora
- Hugging Face: RunningHubAI/rh-minimax-h3-lms-v1.0-r64-lora
Note: Use of the referenced models, datasets, and code is subject to the respective licenses and terms provided by their authors and maintainers.


