Minimax H3 I2V デュアルクロック 8ステップ 高品質 超高速#
このRunComfy対応のComfyUIワークフローは、単一の参照画像と組み合わせた動きとオーディオプロンプトを短い同期ビデオに変換し、ネイティブステレオサウンドを提供します。MiniMax H3 Ref2VAコンディショニングと8ステップのデュアルクロックサンプラーを中心に構築されており、ビジュアルの一貫性を損なうことなく高速な画像アニメーションと緊密に結合されたサウンドを提供します。
Minimax H3 I2V デュアルクロック 8ステップ 高品質 超高速ワークフローを使用して、シネマティックな画像アニメーション、キャラクターのパフォーマンス、車両、製品ショット、同期された動きと生成されたオーディオから恩恵を受ける大気シーンを作成します。このグラフは、メモリ効率の良い推論のためにSageAttentionを統合し、ユーザー向けのI2V体験をシンプルに保ちながら、加速された生成を実現するMiniMax-H3 Turbo LoRAを備えています。
Comfyui Minimax H3 I2V デュアルクロック 8ステップ 高品質 超高速ワークフローの主要モデル#
- MiniMax-H3 AV Foundation Model。参照画像のコンディショニング、動きの生成、ネイティブオーディオ合成を実現するコアオーディオビジュアルトランスフォーマー。公式モデルカードはHugging Faceで確認できます: MiniMaxAI/MiniMax-H3。
- MiniMax-H3 Turbo LoRA V4 step600。8ステップサンプリングでMiniMax-H3を高速化し安定化させる軽量アダプター。モデルカード: larryvrh/MiniMax-H3-Turbo-Lora。
- MiniMax-H3 Video VAEとAudio VAE。オーディオビジュアルレイテントをRGBフレームとステレオ波形に変換するペアのデコーダー。サンプリング中の効率的なレイテント輸送と最終的な高品質デコードを保証します。
Comfyui Minimax H3 I2V デュアルクロック 8ステップ 高品質 超高速ワークフローの使用方法#
このワークフローは、モデルとアセットのセットアップ、デュアルクロックサンプリング、デコードとMP4マクシングの3つのグループに分けて左から右に実行されます。1つの参照画像と視覚的な方向と"Audio:" セクションを含む単一のプロンプトを提供します。
H3ローダー + Turbo LoRA (EMA)#
このグループはMiniMax-H3スタックを準備し、Turbo LoRAを適用して速度を向上させます。LoadImageに参照画像をロードし、CR Prompt Textに"Audio: …" で終わる記述的な動きのプロンプトを書きます。ResolutionSelectorを使用して出力サイズを選択し、ビデオの安定性を保つために32の倍数に合わせた寸法を維持します。Float (duration) コントロールでターゲット期間を秒単位で設定します。グラフの内部数学により、モデルのタイミングに合わせてフレーム数に変換されるため、サンプラーがスムーズに動作します。SageAttentionパッチがモデルに適用され、VRAM使用量を削減し、最終的な外観を変更せずにスループットを向上させます。
STABLE: video 4 / audio 4#
このグループは、8ステップのMiniMax H3 デュアルクロックサンプラーを使用して生成の中心部を実行します。コンディショニングブロックは、Ref2VAを使用して参照画像とテキストプロンプトをAVレイテントに融合し、アイデンティティ、構成、高レベルのサウンドキューを固定します。デュアルクロックサンプラーは、別々でありながら同期されたクロックでビデオとオーディオを進め、動きと音が自然にロックされたように感じさせます。知覚されたリードやラグを修正する必要がある場合は、ビデオとオーディオのクロックシフトを調整して、いずれかのストリームを前後に微調整し、パフォーマンスを同期に合わせます。基本的なCFGスタイルのガイダーが、プロンプトへの忠実さとモデルの学習済みの先行知識をバランスさせ、クリーンでシネマティックな動きを実現します。
デコード + 同期MP4#
デコーダーは、専用のMiniMax-H3 VAEを使用して最終的なAVレイテントをフレームシーケンスとステレオオーディオトラックに変換します。VHS_VideoCombineステージは、フレームとオーディオを選択したフレームレートで単一のH.264 MP4にパッケージし、共有可能なビデオを保存します。後から独自のオーディオを持ち込む場合は、オーディオの長さにトリムするか、外部編集用に画像のみをエクスポートできます。結果は、参照画像の外観を保持しながらリアルな動きと音を追加する、コンパクトで同期されたクリップです。
Comfyui Minimax H3 I2V デュアルクロック 8ステップ 高品質 超高速ワークフローの主要ノード#
MiniMaxH3AudioConditioningT8 (#6)#
このノードはRef2VAコンディショニングを実装し、プロンプト、参照画像、ターゲットの幅、高さ、長さを使用してオーディオビジュアルレイテントとポジティブコンディショニングを作成します。創造的な意図を設定するために使用します: 動き、カメラの動作、シーンの連続性を説明し、"Audio:" セグメントを追加して楽器、音色、雰囲気、ダイナミクスを指定します。幅と高さを参照画像のアスペクトに合わせて一貫性を保つことで、最も一貫性のあるレイアウトを実現できます。長さコントロールは、サンプラーの内部タイミングに合わせたフレームに期間をマッピングし、スムーズな動きと安定したオーディオを維持するのに役立ちます。ComfyUI MiniMax H3 Turboプロジェクトによって提供されています: Larryvrh/ComfyUI-MiniMax-H3-Turbo。
MiniMaxH3DualClockSamplerT8 (#7)#
MiniMax-H3 AV生成専用に設計された8ステップサンプラーで、ビデオとオーディオのクロックを分けて調整します。Ref2VA制約を尊重しながら、両方のタイムラインを調整することで、高速で高品質な結果を生成します。ビジュアルがビートやアクションに対して少し早いまたは遅れていると感じた場合は、ビデオとオーディオのクロックシフトを小刻みに調整して同期を再センタリングします。8ステップのままにして、高品質超高速バランスを意図したものにしてください。同じプラグインで実装されています: Larryvrh/ComfyUI-MiniMax-H3-Turbo。
LoraLoaderBypassModelOnly (#2)#
MiniMax-H3 Turbo LoRAをベースモデルに注入して、収束を加速し、低ステップでの安定性を向上させます。特定の画像で過度にシャープになったりアイデンティティがずれたりした場合は、LoRAの強度を少し下げて中立性を取り戻します。よりパンチのあるディテールや強力な時間固定が必要な場合は、強度を適度に増やします。LoRAリファレンス: larryvrh/MiniMax-H3-Turbo-Lora。
MiniMaxH3MemoryEfficientSageAttentionPatch (#17)#
MiniMax-H3モデルにメモリ効率の良いアテンション実装を適用して、一般的なGPUでのスループットを向上させます。それをそのまま使用して、大きな解像度や長い期間でのVRAM圧力を軽減します。このパッチはComfyUI用のKJNodesスイートの一部です: kijai/ComfyUI-KJNodes。
MiniMaxH3AVDecodeT8 (#11)#
ペアのMiniMax-H3 VAEを使用してオーディオビジュアルレイテントをRGBフレームとステレオオーディオにデコードします。ここで最終的な忠実度が実現されるため、解像度の選択を現実的にしてGPUのデコードボトルネックを避けてください。このノードは、サンプラーのクロックに時間を合わせたフレームとオーディオ信号を出力し、マクシングの準備が整います。MiniMax H3 Turboプラグインによって提供されています: Larryvrh/ComfyUI-MiniMax-H3-Turbo。
VHS_VideoCombine (#12)#
Video Helper Suiteを使用してデコードされたフレームとステレオオーディオを単一のMP4に結合します。好みのフレームレートを設定し、後でカスタムオーディオを代用する場合はトリミングを有効にします。このノードは配信を最終化し、迅速にプレビューとエクスポートが可能です。プロジェクトリファレンス: Kosinkadink/ComfyUI-VideoHelperSuite。
オプションの追加#
- プロンプトは視覚的な方向とサウンドデザインを分けて行うと最適です。シーンを書いてから、"Audio:" に楽器、スタイル、部屋の種類、強度を追加します。
- まずは画像のアスペクトに合った中程度のサイズから始めます。動きとタイミングが気に入ったらアップサイズします。
- 同期がずれていると感じた場合は、持続時間を変更するのではなく、ビデオまたはオーディオのクロックシフトを微調整します。小さな調整でパフォーマンスをビートにロックできます。
- キャラクターショットの場合は、動きの中でアイデンティティを保持するために、はっきりとした被写体の分離と一貫した照明を持つ画像を選択します。
- シードを再設定して、同じセットアップを維持しながら表現とタイミングの微細なバリエーションを探索します。
謝辞#
このワークフローは、以下の作品とリソースを実装および基盤にしています。我々は、Sourceワークフローテンプレートを提供してくれたRunningHub、MiniMaxAIのMiniMax-H3モデルの重み、MiniMax-H3 Turbo LoRAおよびComfyUI MiniMax H3 Turboプロジェクトの貢献とメンテナンスをしてくれたLarryvrhに感謝します。権威ある詳細については、以下にリンクされた元のドキュメントおよびリポジトリを参照してください。
リソース#
- RunningHub/Source workflow template
- ドキュメント / リリースノート: Source workflow template
- MiniMaxAI/MiniMax H3 model weights
- Hugging Face: MiniMaxAI/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
- Larryvrh/ComfyUI MiniMax H3 Turbo project
注意: 参照されたモデル、データセット、およびコードの使用は、それぞれの著者およびメンテナによって提供されるライセンスおよび条件に従います。

