FastH3 8ステップ V2 ComfyUI ワークフロー: 2フレーム条件付けのMiniMax H3ビデオとオーディオ#
FastH3 8ステップ V2 ComfyUI ワークフローは、最初と最後の参照フレームを連続したMiniMax H3ビデオに変え、同期された生成オーディオを提供します。FastVideo FastH3 V2 INT8チェックポイントを使用し、8ステップのスケジュール、スパースアテンション、および明示的な最初/最後フレーム条件を用いて、迅速で制御された結果を提供します。
このワークフローは、シネマティックなトランジション、キャラクターの動き、ソーシャルビデオコンセプト、明確なオープニングとクロージング構成が必要な短いナラティブショットに最適です。安定した被写体、固定されたフレーミング、自然な動きが求められる場合は、FastH3 8ステップ V2 ComfyUI ワークフローが最適です。
ComfyUI FastH3 8ステップ V2 ComfyUI ワークフローの主要モデル#
- FastVideo FastH3 8ステップ V2 (INT8)。迅速な反復のためにわずか8ステップのサンプリングでビデオおよびオーディオの潜在変数を生成するディフュージョンバックボーン。チェックポイント: FastVideo/FastVideo-FastH3-8-Step-V2 および ComfyUI対応の重みは FastVideo/FastVideo-FastH3-Comfy にあります。
- MiniMax H3用のQwen3-VL 32Bテキストエンコーダー。モーション、シーンの詳細、およびオーディオキューをガイドするために使用される条件付け埋め込みにプロンプトをエンコードします。重みは Comfy-Org/MiniMax-H3 で公式モデルセットと共に配布されています。
- MiniMax H3 Video VAE。入力で指定されたターゲット解像度でビデオ潜在変数をRGBフレームにデコードします。詳細は Comfy-Org/MiniMax-H3 を参照してください。
- MiniMax H3 Audio VAE。オーディオ潜在変数を波形オーディオにデコードし、生成されたフレームとマルチプレックスします。詳細は Comfy-Org/MiniMax-H3 を参照してください。
ComfyUI FastH3 8ステップ V2 ComfyUI ワークフローの使用方法#
グラフは公式のFastH3イメージトゥビデオパターンに従い、ショットを左から右に組み立てます。2つの参照画像とテキストプロンプトを提供すると、ワークフローは8ステップで必要な条件付けとサンプリングを計算し、同期されたビデオとオーディオをデコードし、公開準備済みのファイルを保存します。
画像/ビデオ入力 (2)
LoadImage(#136) とLoadImage(#161) を使用して最初と最後のフレームをロードします。同じシーンとアスペクト比の画像を選択して、クリップ全体で構図とアイデンティティが一貫するようにします。- 最初のフレームは
ImageScaleToTotalPixels(#142) によって自動的にリサイズされ、計算予算に適合します。その後、GetImageSize(#141) がその幅と高さを読み取り、生成されたシーケンスがその解像度に一致するようにします。 - 自然でシーンに正確な参照フレームを使用します。最後のフレームは最終構成を固定するので、ショットが正確に意図した場所で終了します。
処理 (19)
- コアウェイトは
UNETLoader(#151)、CLIPLoader(#152)、および2つのVAELoaderノード(#143 ビデオ、#144 オーディオ)でロードされます。MiniMaxH3ImageToVideo(#155) ノードは、最初のフレーム、最後のフレーム、プロンプト、ターゲット期間を単一の条件付けパッケージと初期潜在変数に融合します。 - 期間は便利な
Float (duration)コントロール (#157) で一度設定されます。ComfyMathExpression(#156) がその時間をモデルのストライドに整合するフレーム数に変換し、シーケンス全体でスムーズなアテンションを実現します。 - 時間的および効率的なヘルパーには
MiniMaxH3SigmaShift(#160) が含まれ、MiniMax H3 のスケジュールをバイアスし、ModelAttentionBackend(#159) がアテンション実装を選択し、BlockSparseAttention(#158) が重要な領域の忠実度を維持しながら計算を削減します。 - デノイズコアは、画像からビデオへのノードからの正の条件を持つ
BasicGuider(#150)、8ステップのBasicScheduler(#148)、KSamplerSelect(#147) で選択されたres_multistepサンプラー、およびSamplerCustomAdvanced(#149) を使用して、1回のパスでビデオとオーディオの潜在変数を生成します。
出力 (2)
- ビデオ潜在変数は
VAEDecode(#146) によりフレームにデコードされ、オーディオ潜在変数はVAEDecodeAudio(#145) によりデコードされます。CreateVideo(#154) は画像シーケンスとオーディオを単一クリップにマルチプレックスします。 SaveVideo(#92) がファイルを書き込みます。ファイル名のプレフィックスを設定し、配信プラットフォームまたは編集パイプラインに一致するフォーマットとコーデックを選択します。
ComfyUI FastH3 8ステップ V2 ComfyUI ワークフローの主要ノード#
MiniMaxH3ImageToVideo (#155)
- 最初と最後の参照フレームにプロンプトを加えて条件付けを構築し、ビデオとオーディオの共同生成のための初期潜在変数を出力します。モーション、カメラ、雰囲気、および必要な音声キューを説明するようにテキストプロンプトを調整します。最も安定した結果を得るために、参照と一致するアイデンティティとシーン要素を維持します。左のグループで期間コントロールを調整して、サンプラー設定に触れずにクリップの長さを変更します。
BlockSparseAttention (#158)
- 読み込まれたモデルにスパースアテンションを適用して、サンプリングを加速しながら、重要な箇所でアテンションを維持します。忙しいシーンで詳細が失われる場合は、保持する割合を増やすか、前景被写体に追加のトークンを予約します。単純なシーンでは、より強いスパース性がレンダリングを大幅にスピードアップできます。
MiniMaxH3SigmaShift (#160)
- 短い8ステップの軌道全体で時間的構造と音を一貫させるために、ビデオとオーディオのノイズスケジュールをシフトします。モーションが不安定に見える場合は、ビデオシフトを高くし、オーディオの整合性がずれる場合は、オーディオシフトを少し調整します。小さな変更を行い、短いプレビューをテストしてバランスを見つけてください。
SamplerCustomAdvanced (#149)
res_multistepサンプラーとBasicScheduler(#148) からのスケジュールを使用して8ステップのデノイジングを実行します。再現性のためにRandomNoise(#153) のシードを固定し、モーションが気に入ったら変更して代替を探索します。複雑な構成のときは、BasicGuider(#150) からの強いガイダンスがプロンプトに従うのに役立ちます。
CreateVideo (#154)
- デコードされたフレームとオーディオを最終クリップにマルチプレックスします。フレーム毎秒を設定してリズムを制御し、ワークフローに適したカラースペースを選択します。後で編集する予定がある場合は、サイズと品質のバランスを取ったコーデックを選択します。
オプションのエクストラ#
- 参照選択: 同じレンズと視点からの2つのフレームを選び、露出とホワイトバランスを一致させます。よりシャープな参照は通常、よりクリーンなテクスチャを生み出します。
- プロンプト作成: 被写体が何をするか、カメラがどのように振る舞うか、環境がどのような音を出すかを書きます。アイデンティティのドリフトを避けるために、参照と一致する言葉遣いを維持します。
- 解像度と速度: メモリ制限に達した場合は、
ImageScaleToTotalPixels(#142) でターゲットピクセル予算を下げます。ヒーローショットでは、これを上げてバリエーションを減らしてレンダリングします。 - 期間とfps: ペーシングのために期間を調整し、その後
CreateVideo(#154) でfpsを設定してフィーリングを制御します。ワークフローはフレーム数を自動的に整合させ、安定したアテンションを実現します。 - シードと反復: ノイズシードを固定してプロンプトと参照を洗練し、構成とタイミングがロックされたら新しいシードを試して代替を探索します。
- テンプレートのパリティ: グラフは公式のFastH3 I2V構造に従っているため、参照テンプレートからのヒントが Comfy-Org/workflow_templates から直接移行します。
謝辞#
このワークフローは以下の作品やリソースを実装し、構築しています。FastVideoによるFastH3 8ステップ V2モデルとComfyUIの重みに感謝し、FastH3 I2VワークフローテンプレートのためのComfy-Orgに感謝し、RunningHub.aiのワークフローソースに感謝します。詳細については、以下にリンクされている元のドキュメントとリポジトリを参照してください。
リソース#
- RunningHub.ai/Workflow source
- ドキュメント / リリースノート: RunningHub.ai post
- FastVideo/FastVideo-FastH3-8-Step-V2
- GitHub: hao-ai-lab/FastVideo
- Hugging Face: FastVideo/FastVideo-FastH3-8-Step-V2
- arXiv: 2405.14867
- FastVideo/FastVideo-FastH3-Comfy
- Hugging Face: FastVideo/FastVideo-FastH3-Comfy
- Comfy-Org/workflow_templates (FastH3 I2V template)
- GitHub: Comfy-Org/workflow_templates
注: 参照されたモデル、データセット、およびコードの使用は、それぞれの著者およびメンテナーによって提供されたライセンスおよび条件に従います。


