MiniMax H3 ロングビデオ: ComfyUIでのシームレスな長尺リファレンスからビデオ#
MiniMax H3 ロングビデオは、複数のMiniMax H3リファレンスからビデオ生成を端から端まで連結して、連続的でカットのないショットを作成するために設計されたComfyUIワークフローです。モーションコンテキストを備えたマルチトラックエディタに基づいており、新しいセグメントは前のセグメントから最後のフレームとアクティブオーディオを継承するため、カメラの動き、キャラクターのパフォーマンス、および雰囲気がジョインをまたがってクリーンに流れます。顔、髪型、衣装、パレットをロックするための単一の共有リファレンス画像と、各セグメントごとの単一パスサンプリングにより、結果は目に見えるシームなしで1つのテイクとして読み取られます。
チェイスシーン、ウォーク&トーク、トラベルショット、その他のナラティブな長尺テイクが1つの画像といくつかのリンクされたプロンプトから必要な場合、MiniMax H3 ロングビデオを使用してください。アイデンティティとトーンを一貫して保ちながら、セグメントプロンプトと期間を通じてストーリーをビートごとに操縦できます。
Comfyui MiniMax H3 ロングビデオワークフローの主要モデル#
- MiniMax H3 リファレンスからビデオモデル。共有リファレンス画像と現在のプロンプトから各セグメントを駆動し、ネイティブオーディオを備えた時間的に一貫したビデオを生成します。このワークフローでの役割は、アクション、カメラ、シーンを連続性を壊さずに進化させるプロンプトの変更を受け入れながら、セグメント間での被写体のアイデンティティを保持することです。
Comfyui MiniMax H3 ロングビデオワークフローの使用方法#
このワークフローは、タイムラインのように制作を組織します: グローバルアセットを設定し、セグメントのシリーズを作成し、モーションコンテキストが各ジョインで画像と音を前進させます。セグメントごとに何が変わるかをプロンプトで決定しながら、共有リファレンスと単一パスサンプリングが連続性を保ちます。
- グローバル設定とリファレンス画像
- 高品質のリファレンス画像をアップロードします。これが全体のテイクの標準的な外観になるため、シャープでフロントライトのショットを選び、キャラクターを意図した角度に似たフレーミングで撮影します。
- ベースプロンプトを入力し、必要に応じて、全セグメントに適用されるネガティブプロンプトを入力します。キャラクターと衣装の記述をベースプロンプトに保持して、アイデンティティを強化します。
- 出力解像度、フレームレート、全体のランレングス目標を設定します。MiniMax H3 ロングビデオは、セグメントを連結してその期間を埋めます。
- セグメントタイムラインオーサリング
- 順番にセグメントを作成します。各セグメントには、そのビートの変化を表す短く集中したプロンプトがあります: モーション(「駐車している車をスプリントで通過する」)、カメラ(「ハンドヘルドで後ろから追う」)、またはシーンの詳細(「雨が強まり、アスファルトにネオンが反射する」)。
- プロンプトを加算的かつ具体的に保ちます。初期セグメントで被写体と衣装を再確認し、アイデンティティがロックされたら後のプロンプトをアクションと撮影に短縮します。
- 自然なリズムを感じるように期間を割り当てます。長いビートは視聴者がシーンの変化を認識するのに役立ち、短いビートはアクションを強調します。ワークフローはそれらをシームレスに結びつけます。
- モーションコンテキストの受け渡し
- セグメントNの最終フレームは、セグメントN+1にモーションコンテキストとして渡されます。それは、ボディポーズ、カメラの軌道、シーンレイアウトがスムーズに続くことを意味します。
- 各セグメントでのサンプリングは単一パスであるため、ジョインでの再レンダーループはありません。時間的な混乱や幻覚の再エントリなしにクリーンな引き継ぎが得られます。
- 目に見えるピボットが欲しい場合は、それを書いてください。たとえば、「キャラクターが横断歩道で止まり、カメラが前面クローズアップに回転する」と書くと、次のセグメントが自然にピボットするように指示します。
- オーディオの連続性
- MiniMax H3 ロングビデオからのネイティブオーディオは、セグメント間で穏やかなクロスフェードを伴ってタイムラインを走ります。アンビエントベッドと声は、次のプロンプトが明確なオーディオ変更を導入しない限り、ジョインをまたがって続きます。
- 聴覚的な移行を強調するには、次のセグメントの最初の秒間のプロンプトにそれを含めます。たとえば、「群衆の音が膨らみ、サイレンが左から右にフェードする」として、モデルがサウンドステージを絵と共に進化させるようにします。
- レンダリングとエクスポート
- プロンプトとセグメントの順序に満足したら、全タイムラインをキューに入れます。ワークフローは各セグメントを順番に生成し、選択したフレームレートとコーデックで単一のビデオファイルにまとめます。
- 最終テイクを端から端までレビューします。ジョインがカットとして読まれる場合、その境界付近のプロンプトのみを調整するか、隣接するセグメントの期間をわずかに再調整します。
Comfyui MiniMax H3 ロングビデオワークフローの主要ノード#
- MiniTrackタイムラインエディタグループ
- ストーリーボードとタイムラインとして機能します。セグメントの順序、期間、プロンプトを一箇所で整理し、生成スタックに触れずにストーリーフローを考えることができます。
- タイムラインヘッダーにリファレンス画像とグローバルプロンプトを固定します。これにより、各セグメントが同じアイデンティティアンカーを引き出し、ビート固有のプロンプトがその上にレイヤーされます。
- モーションコンテキストブリッジ
- セグメント間のエンドからスタートへのフレームパススルーを処理します。ここで変更する必要はほとんどありません。ジョインを見えなくするために存在します。
- 境界でわずかなジッターが見られる場合、アウトゴーイングセグメントをわずかに延長するか、次のセグメントを「呼吸が整い、歩みが再開する」などのモデルがアニメートできるマイクロアクションで開始することによって滑らかにします。
- オーディオステッチャー
- 短いクロスフェードで連続するセグメントからのネイティブオーディオを整列させます。セグメントプロンプトを使用して、注目すべきオーディオの変更を説明し、このグループの内部を使用しないでください。
- 明確なシーンシフトの場合、新しいセグメントプロンプトの開始時に素早い聴覚イベントを含めます。「ドアが閉まり、廊下のリバーブ。」
オプションの追加要素#
- 移動するプロンプト作成
- セグメントごとに「被写体 + シーン + アクション + カメラ」というコンパクトなフォーミュラを使用します。例: 「同じランナー、夜市の路地、スプリントに加速し、ハンドヘルドで追う」; 「同じランナー、高架電車のプラットフォーム、歩みに減速し、左にドリー。」
- 「同じランナー」のようなアンカーフレーズを再利用してドリフトを防ぎます。
- リファレンス画像の規律
- 一貫したヘッドルームとレンズの感覚にクロップします。極端なフィッシュアイや低光量ノイズをリファレンスに避けてください。これは全体のテイクに伝播する可能性があります。
- セグメントのペーシング
- 短いテストのために3から6のセグメントを計画し、次にスケールアップします。広範なビートから始め、プロンプトを修正し、その後でタイムラインを拡張して目標の期間に到達します。
- 見えるジョインの診断
- 境界が目立つ場合、アウトゴーイングプロンプトを次のアクションを予感させるように微調整するか、インカミングプロンプトに単純な移行アクションを追加します。小さなテキストキューは時間的な問題を修正することがよくあります。
MiniMax H3 ロングビデオは、1つの画像といくつかのリンクされたプロンプトを1つの連続したショットに変え、ネイティブオーディオでストーリーテリングの準備が整います。Comfyui MiniMax H3 ロングビデオワークフローを使用して、長尺テイクシーケンスをブロック、洗練、出荷し、撮影されたように感じられるようにします。
謝辞#
このワークフローは、次の作品とリソースを実装し、それに基づいて構築されています。H3 ロングビデオワークフローのソースに対する貢献とメンテナンスに対してMiniMaxに感謝します。権威ある詳細については、以下にリンクされたオリジナルのドキュメントとリポジトリを参照してください。
資源#
- MiniMax/H3 Long Video Workflow Source
- ドキュメント / リリースノート: RunningHub.ai post
注: 参照されたモデル、データセット、およびコードの使用は、それぞれの著者およびメンテナによって提供されるライセンスおよび条件に従います。

