MiniMax H3 Taomate 3ステップ加速: 参照画像から映画的ビデオへの同期オーディオ#
このComfyUIワークフローは、1枚または2枚の静止画像と映画的なプロンプトを、同期されたサウンドを備えた一貫したビデオに変換します。MiniMax H3とTaoMate H3の3ステップ加速LoRAを中心に構築されており、被写体のアイデンティティ、シーンの連続性、カメラの動き、オーディオキューを保持しながら迅速なサンプリングを実現します。MiniMax H3 Taomate 3ステップ加速パイプラインは、キャラクターポートレート、SFビート、歴史的再現、および強い類似性制御と自然な動きが求められる洗練された短編コンセプトに最適です。
参照画像をショット構造化プロンプトと組み合わせることで、MiniMax H3 Taomate 3ステップ加速ワークフローは、画面上の一貫したパフォーマー、安定した照明とセットドレッシング、そしてあなたのテキスト指示に従うアンビエンストラックを提供します。メモリ効率の良いアテンションパッチとチャンク化推論を搭載しているため、大きなフレームを低VRAMで実行しながら、オーディオとビデオを整合させることができます。
Comfyui MiniMax H3 Taomate 3ステップ加速ワークフローの主要モデル#
- MiniMax H3 reference-to-video基盤モデル。テキストとビジュアル参照からのビデオとオーディオの共同生成を駆動します。公式モデルカードで能力とフォーマットを確認してください:MiniMaxAI/MiniMax-H3。
- TaoMate-H3 3ステップ加速LoRA。高品質が非常に少ないステップで達成できるようにデノイズスケジュールを再構成し、このワークフローが使用する3ステップスタイルスケジュールを可能にします。プロジェクトと重み:TaoMate-H3 on GitHub および TaoLiveAIGC/TaoMate-H3。
- Qwen3-VL 32Bテキストエンコーダーバリアント for MiniMax H3。カメラとサウンドの指示を含む長いショットに対応したプロンプトをエンコードし、より強力なコンディショニングを行います。Comfy-ready H3バンドルと共に配布されています:Comfy-Org/MiniMax-H3。
- MiniMax H3 Video VAEおよびAudio VAE。共有された潜在ストリームを画像フレームと同期オーディオにデコードし、リップセーフなタイミングとアンビエンスの連続性を確保します。Comfy-Org/MiniMax-H3に含まれています。
Comfyui MiniMax H3 Taomate 3ステップ加速ワークフローの使用方法#
ワークフローは入力から単一のサンプラーパスへと流れ、ビデオとオーディオの両方の統一された潜在を発行し、最終ファイルにデコードおよびマルチプレックスします。グループは参照とテキストを最初に設定できるように整理されており、その後MiniMax H3 Taomate 3ステップ加速処理スタックが引き継ぎます。
画像/ビデオ入力 (2)#
LoadImage(#94)およびLoadImage(#9)に1枚または2枚の被写体フレームを読み込みます。アイデンティティが固定されるように、安定した照明でクリーンな正面画像を使用してください。強い参照が1枚あれば十分ですが、2つ目の角度が衣装、プロポーション、環境を維持するのに役立ちます。参照はデノイズが始まる前にアイデンティティ、ポーズ範囲、レイアウトを初期化するためにMiniMaxH3ReferenceToVideoにフィードされます。
テキスト入力 (1)#
Prompt(#93)にあなたの映画的プロンプトを入力します。エンコーダーはショット分解、カメラの動き、動作動詞、および音のための2つのオプションブロック(アンビエンスラインと非ダイジェティック音楽ライン)のようなセクションを持つ構造化された散文を好みます。提供されたテンプレートスタイルを保持し、その内容をシーンとタイミングマーカーで置き換えることができます。これらの指示は画像と音の両方を条件付けするので、MiniMax H3 Taomate 3ステップ加速スタックは画面上のアクションとオーディオイベントを整合できます。
処理 (22)#
このグループはMiniMax H3をロードし、TaoMate 3ステップ加速LoRAを適用し、低VRAM実行のためのメモリ効率の良いアテンションをインストールします。MiniMaxH3ReferenceToVideo(#11)は参照画像とプロンプトを融合して潜在計画を作成します; Resolution Selector (Size)(#20)は幅と高さを設定します; Float (Duration)(#17)は実行時間を駆動します。小さな式ノードがH3に適したフレーム数に変換され、内部ストライドと一致するので動きが滑らかに保たれます。サンプラー、ガイダー、スケジューラー、およびシグマシフトは、MiniMax H3 Taomate 3ステップ加速のために設計された短く積極的なスケジュールを実行し、アイデンティティやシーンの安定性を犠牲にしません。
出力 (2)#
サンプラーのデノイズされた潜在は2回デコードされます: VAEDecode(#25)がフレームを生成し、VAEDecodeAudio(#14)が音を生成します。CreateVideo(#34)は選択したfpsでフレームとオーディオをマルチプレックスし、共有可能な単一クリップを作成し、SaveVideo(#5)はファイル名プレフィックスで保存します。出力はあなたのショットレベルのテキストを反映し、参照画像から顔の類似性を保ちます。ビデオとオーディオが潜在を共有しているため、同期は維持されます。
Comfyui MiniMax H3 Taomate 3ステップ加速ワークフローの主要ノード#
MiniMaxH3ReferenceToVideo (#11)#
このノードはH3パイプラインへのテキスト画像条件付けのエントリーポイントです。プロンプト、1枚または2枚の参照画像、および有効なwidth、height、lengthを供給するために使用します。正確なタイミングのために、上流で期間を調整し、計算されたlengthを自動的に整合させます; 解像度はセレクターを介して変更し、生のサイズをここに入力しないでください。参照を交換または追加する場合、アイデンティティのドリフトを避けるために画像全体でフレーミングを一貫させてください。
LoraLoaderModelOnly (#92) — TaoMate H3 3ステップ加速#
MiniMax H3 Taomate 3ステップ加速スケジュールを可能にするTaoMate H3 LoRAを適用します。非常に低いステップでより多くの速度または強いガイダンスが必要な場合にのみその影響を増やします; 過度のシャープ化または微妙な動きの減少が観察される場合はわずかに減少させます。この短いスケジュールが収束する明確なターゲットを持つために、簡潔で具体的なプロンプトと組み合わせてください。
MiniMaxH3SigmaShift (#38)#
ビデオの鮮明さと時間的一貫性を保ちながら、オーディオを安定させるためにノイズスケジュールをシフトします。フレームが柔らかすぎる場合はビデオシフトを上に動かし、アンビエンスが支配的または脆くなりすぎる場合はオーディオシフトを緩めます。小さな調整を行い、完全なレンダリングをコミットする前に数秒プレビューします。
SamplerCustomAdvanced (#21)#
選択したサンプラーとスケジューラーのシグマカーブで短いデノイズパスを実行します。プロンプトを比較するときはサンプラーを一貫させ、テキストと参照に変化を帰することができるようにしてください。多様性のために、上流のRandomNoiseシードを変更します; これにより、アイデンティティを損なうことなくマイクロモーションとカメラフィーリングが変更されます。
ComfyMathExpression (#19) — 自動フレームカウント#
期間をH3の内部ストライドに整合したフレームカウントに変換し、リズムのスタッターを防ぎます。期間入力ノードのみを編集してください; 数式は自動的に最も近い互換性のあるカウントに丸めます。これによりスムーズな動きが保たれ、視覚的ビートと同期したオーディオベッドが維持されます。
Resolution Selector (Size) (#20)#
モデルフレンドリーなタイルサイズの倍数である両方の寸法を維持しながら、アスペクト比とピクセル予算を選択します。配布物に一致するアスペクトを選択し、ディテールと速度およびVRAMを交換するためにメガピクセルを上げ下げします。VAEとアテンションウィンドウでの不整合を避けるために、任意のサイズを使用せずにこれを使用してください。
CreateVideo (#34) および SaveVideo (#5)#
フレームとオーディオを単一のファイルにマルチプレックスし、希望のプレフィックスとフォーマットで保存します。ここでfpsを調整して、モデルを再サンプリングせずに見た目の動きの速度とサウンドのタイミングを変更します。シリーズを構築するときは一貫したビット深度とカラースペースを使用し、クリップが均一にグレードされるようにします。
オプションの追加機能#
- 最良の結果を得るためのプロンプト作成
- ワンセンテンスのシーン概要で始め、明確な動詞とタイミングキューを持つ1〜3のショットブロックをリストします。
- 1つのアンビエンスラインと、オプションで抑えた音楽ノートを含め、オーディオが意図的に感じられるようにします。
- 短いスケジュールのMiniMax H3 Taomate 3ステップ加速は明確さを報いるので、矛盾する指示を避けてください。
- 強力な参照画像
- 被写体の顔が見え、衣装が読み取れるクリーンな中間または中広角フレームを使用します。
- カラーシフトを減少させるために、ターゲットシーンと似た照明温度と背景を維持します。
- 高速で安定した反復
- シードをロックしてプロンプトを公正に比較し、1回に1つのコントロールのみを変更します。
- 中程度の解像度で始め、動きと同期を確認し、最終パスで同じシードでスケールアップします。
- スタイルコントロール
- 異なるジャンルのルックを求める場合は、含まれているスタイルLoRAを他のH3互換LoRAに交換します。
- MiniMax H3 Taomate 3ステップ加速の速度プロファイルを保持するために、TaoMate H3加速LoRAをアクティブに保ちます。
謝辞#
このワークフローは、以下の作品とリソースを実装および構築しています。ワークフローのソースを提供してくださったRunningHub.ai、TaoMate-H3プロジェクトとモデルを提供してくださったTaoLiveAIGC、およびMiniMax-H3モデルを提供してくださったMiniMaxAIに心より感謝いたします。権威ある詳細については、以下にリンクされた元のドキュメントとリポジトリを参照してください。
リソース#
- RunningHub.ai/ワークフローソース
- ドキュメント / リリースノート: RunningHub.ai post
- TaoLiveAIGC/TaoMate-H3プロジェクト
- GitHub: TaoLiveAIGC/TaoMate-H3
- Hugging Face: TaoLiveAIGC/TaoMate-H3
- TaoLiveAIGC/TaoMate-H3モデル
- Hugging Face: TaoLiveAIGC/TaoMate-H3
- GitHub: TaoLiveAIGC/TaoMate-H3
- MiniMaxAI/MiniMax H3公式モデル
- Hugging Face: MiniMaxAI/MiniMax-H3
注: 参照されたモデル、データセット、およびコードの使用は、それぞれの著者およびメンテナーによって提供されたライセンスおよび条件に従います。


