MiniMax H3 ComfyUI トーキングとシンギング デュアルキャラクター 4ステップ加速#
このRunComfy対応ワークフローは、2つのポートレート静止画と短いスピーチまたは歌のトラックを1つのリップシンクしたビデオに変換します。両キャラクターがシーンを共有します。公式のTurbo LoRAを使用したMiniMax H3の参照からビデオへの基盤で構築され、少ないステップの生成を提供しつつ、両方のアイデンティティを安定させ、口の動きを音源にロックします。
MiniMax H3 ComfyUI トーキングとシンギング デュアルキャラクター 4ステップ加速は、デュエット、2人の対話のビート、トレーラー、またはクイックパフォーマンスプレビューに最適です。2枚の画像と1つのオーディオファイルを持ち込み、短いプロンプトを追加し、サイズを選び、グラフが元のサウンドトラックを保持したままmp4をレンダリングします。
Comfyui MiniMax H3 ComfyUI トーキングとシンギング デュアルキャラクター 4ステップ加速ワークフローのキーとなるモデル#
- MiniMax-H3 reference-to-video backbone from Comfy-Org — あなたの参照とテキストをオーディオビジュアル潜在にマッピングする生成モデル。 Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — ビデオ潜在をエンコード・デコードし、フレームが効率的に除去され、忠実に再構築されるようにします。モデルパックに含まれています。 Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — あなたのトラックからリップモーションとタイミングを学習するための潜在空間でドライビングオーディオを表します。モデルパックに含まれています。 Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B text encoder (AWQ/NVFP variants packaged for H3) — デュアルキャラクター構成のためのシーン、スタイル、ショット意図を設定するためにあなたのプロンプトを解釈します。モデルパックに含まれています。 Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA — サンプリングを加速し、アイデンティティとリップシンクを保持しながら、わずか4つのデノイズステップでレンダリングできます。 Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Comfyui MiniMax H3 ComfyUI トーキングとシンギング デュアルキャラクター 4ステップ加速の使用方法#
このグラフは左から右に流れます:2つのキャラクター静止画と1つのオーディオクリップをロードし、プロンプトとサイズを設定し、コアH3パスが参照とオーディオをAV潜在に融合します。短いオーディオロックステージは、元のサウンドトラックを保持しながらリップモーションを駆動し、Turbo LoRAを使用したサンプラーが少ないステップでデノイズを行い、最終的なビデオを組み立てます。
- 画像をアップロード (キャラクターA)
- キャラクターAのクリアで正面を向いた静止画を
LoadImage(#227)にドロップします。キャラクターBに似た頭のサイズと照明を好み、安定した共存を実現します。背景はシンプルでもかまいません;アイデンティティとポーズが優先です。このノードはH3参照スタックにフィードされ、モデルが共有シーンの最初のスピーカーを学習します。
- キャラクターAのクリアで正面を向いた静止画を
- 画像をアップロード (キャラクターB)
LoadImage(#137)にキャラクターBを提供します。フレーミング、オリエンテーション、表情をキャラクターAと大体同じに保ち、ショット間のドリフトを減らします。この2番目の参照は、H3が両者が互いに話したり歌ったりしている2ショットを合成するのに役立ちます。
- オーディオをアップロード
LoadAudio(#171)に対話やボーカルを追加します。AudioCrop(#177)を使用して開始と終了時間を設定し、クリップの長さがセグメントに一致するようにします。クリーンで中心のオーディオが口の発音を改善し、タイミングのずれを減らします。
- プロンプト
Input Text (Prompt)(#138)でショットを説明します。短く映画的な表現がよく機能します。例えば、カメラの距離、背景、ムードを2人のキャラクターのために説明します。プロンプトはレイアウトとスタイルを導きますが、静止画からのアイデンティティのガイダンスやトラックからのタイミングを置き換えることはありません。
- 解像度セレクター (サイズ)
Resolution Selector (Size)(#115)でアスペクトとターゲットサイズを選びます。セレクターはすでにモデルに優しいマルチプルに整列した幅と高さを出力し、ディテールと速度のバランスをとります。内蔵のサイズノートはすぐに使える16:9のプリセットを提供し、GPU予算に合うメガピクセル階層を選択できます。
- 結果
- フレームはデコードされ、元のオーディオと共に
VHS_VideoCombine(#142)でmp4として結合されます。レンダリングがわずかに長すぎたり短すぎたりする場合は、このステップのトグルを使用してオーディオの長さに合わせてトリムします。ファイル名とフォーマットは迅速な反復のために事前に構成されています。
- フレームはデコードされ、元のオーディオと共に
- コア (変更しないでください)
- この保護されたエリア内で、
MiniMaxH3ReferenceToVideo(#136)は、両方の参照画像、プロンプト、クロップされたオーディオを統合したAV潜在と正のコンディショニングに融合します。VRGDG_MiniMaxH3AudioDrive(#172)は、リップシンクがトラックに従うように音源オーディオをロックし、サウンドトラックは変更されずに通過します。UNetはメモリ効率のためにパッチが当てられており、LoraLoaderModelOnly(#234)がTurbo 4ステップLoRAを適用してサンプラーがデノイズし、VAEDecodeがフレームを再構築します。これらの内部は安定性と速度のために調整されており、通常は調整する必要はありません。
- この保護されたエリア内で、
Comfyui MiniMax H3 ComfyUI トーキングとシンギング デュアルキャラクター 4ステップ加速ワークフローのキーとなるノード#
MiniMaxH3ReferenceToVideo(#136)- グラフの中心で、両キャラクター静止画、プロンプト、幅、高さ、自動計算されたクリップの長さを取り込みます。また、クロップされたオーディオを参照として受け入れ、音素のタイミングとビセムの形状がサウンドトラックに一致します。より厳密なコントロールが必要な場合は、
prompt、width、heightを直接調整するか、特別なタイミングのためにlengthをオーバーライドできます。
- グラフの中心で、両キャラクター静止画、プロンプト、幅、高さ、自動計算されたクリップの長さを取り込みます。また、クロップされたオーディオを参照として受け入れ、音素のタイミングとビセムの形状がサウンドトラックに一致します。より厳密なコントロールが必要な場合は、
VRGDG_MiniMaxH3AudioDrive(#172)- 提供された音源オーディオにリップモーションをロックし、最終ビデオが同じオーディオトラックを使用することを保証します。正確な歌詞や対話のタイミングを希望する場合は、生成オーディオの変更を加えずに使用します。クリーンなボーカルや対話をフィードすると最良の結果が得られます。
LoraLoaderModelOnly(#234)- MiniMax-H3 Turbo 4-step LoRAをロードし、サンプラーが非常に少ないステップで収束できるようにします。より遅いが保守的なデノイズを希望する場合は、LoRAの影響を減らすことができます;最大速度を希望する場合は、デフォルトの強度を維持します。モデルの参照:MiniMax-H3 Turbo LoRA。
SamplerCustomAdvanced(#125)- 上流で選択されたスケジューラーとサンプラーを使用して実際のデノイズを実行します。Turbo LoRAがアクティブな場合、最小ステップで素早くレンダリングできます;動きの不安定さを感じた場合はステップを増やしてください。シードコントロールは
RandomNoise(#129)から来ており、再現可能なテイクを可能にします。
- 上流で選択されたスケジューラーとサンプラーを使用して実際のデノイズを実行します。Turbo LoRAがアクティブな場合、最小ステップで素早くレンダリングできます;動きの不安定さを感じた場合はステップを増やしてください。シードコントロールは
Resolution Selector (Size)(#115)- モデルに整列した幅と高さを出力し、マルチプルやアスペクトの計算をする必要がありません。プレビュー、中間、最終サイズ間をジャンプし、構成を一貫して保持するのに使用します。大きなサイズはアイデンティティのディテールを増加させますが、より多くのVRAMと時間を必要とします。
AudioCrop(#177)- 入力オーディオをアニメーション化したい正確なセグメントにトリムします。これを使用して、静寂をカットしたり、詩や対話のビートを分離します。クリーンな開始と終了ポイントは口の開閉のタイミングに役立ちます。
VHS_VideoCombine(#142)- デコードされたフレームと通過オーディオを共有可能なmp4に組み立てます。内蔵のオプションを使用して、サウンドトラックに期間を合わせ、ファイル名の慣例を設定します。これはMiniMax H3 ComfyUI トーキングとシンギング デュアルキャラクター 4ステップ加速の最終的なデリバリーステップです。
オプションの追加#
- 両方の画像で主題のスケールと顔の角度を一致させ、アイデンティティのドリフトを最小限に抑えます。
- プロンプトを簡潔で視覚的に保ちます:カメラの距離、設定、ムード、照明の手がかり。
- 変化を信頼してA/Bできるように、ノイズシードを使用します。
- クリップが少しオーバーシュートする場合は、結合ステップでトリミングを有効にして、フレーム精度の同期を実現します。
- 中間層の解像度から始め、ブロッキングとタイミングが正しいことを確認したらスケールアップします。
謝辞#
このワークフローは、以下の作品とリソースを実装し、構築しています。MiniMax ResearchのMiniMax H3、Comfy.orgのComfyUI MiniMax H3チュートリアル、Comfy-OrgとlarryvrhのMiniMax-H3モデルウェイトとMiniMax-H3 Turbo LoRAの貢献とメンテナンスに心より感謝します。権威ある詳細については、以下にリンクされた元のドキュメントとリポジトリを参照してください。
リソース#
- MiniMax Research/MiniMax H3公式発表
- ドキュメント / リリースノート: MiniMax H3公式発表
- Comfy.org/MiniMax H3チュートリアル
- GitHub: Comfy-Org/docs
- ドキュメント / リリースノート: Comfy.org MiniMax H3チュートリアル
- Comfy-Org/MiniMax-H3モデルウェイト
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
注: 参照されたモデル、データセット、およびコードの使用は、それぞれの著者およびメンテナによって提供されたライセンスおよび条件に従います。



