ComfyUI MiniMax H3 Talking Digital Human: ポートレートと音声をリップシンクされたアバター動画に#
このワークフローは、正面向きのポートレートと短い音声リファレンスを高品質のトーキングヘッドクリップに変換し、RunComfyで同期された音声を提供します。MiniMax H3のリファレンスからビデオとオーディオを生成するためのQwenVL画像グラウンディングを中心に構築されており、アイデンティティと背景を維持しつつ、サンプルからスピーキングボイスを生成します。ComfyUI MiniMax H3 Talking Digital Humanは、製品説明、プレゼンターアバター、ソーシャル投稿、短いスポークスパーソン動画に最適です。別のTTSやリップシンクスタックは必要ありません。
1つの画像と1つの音声クリップを提供します。このワークフローは顔とシーンのコンパクトな説明を推論し、そのガイダンスでMiniMax H3を条件付け、ビデオフレームと一致するオーディオを統一された潜在空間で共生成します。その結果はダウンロードして共有できる単一のビデオファイルにレンダリングされます。
Comfyui ComfyUI MiniMax H3 Talking Digital Human ワークフローの主要モデル#
- MiniMax H3 Reference-to-Video-and-Audio diffusion model。ポートレートとオプションのオーディオをリファレンスとして使用して、同期されたトーキングヘッドを生成するコアジェネレーター。Comfy-Orgによってホストされ、ComfyUIで簡単に使用できます。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Video VAE。MiniMax H3によって使用される共有潜在空間のビデオ部分をエンコードおよびデコードし、アイデンティティと背景を安定させるのに役立ちます。同じモデルパッケージで配布されています。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Audio VAE。音声が口の動きと一致して生成されるように、共有潜在空間のオーディオ部分をエンコードおよびデコードします。モデルパッケージでも利用可能です。Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 4B Instruct。アップロードされたポートレートの視覚的詳細にプロンプトを基づけるために使用され、アイデンティティ保持とシーンの一貫性を向上させます。Hugging Face: Qwen/Qwen3-VL-4B-Instruct
Comfyui ComfyUI MiniMax H3 Talking Digital Human ワークフローの使い方#
このワークフローは、アップロードと編集セクション、期間ヘルパー、MiniMax H3生成コア、出力ステージの4つのエリアに整理されています。メディア入力から開始し、プロンプトガイダンス、生成の実行、ビデオの保存を行います。
アップロード/編集エリア:通常はここだけ変更してください。他はデフォルトのままにしてください#
LoadImage (#137)を使用して、正面向きのキャラクターポートレートをアップロードします。正面またはほぼ正面のフレーミングで、目と口が見える状態が自然な唇の動きに最適です。LoadAudio (#141)を使用して、模倣したい音色のクリーンな音声サンプルをアップロードします。数秒のトークでバックグラウンドノイズが最小限である必要があります。必要に応じて、AudioCrop (#142)で音声サンプルをトリミングし、アバターが一致するように話されたセグメントの開始と終了を設定します。スタイルやコンテンツガイダンスをPrompt (#138)に追加します。このワークフローは、より一貫性を持たせるために自動的に画像に基づいた詳細を追加します。
ビデオの持続時間(秒):#
持続時間グループの上部にある数値コントロールを使用して、ターゲットの持続時間を設定します。ヘルパーComfyMathExpression (#131)が秒をモデルに適したフレーム数に変換し、サンプラーの要件に合わせます。これにより、タイミングが安定し、音素の途中で切れるのを防ぎます。後で持続時間を変更する場合は、最終的な音声と唇の動きが一致するようにオーディオトリムを更新します。
MiniMax-H3 オープンソース - 画像話すデジタルヒューマン#
これはMiniMaxH3ReferenceToVideo (#136)を中心に構築されたコア生成経路です。このノードは、リファレンス画像としてポートレートを、リファレンスオーディオとしてトリミングされた音声クリップを受け取り、セレクターから幅、高さ、長さを取得します。ポートレートのQwenVLベースの説明があなたの書いたプロンプトと結合され、モデルが視覚的なグラウンディングと指示を受け取るようにします。モデルは、ビデオとオーディオの両方を含む単一の潜在空間を発出し、サンプラースタックによって使用されるコンディショニングも提供されるため、リップシンクが別のリップシンクステージなしで堅牢です。
QwenVLによるプロンプトグラウンディング#
AILab_QwenVL (#152)は、アップロードされたポートレートを分析し、簡潔で事実的な説明を返します。このワークフローはその説明をJoinStrings (#150, #148, #144)経由で指示テキストと連結し、モデルに背景を変更しないように伝え、音声を使用して話す声を生成する最終プロンプトを生成します。この自動グラウンディングにより、アイデンティティと背景の安定性が著しく強化されます。あなたの書いたプロンプトを短く保ち、グラウンディングが正確な顔とシーンの詳細を埋めるようにします。
解像度/ビデオのアスペクト比#
ResolutionSelector (#115)を使用してアスペクトとターゲット解像度を選択します。それはモデルとGPUに適した幅と高さを出力し、コアノードが直接使用します。ポートレートアバターの場合、高いアスペクトは被写体をより多く保持し、自然な頭の動きのためのスペースを残します。テスト後にアスペクト比を調整する場合は、入力ポートレートのフレーミングを一貫して保ち、結果を一貫させます。
出力生成ビデオ#
サンプラー経路はジョイント潜在をデノイズし、VAEDecode (#122)がそれをフレームに変換し、VAEDecodeAudio (#121)がそれを波形に変換します。CreateVideo (#130)がフレームとオーディオを選択したフレームレートで単一のクリップに統合し、SaveVideo (#92)がファイルを書き込みます。保存された結果には、同じ生成実行からの画像と同期された声が含まれています。ダウンロードしてレビューし、タイミングが合わないと感じた場合は、オーディオトリムまたは持続時間を調整して再実行します。
Comfyui ComfyUI MiniMax H3 Talking Digital Human ワークフローの主要ノード#
MiniMaxH3ReferenceToVideo (#136)#
リファレンスポートレートと音声サンプルを受け入れてビデオとオーディオを共生成するパイプラインの中心。コンテンツとスタイルのためのprompt、フレーミングのためのwidthとheight、フレームでの持続時間のためのlengthがキーコントロールです。最初の参照画像として1つのシャープなポートレートを使用し、ref_image_sizeを一致させて顔のプロポーションを正しく転送します。ドリフトや背景の変更が見られる場合は、指示テキストを強化して背景を明示的に変更しないようにします。
ResolutionSelector (#115)#
アスペクト比と全体のピクセル数を設定し、モデルに適した倍数に揃えた幅と高さを発出します。ポートレートのクロップに一致するアスペクトを選び、リサンプリングアーティファクトを減らします。解像度全体を増やすと詳細が向上する可能性がありますが、VRAMと時間も増加します。スケールアップする前に小さな設定でテストしてください。アイデンティティを再現可能にするために、実行間でフレーミングを一貫して保ちます。
AudioCrop (#142)#
アップロードされたリファレンス音声をアバターが話すセグメントにトリミングします。開始と終了を話された部分に設定し、自然なオンセットとオフセットのために末端に小さなサイレンスのマージンを残します。トリミングされた音声の長さをターゲットビデオの持続時間に一致させることで、ジェネレーターが音素と口の形を一致させるのに役立ちます。破裂音や摩擦音が不適切に見える場合は、クリーンな録音を試すか、トリミング範囲を短縮します。
AILab_QwenVL (#152)#
画像に基づいた説明を生成し、自動的にプロンプトに追加します。これにより、顔、髪、服装、背景に関する具体的な詳細が追加され、モデルがアイデンティティとシーンを保持するのに役立ちます。グラウンディングされた説明がスタイルを過度に制約する場合は、書かれたプロンプトをミニマルでニュートラルに保ち、グラウンディングがその役割を果たせるようにします。複数のキャラクターがいる画像の場合は、説明が単一の被写体に焦点を当てるようにタイトなクロップをアップロードします。
CreateVideo (#130)#
デコードされたフレームとオーディオを単一の再生可能なファイルに結合します。下流のタイムラインに合わせる必要がある場合はfpsを変更できますが、以前の持続時間からフレームへの変換と一致させてください。特定のプラットフォームでスタッターが見られる場合は、そのプラットフォームに一般的なフレームレートで再エクスポートしてください。bit_depthコントロールはウェブ配信のためにデフォルトのままにすることができます。
ComfyMathExpression (#131)#
秒単位の持続時間をジェネレーターの有効なフレーム数に変換し、サンプラーのストライドに合わせます。これにより、タイミングのずれを引き起こす部分ステップが防止されます。下流でフレームレートを変更する場合は、持続時間を再検討して口の動きを音節に合わせてください。このノードを全体の実行のタイミングの真実の源として扱ってください。
オプションの追加機能#
- 目と口が遮られていない均一に照らされたポートレートを使用すると、最も自然な発音が得られます。
- 静かな部屋で5〜10秒間のクリアな音声を録音します。リファレンスクリップには音楽や重い圧縮を避けてください。
- 再現可能な結果を得るために、
RandomNoise(#129)でRandomNoiseシードを固定し、実行間でランダム化しないでください。 - キャプションが必要な場合は、プロンプトに焼き込むのではなく、投稿で追加してください。モデルが顔と声に集中できるようにします。
- 実際の人物のComfyUI MiniMax H3 Talking Digital Humanを作成する際には、肖像権と音声権を尊重してください。
謝辞#
このワークフローは、以下の作品とリソースを実装および構築しています。MiniMax H3モデル、Comfy-OrgによるMiniMax-H3モデルウェイト、Comfy.orgによるMiniMax H3チュートリアルへの貢献とメンテナンスに感謝します。正式な詳細については、以下にリンクされた元のドキュメントとリポジトリを参照してください。
リソース#
- MiniMax/MiniMax H3公式発表
- Docs / リリースノート: MiniMax H3公式発表
- Comfy-Org/MiniMax-H3モデルウェイト
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org/MiniMax H3チュートリアル
- GitHub: comfy-org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- Docs / リリースノート: Comfy.org MiniMax H3チュートリアル
注: 参照されたモデル、データセット、およびコードの使用は、それぞれの著者およびメンテナによって提供されるライセンスおよび条件に従います。
