LTX 2.3 話すと歌うリップシンク: ポートレートからパフォーマンスへのComfyUIワークフロー#
LTX 2.3 話すと歌うリップシンクは、正面向きの明確なポートレートと声または歌を表情豊かで同期された口の動きのあるシネマティックデジタルヒューマンビデオに変えます。RunComfy用に構築されており、LTX 2.3ビデオ生成をLTXV ComfyUIノードとMel-Band RoFormer音声分離を使用して、顔を読みやすく保ちながらスピーチや歌詞を一致させます。
このComfyUIワークフローは、AIミュージックビデオ、バーチャルシンガー、キャラクターパフォーマンステスト、クリエーターデモに適しており、画面上のパフォーマーと最終音声の両方を使用可能な状態に保ちます。ポートレート画像と音声トラックを提供し、フレームレートと期間を選択すると、パイプラインがトラックに一致したリップシンクでmp4をレンダリングします。
Note: 特に印象的な結果を得るには、Ace Step Modelで歌を生成し、その後Seedream 5.0 Proで明確なシネマティックポートレートを作成することを強くお勧めします。これらの2つのアセットを音声およびポートレート入力として使用すると、より洗練された歌うデジタルヒューマンパフォーマンスを得ることができます。
Comfyui LTX 2.3 話すと歌うリップシンクワークフローの主要モデル#
- LightricksによるLTX-2.3ビデオ生成モデル。音声特徴と視覚的動きを結合して、話すと歌うのに適した時間的に一貫したフレームを生成するトランスフォーマーベースのオーディオビデオ生成器。モデルカードおよび公式リポジトリ。
- LTX-2.3 Video VAEおよびAudio VAE。LTX-2.3で使用されるAV潜在空間にビデオと音声をパックする潜在エンコーダー/デコーダーで、効率的なサンプリングとクリーンな再構築を保証します。LTX ComfyUI統合に実装されています。ComfyUI-LTXVideo。
- MelBandRoFormer。ここで使用される現代的な音楽ソース分離モデルで、よりクリーンなリップコンディショニングのためにボーカルを抽出するオプションがあります。WeightsおよびComfyUIノード。
Comfyui LTX 2.3 話すと歌うリップシンクワークフローの使い方#
ワークフローは、入力、LTX 2.3生成、エクスポートの3段階で実行されます。グループはエンドツーエンドで協力し、ポートレートと音声を同期されたパフォーマンスに変えます。
INPUT#
Character Image (front view + 9:16, recommended) (#444)を使用して正面向きのポートレートをロードします。画像はモデル用にリサイズされ、アイデンティティと口の領域の詳細を保存するために軽く前処理されます。Upload Song or Voice (#1755)で歌や声をアップロードし、イントロのバーや無音をスキップしたい場合はStart lip-sync from which second? e.g. 10.0 (seconds) (#1776)を設定します。Duration in seconds (best under 35s; enter 0 for full audio) (#1583)で期間を選択し、レンダリング用にFrame Rate (#1586)を設定します。表情やカメラの動作をガイドするためにPrompt (#1624)に意図を記述します。ワークフローはまた、字幕、透かし、静的フレームを避けるための役立つネガティブキューを注入します。
LTX2.3デジタルヒューマン話す/歌うリップシンク#
LTXV Preprocess (#446)とLTXVImgToVideoInplaceKJ (#1762)によってポートレートが開始潜在クリップに変換されます。IMG STRENGTH. Set 0 for T2I mode (#1722)を使用してポートレートの強制力を制御します。高い値は写真にロックされ、低い値はより生成的な動きを可能にします。音声パスはアップロードをトリミングし、Mel-Band RoFormer Sampler (#1599)でボーカルをオプションで分離し、選択したトラックをLTXV Audio VAE Encode (#1605)でエンコードします。音声とビデオの潜在はLTXV Concat AV Latent (#350)で統合され、CLIP Text Encodeノードからのテキスト条件付けにより、全体のシーンの意図と清潔さが駆動されます。LTX2 NAG (#508)を使用してリップの精度を高め、選択したスケジューラとサンプラーの下でSamplerCustomAdvanced (#161)でサンプリングされます。
エクスポートと保存#
サンプリング後、ビデオ潜在はVAE Decode (#1318)でフレームにデコードされます。Video Combine 🎥🅥🅗🅢 (#1747)は、トリミングされたオリジナル音声とこれらのフレームを結合し、選択したフレームレートでmp4を生成します。コンディショニング用にボーカルのみを有効にした場合でも、最終エクスポートではフルミックスが使用されるため、結果は共有する準備が整っています。出力は、簡単にバージョン管理できるように明確なプレフィックスで保存されます。
Comfyui LTX 2.3 話すと歌うリップシンクワークフローの主要ノード#
LTXVImgToVideoInplaceKJ (#1762)#
参照ポートレートを初期潜在ビデオに変換します。IMG STRENGTH. Set 0 for T2I mode (#1722)を調整して、アイデンティティのロックと動きの自由度のバランスを取ります。外観と安定した頭のポーズを維持するには強度を高く保ち、よりパフォーマンス的な動きを求める場合は減らします。0に設定した場合は、ワークフローをテキストからビデオとして扱い、プロンプトと音声により依存します。
Mel-Band RoFormer Sampler (#1599)#
歌からボーカルを分離して、よりクリーンな音声特徴をモデルに供給します。楽器が子音を隠す場合や、子音が失われる場合はUSE VOCALS ONLY (#1616)を使用します。フルミックスが表現力に影響を与えるようにしたい場合はオフにしておきます。最終レンダリングでは元のトリミングされた音声が使用され、意図したサウンドトラックが保持されます。ComfyUI拡張とリンクされたウェイトでモデルの詳細を確認してください。
LTXV Audio VAE Encode (#1605)#
選択した音声を口の形状と微表情を駆動するLTXオーディオ潜在空間にエンコードします。エンコード前に明らかな無音をトリミングして、より迅速なアラインメントを実現します。歌詞のエントリーが0秒から始まらない場合は、開始時間のオフセットと組み合わせてください。
LTX2 NAG (#508)#
LTX 2.3用にノイズ増強ガイダンスを適用して、音声とリップの結合をシャープにします。リップがアニメーション不足と感じる場合はガイダンスを少し上げ、歯や口の形状が過剰に駆動される場合は効果を下げます。プロンプトの強度とサンプラーの設定と相互作用するため、小さなインクリメンタル変更が最適です。参照実装はLTXリポジトリにあります。
SamplerCustomAdvanced (#161)#
選択したKSamplerSelect (#154)、CFG Guider (#153)、およびスケジューラでノイズ除去プロセスを実行します。低い分類子フリーガイダンスは一般に自然な動きとアイデンティティの保持を好みますが、高い値はプロンプトの支配を増し、リップを硬直させる可能性があります。サンプラーを切り替える場合は、フェアなA/B比較のために残りの設定をそのまま維持してください。
Video Combine 🎥🅥🅗🅢 (#1747)#
フレームとトリミングされた音声を組み合わせて最終的なmp4を書き込みます。後でカラーグレーディングを計画している場合は、品質を向上させるか、広い互換性のためにデフォルトのままにしておきます。frame_rateがクリエイティブな意図に一致し、以前に設定したものに一致していることを確認してください。
オプションの追加機能#
- 最も説得力のあるLTX 2.3 話すと歌うリップシンクの結果を得るには、クリーンで正面向きのポートレートを中立的な照明と9:16のクロップで使用してください。
- 楽器が子音を隠す場合は、
USE VOCALS ONLY(#1616)を有効にして、モデルがよりクリーンなボーカルステムに基づいて条件付けされるようにし、エクスポートはフルミックスを保持します。 - 約35秒以下のクリップを保持して、より速い反復を行い、長いミュージックビデオを構築する場合は外部でテイクをステッチします。
- 動きが静的すぎる場合は
IMG STRENGTHを下げ、アイデンティティがずれる場合はそれを上げ、プロンプトを簡素化します。 - リップシェイプが最初の単語に正確に始まるように、リードインサイレンスをトリミングし、開始時間オフセットコントロールを使用して歌詞を整列させます。
- テイクを再現するために固定
Start Seedを設定し、代替案にはシードを変えてください。 - 公開プロジェクトでこのLTX 2.3 話すと歌うリップシンクワークフローを使用する際は、肖像権と音楽の権利を尊重してください。
公式リソースへのリンク
- LTX-2.3モデルカード: Lightricks/LTX-2.3
- LTX-Videoリポジトリ: Lightricks/ltx-video
- ComfyUI-LTXVideo: Lightricks/ComfyUI-LTXVideo
- ComfyUI-MelBandRoFormer: kijai/ComfyUI-MelBandRoFormer
- MelBandRoFormer weights: Kijai/MelBandRoFormer_comfy
謝辞#
このワークフローは以下の作品とリソースを実装し、基づいています。LTX-Video(LTX 2.3モデルとComfyUI-LTXVideoノードを含む)を提供してくれたLightricks、MelBandRoFormer(ComfyUIノードとモデルの重み)を提供してくれたKijai、そしてワークフローのソース記事を提供してくれたRunningHubの貢献とメンテナンスに感謝します。権威ある詳細については、以下にリンクされているオリジナルのドキュメントとリポジトリを参照してください。
リソース#
- RunningHub/RunningHubワークフローソース
- ドキュメント / リリースノート: RunningHub Post
- Lightricks/LTX 2.3モデル
- GitHub: Lightricks/ltx-video
- Hugging Face: Lightricks/LTX-2.3
- Lightricks/LTX-Video公式リポジトリ
- GitHub: Lightricks/ltx-video
- Hugging Face: Lightricks/LTX-2.3
- Lightricks/ComfyUI-LTXVideoノード
- GitHub: Lightricks/ComfyUI-LTXVideo
- Kijai/ComfyUI-MelBandRoFormerノード
- GitHub: kijai/ComfyUI-MelBandRoFormer
- Hugging Face: Kijai/MelBandRoFormer_comfy
- Kijai/MelBandRoFormer ComfyUIモデルの重み
- Hugging Face: Kijai/MelBandRoFormer_comfy
- GitHub: kijai/ComfyUI-MelBandRoFormer
Notejson
: 参照されているモデル、データセット、コードの使用は、それぞれの著者および管理者によって提供されたライセンスおよび条件に従います。


