LTX 2.5 GGUF ComfyUI 画像から動画への変換と同期音声#
このLTX 2.5 GGUF ComfyUIワークフローは、単一のソース画像と自然言語プロンプトを短編動画に変換し、生成された同期音声トラックを追加します。公式のLTX-2.5モデルファミリーを使用して動画と音声を生成し、GGUF量子化されたUNetパスを介してVRAMを削減しながら、シネマティックな動きとシーンの一貫性を維持します。
グラフは、キャラクターショット、機械、環境移動の迅速な反復のために設計されています。画像から動画またはテキストから動画へのスイッチ、2段階の潜在パイプライン(粗いパスと潜在アップスケーリング)、タイルデコードを含んでおり、メモリ負荷を低く保ちます。コンパクトで実用的なプロダクション対応のパスが必要な場合、このLTX 2.5 GGUF ComfyUIワークフローは実用的な出発点です。
ComfyUI LTX 2.5 GGUF ComfyUIワークフローの主要モデル#
- LTX-2.5 (公式, Lightricksによる)。動きの合成とマルチモーダルガイダンスに使用されるコア動画と音声生成モデル。モデルカード
- LTX-2.5 Video VAE (bf16)。効率的な生成のために動画潜在をエンコードおよびデコードし、メインモデルとペアリングされます。LTX-2.5リポジトリのvae/に含まれています。Video VAE
- LTX-2.5 Audio VAE (bf16)。音声潜在経路を処理し、最終レンダーに同期された音声を含めます。LTX-2.5リポジトリのvae/に含まれています。Audio VAE
- Gemmaベースの12BテキストエンコーダーとLTX-2.5プロジェクション。LTX-2.5に一致するプロンプト埋め込みを提供し、LTXリポジトリのtext_encoders/でパッケージされています。テキストエンコーダー
- LTX-2.5 Latent Spatial Upscaler x2 1.0。粗いパスの後に詳細を追加する潜在空間超解像モデル。アップスケーラー
- LTX-2.5 Distilled UNet (GGUF量子化)。ComfyUI-GGUFローダーを介してロードされる量子化されたUNetウェイトで、メモリ使用量を削減しながら品質を維持します。GGUFは推論フォーマットであり、公式モデル名ではありません。ComfyUI-GGUF
ComfyUI LTX 2.5 GGUF ComfyUIワークフローの使用方法#
パイプラインは2段階で実行されます。ガイド付き低解像度パスで動きとタイミングを確立し、その後に潜在アップスケーリングと高解像度の精緻化を行います。音声はペアリングされた潜在として通過し、最終フレームとデコードされてマックスされます。
モデル#
UnetLoaderGGUF (#406)でGGUF量子化UNetをロードします。VAELoader (#385, #386)で動画と音声VAEを選択し、CLIPLoader (#387)でGemmaベースのテキストエンコーダーが提供されます。アップスケーラーはLatentUpscaleModelLoader (#371)で選択されます。このグループは、他のすべてのグループが依存するバックボーンを定義します。
プロンプト#
Promptフィールドにシーンの説明を書き込み、被写体、動き、単一の明確なカメラ移動に焦点を当てます。テキストエンコーダーはLTXVConditioning (#365)を通じてポジティブおよびネガティブプロンプトを埋め込み、タイミングを合わせるために選択されたフレームレートも受け入れます。スピーチのような音声が必要な場合は、短い引用符付きの行を含めてください。音声経路はテキストコンテキストに応じて反応し、シーンに注意を払います。プロンプトを簡潔かつ具体的に保ち、矛盾するガイダンスを避けてください。
動画設定#
持続時間、フレームレート、ターゲットサイズを設定します。ユーティリティは秒とfpsをフレームカウントに変換し、グラフが正しい時間的長さを割り当てるようにします。安定性と速度のために32の倍数のサイズを使用してください。共通のアスペクト比を選択し、希望のスケールに調整します。
画像前処理#
最初の(参照)フレームをロードし、LTXVPreprocess (#350)でLTX-2.5用に正規化します。スイッチSwitch to Text to Video? (#363)は、画像が空間アンカーとして使用されるか、純粋なテキストから動画への変換のためにバイパスされるかを制御します。リサイズヘルパーは入力を作業解像度と一致させます。良好な前処理はアイデンティティの保存とレイアウトを改善します。
空の潜在#
EmptyLTXVLatentVideo (#356)とLTXVEmptyLatentAudio (#366)は動画と音声の時間的キャンバスを事前割り当てします。これらの長さは、持続時間とfpsの選択から来ています。この分離は、動画と音声経路がサンプリングと精緻化を通じて同期したままであることを保証します。
低解像度生成#
最初のサンプラーブロックは、プロンプト条件付けとともにLTXVDualCFGGuider (#388)を使用して動きとシーンのダイナミクスを駆動し、SamplerCustomAdvanced (#344)で粗い潜在を合成します。画像から動画への変換を行う場合、LTXVImgToVideoInplace (#357)が参照フレームを潜在に注入し、アイデンティティと構成を安定させます。これはテキストから動画への変換ではバイパスされます。このパスは意図的に軽く、アップスケーリング前に動きとタイミングを確立します。
潜在アップスケール#
LTXVSeparateAVLatent (#367)は音声と動画を分離し、動画潜在をLTXVLatentUpsampler (#348)でx2モデルを使用して強化します。前処理された画像は、アップスケール後に詳細を一貫して保持するためにLTXVImgToVideoInplace (#349)で再適用されます。その後、音声潜在はLTXVConcatAVLatent (#340)を介して再結合され、同期を保持します。
高解像度生成#
2番目のサンプラーブロック(LTXVDualCFGGuider (#391)とSamplerCustomAdvanced (#368))は、より高いスケールで詳細と時間的一貫性を精緻化します。LTXVSeparateAVLatent (#369)は音声をLTXVAudioVAEDecode (#358)に渡し、動画潜在はVAEDecodeTiled (#374)でデコードされ、VRAMのピークを抑えます。CreateVideo (#370)は、フレームと音声を最終的なMP4に組み立てます。
ComfyUI LTX 2.5 GGUF ComfyUIワークフローの主要ノード#
UnetLoaderGGUF (#406)#
LTX-2.5蒸留UNetをGGUFフォーマットでロードします。VRAM予算に一致する量子化ファイルを選択します。軽い量子化はメモリを削減し、推論速度を向上させますが、品質にはいくらかのコストがかかります。より少ない量子化ファイルにアップグレードする場合、テクスチャのシャープさと細かい動きの安定性が向上します。
LTXVImgToVideoInplace (#357と#349)#
最初のフレームを潜在に注入し、動きが画像から進化するようにします。画像から動画への変換とテキストから動画への変換を切り替えるときにbypass入力を切り替えます。低解像度ノード (#357)は初期安定化に使用し、高解像度ノード (#349)はアップスケーリング後の詳細を再アンカーするために使用します。
LTXVLatentUpsampler (#348)#
LTX-2.5潜在空間アップスケーラーを適用し、ピクセルにデコードせずに詳細を追加します。粗いパスとほぼ同じメモリコストでより多くの定義が必要な場合に使用します。アップスケーリング後にちらつきが見られる場合は、次の精緻化段階でガイダンスを少し強化してください。
ManualSigmas (#397と#396)#
サンプラーで使用されるノイズスケジュールを制御します。短いスケジュールは速いですが、適合性や時間的スムーズさを減少させる可能性があります。長いまたは前面にロードされたスケジュールは、追加コストで安定性を向上させます。サンプラーの選択とペアリングして、シーンの速度と品質のバランスを取ります。
VAEDecodeTiled (#374)#
タイルを使用して高解像度の動画潜在をフレームにデコードし、VRAM使用量を制限します。メモリが不足する場合、タイルサイズを縮小するか、より強力なタイルを有効にします。シームが見られる場合は、オーバーラップを増やすか、より大きなタイルを試してください。VAEの選択を公式のLTX-2.5動画VAEと一致させてください。
CreateVideo (#370)#
画像シーケンスとデコードされた音声を最終動画ファイルにマックスします。生成フレームレートに一致するようにfpsを設定し、時間の伸縮を避けます。反復間で一貫した出力を得るための単一のレンダーポイントとしてこれを使用します。
オプションの追加機能#
- 画像から動画への変換では、1つの明確なカメラ移動と被写体の動作を説明してください。複数の競合する動きは避けてください。
- テキストから動画への変換では、プロンプトを簡潔に保ち、適切な場合はスピーチのような音声のために短い引用符付きの行を追加してください。
- 解像度のヒント:32の倍数を使用してください。一般的な16:9サイズには960x544(速い)と1344x768または1504x832(シャープ)が含まれます。VRAMの余裕がある場合にのみ増加させてください。
- プロンプトが無視される場合、サンプラーブロックでガイダンスを増やすか、プロンプト言語を簡素化してください。
- 実行間での再現性のために、ノイズノードで固定シードを設定します。ランダムシードは探索に最適です。
- VRAMが不足している場合、利用可能なGGUF Qレベルを優先し、アップスケーラーを有効に保ちます。最小限のメモリコストで詳細を追加します。
参照用リンク:公式のLTX-2.5モデルとアセットはHugging Faceにあり、GGUF UNetローダーはComfyUI-GGUFから提供されます。
- LTX-2.5モデルとアセット:Lightricks/LTX-2.5
- GGUFローダー:city96/ComfyUI-GGUF
謝辞#
このワークフローは、以下の作品とリソースを実装および構築しています。我々は、LightricksによるLTX-2.5とcity96によるComfyUI-GGUFの貢献とメンテナンスに感謝します。権威ある詳細については、以下のリンクされたオリジナルのドキュメントとリポジトリを参照してください。
リソース#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
注:参照されたモデル、データセット、およびコードの使用は、それぞれの著者およびメンテナによって提供されたライセンスおよび条件に従います。


