ComfyUI>ワークフロー>LTX 2.5 ComfyUI 画像からビデオへ | リアルな動き&ネイティブオーディオ

LTX 2.5 ComfyUI 画像からビデオへ | リアルな動き&ネイティブオーディオ

Workflow Name: RunComfy/LTX-2.5-ComfyUI
Workflow ID: 0000...1489
1枚の画像をシネマティックショートに変換できます。自然言語のプロンプトで動きをガイドし、よりシャープな動きと同期されたオーディオを得ることができます。シーンコントロールを向上させるためにプロンプトエンハンスメントを使用してください。ポートレート、製品、動物、場所をアニメーション化します。追加のセットアップなしでRunComfyでLTX-2.5ワークフローを実行します。

LTX 2.5 ComfyUI Workflow

LTX 2.5 ComfyUI Image to Video | Synced Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

LTX 2.5 ComfyUI Examples

LTX 2.5 ComfyUI 画像からビデオへ 同期されたオーディオ付き#

このRunComfy対応のLTX 2.5 ComfyUIワークフローは、単一の最初のフレームとモーションプロンプトを短いシネマティックビデオに変換し、一貫したインモデルオーディオを提供します。これはLightricks LTX-2.5ファミリーによって駆動され、Pixel Diffusion、Gemmaベースのプロンプトエンハンサー、ビデオおよびオーディオVAE、そしてシャープな動きと強力なプロンプト順守のための潜在スケーリングを組み合わせています。

このLTX 2.5 ComfyUIグラフを使用して、ポートレート、雰囲気のある場所、製品、動物、コンセプトショットをComfyUI内でアニメーション化します。開始画像を提供し、アクションとカメラを説明し、期間とフレームレートを設定し、フレーム全体でキャラクター、照明、スタイルを保持するショットをレンダリングします。

Comfyui LTX 2.5 ComfyUIワークフローの主要モデル#

  • Lightricks LTX-2.5 蒸留変換器。コアイメージからビデオへのジェネレーターは、時間的一貫性のある動きを生成し、オーディオビジュアルの潜在変数を融合します。モデルカード:Lightricks/LTX-2.5
  • LTX-2.5 ビデオVAE。ビデオの潜在変数をより高い忠実度と高速な動きでのスミアが少ないフレームにデコードします。重み:ltx-2.5-video-vae-bf16.safetensors
  • LTX-2.5 オーディオVAE。視覚的なアクションとタイミングに一致する同期されたオーディオを生成します。重み:ltx-2.5-audio-vae-bf16.safetensors
  • LTXプロジェクション付きGemma 4 12Bテキストエンコーダー。豊富なマルチエンティティプロンプトとカメラ方向を解釈します。重み:gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
  • プロンプトエンハンサー用Gemma 4 E2Bインストラクトバリアント。短いプロンプトを低コストでシネマティックな方向に拡張します。重み:gemma4_e2b_it_bf16.safetensors
  • LTX-2.5 潜在空間アップスケーラーx2。デコード前に潜在空間でアップスケールしてディテールをシャープにします。重み:ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors
  • パイプラインとスケジューラーのリファレンス実装:LTX-2.5 Diffusers

Comfyui LTX 2.5 ComfyUIワークフローの使用方法#

このワークフローは、プロンプトを拡張し条件付けし、ビデオとオーディオの潜在変数を構築し、低解像度パスをサンプリングし、潜在スケーリングを実行し、フレームと同期されたオーディオにデコードして最終的なマルチプレクシングを行います。トップレベルのコントローラーはImage to Video (LTX-2.5) (#398)で、最初のフレーム、テキストプロンプト、主要設定を受け取り、サブグラフにルーティングします。

画像の前処理#

Load First Frame (#395)に開始画像を提供します。フレームはLTXVPreprocess (#350)でクリーンでモデルフレンドリーなベースラインに標準化されます。ResolutionSelector (#403)を使用してアスペクトとスケールを選択し、モデルフレンドリーな倍数に整列した幅と高さを出力します。良い最初のフレームはシャープで、照明が良く、計画する動きに合わせて構成されています。前処理は潜在サンプリングのために画像を準備しながら破壊的な変更を回避します。

プロンプトエンハンスメント#

Prompt (#376)に動きとカメラのプロンプトを書いてください。組み込みのエンハンサーを有効にすると、TextGenerateLTX2Prompt (#380)がアクションのビート、連続性、フレーミングに関する詳細でテキストを豊かにします。スイッチャーComfySwitchNode (#382)を使用して、生のテキストまたは強化バージョンを条件付けにルーティングします。このステップは短い入力のプロンプト順守を改善し、フレーム全体で主題とスタイルを維持するのに役立ちます。レンダリング前にPreviewAny (#381)で拡張テキストをプレビューできます。

モデル#

サブグラフはUNETLoader (#384)で蒸留ジェネレーターをロードし、ビデオ(#385)とオーディオ(#386)のデコーダーをVAELoaderでロードします。潜在アップスケーラーモデルは後でクリーンなx2ディテールパスのためにLatentUpscaleModelLoader (#371)で準備されます。これにより、エンコーディング、サンプリング、およびデコード全体でLTX-2.5モデルの同じファミリーが使用され、時間的一貫性が保たれます。

プロンプト#

CLIPLoader (#387)とCLIPTextEncodeポジティブ(#364)があなたの説明的なプロンプトを条件付けに変えます。専用のネガティブエンコーダー(#373)は低品質やアーティファクトのような望ましくない特性を抑制します。LTXVConditioning (#365)はテキスト条件付けを選択したフレームレートと結合し、タイミングガイダンスがオーディオビジュアルの潜在ストリームに流れるようにします。カメラとアクションの言語を明確に保つことで、より安定した動きと編集の自由度が得られます。

ビデオ設定#

Video Settingsグループ(例:Duration (#362)およびFrame Rate (#361))で期間、幅、高さ、フレームレート、シードを設定します。単純な数学ヘルパーがフレーム数を計算し、必要な場所に均一な値を供給します。欲しい感触に合ったフレームレートを選んでください。スローアクションは低fpsでより良く見え、速い動きは高fpsの恩恵を受けます。再現可能なショットにはシードを固定し、代替を探るにはシードを変えてください。

空の潜在#

EmptyLTXVLatentVideo (#356)が適切なサイズと長さのビデオ潜在を作成し、LTXVEmptyLatentAudio (#366)が時間合わせされたオーディオ潜在を構築します。これにより、ビデオとオーディオのストリームが開始時からタイミングを共有します。期間とフレームレートから導出された長さで、サンプラーは正しい形状のテンソルを受け取ります。結果は、共同のオーディオビジュアルデノイジングのための同期された基盤です。

低解像度生成#

最初のサンプリングパスは、管理しやすい解像度で一貫した動きを構築します。LTXVDualCFGGuider (#388)は、テキストとタイミングの両方がビデオとオーディオの潜在を一緒に形成するようにデュアルモダリティガイダンスを適用します。SamplerCustomAdvanced (#344)は選択したサンプラーとスケジュールで拡散ステップを実行し、RandomNoise (#339)でシードされます。最初のフレームの制約は、提供された画像にアイデンティティ、照明、構成を固定するLTXVImgToVideoInplace (#357)によって強制されます。サンプリング後、LTXVConcatAVLatentLTXVSeparateAVLatentが次のステージに必要に応じてオーディオとビデオの潜在をシャッフルします。

潜在アップスケール#

LTXVLatentUpsampler (#348)が潜在空間でのx2アップスケーリングを実行し、デコード前にテクスチャとマイクロディテールをシャープにします。LTXVImgToVideoInplace (#349)がアップスケールされた潜在を開始フレームと再整列し、アイデンティティとレイアウトを安定させます。潜在空間でこれを行うことで、ピクセル空間のリサイズよりも時間的なスムーズさが維持されます。このステージは最終的な鮮明さに大きく貢献します。

高解像度生成#

リファインメントサンプラー(KSamplerSelect (#341)とSamplerCustomAdvanced (#368))が、短いスケジュールでアップスケールされた潜在で実行され、エッジを安定させ、ディテールを豊かにします。LTXVDualCFGGuider (#391)が最初のパスで設定された動きを維持しながら、テキストに一致したガイダンスを保ちます。結合された潜在は、デコードのためにLTXVSeparateAVLatent (#369)によって分割されます。VAEDecodeTiled (#374)がビデオ潜在をフレームに変換し、LTXVAudioVAEDecode (#358)が同期されたオーディオを生成します。

レンダリングと保存#

CreateVideo (#370)が、選択したfpsでフレームとオーディオを単一のビデオストリームにマルチプレクスします。外部グラフでSaveVideo (#75)が結果を通常のComfyUI出力に書き込みます。フルレンダリング前にトップレベルのラッパー内のプレビューノードでオーディオだけを試聴することもできます。

Comfyui LTX 2.5 ComfyUIワークフローのキー ノード#

Image to Video (LTX-2.5) (#398)#

パイプライン全体のワンストップコントローラーです。最初のフレーム、プロンプト、期間、解像度、フレームレート、プロンプトエンハンスメントを有効にするかどうかを提供します。迅速に反復するために使用します。微調整の準備ができたら、サブグラフに入ってサンプラー、ガイダンス、デコードを調整します。テキストのみのビデオが必要な場合は、サブグラフを開いて、画像からビデオへのノードの内部テキストからビデオへのバイパスを切り替えます。

LTXVDualCFGGuider (#388)#

オーディオビジュアルの潜在全体でクラシファイアーフリーガイダンスを適用し、プロンプトの順守と時間的安定性をバランスします。ガイダンスを増やしてプロンプトの順守を強化し、パンチの効いた動きを得ます。フリッカーを減らしたり、開始フレームのニュアンスをより多く保持するためにガイダンスを下げます。ビデオとオーディオのガイダンスを同じ範囲に保つことで、サウンドトラックが画面上のアクションと一致します。

SamplerCustomAdvanced (#344)#

選択したサンプラーとカスタムシグマスケジュールで拡散を駆動します。このノードを使用して、サンプラーのバリエーションを切り替えたり、スケジュールを編集したりして、動きの品質と安定性を探ります。固定シードとペアにして設定を同じ条件で比較し、その後シードをランダム化して最適なテイクを探します。

LTXVLatentUpsampler (#348)#

専用のLTX-2.5 x2モデルで潜在空間でアップスケールし、時間的な揺れを導入せずにディテールを向上させます。重いクロッピングやタイトなクローズアップを計画している場合は、小さな特徴がデコードを生き延びるようにこれを有効に保ちます。極端なVRAM制限のためには、シャープさの一部を犠牲にしてアップスケーリングをバイパスすることができます。

VAEDecodeTiled (#374)#

タイルを使用してメモリ使用量を制御しながら高解像度ビデオ潜在をフレームにデコードします。低VRAMでは、メモリエラーを避けるために小さなタイルを選びます。高VRAMでは、より大きなタイルがシームを減らし、デコードを高速化できます。

CreateVideo (#370)#

デコードされたフレームと生成されたオーディオを選択したフレームレートで単一のビデオストリームに結合します。ここでfpsを調整して、クリエイティブな意図に合わせたり、プラットフォームの要件を満たしたりします。その後、マルチプレクスされた出力は外部グラフのセーバーに渡されます。

オプションの追加機能#

  • プロンプトを簡潔だが具体的に保つ:誰/何、json
RunComfy
著作権 2026 RunComfy. All Rights Reserved.

RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。