LTX 2.5 ComfyUI 圖像轉視頻,具有同步音頻#
這個適合 RunComfy 的 LTX 2.5 ComfyUI 工作流程將單個第一幀和運動提示轉換為短片式的電影視頻,並具有一致的模型內音頻。它由 Lightricks LTX-2.5 系列驅動,結合了 Pixel Diffusion、基於 Gemma 的提示增強器、視頻和音頻 VAE 以及潛在升級以實現清晰的運動和強有力的提示遵從性。
使用這個 LTX 2.5 ComfyUI 圖表來動畫化人像、氛圍地點、產品、動物和概念鏡頭,同時保持在 ComfyUI 內。提供起始圖像,描述動作和攝影機,設置持續時間和幀率,並渲染一個在幀間保持角色、照明和風格的鏡頭。
Comfyui LTX 2.5 ComfyUI 工作流程中的關鍵模型#
- Lightricks LTX-2.5 蒸餾變壓器。核心圖像到視頻生成器產生時間一致的運動並融合音視頻潛在變量。模型卡:Lightricks/LTX-2.5。
- LTX-2.5 Video VAE。將視頻潛在變量解碼為具有更高保真度和較少模糊的幀。權重:ltx-2.5-video-vae-bf16.safetensors。
- LTX-2.5 Audio VAE。生成同步音頻以匹配視覺動作和時間。權重:ltx-2.5-audio-vae-bf16.safetensors。
- Gemma 4 12B 文本編碼器與 LTX 投影。解釋豐富的多實體提示和攝像機方向。權重:gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors。
- Gemma 4 E2B 指導變體用於提示增強器。以低計算成本將短提示擴展為電影方向。權重:gemma4_e2b_it_bf16.safetensors。
- LTX-2.5 Latent Spatial Upscaler x2。在解碼前在潛在空間中升級以銳化細節。權重:ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors。
- 管道和調度器的參考實現:LTX-2.5 Diffusers。
如何使用 Comfyui LTX 2.5 ComfyUI 工作流程#
此工作流程擴展和調整您的提示,構建視頻和音頻潛在變量,採樣低分辨率通過,進行潛在放大,然後解碼為幀和同步音頻以進行最終混合。頂級控制器是 Image to Video (LTX-2.5) (#398),它接收您的第一幀、文本提示和關鍵設置,然後路由到子圖。
圖像預處理#
將您的起始圖像提供給 Load First Frame (#395)。幀在 LTXVPreprocess (#350) 中標準化為乾淨、模型友好的基線。使用 ResolutionSelector (#403) 選擇縱橫比和比例;它輸出對齊到模型友好倍數的寬度和高度。良好的第一幀應該是清晰的、光線充足的,並且為您計劃描述的運動而構圖。預處理器在準備圖像進行潛在採樣時避免破壞性更改。
提示增強#
在 Prompt (#376) 中寫下您的運動和攝影機提示。如果您啟用內置增強器,TextGenerateLTX2Prompt (#380) 會使用基於 Gemma 的模型豐富您的文本,添加有關動作節拍、連續性和框架的細節。切換器 ComfySwitchNode (#382) 讓您可以將原始文本或增強版本路由到條件化。這一步改善了對短輸入的提示遵從性,並有助於在幀間保持主題和風格。在渲染之前,您可以在 PreviewAny (#381) 中預覽擴展文本。
模型#
子圖在 UNETLoader (#384) 中加載蒸餾生成器,在 VAELoader 中加載視頻 (#385) 和音頻 (#386) 解碼器。潛在升級器模型由 LatentUpscaleModelLoader (#371) 準備,以便稍後進行乾淨的 x2 詳細通過。此塊確保在編碼、採樣和解碼過程中使用同一系列 LTX-2.5 模型,這保持了時間一致性。
提示#
CLIPLoader (#387) 和 CLIPTextEncode 正面 (#364) 將您的描述性提示轉換為條件化。專用的負面編碼器 (#373) 抑制低質量或伪影等不良特徵。LTXVConditioning (#365) 將文本條件與您選擇的幀率合併,以便時間指導流入音視頻潛在流。保持攝影機和動作語言清晰有助於實現更穩定的運動和編輯自由。
視頻設置#
在 Video Settings 組中設置持續時間、寬度、高度、幀率和種子(例如,Duration (#362) 和 Frame Rate (#361))。簡單的數學助手計算總幀數,並在需要的地方提供統一的值。選擇與您想要的感覺相匹配的幀率;較慢的動作在較低的幀率下可能看起來更好,而快速運動則受益於較高的幀率。為了可重複的鏡頭,固定種子;改變它以探索替代方案。
空潛在變量#
EmptyLTXVLatentVideo (#356) 創建合適大小和長度的視頻潛在變量,而 LTXVEmptyLatentAudio (#366) 則構建時間對齊的音頻潛在變量。這確保從一開始視頻和音頻流共享時間。長度由持續時間和幀率派生,採樣器接收正確形狀的張量。結果是一個同步的基礎,用於聯合音視頻去噪。
生成低分辨率#
第一次採樣通過在可控分辨率下構建一致的運動。LTXVDualCFGGuider (#388) 應用雙模指導,以便文本和時間共同塑造視頻和音頻潛在變量。SamplerCustomAdvanced (#344) 使用您選擇的採樣器和計畫運行擴散步驟,由 RandomNoise (#339) 種植。第一幀約束由 LTXVImgToVideoInplace (#357) 強制執行,保持身份、照明和構圖錨定在您提供的圖像上。採樣後,LTXVConcatAVLatent 和 LTXVSeparateAVLatent 根據需要對音視頻潛在變量進行排序,為下一階段做準備。
潛在升級#
LTXVLatentUpsampler (#348) 在解碼之前進行 x2 潛在空間升級,以銳化紋理和微細節。LTXVImgToVideoInplace (#349) 將升級的潛在變量與起始幀重新對齊,以便身份和佈局保持穩定。在潛在空間中執行此操作比在像素空間中調整大小更能保持時間平滑性。這一階段是最終清晰度的主要貢獻者。
生成高分辨率#
精煉採樣器(KSamplerSelect (#341) 加 SamplerCustomAdvanced (#368))在升級的潛在變量上運行較短的計畫,穩定邊緣和豐富細節。LTXVDualCFGGuider (#391) 保持指導與您的文本一致,同時保留第一通過中設置的運動。然後,組合的潛在變量由 LTXVSeparateAVLatent (#369) 分解以進行解碼。VAEDecodeTiled (#374) 將視頻潛在變量轉換為幀,而 LTXVAudioVAEDecode (#358) 則生成同步音頻。
渲染和保存#
CreateVideo (#370) 將幀和音頻按您選擇的幀率混合成單個視頻流。在外部圖表中,SaveVideo (#75) 將結果寫入您正常的 ComfyUI 輸出。您還可以在頂層包裝器中的預覽節點中單獨試聽音頻,然後再進行完整渲染。
Comfyui LTX 2.5 ComfyUI 工作流程中的關鍵節點#
Image to Video (LTX-2.5) (#398)#
這是整個管道的一站式控制器。提供第一幀、您的提示、持續時間、分辨率、幀率以及是否啟用提示增強。使用它快速迭代;當您準備好進行微調時,單擊進入子圖以調整採樣器、指導和解碼。如果您需要僅文本視頻,請打開子圖並在圖像到視頻節點上切換內部文本到視頻旁路。
LTXVDualCFGGuider (#388)#
在聯合音視頻潛在變量上應用無分類指導,平衡提示遵從性與時間穩定性。增加指導以加強提示跟隨和生動運動;降低它以減少閃爍或保留更多起始幀的細微差別。保持視頻和音頻指導在同一範圍內,以便音軌與螢幕上的動作保持一致。
SamplerCustomAdvanced (#344)#
使用您選擇的採樣器和自定義 sigma 計畫驅動擴散。使用此節點通過切換採樣器變體或編輯計畫來探索運動質量與穩定性。將其與固定種子配對以進行設置的蘋果對蘋果比較,然後隨機化種子以尋找最佳鏡頭。
LTXVLatentUpsampler (#348)#
使用專用的 LTX-2.5 x2 模型在潛在空間中升級,提高細節而不引入時間抖動。如果您計劃進行大量裁剪或緊密特寫,請保持此選項啟用,以便小特徵在解碼中倖存。對於極端 VRAM 限制,您可以在犧牲一些清晰度的情況下跳過升級。
VAEDecodeTiled (#374)#
使用平鋪控制記憶體使用情況解碼高分辨率視頻潛在變量為幀。在較低的 VRAM 上,請選擇較小的平鋪以避免內存不足錯誤。在較高的 VRAM 上,較大的平鋪可以減少接縫並加快解碼速度。
CreateVideo (#370)#
將解碼的幀與生成的音頻結合成單個視頻流,按您選擇的幀率調整 fps 以匹配創意意圖或滿足平台要求。然後將多路復用的輸出傳遞給外部圖表中的保存器。
可選附加功能#
- 保持提示簡潔但具體:誰/什麼、動作、攝影機移動、照明、情緒。讓提示增強器添加電影化措辭。
- 避免相互矛盾的攝影機方向。一個強烈的移動(推進、平移、推車)往往比疊加幾個更能產生更穩定的結果。
- 使用乾淨、高對比度的第一幀進行人像和產品拍攝;模型將更好地保持身份和邊緣。
- 從適度的持續時間開始調整運動和框架;只有在您喜歡行為後才延長。
- 如果輸出看起來柔和,請驗證寬度和高度是 32 的倍數,並保持潛在升級器啟用。
- 為了一致的迭代,固定種子。當探索替代方案時,改變種子,同時保持其他設置不變。
鳴謝#
此工作流程實現並建立在以下作品和資源之上。我們對 Comfy Org 的 LTX-2.5:Image to Video ComfyUI 工作流程模板、Lightricks 的 LTX-2.5 模型權重、Lightricks 的 LTX-2.5 Diffusers 項目以及 Lightricks 的 Hugging Face 組織資源的貢獻和維護表示感謝。欲了解權威細節,請參考下面鏈接的原始文檔和存儲庫。
資源#
- Comfy.org/Source 工作流程模板
- GitHub: Comfy-Org
- 文檔 / 發布說明: Source 工作流程模板
- Lightricks/LTX-2.5 模型權重
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.5
- arXiv: 2601.03233
- Lightricks/LTX-2.5 Diffusers 項目
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- arXiv: 2601.03233
- Lightricks/Hugging Face 組織
- GitHub: Lightricks
- Hugging Face: Lightricks
json

