LTX 2.5 GGUF ComfyUI 圖像到影片,音頻同步#
此 LTX 2.5 GGUF ComfyUI 工作流程將單個源圖像和自然語言提示轉換為具有生成的同步音頻軌道的短片。它使用官方 LTX-2.5 模型家族進行影片和音頻生成,通過 GGUF 量化的 UNet 路徑來減少 VRAM 同時保持電影運動和場景一致性。
該圖表設計用於快速迭代角色鏡頭、機械和環境移動。它包括圖像到影片或文本到影片的開關,兩階段潛在管道(粗略通過然後潛在升級)和平鋪解碼以保持記憶體壓力低。如果您需要一個緊湊、可生產的路徑,此 LTX 2.5 GGUF ComfyUI 工作流程是一個實用的起點。
ComfyUI LTX 2.5 GGUF ComfyUI 工作流程中的關鍵模型#
- LTX-2.5(官方,由 Lightricks)。用於運動合成和多模態指導的核心影片和音頻生成模型。模型卡
- LTX-2.5 Video VAE (bf16)。為高效生成編碼和解碼影片潛在,與主模型配對。包含在 LTX-2.5 資源庫中的 vae/。 Video VAE
- LTX-2.5 Audio VAE (bf16)。處理音頻潛在路徑,以便最終渲染包含同步聲音。包含在 LTX-2.5 資源庫中的 vae/。 Audio VAE
- 基於 Gemma 的 12B 文本編碼器與 LTX-2.5 投影。提供與 LTX-2.5 匹配的提示嵌入,由 LTX 資源庫中的 text_encoders/ 包裝。 文本編碼器
- LTX-2.5 Latent Spatial Upscaler x2 1.0。潛在空間超分辨率模型,在粗略通過後增加細節。Upscaler
- LTX-2.5 Distilled UNet (GGUF 量化)。通過 ComfyUI-GGUF 加載器加載量化的 UNet 權重,以減少記憶體使用,同時保持可接受的質量。GGUF 是推理格式,而不是官方模型名稱。ComfyUI-GGUF
如何使用 ComfyUI LTX 2.5 GGUF ComfyUI 工作流程#
管道分兩階段運行:引導低分辨率通過以建立運動和時序,然後進行潛在升級和高分辨率精煉。音頻作為配對的潛在貫穿,然後解碼並與最終幀合併。
模型#
使用 UnetLoaderGGUF (#406) 加載 GGUF 量化的 UNet。選擇 VAELoader (#385, #386) 選擇影片和音頻 VAE,並由 CLIPLoader (#387) 提供基於 Gemma 的文本編碼器。使用 LatentUpscaleModelLoader (#371) 選擇升級器。這組定義了所有其他組依賴的骨幹。
提示#
在 Prompt 欄位中撰寫場景描述,專注於主題、運動和一個清晰的鏡頭移動。文本編碼器通過 LTXVConditioning (#365) 嵌入正面和負面提示,這也接受選擇的幀速率以對齊時序。如果您想要類似語音的音頻,請包括短的引用語句;音頻路徑會響應文本上下文同時保持場景感知。保持提示簡潔具體以避免指導衝突。
影片設置#
設置持續時間、幀速率和目標尺寸。工具將秒數和 fps 轉換為幀數,以便圖表分配正確的時間長度。選擇 32 的倍數的尺寸以保持穩定性和速度。使用分辨率選擇器選擇常見的長寬比,然後調整到您想要的比例。
圖像預處理#
加載第一個(參考)幀,讓 LTXVPreprocess (#350) 為 LTX-2.5 正規化。開關 Switch to Text to Video? (#363) 控制圖像是用作空間錨點還是被繞過以進行純文本到影片。調整助手保持您的輸入與工作分辨率一致。良好的預處理有助於保持身份和佈局。
空潛在#
EmptyLTXVLatentVideo (#356) 和 LTXVEmptyLatentAudio (#366) 為影片和音頻預分配時間畫布。這些長度來自您的持續時間和 fps 選擇。這種分離確保影片和音頻路徑在經過抽樣和精煉時保持同步。
生成低分辨率#
第一個採樣器塊使用 LTXVDualCFGGuider (#388) 與您的提示調節一起驅動運動和場景動態,然後使用 SamplerCustomAdvanced (#344) 合成粗略潛在。如果您正在進行圖像到影片,LTXVImgToVideoInplace (#357) 將參考幀注入潛在以穩定身份和構圖;它被繞過用於文本到影片。此通過有意較輕,以便在升級之前建立運動和時序。
潛在升級#
LTXVSeparateAVLatent (#367) 分離音頻和影片,以便影片潛在可以由 LTXVLatentUpsampler (#348) 使用 x2 模型增強。預處理的圖像可以選擇性地重新應用 LTXVImgToVideoInplace (#349) 以保持升級後的細節一致。然後音頻潛在通過 LTXVConcatAVLatent (#340) 重新附加,保持同步。
生成高分辨率#
第二個採樣器塊 (LTXVDualCFGGuider (#391) 加 SamplerCustomAdvanced (#368)) 在更高的比例上細化細節和時間一致性。LTXVSeparateAVLatent (#369) 將音頻傳遞給 LTXVAudioVAEDecode (#358),而影片潛在由 VAEDecodeTiled (#374) 解碼為幀以減少 VRAM 峰值。CreateVideo (#370) 將幀和音頻組裝成目標 fps 的最終 MP4。
ComfyUI LTX 2.5 GGUF ComfyUI 工作流程中的關鍵節點#
UnetLoaderGGUF (#406)#
加載 LTX-2.5 蒸餾的 UNet,以 GGUF 格式選擇與您的 VRAM 預算匹配的量化文件;較輕的量化降低記憶體並加快推理速度,但會在某些質量上有所損失。如果升級到較少量化的文件,預期會有更清晰的紋理和更穩定的細微運動。
LTXVImgToVideoInplace (#357 和 #349)#
將第一幀注入潛在,以便運動從您的圖像演變而不是漂移。切換 bypass 輸入以在圖像到影片和文本到影片之間切換。對於初始穩定性使用低分辨率節點 (#357),對於升級後的細節重新錨定使用高分辨率節點 (#349)。
LTXVLatentUpsampler (#348)#
應用 LTX-2.5 潛在空間升級器,以在不解碼為像素的情況下增加細節。當您希望在幾乎相同的記憶體成本下獲得更多定義時使用它。如果升級後出現閃爍,請在後續精煉階段稍微加強指導。
ManualSigmas (#397 和 #396)#
控制採樣器使用的去噪計劃。較短的計劃更快但可能降低依從性或時間平滑度;較長或前置的計劃在額外成本下增加穩定性。將此與採樣器選擇配對,以平衡場景的速度和質量。
VAEDecodeTiled (#374)#
使用平鋪將高分辨率影片潛在解碼為幀,以限制 VRAM 使用。如果記憶體不足,減少平鋪尺寸或啟用更強的平鋪;如果看到接縫,增加重疊或嘗試更大的平鋪。保持您的 VAE 選擇與官方 LTX-2.5 影片 VAE 對齊。
CreateVideo (#370)#
將圖像序列和解碼音頻合併為最終影片文件。設置 fps 以匹配您的生成幀速率以避免時間拉伸。在迭代中使用此作為單一渲染點,以獲得一致的輸出。
可選擇的附加項#
- 對於圖像到影片,僅描述一個清晰的鏡頭移動和主題的動作;避免多個相互競爭的移動。
- 對於文本到影片,保持提示簡潔,並在適當時添加短的引用句以獲得類似語音的音頻。
- 分辨率提示:堅持 32 的倍數;常見的 16:9 尺寸包括 960x544(快速)和 1344x768 或 1504x832(更清晰)。僅在您有 VRAM 預留時增加。
- 如果結果忽略提示,請在採樣器塊中增加指導或簡化提示語言。
- 為了在多次運行中重複,請在噪聲節點中設置固定的種子;隨機種子最適合探索。
- 如果 VRAM 緊張,請選擇您能負擔得起的 GGUF Q 級,並保持升級器啟用;它在最小記憶體成本下增加細節。
參考鏈接:官方 LTX-2.5 模型和資產位於 Hugging Face 上,GGUF UNet 加載器來自 ComfyUI-GGUF。
- LTX-2.5 模型和資產:Lightricks/LTX-2.5
- GGUF 加載器:city96/ComfyUI-GGUF
致謝#
此工作流程實施並基於以下作品和資源。我們感謝 Lightricks 提供的 LTX-2.5 和 city96 提供的 ComfyUI-GGUF 的貢獻和維護。欲獲得權威詳細信息,請參閱下面鏈接的原始文檔和資源庫。
資源#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
注意:使用引用的模型、數據集和代碼需遵循其作者和維護者提供的各自許可和條款。

