LTX 2.5 首尾幀轉影片:兩幀錨定,具有同步音頻的電影片段#
此 RunComfy-ready 工作流程將匹配的起始和結束圖像轉換為具有同步音頻的短電影視頻。通過從您的首幀和尾幀錨點引導生成,它在創建兩者之間的連貫運動時,保持構圖、照明、主體身份和風格。LTX 2.5 首尾幀轉影片非常適合受控的角色動作、產品節奏、鏡頭移動和 ComfyUI 內的場景過渡。
在其背後,將 Lightricks 的 LTX-2.5 變壓器與專用的視頻和音頻 VAE 以及基於 Gemma 的提示增強器配對。該圖隨附清晰的組別,用於提示、視頻設置、首/尾幀準備、條件、採樣和解碼,讓您可以獲得可靠、可重複的結果,而無需觸及低層次的佈線。
Comfyui LTX 2.5 首尾幀轉影片工作流程中的關鍵模型#
- Lightricks LTX-2.5 精煉變壓器。核心視頻生成器,從文本和視覺指導中學習運動、外觀和時間一致性。模型頁面
- LTX-2.5 視頻 VAE。壓縮和解碼視頻潛在變量以保持銳利的幀,同時保持實際的內存使用。在 LTX-2.5 存儲庫中包含。模型頁面
- LTX-2.5 音頻 VAE。生成並重建同步音頻潛在變量以匹配視覺事件。在 LTX-2.5 存儲庫中包含。模型頁面
- Gemma 4 12B 文本編碼器,帶有 LTX-2.5 的投影。將您的提示編碼為涵蓋主題、動作、照明和鏡頭方向的豐富條件。在 LTX-2.5 資產中包含。模型頁面
- 用於提示增強的 Gemma 4 E2B 指令調優變體。啟用增強時,將短輸入擴展為電影方向。模型頁面
- LTX-2.5 管道和計劃行為的可選 Diffusers 參考。用於了解採樣器取捨。項目頁面
如何使用 Comfyui LTX 2.5 首尾幀轉影片工作流程#
該工作流程將兩張圖像作為錨點,將它們轉換為指導,然後在文本控制下去噪視頻和音頻潛在變量,最後解碼為可分享的剪輯。下面的每個組別都扮演著特定的角色;大多數用戶只需觸碰提示、提示增強和視頻設置。
提示#
在 Prompt (#252) 節點中撰寫簡潔但描述性的指令。積極文本由 CLIPTextEncode (#222) 使用 Gemma 4 12B 編碼器編碼,以便模型理解主題、動作、照明和鏡頭意圖。保持終態和開場節奏的描述,以幫助模型尊重兩個錨點。如果需要嚴格的措辭或品牌術語,請在提示中明確寫出。
提示增強#
短提示可以通過 TextGenerateLTX2Prompt (#247) 自動擴展。ComfySwitchNode (#248) 將您的原始提示或增強文本路由到編碼器,而 PreviewAny (#249) 讓您檢查最終文本。當您想要電影措辭和更豐富的運動提示時啟用增強;當提示措辭必須保持精確時禁用它。
視頻設置#
使用 Duration (#198)、Frame Rate(int) (#205)、Width (#215) 和 height (#216) 設置剪輯長度、幀率和分辨率。該圖通過 ComfyMathExpression (#226) 計算總幀數,並在 EmptyLTXVLatentVideo (#201) 中分配視頻潛在變量,在 LTXVEmptyLatentAudio (#197) 中分配音頻潛在變量。更高的分辨率或幀率會增加 VRAM 和時間;從適中開始,然後在喜歡運動後再擴展。
首幀#
加載您的起始圖像,在 ResizeImageMaskNode (#213) 中調整大小以匹配目標分辨率。LTXVPreprocess (#199) 正規化色調和細節以獲得穩定的指導。乾淨、曝光良好且構圖清晰的圖像能讓模型更快鎖定,並減少從錨點不必要的漂移。
尾幀#
加載您的結束圖像;它在 ResizeImageMaskNode (#214) 中調整大小並在 LTXVPreprocess (#195) 中正規化。目標是相對於首幀匹配的長寬比、透視和主體比例,以便過渡感覺物理上合理,並且錨點在結尾處保持。
條件#
文本條件在 LTXVConditioning (#202) 中組成,還接收目標幀率,以便時間在各個分支之間對齊。圖像指導在兩次傳遞中附加,首幀使用 LTXVAddGuide (#206),尾幀使用 LTXVAddGuide (#204),確保兩個錨點影響軌跡。LTXVCropGuides (#200) 調和任何剩餘的尺寸差異,使指導線完美對齊潛在畫布。
採樣#
噪聲在 RandomNoise (#196) 中播種,去噪由 SamplerCustomAdvanced (#211) 驅動,使用 SamplerEulerAncestral (#208) 和 ManualSigmas (#239) 的計劃進行清晰、運動穩定的更新。指導來自 LTXVDualCFGGuider (#235),由 UNETLoader (#230) 提供動力,混合正面和負面條件以引導外觀和運動。音頻和視頻潛在變量在 LTXVConcatAVLatent (#210) 中串聯,然後在 LTXVSeparateAVLatent (#221) 中分開,以便運動和聲音共同演化。
解碼和輸出#
潛在變量使用視頻 VAE 在 VAEDecodeTiled (#219) 中解碼為幀,使用音頻 VAE 在 LTXVAudioVAEDecode (#220) 中解碼為音頻。CreateVideo (#218) 以您選擇的 FPS 將圖像和音頻混合以製作最終剪輯。返回頂部圖中,SaveVideo (#68) 寫入結果;如果需要,請在此處重命名或更改位置。
Comfyui LTX 2.5 首尾幀轉影片工作流程中的關鍵節點#
TextGenerateLTX2Prompt (#247)#
將簡短的輸入擴展為電影化、LTX 友好的提示。當您想要更豐富的動詞、照明和鏡頭語言時使用,並且努力最小。如果您需要精確的措辭或品牌安全的措辭,請通過 ComfySwitchNode (#248) 關閉增強,然後自己提供最終文本。
LTXVDualCFGGuider (#235)#
將 LTX-2.5 模型與正面和負面條件相結合,以平衡忠實性和自由度。提高指導以增強提示和錨點的忠實性;降低它以獲得更鬆散、更自然的運動。極高的指導可能會過度約束運動或引入飽和,因此請與您的負面提示強度一起調整。
SamplerCustomAdvanced (#211)#
使用 SamplerEulerAncestral (#208) 和選定的西格瑪計劃運行去噪循環。使用較短的計劃進行速度測試,當需要在運動中保留更多細節時使用較長的計劃。如果運動看起來顫抖,嘗試更平滑的西格瑪斜坡或稍微降低指導以減少步驟之間的過度校正。
ManualSigmas (#239)#
定義將清晰度與時間平滑度交換的噪聲計劃。前載噪聲可以鼓勵早期更大的動作,而更溫和的尾部可以在接近尾錨時保留細節。只有在您對提示和錨點滿意後進行調整。
VAEDecodeTiled (#219)#
使用平鋪處理將視頻潛在變量解碼為圖像,以適應內存中的更大分辨率。較小的平鋪減少 VRAM,但可能會有平鋪縫隙風險;較大的平鋪更乾淨但更重。保持分辨率和平鋪大小與您的 GPU 平衡。
LTXVAudioVAEDecode (#220)#
從音頻潛在變量重建同步音頻軌道。要導出無聲剪輯,請在 CreateVideo (#218) 前暫時禁用子圖中的音頻分支。如果最終聲音感覺太忙,請在提示中減少動作密度,以便音頻模型遵循更簡單的節奏。
RandomNoise (#196)#
播種生成。為了獲得可重現的結果,打開子圖並設置固定種子,而不是隨機化。當從相同的錨點和提示中探索運動選項時,變換種子以採樣不同的軌跡。
可選附加內容#
- 為了獲得最乾淨的過渡,保持首幀和尾幀在長寬比、地平線和主體比例上的對齊;不匹配會迫使模型扭曲幾何。
- 明確描述運動:“開始面向左側,轉向攝像機,手打開,藍色水晶升起在手掌上”比僅有風格的提示更好。
- 持續時間和 FPS 互動;增加兩者會提高內存和渲染時間。一次拉伸一個,然後在擴大之前進行預覽。
- 如果邊緣閃爍,請在提示中減少細紋理形容詞或稍微降低指導以促進時間穩定性。
- 為了加快迭代,請在較小的分辨率下測試,然後在運動和構圖鎖定後提高寬度和高度。
- 當您需要品牌完美的結尾幀時,請在提示中強調它們,並保持尾幀乾淨且高對比度,以便 LTX 2.5 首尾幀轉影片可以可靠地鎖定。
致謝#
此工作流程實施並建立在以下作品和資源之上。我們衷心感謝 Comfy.org 提供的源工作流程模板,Lightricks 提供的 LTX-2.5 模型權重,以及 Lightricks 提供的 LTX-2.5 Diffusers 項目對其貢獻和維護。要獲得權威的詳細信息,請參閱以下鏈接的原始文檔和存儲庫。
資源#
- Comfy.org/Source 工作流程模板
- 文檔 / 發布說明: Source 工作流程模板
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/Hugging Face 組織
- Hugging Face: Lightricks
注意: 參考模型、數據集和代碼的使用受其作者和維護者提供的相應許可和條款約束。

