LTX 2.5 ComfyUI 文本轉影片:提示到影片,具有同步音頻#
LTX 2.5 ComfyUI 文本轉影片是適合 RunComfy 的工作流程,將短文提示轉換成具有對齊音頻軌的電影影片。它結合了 Lightricks 的 LTX-2.5 精煉變壓器進行文本到影片生成,緊湊的視頻/音頻 VAE 用於重建,潛在升級器用於更清晰的細節,以及基於 Gemma 的提示增強以增強提示的依從性。
專為希望在 ComfyUI 中進行快速、本地優先迭代的創作者而設計,這個圖表在大氣場景、產品鏡頭、角色瞬間和情感片段方面表現出色。使用 LTX 2.5 ComfyUI 文本轉影片,您可以在幾分鐘內從想法過渡到預覽,然後在不離開 RunComfy 的情況下微調動作、外觀和時間。
ComfyUI LTX 2.5 ComfyUI 文本轉影片工作流程中的關鍵模型#
- Lightricks LTX-2.5。核心的精煉變壓器,從文本合成時間上連貫的影片。它在保持推理速度的同時平衡提示忠誠度和運動現實主義。查看官方模型卡片在 Lightricks/LTX-2.5 和參考管道在 Lightricks/LTX-2.5-Diffusers。
- Google Gemma 2 Instruct。一個緊湊的指令調整語言模型,用於在生成之前擴展和澄清用戶提示,改善樣式指導和鏡頭意圖。代表性檢查點是 google/gemma-2-9b-it。
- Lightricks 組織中心。LTX 發佈和文本轉影片系列更新的中心列表,對於模型筆記和已知行為非常有用:huggingface.co/Lightricks。
如何使用 ComfyUI LTX 2.5 ComfyUI 文本轉影片工作流程#
此工作流程從提示到影片遵循一條清晰的路徑:提示增強、文本調節、潛在影片合成、升級、解碼、音頻對齊和輸出。以下部分用簡單的語言解釋每個階段,以便您知道要更改什麼以及為什麼。
提示和預設#
開始時寫一個簡潔的提示,說明主題、場景、光照、鏡頭或攝像機感覺和運動意圖。可選地添加一個負面提示以避免不需要的元素。如果提供樣式預設,選擇一個樣式預設以快速設置顏色和對比傾向。如果圖表提供種子控制,請在迭代措詞時保持種子穩定,以便差異反映您的編輯,而不是隨機性。LTX 2.5 ComfyUI 文本轉影片受益於明確的運動動詞,如“慢速推進”、“手持”或“微風”。
文本調節#
您的提示被標記化並編碼,然後由 Gemma 輕微重寫以增強意圖並消除歧義。增強的文本創建調節向量,視頻模型使用這些向量來決定佈局、主題外觀和運動提示。保持描述具體和可視化;避免長列表的修飾符彼此競爭。如果您需要一致的身份或品牌,請將這些術語放在提示的前面。這一步是 LTX 2.5 ComfyUI 文本轉影片在生成任何像素之前鎖定意義的地方。
潛在影片合成#
工作流程初始化一個潛在時間線,尺寸為您選擇的長寬比和持續時間。LTX-2.5 反覆去噪這個潛在影片,將結構、運動和外觀編織到每一幀中,同時保持時間連貫性。較短的鏡頭收斂更快,更容易指導;只有在喜歡第一拍之後才延長持續時間。使用負面提示來抑制如多餘的肢體、閃爍或文本覆蓋之類的瑕疵。這裡的目標是一個乾淨、符合要求的潛在剪輯,已經顯示為您預期的場景。
運動和時間#
在去噪過程中,模型平衡空間細節和流暢的運動。提示中的強運動提示有助於避免靜態的剪輯;過多的細紋理要求會降低運動清晰度。如果圖表包括運動強度控制,對於動態鏡頭增加它,對於肖像或宏觀產品角度減少它。在測試變化時,一次改變一個元素,以便將差異歸因於具體的編輯。LTX 2.5 ComfyUI 文本轉影片通常獎勵清晰的攝像機動詞和單一主題焦點。
潛在升級#
專用的潛在升級器在不打破時間穩定性的情況下提煉細節。當基礎運動和構圖看起來正確時啟用此通道。如果高光開花或邊緣過度銳化,稍微減少強度並重新運行;如果圖像感覺柔和,則增加強度。在運動穩定後進行升級比從更高的基礎分辨率開始更能保持一致性。這個階段賦予 LTX 2.5 ComfyUI 文本轉影片其清晰度而不引入閃爍。
解碼和顏色#
視頻 VAE 解碼潛在內容為幀,應用適合預覽和輸出顏色空間和色調映射。如果可用,選擇一個與您的意圖匹配的外觀設定檔:中性用於稍後分級,電影用於準備分享的日常。微小的條紋或閃爍通常表明上游銳化過於激進;調整升級器強度,而不是強迫更重的後期對比。保持長寬比一致以便公平比較結果。解碼是您的幀成為可以評估的像素的地方。
音頻生成和同步#
音頻模塊從相同的提示生成輕量級的音軌,並將其對齊到影片時間線。使用情感詞如“陰森的嗡嗡聲”、“快樂的合成音”或“柔和的雨聲效果”來引導背景音。如果工作流程暴露音頻切換,您可以在探索運動時禁用它,然後在最終時啟用它。輕微的提示調整可以改變節奏和強度;在試聽音頻變化時鎖定您的視覺種子。目標是支持場景而不與之鬥爭的協調音頻。
輸出和審查#
選擇您的容器和編解碼器預設,用於緊湊的預覽或更高質量的可共享文件。如果圖表包括幀導出,您可以在提交完整運行之前檢查單個幀中的瑕疵。保留提示、種子和任何切換的記錄,以便您可以重現或分支想法。對於社交或產品審查,使用預覽預設;對於影片或客戶甲板,使用高質量預設。LTX 2.5 ComfyUI 文本轉影片已優化,讓您可以快速迭代,然後在準備好時升級和輸出。
可選附加功能#
- 用鏡頭語言編寫提示:主題 + 場景 + 照明 + 鏡頭 + 運動(例如,“大理石上的產品英雄,柔和的背光,50 mm,慢速左弧”)。
- 偏好一個明確的樣式提示而不是許多弱的提示。太多的形容詞會稀釋指導。
- 使用負面提示來抑制文本覆蓋、過多的顆粒或不需要的標誌形狀。
- 鎖定種子以比較提示編輯;更改種子以探索新組合。
- 先短再延長,當運動清晰時;較長的剪輯會加重小問題。
- 如果面孔是中心,保持相機運動溫和和光照穩定,以減少時間漂移。
- 為了乾淨的輸出,避免在後期調整大小;在圖表中設置長寬比和分辨率並保持一致。
這個 LTX 2.5 ComfyUI 文本轉影片工作流程旨在幫助您以最小的設置獲得令人信服的運動、清晰的細節和對齊的音頻。快速迭代,使用清晰的意圖進行指導,並讓圖表從文本到影片承擔繁重的工作。
致謝#
此工作流程實現並建立在以下作品和資源之上。我們衷心感謝 Comfy.org 提供的源工作流程模板,Lightricks 提供的 LTX-2.5 模型權重,以及 Lightricks 提供的 LTX-2.5 Diffusers 項目,他們的貢獻和維護。欲了解權威詳情,請參閱下方鏈接的原始文檔和存儲庫。
資源#
- Comfy.org/Source workflow template
- 文檔 / 發佈說明: Source workflow template
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/Hugging Face organization
- Hugging Face: Lightricks
注意:引用的模型、數據集和代碼的使用受其作者和維護者提供的相應許可和條款的約束。


