ComfyUI>工作流程>LTX 2.3 特寫鏡頭 - 電影圖像到視頻

LTX 2.3 特寫鏡頭 - 電影圖像到視頻

Workflow Name: RunComfy/LTX-2.3-Close-Up
Workflow ID: 0000...1469
將您的肖像轉化為電影般的面向前的視頻。獲得自然的面部運動和同步的原生音頻。緊密框住時尚、對話或社交剪輯。兩個潛在階段保留細節。2x 升頻使每一幀更加清晰。使用這個即用的 LTX 設置快速開始。

ComfyUI LTX 2.3 Close-Up Shots Workflow

LTX 2.3 Close-Up Shots in ComfyUI - Audio and 2x Upscale
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Close-Up Shots Examples

LTX 2.3 特寫鏡頭:帶有原生音頻的肖像圖像到視頻#

LTX 2.3 特寫鏡頭是一個 RunComfy-ready ComfyUI 工作流程,可以將單一肖像轉換為電影般的面向前的剪輯,並產生聯合生成的原生音頻。“特寫鏡頭”描述了框架目標和提示風格,而不是單獨的 LTX 模型變體或 LoRA。該圖運行精煉的 LTX 2.3 v1.1 GGUF 路徑,沒有活動的細節 LoRA,使用兩階段潛在管道和 x2 空間升頻器來提供穩定的身份、自然的唇同步和清晰的特寫框架。

設計用於時尚肖像、對話節拍、訪談和精緻的社交剪輯,這個 ComfyUI 構建強調緊密的構圖和一致的音視頻運動。使用 LTX 2.3 特寫鏡頭,您提供一張靜態圖像和一個簡明的場景描述;工作流程處理運動、時間和聲音,以生成一個準備分享的 MP4。

Comfyui LTX 2.3 特寫鏡頭工作流程中的關鍵模型#

  • LTX-2.3 22B Distilled 1.1 (僅限 Transformer)。核心視頻音頻生成器經過精煉以提高推理速度和降低內存,同時保持質量。來源:Lightricks/LTX-2.3
  • LTX-2.3 x2 空間升頻器 1.1。一個原生潛在升頻器,在第二次通過期間銳化細節並提高運動穩定性。打包在 LTX 2.3 版本中:Lightricks/LTX-2.3
  • LTX-2.3 Video VAE (bf16) 和 LTX-2.3 Audio VAE (bf16)。解碼器將視頻和音頻潛在轉換為幀和波形,同時保持同步緊密。精選權重:Kijai/LTX2.3_comfy
  • LTX 2.3 22B 1.1 的量化 GGUF 權重。內存高效的 UNet/transformer 和文本堆棧,優化用於 CPU 卸載或低 VRAM 的 GPU。分發:QuantStack/LTX-2.3-GGUF
  • Gemma 3 12B Instruct 文本編碼器與 LTX 文本投影。提供強大的提示理解和時間標記符號,連接到 ComfyUI 的 CLIP 接口。通過 GGUF 包包含:QuantStack/LTX-2.3-GGUF
  • 用於快速預覽的可選小型 VAE。在迭代期間的取樣器預覽中有用:madebyollin/taehv

如何使用 Comfyui LTX 2.3 特寫鏡頭工作流程#

此工作流程在兩個協調階段運行。第一次通過在基本尺寸建立特寫運動和原生音頻。第二次通過進行空間升頻並完善身份和唇同步,然後解碼並將視頻與音頻混合。

  • 模型 加載 GGUF 中的精煉 LTX 2.3 22B 1.1 模型,基於 Gemma 3 的文本堆棧,以及 LTX 視頻和音頻 VAE。它還啟用序列並行和預覽助手以促進更流暢的迭代。默認情況下沒有激活細節 LoRA,這保持了 LTX 2.3 特寫鏡頭的外觀乾淨和一致。
  • 視頻設置 在此設置您的目標寬度、高度、幀速率和剪輯長度。圖形在內部強制執行有效的尺寸,但選擇適合製作的值會產生更穩定的結果和更流暢的播放。如果您計劃快速迭代,請從謹慎開始,然後在第二次通過中放大。
  • T2V — 文本到視頻模式 當您僅想從文本生成時,切換提供的文本到視頻開關。對於 LTX 2.3 特寫鏡頭,默認路徑是圖像到視頻,這保持了身份和框架固定在您的肖像上。
  • 輸入圖像 提供一個乾淨的肖像靜止圖像,面部沒有遮擋。工作流程預處理並調整圖像大小,然後使用 LTXVImgToVideoInplace (#161) 錨定身份和鏡頭幾何。保持背景雜亂最小,並允許一些空間,以便緩慢的推進感覺自然。
  • 提示 使用一個簡明的正面提示來描述隨著時間的推移發生的鏡頭,包括台詞閱讀、呼吸、微動作和聽得到的事件。將負面提示集中在去除瑕疵上,而不是風格監控。不要重複已在參考圖像中可見的細節,因為這會降低保真度和穩定性。
  • 準備 LTX 潛在 該圖創建與您的設置匹配的空視頻和音頻潛在,將它們合併為單個 AV 潛在,並附加您選擇的幀速率的正面和負面條件。這保持了時間、運動和音頻從一開始就同步。
  • 取樣器 — 第一次通過 第一次通過使用 CFGGuider (#129) 與速度優化的取樣器生成一致的低分辨率 AV 潛在。這個階段鎖定了特寫鏡頭行為、語音節奏和基本的唇同步。可以將其視為建立發生內容的敘述通過。
  • 取樣器 — 第二次通過升頻 AV 潛在被分割,視頻路徑使用 LTXVLatentUpsampler (#118) 進行 x2 升頻。身份通過 LTXVImgToVideoInplace (#160) 重新投影,以在更高尺寸下保持面部穩定,然後音頻和視頻重新結合並使用專注於保真的取樣器進行完善。此通過增強細節,減少閃爍,並打磨 LTX 2.3 特寫鏡頭的外觀。
  • 解碼 使用平鋪 VAE 解碼視頻幀以提高內存效率,通過音頻 VAE 解碼音頻,並使用 VHS_VideoCombine 將所有內容混合成 H.264 MP4,標準 4:2:0 像素格式。您可以在迭代期間預覽音頻,並將最終持續時間修剪以匹配生成的語音。
  • 可選 如果 VRAM 緊張,啟用分片前饋選項以用一點速度換取穩定性。為了更快的 look-dev,使用小型預覽 VAE。多 GPU 用戶可以從序列並行補丁中受益,以保持長序列的順暢。

Comfyui LTX 2.3 特寫鏡頭工作流程中的關鍵節點#

  • LTXVImgToVideoInplace (#161 和 #160) 將肖像錨定到潛在視頻中,以便面部在微推進和微動作播放時保持穩定。保持其在圖像到視頻中活躍;僅當使用文本到視頻模式時切換其 bypass。為了獲得最佳的 LTX 2.3 特寫鏡頭效果,從一個清晰、光線均勻的參考開始,避免口部遮擋。
  • LTXVLatentUpsampler (#118) 在第二次通過精細化之前在潛在空間中應用原生 LTX 2.3 x2 空間升頻器。這在增加細節的同時保持運動一致性。對於特寫,保持升頻在 x2 通常提供最佳的清晰度和穩定性平衡。
  • CFGGuider (#129 和 #103) 將您的正面和負面條件結合為統一的指導信號,用於兩種模式。小調整指導強度可以緊縮或放鬆對您的腳本和框架的遵循。如果增加指導,考慮稍微軟化負面清單以避免過度限制表情。
  • SamplerCustomAdvanced (#113 和 #119) 第一次通過偏向速度導向的策略快速建立運動和音頻,而第二次通過切換到保真導向的策略以銳化細節。如果更改取樣器策略,保持第一次通過快速,第二次通過精確,以便 LTX 2.3 特寫鏡頭保持其電影光澤。
  • LTX2_NAG (#342) 引入噪聲感知指導,平衡視頻和音頻條件。提高視頻重點可以鞏固框架和姿勢;提高音頻重點可以加強唇同步。與 CFGGuider 一起保守調整,以避免過度限制。
  • LTXVConditioning (#107 和 #22) 將您的提示和幀速率綁定到潛在時間線。保持單一場景級的正面提示和精簡的負面提示,以獲得最清晰的對齊。附加的幀速率確保語音節奏和運動節奏保持同步。
  • VHS_VideoCombine (#140) 以標準播放設置將最終結果編碼為 MP4。為了傳遞,通過降低 crf 提高質量;為了編輯,啟用 trim_to_audio 以便剪輯長度與生成的語音完全匹配。

可選附加#

  • LTX 2.3 特寫鏡頭的框架提示 裁剪使得眼睛位於上三分之一附近,留出一些空間,並保持嘴巴完全可見以改善唇同步。避免強烈的背光或重濾鏡在參考中。
  • 有效的提示 寫出隨時間發生的事情,包括可聽到的時刻,如呼吸、笑聲和房間聲音。省略已存在於圖像中的屬性。保持負面清單簡短且實用。
  • 尺寸和性能 如果 VRAM 低,先嘗試適中的基本尺寸,然後讓第二次通過升頻。遵循 LTX 網格約束的尺寸將更可預測地取樣,更高的幀速率需要更多的計算。
  • 迭代工作流程 鎖定圖像和提示,迭代第一次通過直到運動和讀取感覺正確,然後移至第二次通過以獲取細節。使用小型預覽 VAE 以加快檢查速度,並僅在準備好導出時啟用完整解碼。
  • 何時使用 T2V 切換到文本到視頻模式以生成僅由旁白驅動的 B 卷和抽象特寫。對於以身份為驅動的鏡頭,保持肖像路徑以保留 LTX 2.3 特寫鏡頭的美學。

致謝#

此工作流程實施並建立在以下作品和資源的基礎上。我們衷心感謝 Lightricks 的 LTX‑2.3 模型,LTX Docs 的圖像到視頻工作流程指南,QuantStack 的 LTX‑2.3‑GGUF 量化以及 iiTzMYUNG 的 LTX 2.3 源展示,感謝他們的貢獻和維護。有關權威細節,請參閱下列鏈接的原始文檔和存儲庫。

資源#

注意:使用所引用的模型、數據集和代碼需遵循其作者和維護者提供的各自許可和條款。

RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。