ComfyUI>工作流>LTX 2.3 近景拍摄 - 电影级图像到视频

LTX 2.3 近景拍摄 - 电影级图像到视频

Workflow Name: RunComfy/LTX-2.3-Close-Up
Workflow ID: 0000...1469
将您的人像转变为电影级的正面视频。获得自然的面部动作和同步的本地音频。紧密框定时尚、对话或社交片段。两个潜在阶段保留细节。2x 放大锐化每一帧。使用这个现成的 LTX 设置快速开始。

ComfyUI LTX 2.3 Close-Up Shots 工作流程

LTX 2.3 Close-Up Shots in ComfyUI - Audio and 2x Upscale
想要运行这个工作流吗?
  • 完全可操作的工作流
  • 没有缺失的节点或模型
  • 无需手动设置
  • 具有惊艳的视觉效果

ComfyUI LTX 2.3 Close-Up Shots 示例

LTX 2.3 近景拍摄:人像图像到视频,带有本地音频#

LTX 2.3 近景拍摄是一个 RunComfy-ready 的 ComfyUI 工作流程,它将单一人像转变为带有联合生成的本地音频的电影级正面剪辑。“近景拍摄”描述了框定目标和提示风格,而不是单独的 LTX 模型变体或 LoRA。该图运行经过蒸馏的 LTX 2.3 v1.1 GGUF 路径,没有活动的细节 LoRA,使用两阶段潜在管道和 x2 空间放大器提供稳定的身份、自然的唇同步和清晰的近景框定。

专为时尚人像、对话节拍、访谈和精致的社交剪辑设计,这个 ComfyUI 构建强调紧密的构图和连贯的音视频运动。使用 LTX 2.3 近景拍摄,您提供一张静态图像和一个简明的场景描述;工作流程处理运动、时序和声音以生成一个随时可分享的 MP4。

Comfyui LTX 2.3 近景拍摄工作流程中的关键模型#

  • LTX-2.3 22B Distilled 1.1 (Transformer-only)。核心视频音频生成器经过蒸馏以更快推理和更低内存,同时保留质量。来源:Lightricks/LTX-2.3
  • LTX-2.3 x2 Spatial Upscaler 1.1。一个本地潜在放大器,在第二次通过期间锐化细节并改善运动稳定性。包装在 LTX 2.3 版本中:Lightricks/LTX-2.3
  • LTX-2.3 Video VAE (bf16) 和 LTX-2.3 Audio VAE (bf16)。解码器将视频和音频潜在变量转化为帧和波形,同时保持紧密同步。精选权重:Kijai/LTX2.3_comfy
  • Quantized GGUF weights for LTX 2.3 22B 1.1。内存高效的 UNet/transformer 和文本堆栈,优化用于 CPU 卸载或低 VRAM GPU。分发:QuantStack/LTX-2.3-GGUF
  • Gemma 3 12B Instruct text encoder with LTX text projection。提供强大的提示理解和时序令牌,用于两个模态,通过 GGUF 包装接入 ComfyUI 的 CLIP 接口:QuantStack/LTX-2.3-GGUF
  • 可选的小型 VAE,用于快速预览。在迭代期间用于采样器预览:madebyollin/taehv

如何使用 Comfyui LTX 2.3 近景拍摄工作流程#

此工作流程在两个协调阶段运行。第一次通过在基础大小上建立近景运动和本地音频。第二次通过在空间上放大并精细调整身份和唇同步,然后解码并将视频与音频合并。

  • 模型 加载蒸馏的 LTX 2.3 22B 1.1 模型在 GGUF 中,基于 Gemma 3 的文本堆栈,以及 LTX 视频和音频 VAE。它还启用序列并行和预览助手以实现更平滑的迭代。默认情况下没有活动的细节 LoRA,这保持了 LTX 2.3 近景拍摄的外观干净和一致。
  • 视频设置 在此处设置目标宽度、高度、帧速率和剪辑长度。图形内部强制有效尺寸,但选择适合制作的值会产生更稳定的结果和更流畅的播放。如果您计划快速迭代,请从适度开始,并在第二次通过中放大。
  • T2V — 文本到视频模式 当您只想从文本生成时,切换提供的文本到视频开关。对于 LTX 2.3 近景拍摄,默认路径是图像到视频,这保持了身份和框定锚定在您的肖像上。
  • 输入图像 提供一个干净的肖像静态图像,面部无遮挡。工作流程预处理并调整图像大小,然后使用 LTXVImgToVideoInplace (#161) 锚定身份和镜头几何。保持背景杂乱最小,并留出一点头部空间,以便慢推入感自然。
  • 提示 使用一个简明的正面提示来描述随时间变化的镜头,包括台词、呼吸、微动作和可听事件。将负面提示集中在去除伪影上,而不是风格管理。不要重复参考图像中已可见的细节,因为这可能会降低保真度和稳定性。
  • 准备 LTX 潜在变量 图形创建与您的设置匹配的空视频和音频潜在变量,将它们合并为一个 AV 潜在变量,并附加您的正面和负面条件,选择的帧速率。这从一开始就保持时序、运动和音频同步。
  • 采样器 — 第一次通过 第一次通过使用 CFGGuider (#129) 和一个速度优化采样器生成一个连贯的低分辨率 AV 潜在变量。这个阶段锁定了近景相机行为、语速和基本唇同步。可以将其视为建立发生内容的叙述过程。
  • 采样器 — 第二次通过放大 AV 潜在变量被分割,视频路径使用 LTXVLatentUpsampler (#118) 以 x2 放大。身份通过 LTXVImgToVideoInplace (#160) 在更大尺寸下重新投射以保持面部稳定,然后音频和视频重新组合并通过注重保真的采样器进行细化。这个过程增强细节,减少闪烁,并优化 LTX 2.3 近景拍摄的外观。
  • 解码 视频帧通过分块 VAE 进行解码以提高内存效率,音频通过音频 VAE 解码,VHS_VideoCombine 将所有内容混合成一个 H.264 MP4,采用标准 4:2:0 像素格式。您可以在迭代期间预览音频,并将最终持续时间修剪以匹配生成的语音。
  • 可选 如果 VRAM 紧张,启用分块前馈选项以在速度上稍作交换以获得稳定性。对于更快的 look-dev,使用小型预览 VAE。多 GPU 用户可以从序列并行补丁中受益,以保持长序列的平滑性。

Comfyui LTX 2.3 近景拍摄工作流程中的关键节点#

  • LTXVImgToVideoInplace (#161 and #160) 将肖像锚定到潜在视频中,以便在微推入和微动作播放时面部保持稳定。保持其在图像到视频模式中处于活动状态;仅在使用文本到视频模式时切换其 bypass。为了获得最佳的 LTX 2.3 近景拍摄结果,从清晰、均匀照明的参考开始,并避免嘴部遮挡。
  • LTXVLatentUpsampler (#118) 在第二次通过细化前,在潜在空间中应用本地 LTX 2.3 x2 空间放大器。这在增加细节的同时保持运动一致性。对于近景,保持 x2 放大通常提供最佳的锐度和稳定性平衡。
  • CFGGuider (#129 and #103) 将您的正面和负面条件结合成一个统一的指导信号,适用于两种模态。对指导强度的微调可以收紧或放松对脚本和框架的遵循。如果您增加指导,考虑稍微软化负面列表以避免过度限制表达。
  • SamplerCustomAdvanced (#113 and #119) 第一次通过倾向于速度导向策略以快速建立运动和音频,而第二次通过切换到保真度导向策略以锐化细节。如果您更改采样器策略,请保持第一次通过快速,第二次通过精确,以便 LTX 2.3 近景拍摄保持其电影级光泽。
  • LTX2_NAG (#342) 引入噪声感知指导,平衡视频和音频条件。提高视频强调可以稳定框架和姿势;提高音频强调可以加强唇同步。保守地调整,并与 CFGGuider 配合使用以避免过度限制。
  • LTXVConditioning (#107 and #22) 将您的提示和帧速率绑定到潜在时间轴。保持单一的场景级正面提示和简洁的负面提示以获得最清晰的对齐。附加的帧速率确保语音节奏和运动节奏保持同步。
  • VHS_VideoCombine (#140) 使用标准播放设置将最终结果编码为 MP4。对于交付,通过降低 crf 提高质量;对于编辑,启用 trim_to_audio 以便剪辑长度与生成的语音精确匹配。

可选额外功能#

  • LTX 2.3 近景拍摄的框定技巧 剪裁使眼睛位于上三分之一附近,留出一点头部空间,并保持嘴巴完全可见以改善唇同步。避免强烈的背光或在参考中使用重滤镜。
  • 有效的提示 写下随时间发生的事情,包括可听的时刻,如呼吸、笑声和房间音调。省略图像中已经存在的属性。保持负面列表简短且实用。
  • 大小和性能 如果您的 VRAM 很低,先尝试适度的基础大小,然后让第二次通过放大。遵循 LTX 的网格约束的尺寸将更可预测地采样,更高的帧速率需要更多的计算。
  • 迭代工作流程 锁定图像和提示,迭代第一次通过直到运动和读取感觉正确,然后移动到第二次通过以获取细节。使用小型预览 VAE 加速检查,仅在准备好导出时启用完整解码。
  • 何时使用 T2V 切换到文本到视频模式,用于纯粹由旁白驱动的 B 卷和抽象近景。对于以身份为驱动的镜头,保持肖像路径以保留 LTX 2.3 近景拍摄的美感。

致谢#

此工作流程实现并建立在以下作品和资源之上。我们衷心感谢 Lightricks 提供的 LTX‑2.3 模型,LTX Docs 提供的图像到视频工作流程指南,QuantStack 提供的 LTX‑2.3‑GGUF 量化,以及 iiTzMYUNG 提供的 LTX 2.3 源展示的贡献和维护。有关权威详细信息,请参考下面链接的原始文档和存储库。

资源#

注意:使用参考的模型、数据集和代码需遵循其作者和维护者提供的各自许可证和条款。

RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。