LTX 2.5 ComfyUI 图像到视频与同步音频#
这个适用于 RunComfy 的 LTX 2.5 ComfyUI 工作流将单个首帧和运动提示转化为短片电影视频,具有连贯的模型内音频。它由 Lightricks LTX-2.5 家族提供动力,结合了 Pixel Diffusion、基于 Gemma 的提示增强器、视频和音频 VAE,以及用于清晰运动和强提示遵从性的潜在放大。
使用这个 LTX 2.5 ComfyUI 图来动画化肖像、气氛位置、产品、动物和概念镜头,同时保持在 ComfyUI 内。提供起始图像,描述动作和摄像机,设置持续时间和帧率,并渲染一个在各帧中保持角色、照明和风格的镜头。
Comfyui LTX 2.5 ComfyUI 工作流中的关键模型#
- Lightricks LTX-2.5 蒸馏变压器。核心图像到视频生成器产生时间一致的运动并融合视听潜在变量。模型卡:Lightricks/LTX-2.5。
- LTX-2.5 视频 VAE。将视频潜在变量解码为具有更高保真度和更少运动模糊的帧。权重:ltx-2.5-video-vae-bf16.safetensors。
- LTX-2.5 音频 VAE。生成同步音频以匹配视觉动作和时间。权重:ltx-2.5-audio-vae-bf16.safetensors。
- Gemma 4 12B 文本编码器与 LTX 投影。解释丰富的多实体提示和摄像机方向。权重:gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors。
- Gemma 4 E2B 指令变体用于提示增强器。以低计算成本将简短提示扩展为电影方向。权重:gemma4_e2b_it_bf16.safetensors。
- LTX-2.5 潜在空间放大器 x2。在解码之前通过潜在空间放大来锐化细节。权重:ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors。
- 管道和调度器的参考实现:LTX-2.5 Diffusers。
如何使用 Comfyui LTX 2.5 ComfyUI 工作流#
此工作流扩展并调节您的提示,构建视频和音频潜在变量,采样低分辨率通道,执行潜在放大,然后解码为帧和同步音频以进行最终混合。顶级控制器是 Image to Video (LTX-2.5) (#398),它接收您的第一帧、文本提示和关键设置,然后路由到子图。
图像预处理#
将您的起始图像提供给 Load First Frame (#395)。该帧在 LTXVPreprocess (#350) 中标准化为干净、模型友好的基线。使用 ResolutionSelector (#403) 选择纵横比和比例;它输出与模型友好倍数对齐的宽度和高度。良好的第一帧是清晰、光线良好,并为您计划描述的运动构图。预处理器在准备图像进行潜在采样时避免破坏性更改。
提示增强#
在 Prompt (#376) 中编写您的运动和摄像机提示。如果启用了内置增强器,TextGenerateLTX2Prompt (#380) 使用基于 Gemma 的模型为您的文本丰富关于动作节拍、连续性和构图的细节。切换器 ComfySwitchNode (#382) 让您可以将原始文本或增强版本路由到调节。此步骤改善短输入的提示遵从性,并有助于在各帧间保持对象和风格。在渲染前,您可以在 PreviewAny (#381) 中预览扩展文本。
模型#
子图在 UNETLoader (#384) 中加载蒸馏生成器,在 VAELoader 中加载视频 (#385) 和音频 (#386) 解码器。潜在放大器模型由 LatentUpscaleModelLoader (#371) 准备,以便稍后进行干净的 x2 细节处理。此块确保在编码、采样和解码过程中使用相同的 LTX-2.5 模型系列,从而保持时间一致性。
提示#
CLIPLoader (#387) 和 CLIPTextEncode 正面 (#364) 将您的描述性提示转化为调节。专用的负面编码器 (#373) 抑制低质量或伪影等不需要的特征。LTXVConditioning (#365) 将文本调节与您选择的帧率合并,以便时间指导流入视听潜在流。保持摄像机和动作语言清晰可导致更稳定的运动和编辑余地。
视频设置#
在 Video Settings 组中设置持续时间、宽度、高度、帧率和种子(例如,Duration (#362) 和 Frame Rate (#361))。简单的数学助手计算总帧数,并在需要时提供统一的值。选择与您想要的感觉相匹配的帧率;较慢的动作在较低的 fps 下看起来更好,而快速运动在较高的 fps 下受益。对于可复制的镜头,修复种子;改变它以探索替代方案。
空潜在#
EmptyLTXVLatentVideo (#356) 创建合适大小和长度的视频潜在变量,而 LTXVEmptyLatentAudio (#366) 构建时间对齐的音频潜在变量。这确保了视频和音频流从一开始就共享时间。由持续时间和帧率衍生的长度,采样器接收正确形状的张量。结果是联合视听去噪的同步基础。
生成低分辨率#
第一次采样通过在可管理的分辨率下建立连贯的运动。LTXVDualCFGGuider (#388) 应用双模态指导,以便文本和时间共同塑造视频和音频潜在变量。SamplerCustomAdvanced (#344) 使用您选择的采样器和计划运行扩散步骤,由 RandomNoise (#339) 种子。第一帧约束由 LTXVImgToVideoInplace (#357) 强制执行,保持身份、照明和构图锚定在您提供的图像上。采样后,LTXVConcatAVLatent 和 LTXVSeparateAVLatent 根据需要对音频和视频潜在变量进行洗牌以进行下一个阶段。
潜在放大#
LTXVLatentUpsampler (#348) 执行 x2 潜在空间放大,以在解码前锐化纹理和微细节。LTXVImgToVideoInplace (#349) 重新对齐放大的潜在变量与起始帧,以便身份和布局保持稳定。在潜在空间中执行此操作比在像素空间中调整大小更能保持时间平滑。此阶段是最终清晰度的主要贡献者。
生成高分辨率#
一个细化采样器(KSamplerSelect (#341) 加上 SamplerCustomAdvanced (#368))在放大的潜在变量上运行一个较短的计划,稳定边缘并丰富细节。LTXVDualCFGGuider (#391) 保持指导与您的文本一致,同时保留第一次通过中设定的运动。然后将组合的潜在变量由 LTXVSeparateAVLatent (#369) 分离进行解码。VAEDecodeTiled (#374) 将视频潜在变量转化为帧,LTXVAudioVAEDecode (#358) 产生同步音频。
渲染和保存#
CreateVideo (#370) 将帧和音频以您选择的 fps 组合成一个视频流。在外部图中,SaveVideo (#75) 将结果写入您的正常 ComfyUI 输出。您还可以通过顶级包装器中的预览节点在完全渲染之前单独试听音频。
Comfyui LTX 2.5 ComfyUI 工作流中的关键节点#
Image to Video (LTX-2.5) (#398)#
这是整个管道的一站式控制器。提供第一帧、您的提示、持续时间、分辨率、帧率以及是否启用提示增强。使用它快速迭代;当您准备好微调时,点击进入子图以调整采样器、指导和解码。如果您需要纯文本视频,打开子图并在图像到视频节点上切换内部文本到视频旁路。
LTXVDualCFGGuider (#388)#
在联合视听潜在变量上应用无分类指导,平衡提示遵从性与时间稳定性。增加指导以更强的提示跟随和更有力的运动;降低它以减少闪烁或保留更多起始帧的细微差别。保持视频和音频指导在同一水平,以便声轨与屏幕上的动作保持一致。
SamplerCustomAdvanced (#344)#
使用您选择的采样器和自定义 sigma 计划驱动扩散。使用此节点通过切换采样器变体或编辑计划来探索运动质量与稳定性。将其与固定种子配对以逐个对比设置,然后随机化种子以寻找最佳镜头。
LTXVLatentUpsampler (#348)#
使用专用的 LTX-2.5 x2 模型在潜在空间中放大,改善细节而不引入时间抖动。如果您计划重度裁剪或紧密特写,请保持此功能启用,以便小特征在解码时存活下来。对于极端 VRAM 限制,您可以在某些清晰度的成本下绕过放大。
VAEDecodeTiled (#374)#
使用平铺解码高分辨率视频潜在变量以控制内存使用。在较低 VRAM 上,偏爱较小的平铺以避免内存不足错误。在较高 VRAM 上,较大的平铺可以减少接缝并加速解码。
CreateVideo (#370)#
将解码后的帧与生成的音频合并为一个视频流,以您选择的帧率调整 fps 以匹配创意意图或满足平台要求。混合输出然后传递给外部图中的保存器。
可选附加#
- 保持提示简洁但具体:谁/什么、动作、摄像机移动、照明、情绪。让提示增强器添加电影措辞。
- 避免冲突的摄像机方向。一个强烈的动作(推进、平移、推车)往往比堆叠多个动作产生更稳定的结果。
- 使用干净、高对比度的第一帧进行肖像和产品拍摄;模型将更好地保留身份和边缘。
- 从适中的持续时间开始调整运动和构图;只有在您喜欢行为后才延长。
- 如果输出看起来柔和,请验证宽度和高度是 32 的倍数,并保持潜在放大器启用。
- 对于一致的迭代,固定种子。当探索替代方案时,改变种子,同时保持其他设置不变。
致谢#
此工作流实现并基于以下作品和资源。我们感谢 Comfy Org 提供的 LTX-2.5: Image to Video ComfyUI 工作流模板,Lightricks 提供的 LTX-2.5 模型权重,Lightricks 提供的 LTX-2.5 Diffusers 项目,以及 Lightricks 提供的 Hugging Face 组织资源的贡献和维护。有关权威详细信息,请参阅下方链接的原始文档和存储库。
资源#
- Comfy.org/Source 工作流模板
- GitHub: Comfy-Org
- 文档 / 发行说明: Source 工作流模板
- Lightricks/LTX-2.5 模型权重
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.5
- arXiv: 2601.03233
- Lightricks/LTX-2.5 Diffusers 项目
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- arXiv: 2601.03233
- Lightricks/Hugging Face 组织
- GitHub: Lightricks
- Hugging Face: Lightricks
注意:使用所引用的模型、数据集和代码需遵循其作者和维护者提供的各自许可证和条款。

