LTX 2.5 GGUF ComfyUI 图像到视频与同步音频#
此 LTX 2.5 GGUF ComfyUI 工作流程将单个源图像和自然语言提示转化为带有生成同步音轨的短视频。它使用官方 LTX-2.5 模型系列进行视频和音频生成,通过 GGUF 量化的 UNet 路径以减少 VRAM,同时保持电影运动和场景一致性。
该图表设计用于快速迭代角色镜头、机械和环境移动。它包括一个用于图像到视频或文本到视频的开关,双阶段潜在管道(粗略通过然后潜在放大),以及平铺解码以保持低内存压力。如果您需要紧凑、生产就绪的路径,此 LTX 2.5 GGUF ComfyUI 工作流程是一个实用的起点。
ComfyUI LTX 2.5 GGUF ComfyUI 工作流程中的关键模型#
- LTX-2.5(官方,由 Lightricks)。用于运动合成和多模态引导的核心视频和音频生成模型。模型卡
- LTX-2.5 视频 VAE (bf16)。对视频潜在进行编码和解码以实现高效生成,与主模型配对。在 LTX-2.5 仓库的 vae/ 下包含。视频 VAE
- LTX-2.5 音频 VAE (bf16)。处理音频潜在路径,以便最终渲染包含同步声音。在 LTX-2.5 仓库的 vae/ 下包含。音频 VAE
- 基于 Gemma 的 12B 文本编码器与 LTX-2.5 投影。提供与 LTX-2.5 匹配的提示嵌入,由 LTX 仓库在 text_encoders/ 下打包。文本编码器
- LTX-2.5 潜在空间放大器 x2 1.0。潜在空间超分辨率模型,在粗略通过后添加细节。放大器
- LTX-2.5 蒸馏 UNet (GGUF 量化)。通过 ComfyUI-GGUF 加载器加载量化的 UNet 权重以减少内存使用,同时保持可接受的质量。GGUF 是推理格式,不是官方模型名称。ComfyUI-GGUF
如何使用 ComfyUI LTX 2.5 GGUF ComfyUI 工作流程#
管道分两个阶段运行:一个引导的低分辨率通过以建立运动和时间安排,然后是潜在放大和高分辨率细化。音频在整个过程中作为配对的潜在传递,然后解码并与最终帧混合。
模型#
使用 UnetLoaderGGUF (#406) 加载 GGUF 量化的 UNet。视频和音频 VAE 使用 VAELoader (#385, #386) 选择,基于 Gemma 的文本编码器由 CLIPLoader (#387) 提供。放大器使用 LatentUpscaleModelLoader (#371) 选择。这个组定义了所有其他组依赖的骨干。
提示#
在 Prompt 字段中编写您的场景描述,重点是主题、运动和一个清晰的摄像机移动。文本编码器通过 LTXVConditioning (#365) 嵌入正面和负面提示,该工具还接受选定的帧率以对齐时间。如果您想要类似语音的音频,请包含简短的引用行;音频路径将响应文本上下文,同时保持场景感知。保持提示简洁具体,以避免冲突的引导。
视频设置#
设置持续时间、帧率和目标大小。实用程序将秒数和 fps 转换为帧数,以便图表分配正确的时间长度。坚持使用 32 的倍数的尺寸以确保稳定性和速度。使用分辨率选择器选择一个常见的宽高比,然后调整到您想要的比例。
图像预处理#
加载第一个(参考)帧,让 LTXVPreprocess (#350) 为 LTX-2.5 规范化它。开关 Switch to Text to Video? (#363) 控制图像是用作空间锚还是被绕过用于纯文本到视频。调整助手保持您的输入与工作分辨率一致。良好的预处理提高身份保留和布局。
空潜在#
EmptyLTXVLatentVideo (#356) 和 LTXVEmptyLatentAudio (#366) 预分配视频和音频的时间画布。这些长度来自您的持续时间和 fps 选择。这种分离确保视频和音频路径在采样和细化过程中保持同步。
生成低分辨率#
第一个采样器块使用 LTXVDualCFGGuider (#388) 结合您的提示条件驱动运动和场景动态,然后使用 SamplerCustomAdvanced (#344) 合成粗糙的潜在。如果您正在进行图像到视频,LTXVImgToVideoInplace (#357) 将参考帧注入潜在以稳定身份和构图;对于文本到视频,它被绕过。这个通道有意较轻,以在放大之前建立运动和时间安排。
潜在放大#
LTXVSeparateAVLatent (#367) 将音频和视频分开,以便视频潜在可以通过 LTXVLatentUpsampler (#348) 使用 x2 模型增强。经过预处理的图像可选择性地重新应用 LTXVImgToVideoInplace (#349) 以在放大后保持细节一致。然后通过 LTXVConcatAVLatent (#340) 重新附加音频潜在,保持同步。
生成高分辨率#
第二个采样器块 (LTXVDualCFGGuider (#391) 加上 SamplerCustomAdvanced (#368)) 在更高的比例上细化细节和时间一致性。LTXVSeparateAVLatent (#369) 将音频传递给 LTXVAudioVAEDecode (#358),而视频潜在通过 VAEDecodeTiled (#374) 使用平铺解码以减少 VRAM 峰值。CreateVideo (#370) 将帧和音频组装成最终的 MP4,目标 fps。
ComfyUI LTX 2.5 GGUF ComfyUI 工作流程中的关键节点#
UnetLoaderGGUF (#406)#
加载 LTX-2.5 蒸馏 UNet 为 GGUF 格式。选择与您的 VRAM 预算匹配的量化文件;较轻的量化降低内存并加速推理,但可能会影响质量。如果您升级到量化更少的文件,请期待更清晰的纹理和更稳定的细微运动。
LTXVImgToVideoInplace (#357 和 #349)#
将第一帧注入潜在,使运动从您的图像中演变而不是漂离。切换 bypass 输入在图像到视频和文本到视频之间切换时使用。在初始稳定化时使用低分辨率节点 (#357),在放大后重新锚定细节时使用高分辨率节点 (#349)。
LTXVLatentUpsampler (#348)#
应用 LTX-2.5 潜在空间放大器以在不解码为像素的情况下添加细节。当您希望在几乎相同的内存成本下获得更多定义时使用它。如果放大后出现闪烁,请在后续细化阶段稍微增强引导。
ManualSigmas (#397 和 #396)#
控制采样器使用的去噪时间表。较短的时间表速度更快,但可能会降低依从性或时间平滑性;较长或前载时间表增加稳定性,但成本更高。与采样器选择配对以平衡速度和质量。
VAEDecodeTiled (#374)#
使用平铺将高分辨率视频潜在解码为帧以限制 VRAM 使用。如果内存不足,减少平铺大小或启用更强的平铺;如果看到接缝,增加重叠或尝试更大的平铺。保持您的 VAE 选择与官方 LTX-2.5 视频 VAE 一致。
CreateVideo (#370)#
将图像序列和解码音频混合成最终视频文件。将 fps 设置为匹配您的生成帧率以避免时间拉伸。使用此作为单次渲染点,以便在迭代中获得一致的输出。
可选额外功能#
- 对于图像到视频,仅描述一个清晰的摄像机移动和主体动作;避免多个相互竞争的移动。
- 对于文本到视频,保持提示简洁,并在适当时添加简短的引用行以获得类似语音的音频。
- 分辨率提示:坚持使用 32 的倍数;常见的 16:9 尺寸包括 960x544(快速)和 1344x768 或 1504x832(更清晰)。仅在您有 VRAM 空间时增加。
- 如果结果忽略了提示,请在采样器块中增加引导或简化提示语言。
- 为了跨运行可重复性,在噪声节点中设置固定种子;随机种子最适合探索。
- 如果 VRAM 紧张,优先选择您能负担的 GGUF Q 级别,并保持启用放大器;它以最小内存成本添加细节。
参考链接:官方 LTX-2.5 模型和资产位于 Hugging Face 上,GGUF UNet 加载器来自 ComfyUI-GGUF。
- LTX-2.5 模型和资产:Lightricks/LTX-2.5
- GGUF 加载器:city96/ComfyUI-GGUF
致谢#
此工作流程实现并基于以下作品和资源构建。我们感谢 Lightricks 提供的 LTX-2.5 和 city96 提供的 ComfyUI-GGUF 的贡献和维护。有关权威详细信息,请参考下面链接的原始文档和仓库。
资源#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的相应许可证和条款。


