ComfyUI>工作流>LTX 2.3 说话和唱歌唇同步视频制作器

LTX 2.3 说话和唱歌唇同步视频制作器

Workflow Name: RunComfy/LTX-2.3-Talking-Sync
Workflow ID: 0000...1461
此工作流程让您将肖像图像转换为说话或唱歌的视频,实现自然的嘴部同步。它帮助设计师和创作者为讲故事、音乐视频或互动内容赋予静态角色生命。围绕先进的音频分离技术构建,确保清晰的人声和精确的唇部动作。您可以轻松生成电影质量的结果,匹配面部表情和语音节奏。非常适合数字人类动画、虚拟歌手和表演测试。

ComfyUI LTX 2.3 Talking and Singing Lip Sync Workflow

LTX 2.3 Talking and Singing Lip Sync in ComfyUI | Portrait2Video Sync
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Talking and Singing Lip Sync Examples

LTX 2.3 说话和唱歌唇同步:肖像到表演 ComfyUI 工作流程#

LTX 2.3 说话和唱歌唇同步将清晰的正面肖像和语音或歌曲转化为电影级数字人类视频,具有富有表现力的同步嘴部动作。为 RunComfy 构建,它使用 LTX 2.3 视频生成与 LTXV ComfyUI 节点和 Mel-Band RoFormer 音频分离来保持面部可读性,同时匹配语音或歌词。

此 ComfyUI 工作流程适用于 AI 音乐视频、虚拟歌手、角色表演测试和创作者演示,其中屏幕上的表演者和最终音频必须保持可用。您提供一张肖像图像和一个音轨,选择帧率和持续时间,管道将渲染一个与您的音轨同步的 mp4。

注意: 为了获得特别令人印象深刻的结果,我们强烈建议使用 Ace Step Model 生成歌曲,然后使用 Seedream 5.0 Pro 创建清晰的电影肖像。将这两个资源作为音频和肖像输入用于此工作流程,以获得更精致的唱歌数字人类表演。

Comfyui LTX 2.3 说话和唱歌唇同步工作流程中的关键模型#

  • LTX-2.3 视频生成模型由 Lightricks 提供。一个基于 transformer 的音视频生成器,将音频特征与视觉运动结合,生成适合说话和唱歌的时间一致的帧。模型卡官方仓库
  • LTX-2.3 视频 VAE 和音频 VAE。潜在编码器/解码器,将视频和音频打包到 LTX-2.3 使用的 AV 潜在空间中,确保高效采样和清晰重建。在 LTX ComfyUI 集成中实现。ComfyUI-LTXVideo
  • MelBandRoFormer。一个现代音乐源分离模型,用于在这里可选地提取人声,以便在保持原始混音用于最终渲染的同时进行更清晰的唇部调节。权重ComfyUI 节点

如何使用 Comfyui LTX 2.3 说话和唱歌唇同步工作流程#

该工作流程分三个阶段运行:输入、LTX 2.3 生成和导出。组间协作从头到尾将您的肖像和音频转换为同步表演。

输入#

使用 Character Image (front view + 9:16, recommended) (#444) 加载一个正面肖像。图像被调整大小以适应模型,并轻微预处理以保持身份和嘴部区域细节。使用 Upload Song or Voice (#1755) 上传您的歌曲或语音,然后设置 Start lip-sync from which second? e.g. 10.0 (seconds) (#1776) 以跳过介绍小节或静音。选择一个持续时间,使用 Duration in seconds (best under 35s; enter 0 for full audio) (#1583),并为渲染设置 Frame Rate (#1586)。在 Prompt (#1624) 中写下意图提示,以指导表情和相机行为;工作流程还注入有助于避免字幕、水印和静态帧的负面提示。

LTX2.3 数字人类说话/唱歌唇同步#

您的肖像通过 LTXV Preprocess (#446) 和 LTXVImgToVideoInplaceKJ (#1762) 转换为起始潜在剪辑。使用 IMG STRENGTH. Set 0 for T2I mode (#1722) 控制肖像的强制程度:较高的值锁定照片,而较低的值允许更多生成运动。音频路径修剪您的上传,使用 Mel-Band RoFormer Sampler (#1599) 可选地分离人声,并通过 LTXV Audio VAE Encode (#1605) 对所选音轨进行编码。音频和视频潜在向量通过 LTXV Concat AV Latent (#350) 融合,CLIP Text Encode 节点的文本条件通过 LTXVConditioning (#164) 驱动整体场景意图和清洁度。LTX-2.3 模型通过 LTX2 NAG (#508) 打补丁并引导以实现唇部精度,然后在选定的调度程序和采样器下通过 SamplerCustomAdvanced (#161) 进行采样。

导出和保存#

采样后,视频潜在向量通过 VAE Decode (#1318) 解码为帧。Video Combine 🎥🅥🅗🅢 (#1747) 将这些帧与修剪后的原始音频混合,生成一个符合您选择的帧率的 mp4。如果您启用了仅用于调节的人声,最终导出仍使用完整混音,因此您的结果仍然可以分享。输出保存有清晰的前缀以便于版本管理。

Comfyui LTX 2.3 说话和唱歌唇同步工作流程中的关键节点#

LTXVImgToVideoInplaceKJ (#1762)#

将参考肖像转换为初始潜在视频。调整 IMG STRENGTH. Set 0 for T2I mode (#1722) 以平衡身份锁定与运动自由。为了紧密的相似性和稳定的头部姿势,保持较高的强度;为了更多的表现性运动,降低它。如果设置为 0,将工作流程视为文本到视频,并更多依赖提示和音频。

Mel-Band RoFormer Sampler (#1599)#

从歌曲中分离人声,以便向模型提供更清晰的语音特征。当乐器掩盖辅音或辅音丢失时,使用 USE VOCALS ONLY (#1616);当您希望完整混音影响表现力时,将其关闭。最终渲染使用原始修剪的音频,保留您预期的配乐。请参阅上面链接的 ComfyUI 扩展中的模型详细信息和权重。

LTXV Audio VAE Encode (#1605)#

将选定的音频编码到驱动嘴部形状和微表情的 LTX 音频潜在空间中。在编码前修剪明显的静音以获得更快速的对齐。如果您的歌词输入不在 0 秒开始,请配合使用开始时间偏移。

LTX2 NAG (#508)#

应用针对 LTX 2.3 的噪声增强引导,以加强音频到唇部的耦合。如果嘴唇动画不足,稍微提高其引导;如果牙齿或嘴形看起来过度驱动,降低效果。小的增量变化效果最好,因为此控制与您的提示强度和采样器设置交互。参考实现位于 LTX 仓库中。

SamplerCustomAdvanced (#161)#

使用您选择的 KSamplerSelect (#154)、CFG Guider (#153) 和调度程序运行去噪过程。较低的无分类引导通常有利于自然运动和身份保留;较高的值增加提示主导,但可能使嘴唇僵硬。如果切换采样器,请保持其余设置不变,以便进行公平的 A/B 比较。

Video Combine 🎥🅥🅗🅢 (#1747)#

通过组合帧和修剪后的音频写入最终 mp4。保持默认设置以获得广泛兼容性,或在计划后期进行色彩分级时提高质量。确保 frame_rate 符合您的创意意图,并与您之前设置的匹配。

可选附加功能#

  • 使用干净的正面肖像,具有中性照明和 9:16 裁剪,以获得最具说服力的 LTX 2.3 说话和唱歌唇同步结果。
  • 如果乐器掩盖辅音,启用 USE VOCALS ONLY (#1616),以便模型在更清晰的人声干线上进行调节,而您的导出保留完整混音。
  • 将剪辑保持在大约 35 秒以下以加快迭代速度;如果您正在制作长音乐视频,请在外部拼接拍摄。
  • 当运动过于静态时,降低 IMG STRENGTH;当身份漂移时,提高它并简化提示。
  • 通过修剪前导静音和使用开始时间偏移控制来对齐歌词,以便嘴形在您的第一个词上准确开始。
  • 设置固定的 Start Seed 以重现一次拍摄,然后更改种子以获得替代版本。
  • 在公共项目中使用此 LTX 2.3 说话和唱歌唇同步工作流程时,尊重肖像和音乐版权。

官方资源链接

致谢#

此工作流程实现并构建在以下作品和资源之上。我们感谢 Lightricks 提供 LTX-Video(包括 LTX 2.3 模型和 ComfyUI-LTXVideo 节点),Kijai 提供 MelBandRoFormer(ComfyUI 节点和模型权重),以及 RunningHub 提供的工作流程源文章的贡献和维护。有关权威详情,请参阅下文链接的原始文档和仓库。

资源#

注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的相关许可和条款。

RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。