ComfyUI>工作流>ComfyUI MiniMax H3 | 逼真的对话化身

ComfyUI MiniMax H3 | 逼真的对话化身

Workflow Name: RunComfy/ComfyUI-MiniMax-H3
Workflow ID: 0000...1481
将正面肖像转化为对话化身。添加简短的语音样本以克隆其语音。您将获得同步的嘴唇和共同生成的音频。身份和背景保持稳定。QwenVL 固定图像以进行控制。更快地创建演示、主持人和数字代言人。

ComfyUI MiniMax H3 Talking Digital Human Workflow

ComfyUI MiniMax H3 | Voice-Cloned Talking Avatars
想要运行这个工作流吗?
  • 完全可操作的工作流
  • 没有缺失的节点或模型
  • 无需手动设置
  • 具有惊艳的视觉效果

ComfyUI MiniMax H3 Talking Digital Human Examples

ComfyUI MiniMax H3 对话数字人:从肖像和语音到同步嘴唇的化身视频#

此工作流程将单个正面肖像和简短的语音参考转化为在 RunComfy 上具有同步语音的高质量对话头片段。围绕 MiniMax H3 参考到视频和音频的 QwenVL 图像固定构建,它在生成您的样本语音时保持身份和背景稳定。ComfyUI MiniMax H3 对话数字人非常适合产品说明、主持人化身、社交帖子和短代言人视频,无需单独的 TTS 或唇同步堆栈。

您提供一张图像和一个语音片段。工作流程推断出面部和场景的简洁描述,以此指导 MiniMax H3,并在统一潜在空间中共同生成视频帧和匹配的音频,以保持嘴唇和语音的对齐。结果被渲染为一个可以下载和分享的视频文件。

Comfyui ComfyUI MiniMax H3 对话数字人工作流程中的关键模型#

  • MiniMax H3 参考到视频和音频扩散模型。核心生成器,使用肖像和可选音频作为参考以生成同步的对话头。由 Comfy-Org 托管,便于在 ComfyUI 中使用。Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax H3 视频 VAE。编码和解码 MiniMax H3 使用的共享潜在空间的视频部分,帮助保持身份和背景稳定。与同一模型包一起分发。Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax H3 音频 VAE。编码和解码共享潜在空间的音频部分,以便语音与嘴唇运动同步生成。同样在模型包中提供。Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 4B Instruct。用于在上传的肖像的视觉细节中固定提示的视觉语言模型,提高身份保留和场景一致性。Hugging Face: Qwen/Qwen3-VL-4B-Instruct

如何使用 Comfyui ComfyUI MiniMax H3 对话数字人工作流程#

此工作流程分为四个区域:上传和编辑部分、持续时间助手、MiniMax H3 生成核心和输出阶段。从左到右工作,从媒体输入开始,然后是提示指导,然后运行生成并保存视频。

上传/编辑区域:通常只在这里更改;其余保持默认#

使用 LoadImage (#137) 上传单个正面角色肖像。正面或接近平面构图,眼睛和嘴巴可见,效果最佳。使用 LoadAudio (#141) 上传您想模仿音色的干净语音样本;可以是几秒钟的讲话,背景噪音最小。如有需要,使用 AudioCrop (#142) 通过设置开始和结束来修剪语音样本,以匹配您想让化身说出的片段。在 Prompt (#138) 中添加任何风格或内容指导;工作流程会自动附加图像固定的细节以提高一致性。

视频持续时间(秒):#

使用持续时间组顶部的数字控件设置目标持续时间。一个助手 ComfyMathExpression (#131) 将秒数转换为模型的有效帧数,并使其与采样器的要求对齐。这保持了时间稳定,避免了中音素截断。如果稍后更改持续时间,请更新音频修剪,以便最终的语音和嘴唇运动对齐。

MiniMax-H3 开源 - 图像对话数字人#

这是围绕 MiniMaxH3ReferenceToVideo (#136) 构建的核心生成路径。节点接收您的肖像作为参考图像,您的修剪语音片段作为参考音频,以及选择器提供的宽度、高度和长度。QwenVL 基于肖像的描述与您的书面提示结合,以便模型获得视觉固定和您的指示。模型发出一个包含视频和音频的单一潜在,以及采样器堆栈使用的条件,这就是为什么唇同步在没有单独唇同步阶段的情况下如此稳健。

使用 QwenVL 提供提示固定#

AILab_QwenVL (#152) 分析上传的肖像并返回简洁、事实性的描述。工作流程通过 JoinStrings (#150, #148, #144) 将该描述与您的指示文本连接,生成一个最终提示,告诉模型保持背景不变并使用您的音频作为语音。这种自动固定显著增强了身份和背景的稳定性。您可以保持书面提示简短,让固定填入准确的面部和场景细节。

分辨率/视频宽高比#

使用 ResolutionSelector (#115) 选择宽高比和目标分辨率。它输出与模型和您的 GPU 友好的宽度和高度,核心节点直接使用。对于肖像化身,较高的宽高比可以保留更多主体,同时留出自然头部运动的空间。如果在测试后调整宽高比,请在输入肖像中保持相同的构图以获得一致的结果。

输出生成的视频#

采样器路径去噪联合潜在,然后 VAEDecode (#122) 将其转化为帧,而 VAEDecodeAudio (#121) 将其转化为波形。CreateVideo (#130) 将帧和音频合并为单个剪辑,以您选择的帧率运行,SaveVideo (#92) 写入文件。保存的结果包含同一生成运行中的图片和同步语音。下载并审查;如果时间不对,调整音频修剪或持续时间,然后重新运行。

Comfyui ComfyUI MiniMax H3 对话数字人工作流程中的关键节点#

MiniMaxH3ReferenceToVideo (#136)#

管道的核心,接受参考肖像和语音样本以共同生成视频和音频。关键控制包括内容和风格的 prompt,构图的 widthheight,以及帧持续时间的 length。使用单个清晰的肖像作为第一个参考图像,并保持 ref_image_size 匹配,以便面部比例正确转移。如果看到漂移或背景变化,加强您的指示文本以明确保持背景不变。

ResolutionSelector (#115)#

设置宽高比和总体像素数,然后发出与模型友好的倍数对齐的宽度和高度。选择与您的肖像裁剪匹配的宽高比以减少重采样伪影。增加总分辨率可以提高细节,但也会增加 VRAM 和时间;在放大之前,先在较小的设置下测试。保持每次运行中的构图一致,以获得可重现的身份。

AudioCrop (#142)#

修剪上传的参考语音到您希望化身说出的片段。设置开始和结束到讲话部分,在开始和结束处留出小的沉默余量,以实现自然的起始和结束。将修剪的音频长度与目标视频持续时间匹配,有助于生成器将音素与嘴形对齐。如果爆破音或咝音看起来不对,尝试更干净的录音或缩短修剪范围。

AILab_QwenVL (#152)#

生成一个图像固定的描述,自动附加到您的提示中。这增加了关于面部、头发、服装和背景的具体细节,有助于模型保持身份和场景。如果固定的描述过于限制风格,请保持您的书面提示简短和中立,以便固定能发挥作用。对于多角色图像,上传更紧的裁剪,以便描述集中在单个主体上。

CreateVideo (#130)#

将解码的帧和音频合并为单个可播放文件。如果需要匹配下游时间线,可以更改 fps,但请保持与之前的持续时间到帧转换一致。如果在某些平台上看到卡顿,请在该平台上以常见的帧率重新导出。bit_depth 控制可以保持其默认值以用于网络传输。

ComfyMathExpression (#131)#

将您的持续时间(秒)转换为生成器的有效帧数,并与采样器的步幅对齐。这可以防止导致时间漂移的部分步骤。如果稍后更改帧率,请重新审视持续时间,以保持嘴唇运动与音节对齐。将此节点视为整个运行的时间源。

可选附加项#

  • 使用干净、均匀照明的肖像,眼睛和嘴巴不被遮挡,以获得最自然的表达。
  • 在安静的房间中录制 5 到 10 秒的清晰语音;避免在参考片段中出现音乐或重压缩。
  • 为了获得可重现的结果,请在 RandomNoise (#129) 中修复 RandomNoise 种子,而不是在运行之间随机化。
  • 如果需要字幕,请在后期添加,而不是内置到提示中,以便模型专注于面部和语音。
  • 在为真实人物创建 ComfyUI MiniMax H3 对话数字人时,尊重肖像和语音权利。

致谢#

此工作流程实现并建立在以下作品和资源的基础上。我们感谢 MiniMax 提供 MiniMax H3 模型,感谢 Comfy-Org 提供 MiniMax-H3 模型权重,感谢 Comfy.org 提供 MiniMax H3 教程的贡献和维护。有关权威的详细信息,请参阅以下链接的原始文档和存储库。

资源#

注意:使用所引用的模型、数据集和代码需遵循其作者和维护者提供的各自许可和条款。

RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。