MiniMax H3 ComfyUI 说话与唱歌双角色 4步加速#
这个RunComfy-ready工作流将两个肖像静态图像和一段短的演讲或歌唱轨道转变为一个同步对口型的视频,两个角色共享场景。基于MiniMax H3参考到视频与官方Turbo LoRA,它提供少步骤生成,同时保持两者身份稳定,嘴部动作与您的源音频锁定。
MiniMax H3 ComfyUI 说话与唱歌双角色 4步加速非常适合二重唱、两人对话节拍、预告片或快速演出预览。您带来两张图片和一个音频文件,添加一个简短的提示,选择一个大小,图表将渲染一个带有原始音轨的mp4。
Comfyui MiniMax H3 ComfyUI 说话与唱歌双角色 4步加速工作流中的关键模型#
- 来自Comfy-Org的MiniMax-H3参考到视频骨干——生成模型,将您的参考和文本映射到视听潜空间用于视频合成。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16——编码和解码视频潜空间,以便帧可以高效去噪并高保真重建。包含在模型包中。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32——在潜空间中表示驱动音频,以便从您的轨道学习口部运动和时序。包含在模型包中。Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B文本编码器(AWQ/NVFP变体为H3打包)——解释您的提示以设置场景、风格和镜头意图用于双角色构图。包含在模型包中。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4步LoRA——加速采样,使您可以在仅需四个去噪步骤的情况下渲染,同时保持身份和对口型。Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
如何使用Comfyui MiniMax H3 ComfyUI 说话与唱歌双角色 4步加速#
此图表从左到右流动:您加载两个角色静态图像和一个音频剪辑,设置提示和大小,然后核心H3路径将参考和音频融合成AV潜在。一个短暂的音频锁定阶段保留您的原始音轨,同时驱动口部运动,Turbo LoRA的采样器执行少步骤去噪,然后最终视频组装。
- 上传图片(角色A)
- 将角色A的清晰、正面静态图像放入
LoadImage(#227)。优选与角色B相似的头部大小和光线以稳定共存。背景可以简单;身份和姿势是优先考虑的因素。节点将供给H3参考堆栈,以便模型学习共享场景中的第一个说话者。
- 将角色A的清晰、正面静态图像放入
- 上传图片(角色B)
- 在
LoadImage(#137)中提供角色B。保持框架、方向和表情与角色A大致相同,以减少镜头之间的漂移。第二个参考让H3合成一个双镜头,其中两个人在彼此说话或唱歌时保持一致。
- 在
- 上传音频
- 在
LoadAudio(#171)中添加您的对话或人声。使用AudioCrop(#177)设置开始和结束时间,以便剪辑长度与您想要的段落匹配。清晰、居中的音频改善口部发音并减少时序抖动。
- 在
- 提示
- 在
Input Text (Prompt)(#138)中描述镜头。简短的电影化措辞效果很好,例如描述两角色的镜头距离、背景和氛围。提示引导布局和风格,而不替代静态图像的身份指导和您的轨道的时序。
- 在
- 分辨率选择器(大小)
- 在
Resolution Selector (Size)(#115)中选择纵横比和目标大小。选择器输出的宽度和高度已经对齐到模型友好的倍数,以平衡细节和速度。内置的大小说明提供可用的16:9预设,因此您可以选择符合GPU预算的百万像素等级。
- 在
- 结果
- 在
VHS_VideoCombine(#142)中解码帧并与原始音频多路复用以生成mp4。如果您的渲染略长或略短,请在此步骤中使用提供的切换以修剪到音频长度。文件名和格式预先配置,以便快速迭代。
- 在
- 核心(勿修改)
- 在此受保护区域内,
MiniMaxH3ReferenceToVideo(#136)将两个参考图像、提示和裁剪的音频融合成一个联合AV潜在和正面条件。VRGDG_MiniMaxH3AudioDrive(#172)锁定源音频,以便对口型跟随您的轨道,同时音轨不变通过。UNet经过内存效率优化,LoraLoaderModelOnly(#234)在采样器去噪和VAEDecode重构帧之前应用Turbo 4步LoRA。这些内部经过调谐以保证稳定性和速度,因此您通常不需要调整它们。
- 在此受保护区域内,
Comfyui MiniMax H3 ComfyUI 说话与唱歌双角色 4步加速工作流中的关键节点#
MiniMaxH3ReferenceToVideo(#136)- 图表的核心,摄入两个角色静态图像、您的提示、宽度、高度和自动计算的剪辑长度。它还接受裁剪的音频作为参考,以便音素时序和语素形状与音轨对齐。如果您需要更紧密的控制,可以直接调整
prompt、width、height,或覆盖length以用于特殊时序。
- 图表的核心,摄入两个角色静态图像、您的提示、宽度、高度和自动计算的剪辑长度。它还接受裁剪的音频作为参考,以便音素时序和语素形状与音轨对齐。如果您需要更紧密的控制,可以直接调整
VRGDG_MiniMaxH3AudioDrive(#172)- 将口部运动锁定到提供的源音频,同时确保最终视频使用相同的音轨。当您希望精确的歌词或对话时序而无需任何生成音频更改时使用此功能。提供干净的人声或对话以获得最佳效果。
LoraLoaderModelOnly(#234)- 加载MiniMax-H3 Turbo 4步LoRA,以便采样器可以在很少的步骤中收敛。如果您更喜欢较慢但可能更保守的去噪,可以减少LoRA影响;为了最大速度,请保持默认强度。模型参考:MiniMax-H3 Turbo LoRA。
SamplerCustomAdvanced(#125)- 使用上游选择的调度器和采样器执行实际去噪。激活Turbo LoRA后,您可以用最少的步骤快速渲染;只有在看到运动不稳定时才增加步骤。种子控制来自
RandomNoise(#129)以便可重复的拍摄。
- 使用上游选择的调度器和采样器执行实际去噪。激活Turbo LoRA后,您可以用最少的步骤快速渲染;只有在看到运动不稳定时才增加步骤。种子控制来自
Resolution Selector (Size)(#115)- 输出与模型对齐的宽度和高度,因此您不需要处理倍数或纵横比数学。使用它在预览、中等和最终大小之间跳转,同时保持构图一致。较大尺寸增加身份细节,但需要更多VRAM和时间。
AudioCrop(#177)- 将输入音频修剪到您想要动画的精确片段。使用此功能来剪除静音或隔离一段诗句或对话节拍。干净的进入和退出点有助于口部开合时序。
VHS_VideoCombine(#142)- 将解码的帧和通过音频组装成可共享的mp4。使用内置选项将持续时间与音轨对齐,并设置文件名约定。这是您的MiniMax H3 ComfyUI 说话与唱歌双角色 4步加速输出的最终交付步骤。
可选附加功能#
- 匹配两张图片中的主题比例和脸部角度,以最小化身份漂移。
- 保持提示简洁和视觉化:相机距离、环境、氛围和光线提示。
- 在迭代时使用噪声种子,以便您可以可靠地在拍摄之间进行A/B更改。
- 如果剪辑略微超出,请在组合步骤中启用修剪以实现帧准确同步。
- 从中档分辨率开始,然后在块和时序看起来正确时放大。
致谢#
此工作流实现并构建在以下作品和资源之上。我们感谢MiniMax Research提供MiniMax H3,感谢Comfy.org提供ComfyUI MiniMax H3教程,感谢Comfy-Org和larryvrh提供MiniMax-H3模型权重和MiniMax-H3 Turbo LoRA的贡献和维护。有关权威的详细信息,请参阅下方链接的原始文档和存储库。
资源#
- MiniMax Research/MiniMax H3官方公告
- 文档/发布说明:MiniMax H3官方公告
- Comfy.org/MiniMax H3教程
- GitHub:Comfy-Org/docs
- 文档/发布说明:Comfy.org MiniMax H3教程
- Comfy-Org/MiniMax-H3模型权重
- GitHub:Comfy-Org/workflow_templates
- Hugging Face:Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub:Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face:larryvrh/MiniMax-H3-Turbo-Lora
注意:引用模型、数据集和代码的使用遵循其作者和维护者提供的各自许可证和条款。


