MiniMax H3 Taomate 三步加速:从参考图像到电影视频的音频同步#
这个 ComfyUI 工作流程将一两张静态图像和一个电影提示转化为连贯的视频并进行声音同步。围绕 MiniMax H3 和 TaoMate H3 三步加速 LoRA 构建,实现快速采样,同时保留主体身份、场景连续性、摄像机运动和音频提示。MiniMax H3 Taomate 三步加速流程非常适合角色肖像、科幻节拍、历史再现和精致的短片概念,您希望有强烈的相似性控制和自然的运动。
通过将参考图像与镜头结构化提示配对,MiniMax H3 Taomate 三步加速工作流程在屏幕上产生一致的表现者、稳定的灯光和布景,并有一个跟随文本方向的氛围音轨。它配备了内存高效的注意力补丁和分块推理,因此您可以在低 VRAM 下运行更大的帧,同时保持音频和视频对齐。
Comfyui MiniMax H3 Taomate 三步加速工作流程中的关键模型#
- MiniMax H3 参考到视频基础模型。从文本和视觉参考驱动视频和音频生成。查看官方模型卡以了解功能和格式:MiniMaxAI/MiniMax-H3。
- TaoMate-H3 三步加速 LoRA。重构去噪计划,以便在很少的步骤中达到高质量,使工作流程使用的 3 步样式计划成为可能。项目和权重:TaoMate-H3 on GitHub 和 TaoLiveAIGC/TaoMate-H3。
- Qwen3-VL 32B 文本编码器变体用于 MiniMax H3。编码长的、镜头感知的提示,带有摄像机和声音指令,以实现更强的条件。与 Comfy-ready H3 包一起分发:Comfy-Org/MiniMax-H3。
- MiniMax H3 视频 VAE 和音频 VAE。将共享的潜在流解码为图像帧和同步的音频,确保唇部安全的时序和氛围连续性。包括在 Comfy-Org/MiniMax-H3。
如何使用 Comfyui MiniMax H3 Taomate 三步加速工作流程#
工作流程从输入流向一个发出视频和音频统一潜在的单一采样路径,然后解码并混合到最终文件。组织组以便您可以先设置参考和文本,然后让 MiniMax H3 Taomate 三步加速处理堆栈接管。
图像/视频输入(2)#
将一或两个主体帧加载到 LoadImage (#94) 和 LoadImage (#9)。使用干净、正面的图像,照明稳定且没有严重遮挡,以便身份保持锁定。一个强烈的参考就足够了;第二个角度可以帮助保持服装、比例和环境。这些参考会馈送到 MiniMaxH3ReferenceToVideo,以在去噪开始之前初始化身份、姿势范围和布局。
文本输入(1)#
在 Prompt (#93) 中输入您的电影提示。编码器偏好结构化的散文,带有镜头分解、摄像机移动、运动动词和两个可选的声音模块:一个氛围行和一个非叙述性音乐行。您可以保留提供的模板样式,并用您的场景和时间标记替换其内容。这些指令对图像和声音进行条件化,因此 MiniMax H3 Taomate 三步加速堆栈可以将音频事件与屏幕上的动作对齐。
处理(22)#
此组加载 MiniMax H3,应用 TaoMate 三步加速 LoRA,并安装内存高效注意力以进行低 VRAM 运行。MiniMaxH3ReferenceToVideo (#11) 将您的参考图像和提示融合为潜在计划;Resolution Selector (Size) (#20) 设置宽度和高度;Float (Duration) (#17) 驱动运行时间。一个小的表达式节点将持续时间转换为与内部步幅对齐的 H3 友好帧数,以便运动保持平滑。采样器、引导器、调度器和 sigma 移动然后执行短、激进的计划,旨在不牺牲身份或场景稳定性地实现 MiniMax H3 Taomate 三步加速。
输出(2)#
采样器的去噪潜在被解码两次:VAEDecode (#25) 产生帧和 VAEDecodeAudio (#14) 产生声音。CreateVideo (#34) 在您选择的 fps 下将帧和音频混合为一个准备分享的片段,SaveVideo (#5) 用您的文件名前缀进行保存。输出反映了您的镜头级文本,并保留了参考图像中的面部相似性。由于视频和音频共享一个潜在,整个过程中保持同步。
Comfyui MiniMax H3 Taomate 三步加速工作流程中的关键节点#
MiniMaxH3ReferenceToVideo (#11)#
这个节点是将文本图像条件化输入 H3 流程的入口。用它来提供您的提示,一或两个参考图像,以及有效的 width、height 和 length。为了精确的时序,上游调整持续时间并让计算的 length 自动对齐;通过选择器更改分辨率而不是在此键入原始尺寸。如果更换或添加参考,请保持图像间一致的构图以避免身份漂移。
LoraLoaderModelOnly (#92) — TaoMate H3 三步加速#
应用 TaoMate H3 LoRA,使 MiniMax H3 Taomate 三步加速计划成为可能。仅在需要更快速度或在非常低的步骤下需要更强引导时增加其影响力;如果观察到过度锐化或细微运动减少,则稍微减少它。将其与简洁、具体的提示配对,以便短计划有明确的目标进行收敛。
MiniMaxH3SigmaShift (#38)#
调整噪声计划以在保持音频稳定的同时平衡视频的清晰度和时间一致性。如果您的帧看起来太软,请向上调整视频偏移;如果氛围变得过于主导或脆弱,请缓和音频偏移。进行小的、协调的更改,并在提交完整渲染之前预览几秒钟。
SamplerCustomAdvanced (#21)#
使用您选择的采样器和调度器的 sigma 曲线运行短去噪路径。在比较提示时保持采样器一致,以便将更改归因于文本和参考,而不是采样。为了多样性,上游更改 RandomNoise 种子;这会改变微运动和摄像机感受,而不会损害身份。
ComfyMathExpression (#19) — 自动帧数#
将持续时间转换为与 H3 的内部步幅对齐的帧数,防止节奏卡顿。仅编辑持续时间输入节点;表达式将自动四舍五入到最接近的兼容计数。这保持了平滑运动,并使音频床与视觉节拍同步。
Resolution Selector (Size) (#20)#
选择长宽比和像素预算,同时保持两个维度为模型友好的瓦片尺寸的倍数。选择与您的可交付产品匹配的长宽比,然后提高或降低百万像素以在细节与速度和 VRAM 之间进行权衡。使用此而不是任意大小以避免 VAE 和注意力窗口中的对齐错误。
CreateVideo (#34) 和 SaveVideo (#5)#
将帧和音频混合为单个文件,并用您喜欢的前缀和格式保存。在此调整 fps 改变感知的运动速度和声音时序,而无需重新采样模型。在构建系列时使用一致的位深度和色彩空间,以便剪辑均匀分级。
可选附加功能#
- 提示工艺以获得最佳结果
- 以一句场景总结开篇,然后列出 1-3 个镜头块,带有清晰的动词和时间提示。
- 包括一条氛围线和可选的音乐提示,以使音频有意图。
- 避免矛盾的指令;MiniMax H3 Taomate 三步加速中的短计划奖励清晰。
- 强烈的参考图像
- 使用干净的、中等或中等宽度的框架,主体的脸部可见,服装可读。
- 保持照明温度和背景与目标场景相似,以减少颜色偏移。
- 快速、稳定的迭代
- 锁定您的种子以公平比较提示;一次只更改一个控制。
- 从中等分辨率开始,验证运动和同步,然后使用相同的种子进行最终传递。
- 风格控制
- 如果想要不同的风格外观,可以将包含的样式 LoRA 换成另一个 H3 兼容的 LoRA。
- 保持 TaoMate H3 加速 LoRA 活动,以保留 MiniMax H3 Taomate 三步加速的速度特性。
致谢#
此工作流程实现并构建在以下作品和资源之上。我们感谢 RunningHub.ai 提供工作流程来源,TaoLiveAIGC 提供 TaoMate-H3 项目和模型,以及 MiniMaxAI 提供 MiniMax-H3 模型的贡献和维护。有关权威细节,请参阅下面链接的原始文档和存储库。
资源#
- RunningHub.ai/工作流程来源
- 文档 / 发布说明:RunningHub.ai post
- TaoLiveAIGC/TaoMate-H3 项目
- GitHub: TaoLiveAIGC/TaoMate-H3
- Hugging Face: TaoLiveAIGC/TaoMate-H3
- TaoLiveAIGC/TaoMate-H3 模型
- Hugging Face: TaoLiveAIGC/TaoMate-H3
- GitHub: TaoLiveAIGC/TaoMate-H3
- MiniMaxAI/MiniMax H3 官方模型
- Hugging Face: MiniMaxAI/MiniMax-H3
注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的各自许可和条款。

