一体化 MiniMax H3 ComfyUI 多参考加速:多参考 Ref2VA 视频与同步立体声#
这个一体化 MiniMax H3 ComfyUI 多参考加速工作流程将最多九个视觉参考加上可选的视频和音频提示转化为一个短电影剪辑,带有原生立体声轨。它专为希望保持角色一致的创作者设计,能够融合多个身份、道具或地点,同时保持像 <Picture 1> 这样的提示标签与正确的参考对齐。
基于开放的 Comfy-Org MiniMax-H3 Ref2VA 堆栈构建,图形启用了 SageAttention 加速,以便在支持的 GPU 上更快地采样,并使用 int8 修剪模型来控制 VRAM 而不牺牲一致性。结果是一个适合 MiniMax H3 的单一 RunComfy 准备好的画布,其中多参考指导、时序、分辨率和导出被端到端连接。
Comfyui 一体化 MiniMax H3 ComfyUI 多参考加速工作流程中的关键模型#
- MiniMax-H3 Ref2VA 扩散模型(修剪 int8 convrot)。核心生成器,它将您的参考和提示融合为联合视频和音频潜在变量。权重:Comfy-Org/MiniMax-H3。
- Qwen3-VL 32B 文本-图像-语言编码器(AWQ,与 MiniMax-H3 发布一起打包)。解释您的提示,包括像 <Picture 1> 这样的标签,并为生成器设置条件。权重包含在 Comfy-Org/MiniMax-H3 中。
- MiniMax H3 视频 VAE (FP16)。以高保真度解码视频潜在变量到帧。权重:Comfy-Org/MiniMax-H3。
- MiniMax H3 音频 VAE (FP32)。将音频潜在变量解码为干净的立体波形,准备混音。权重:Comfy-Org/MiniMax-H3。
如何使用 Comfyui 一体化 MiniMax H3 ComfyUI 多参考加速工作流程#
在高层次上,您加载模型,提供参考和提示,工作流程构建 MiniMax-H3 条件,运行加速采样器,然后解码并组合视频帧与生成的立体音频。组按顺序工作:用户输入馈送条件,驱动采样;解码结果进入导出。
用户输入#
使用 LoadImage 节点连接最多九个参考。保持一致的顺序,以便像 <Picture 1>、<Picture 2> 等提示标签与预期图像匹配。在 Input Text (Prompt) 字段中编写您的场景和对话,明确将身份或资产映射到提示顶部的编号标签。在 Resolution Selector (Size) 中选择长宽比和尺寸;它输出宽度和高度,并对齐到 32 像素的倍数以确保稳定性。以秒为单位设置剪辑时长;内部表达式将其转换为接近 24 fps 的帧数,并对齐到与模型友好的倍数以实现平滑采样。
模型#
此组加载 MiniMax-H3 UNet、Qwen3-VL 32B 文本编码器和两个 VAE。修剪的 int8 Ref2VA 模型在保留运动和唇同步质量的同时减少内存。文本编码器为 MiniMax-H3 初始化,因此您提示中的视觉标签绑定到正确的参考。视频和音频的单独 VAE 确保解码准确且高效。模型与官方 Ref2VA 模板使用的相同系列,在此处适配用于多参考控制和联合音频。参考:MiniMax-H3 R2V 模板。
条件#
MiniMaxH3ReferenceToVideo 构建实际的 H3 条件和一个起始潜在剪辑。它接收您的 CLIP、VAE、所有连接的参考图像、提示以及选择的宽度、高度和长度。节点尊重占位符标签,因此身份、位置和道具保持附加到正确的参考。使用参考尺寸模式保持相对于输出的组成比例。节点发出一个积极的条件流和一个潜在剪辑,共同驱动采样器。
采样#
在采样之前,图形用 PathchSageAttentionKJ 包装模型以启用 SageAttention 加速,然后通过 VRAM 管理器路由,以便更大剪辑可以更舒适地适应。BasicGuider、BasicScheduler 和 KSamplerSelect 定义指导策略、步骤计划和采样器算法。RandomNoise 启动过程,SamplerCustomAdvanced 执行去噪过程,在模型和条件下产生精细的视频和音频潜在变量。布局在保持设置易于接近的同时平衡了 MiniMax-H3 的速度和质量。
导出#
VAEDecode 和 VAEDecodeAudio 将最终潜在变量转换为帧和立体波形。然后 VHS_VideoCombine 将帧和音频混合为单个 MP4,按照您选择的帧率,使用 CRF 进行质量控制,并使用简单的文件名前缀进行组织。您可以立即预览结果并将其保存到输出文件夹。如果您稍后提供外部参考音频,导出器可以修剪到该轨道长度以实现完美的对齐。导出器来自广泛使用的视频助手套件 ComfyUI:ComfyUI-VideoHelperSuite。
Comfyui 一体化 MiniMax H3 ComfyUI 多参考加速工作流程中的关键节点#
MiniMaxH3ReferenceToVideo (#136) 这是工作流程的核心,参考、提示、尺寸和长度在此融合为 MiniMax-H3 条件和一个潜在剪辑。调整 prompt 文本,使用明确的标签映射,如 <Picture 1> = character A 锁定身份。调整 width、height 和 length 设置构图和运行时间;上游选择器和持续时间控制确保安全倍数。使用参考尺寸模式在输出帧中平衡主体比例。节点支持官方 Ref2VA 路径,并在此处专为多参考控制而定制。
PathchSageAttentionKJ (#144) 用 SageAttention 包装模型以加速注意力层并减少对支持的 GPU 的内存压力。对于大多数显卡,将加速模式保持在 auto;仅当您的环境受益于它时才启用模型编译。如果您观察到不稳定,请关闭模式以比较性能。来源:ComfyUI-KJNodes。
BasicScheduler (#124) 定义去噪期间使用的西格玛计划和总步骤。增加步骤可以增加细节,但会增加渲染时间;在此处进行任何更改时,请与兼容的采样器类型配对。保持 denoise 接近满值以便纯生成功能,只有在进行强度限制的细化时才考虑降低。
SamplerCustomAdvanced (#125) 使用选定的采样器、计划和指导器运行扩散循环。默认采样器在保持 MiniMax-H3 的时间稳定性和运动流畅性方面取得了平衡。如果更改调度程序系列,请选择为其设计的采样器以避免伪影。
Resolution Selector (Size) (#115) 输出宽度和高度,并对齐到 32 像素的倍数以确保 GPU 友好的形状。设置 megapixels 以快速进行质量与速度的权衡,并选择如 16:9 的方面以获得宽屏镜头。使用适度的尺寸进行草稿预览,然后一旦时序和构图锁定后再放大。
ComfyMathExpression (#131) 将请求的秒数转换为接近 24 fps 的帧数,并对齐到与采样器和模型合作的倍数。这有助于避免时间抖动和偏差一的时间问题。您很少需要触碰它;从秒输入中控制时间。
VHS_VideoCombine (#143) 将帧和生成的立体音频混合为最终可交付文件。设置 frame_rate 以匹配您的目标时间线并调整 crf 以获得质量。当您提供外部轨道时使用 trim_to_audio 并希望获得完美的剪裁长度。
可选附加功能#
- 快速渲染干净的 16:9 尺寸:1056×608 (0.6 MP)、1216×672 (0.8 MP)、1344×768 (0.98 MP)、1664×928 (1.5 MP)、1920×1088 (2.0 MP)。
- 保持显式提示:从一个映射块开始,将
<Picture 1..9>绑定到身份、服装、道具或地点,然后描述镜头。 - 为了一致的面孔,使用清晰的正面图像,并仅在参考中略微改变光线或角度。
- 对话和音效效果良好,当它们被写成简短、自然的句子时;音频 VAE 将从 Ref2VA 潜在变量中合成干净的立体声轨。
- 如果 VRAM 紧张,首先渲染较短的剪辑或降低像素数,然后在对运动和构图满意后放大或延长。
- 此布局遵循官方 Ref2VA 模板谱系,适应于多参考控制和加速。参见基础模板以了解背景:MiniMax-H3 R2V 模板。
致谢#
此工作流程实现并构建在以下作品和资源之上。我们诚挚感谢 MiniMax 为 MiniMax H3,Comfy-Org 为 MiniMax-H3 模型权重和 MiniMax H3 R2V 工作流程模板,以及 Comfy.org 为 MiniMax H3 教程的贡献和维护。有关权威细节,请参考以下链接的原始文档和存储库。
资源#
- MiniMax H3 官方公告
- 文档 / 发布说明:MiniMax H3 公告
- Comfy-Org MiniMax-H3 模型权重
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org MiniMax H3 教程
- 文档 / 发布说明:Comfy.org 教程
- Comfy.org MiniMax H3 R2V 模板
- GitHub: Comfy-Org/workflow_templates
注意:使用所引用的模型、数据集和代码需遵循其作者和维护者提供的相应许可证和条款。

