MiniMax H3 高质量双采样工作流程:多参考视频与同步原生音频#
MiniMax H3 高质量双采样工作流程是一个为 RunComfy 准备的参考到视频图,用于将多个图像参考和可选的视频或音频提示转换为带有原生音频的短片电影剪辑。通过结合双采样计划、内存高效的 H3 注意力、专用的视频和音频 VAE,以及 turbo 4 步 LoRA 路径,它平衡了身份保留、稳定运动和清晰细节。
专为需要跨产品或角色连续性的创作者设计,此 MiniMax H3 高质量双采样工作流程允许您在一个提示中定义主题、场景和声音,然后无需重建图即可生成抛光的 H3 视频输出。为其提供一组静止图像,添加音频样式参考,并导出一个准备共享的 MP4。
Comfyui MiniMax H3 高质量双采样工作流程中的关键模型#
- MiniMax H3 参考到视频扩散模型 (Ref2VA)。核心生成器,将参考加上文本转换为视听潜在变量,支持帧和原生音频。查看官方存储库中的模型包和权重:MiniMaxAI/MiniMax-H3 和 Comfy-Org/MiniMax-H3。
- 优化的 MiniMax H3 的 Qwen3-VL 32B 文本编码器。解释描述主题、镜头和声音的结构化提示,然后通过包含在 Comfy-Org 模型包中的 CLIP 风格嵌入来调整 H3 UNet:Comfy-Org/MiniMax-H3。
- MiniMax H3 视频 VAE。压缩和解码视频潜在变量以实现高效的高质量帧生成,随 Comfy-Org 版本一起发布:Comfy-Org/MiniMax-H3。
- MiniMax H3 音频 VAE。编码和解码原生音频潜在变量,以便在同一管道中生成并同步语音和环境音:Comfy-Org/MiniMax-H3。
- MiniMax H3 Turbo 4 步 LoRA。一条轻量级的细化路径,在保持运行速度的同时提高细节和时间稳定性。它在此工作流程中堆叠在基础 H3 Ref2VA 模型之上。
如何使用 Comfyui MiniMax H3 高质量双采样工作流程#
此图分为清晰组,从参考和提示传递工作,通过 H3 采样,直到解码和 MP4 导出。双采样首先建立运动和结构,然后细化细节和音频,同时保留身份。
参考区域#
加载最多九个静态参考,用于人物、物体或环境。这些输入到 H3 参考到视频节点,使模型能够锁定身份、服装和场景元素。如果需要,您还可以路由一个短片作为视觉参考。使用已经匹配目标视角或光照的参考以获得最佳保留效果。如果您引入批量或精灵表,GetImageRangeFromBatch (#40) 可以提取您希望在下游使用的帧。
视频参考区域#
如果您更喜欢从参考视频开始,请使用视频加载器提取帧并可选限制持续时间。GetImageRangeFromBatch (#40) 选择连续片段,使工作流程保持轻量。这些帧作为第一个 H3 通过的结构或运动指导。您可以将视频与静止图像混合;H3 编码器在采样前融合它们。
音频参考区域#
加载一到三个短音频片段以指导语音音色、节奏或环境。这些不会被逐字复制;相反,它们塑造音频潜在变量,以便最终的语音或音景遵循相同的风格。对于口语,短而干净的语音片段,背景噪音最少的效果最佳。如果省略音频,工作流程仍然会根据提示生成合理的环境音。
模型#
此组连接 H3 UNet、基于 Qwen 的文本编码器和两个 VAE,然后应用内存高效的注意力补丁。Lora Loader Stack (rgthree) (#118) 添加 turbo 4 步 LoRA,以便您在不长时间安排的情况下获得更高的细节。注意力补丁节点减少 VRAM 压力,这在更高分辨率下很有帮助。它们一起准备了采样器将使用的条件堆栈。
采样#
MiniMaxH3ReferenceToVideo (#56) 是您的提示、参考和分辨率汇聚的地方,产生条件和初始视听潜在变量。节点读取结构化提示部分,如 subject_definitions、summary、retention_analysis、detailed_description、overall_soundscape 和 non_diegetic_music。此处设置基本指导器和采样器选择,以保持配置简单,同时仍然实现强大的控制。将其视为双采样细化器接管之前的准备阶段。
Sigma#
一个短计划器生成 sigma 计划,然后分裂以驱动双采样结构。一条分支强调稳定性和粗略运动,而另一条分支强调高频细节和清晰度。当您需要在困难镜头上进行更多清理时,一个小的布尔开关允许您扩展或绕过中间区域。您无需在此处调整数字;只需选择是否在面孔或标志需要额外保真度时启用扩展范围。
SamplerCustomAdvanced#
第一个 SamplerCustomAdvanced (#108) 通过在较低 sigma 范围内运行,以建立布局、身份和运动节奏。然后将潜在变量分为视频和音频,视频潜在变量可以在潜在空间中轻微放大,以为细节添加余地。第二个 SamplerCustomAdvanced (#103) 通过使用更高的 sigma 切片来锐化边缘和纹理,同时尊重第一个通过的指导器。一个伴随的 SamplerCustomAdvanced (#106) 通过可以选择性地去噪或保留区域,开关节点决定在解码之前的最佳最终潜在变量。正是这种双通道舞蹈赋予 MiniMax H3 高质量双采样工作流程其稳定性和清晰细节的可靠组合。
加速节点#
对于 VRAM 紧张的 GPU,UniBlockSwap 通过暂时将 UNet 块交换到系统内存来提供帮助,而 VRAMReserver 保持足够的余地用于解码和最终混音。这些速度和内存助手对质量影响最小,当您看到内存不足警告时可以打开。将它们保持在图中的 UNet 路径附近。
保存视频#
最终潜在变量由专用的视频和音频 VAE 解码,然后 PixaromaSaveMp4 (#115) 将帧和音频混合为 MP4。在此处设置目标帧速率,并选择是否将视频修剪为生成的音频长度。文件名前缀和子文件夹使得保持镜头组织井井有条。当您用新种子或参考重新运行时,输出将堆叠在同一文件夹中。
Comfyui MiniMax H3 高质量双采样工作流程中的关键节点#
MiniMaxH3ReferenceToVideo (#56)#
将文本、图像和可选的视频或音频参考融合为 H3 的条件和初始视听潜在变量。调整 prompt 以定义主题、场景连续性、镜头时间和声音设计,并设置 width、height 和 length 以定位纵横比和持续时间。使用多个参考图像锁定身份和服装,当连续性很重要时。
Lora Loader Stack (rgthree) (#118)#
在基础模型之上应用 MiniMax H3 turbo 4 步 LoRA,以在短时间内提高细节。调整 LoRA 强度,如果边缘过于锋利或基础模型风格被覆盖。参考已经具有强烈纹理时,保持 LoRA 层次最小。
MiniMaxH3MemoryEfficientSageAttentionPatch (#70)#
启用 H3 UNet 的内存高效注意力,以便您可以在适度的 GPU 上运行更高分辨率或更长的剪辑。适用于 8 到 12 GB 的显卡或当您看到 VRAM 峰值时打开。仅在您在高内存 GPU 上基准测试原始吞吐量时禁用。
SplitSigmas (#99)#
将调度器拆分为补充的 sigma 带,以便为两个采样器传递。如果您的场景稳定但缺乏生气,将更多权重转移到高 sigma 分支。如果运动抖动或身份漂移,偏向低 sigma 分支并保持扩展中间开关关闭。
SamplerCustomAdvanced (#108)#
第一遍采样器,奠定结构、运动和身份。保持指导器与您的提示和参考一致,以便第二遍具有干净的基础。在承诺细化之前,使用此遍快速测试种子和构图。
SamplerCustomAdvanced (#103)#
细化采样器,使用更高的 sigma 切片增强细节和修复边缘。最佳效果是在坚实的第一遍之后;当面孔或标志开始过度锐化时避免过度驱动。仅当您需要额外的纹理余地时才与潜在上采样配对。
ComfySwitchNode (#107)#
在双采样之后选择替代潜在细化。切换它以比较辅助去噪分支与直接细化分支的结果。记下哪个路径更好地保持了您的主题集的身份。
PixaromaSaveMp4 (#115)#
将解码的帧和音频混合为 MP4。设置 fps 以匹配运动的感觉,并使用 trim_to_audio 进行紧密的视听同步。更新 filename_prefix 以按拍摄或主题保持镜头组织井井有条。
可选附加功能#
- 从官方 H3 R2V 模板开始,学习核心模式,然后自定义此图:Comfy-Org 工作流程模板。
- 使用
ResolutionSelector(#73) 选择您的 GPU 可以处理的纵横比和百万像素目标,然后在构图看起来正确时逐渐增加。 - 在模型理解的结构化部分中提示:subject_definitions、summary、retention_analysis、detailed_description、overall_soundscape、non_diegetic_music。这种风格为 H3 提供了更清晰的约束。
- 对于身份关键的镜头,提供 3 到 5 张相同主题的高质量静止图像,光照和角度匹配。避免在参考上使用重滤镜。
- 提供一个干净的 1 到 5 秒语音风格片段作为音频参考,以便在角色之间保持一致的音色。保持噪音和音乐低。
- 如果遇到 VRAM 限制,启用注意力补丁和加速节点组。首先降低分辨率,然后是长度。
- 当运动正确但纹理柔和时,保持第一遍不变,增加对第二个采样器分支的依赖,而不是延长整体步骤。
- 经常保存版本。小提示编辑会产生重大影响,因为 MiniMax H3 高质量双采样工作流程同时为视频和音频提供条件。
致谢#
此工作流程实现并建立在以下作品和资源之上。我们对 MiniMaxAI 的 MiniMax-H3 模型、Comfy-Org/Comfy.org 提供的 ComfyUI 模板、权重和 MiniMax H3 教程,以及 RunningHub.ai 提供的工作流程参考的贡献和维护表示感谢。有关权威详细信息,请参阅以下链接的原始文档和存储库。
资源#
- RunningHub.ai/工作流程来源和参考
- 文档 / 发布说明:工作流程来源和参考
- MiniMaxAI/MiniMax-H3 (官方模型)
- Hugging Face: MiniMaxAI/MiniMax-H3
- Comfy-Org/MiniMax-H3 (模型权重)
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org/MiniMax H3 教程
- 文档 / 发布说明:教程
- Comfy-Org/ComfyUI MiniMax H3 R2V 模板
- GitHub: Comfy-Org/workflow_templates
注意:对所引用的模型、数据集和代码的使用受其作者和维护者提供的各自许可证和条款的约束。

