ComfyUI>工作流>MiniMax H3 Fun Control | 精确的图像到视频转换

MiniMax H3 Fun Control | 精确的图像到视频转换

Workflow Name: RunComfy/MiniMax-H3-Control
Workflow ID: 0000...1506
将参考图像转变为可控视频。保持主体的身份、服装和场景一致。使用 H3 Fun ControlNet 引导运动。选择单控或深度加姿态分支。使用可选的 SolAttn 以加快运行速度。创建干净的行走、转身、挥手和全身运动。

ComfyUI MiniMax H3 Fun Control Workflow

MiniMax H3 Fun Control in ComfyUI | Depth and Pose Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Fun Control Examples

MiniMax H3 Fun Control: 在 ComfyUI 中的可控参考图像到视频生成#

这个 RunComfy 准备好的画布将 MiniMax H3 Fun Control 带到 ComfyUI,用于精确的、可提示的图像到视频转换。它遵循你的结构传递(深度、canny、姿态、HED 或 MLSD),同时尊重首帧参考或完整的角色/风格参考。默认布局配备了三个现成的分支,因此你可以从简单开始,按需扩大控制。

Graph 1 运行单控流,并默认启用。Graph 2 添加了一个链式的深度加姿态设置,具有角色/风格参考和真实的负面提示。Graph 3 镜像 Graph 2 但包括可选的 SolAttn 加速补丁。加载工作流后,你可以启用或绕过任何准备好的分支。

Comfyui MiniMax H3 Fun Control 工作流程中的关键模型#

  • MiniMax H3 基础 UNet (fl2va) 和参考到视频 UNet (ref2va)。这些是视频骨干,从提示和首帧(fl2va)或持久图像参考(ref2va)合成运动。ComfyUI 的社区打包权重可在 Hugging Face 的 MiniMax H3 实验集中获得:MiniMax-H3-experimental
  • MiniMax H3 Video VAE 和 Audio VAE。它们对 H3 使用的潜在视频和音频流进行编码和解码,以便管道可以高效采样,然后将结果转回像素和声音。参见相同的模型包:MiniMax-H3-experimental
  • Qwen-VL 系列文本编码器。工作流使用 Qwen-VL 系列的 MiniMax 调优变体来解析提示并将文本条件输入 H3。有关此模型系列的背景信息,请参阅官方存储库:Qwen2-VL
  • MiniMax H3 Fun ControlNet Union (curve-form)。这个单一的 ControlNet 支持多种控制传递(深度、canny、HED、姿态、MLSD),让你可以在帧之间引导场景结构。使用官方发布的曲线形式检查点:MiniMax-H3-Fun-Controlnet-Union

如何使用 Comfyui MiniMax H3 Fun Control 工作流程#

画布包含三个准备好的分支。Graph 1(单控)已启用,Graph 2(深度+姿态带参考)和 Graph 3(SolAttn 加速)被绕过。准备好时切换一个分支;只有启用的分支会运行。

01 · 单控 · 默认启用#

01 · 模型 这一组加载 MiniMax H3 基础 UNet、Qwen-VL 文本编码器和 H3 视频和音频的 VAE。它还加载曲线形式的 MiniMax H3 Fun ControlNet Union,以便单控流可以引导结构。除非你想从不同的检查点集中更换权重,否则不需要更改此处的任何内容。

01 · 控制:这是节点 加载一个与你计划的输出宽度、高度和帧数匹配的控制视频;节点会检查并在不一致时提高这两个数字。根据最佳捕捉你的运动和轮廓,选择任何支持的传递(深度、canny、姿态、HED、MLSD)。强度就像一个依从性预算;1.0 是单控的正确起点,推动更高往往会饱和细节。控制计划窗口定义采样期间控制何时激活;在 0.6 左右结束窗口通常能早期锁定结构,同时释放后期步骤以添加精细纹理。使用曲线形式的 ControlNet 检查点;全宽变体不会在此节点中加载。

01 · 条件 写下你的提示并可选地提供首帧。有了首帧,模型从该图像初始化,往往能保留构图;没有它,提示单独驱动外观。在此设置宽度、高度和长度;MiniMax H3 在其有效网格上以 24 fps(17n + 5)捕捉长度,因此围绕这些计数计划你的编辑。保持首尾帧未设置使用模型的自然开始和结束;添加最后一帧不是此分支的必需。

01 · 采样 采样器运行一个基本的引导器,没有 CFG 和负输入,这意味着你的文本中的负面在此处被忽略;如果你需要负面,请使用 Graph 2 或切换到 CFG 引导器。应用 sigma shift 以平衡视频和音频扩散计划,以便后期稳定解码。此分支中的计划和采样器选择经过调整,以实现合理的质量与速度权衡;一旦你有了基线,可以随意尝试。

01 · 输出 使用 H3 Video VAE 和(如果存在)Audio VAE 解码采样的潜变量。帧和音频被混合成一个视频并保存到你的输出中。使用保存的结果作为风格检查,并根据需要返回控制强度、计划窗口或提示。

02 · 深度 + 姿态参考 · 默认绕过#

02 · 模型 此分支加载 H3 参考到视频 UNet,旨在保持每帧的身份和风格。它共享 Qwen-VL 文本编码器和 H3 VAE。曲线形式的 MiniMax H3 Fun ControlNet Union 在此处重用,以驱动结构。

02 · 控制:链式,强度总和约为 1.0 两个应用节点被链式连接,因此每个控制流都添加自己的贡献,先是深度,然后是姿态。将强度视为预算:两个强度相加,且总和大大超过 1.0 将冲淡细节并涂抹主体。深度适合粗略几何和相机位置;姿态锁定肢体和关节。通过将一个强度设置为零并监听另一个来调整,然后将它们组合在接近 1.0 的总和附近。

02 · 条件和参考 使用 MiniMaxH3ReferenceToVideo 将真实的参考图像与提示一起输入,以便身份和风格在所有帧中保持一致。ref_image_sizemax 在计算成本上给予最强的身份(更大的参考标记);match 更快,通常足以进行更松散的风格控制。添加一个带有相同参考和你的负面文本的负面分支,以便 CFG 引导器可以减去你不想要的内容。长度、大小和帧数遵循与 Graph 1 相同的规则。

02 · 采样 切换到 CFGGuider 以便负面条件实际上适用;指导增加了成本,因为模型在每一步都评估正面和负面。在这里设置更高的步骤,以便链式控制和参考有空间解决;一旦你喜欢外观,可以修剪以加快速度。种子控制可重复性;在你平衡深度和姿态预算时保持固定。

02 · 输出 解码和视频装配与 Graph 1 相同。如果输出匹配结构但看起来过于平滑,请将控制窗口结束减少到 0.6 或稍微降低总控制强度。如果身份滑落,提高 ref_image_size 或添加第二个参考图像。

03 · 可选 Sol-Attn 加速 · 默认绕过#

03 · 模型 此分支镜像 Graph 2 的模型和控制,但添加了稀疏注意力加速补丁。它需要 SolAttn Triton 扩展。如果你没有安装 Triton 或节点包,请将此分支绕过。

03 · 控制:链式,强度总和约为 1.0 同样的深度加姿态链适用;保持组合强度接近 1.0 以获得清晰的结果。使用与 Graph 2 相同的调整方法找到最佳适合你的镜头和主体大小的分割。

03 · 条件和参考 与 Graph 2 相同。在正负分支中保持一致的参考,以便 CFG 减去正确的特征。如果你想要最大的身份,结合 ref_image_size: max 和稍高的步骤数。

03 · 可选:稀疏注意力 SolAttnPatch 加速注意力密集的块,同时在最重要的地方保持质量。保持 morton 关闭,因为在 Z 顺序中重新排列视频标记会对齐不正确,导致 ControlNet 应用其行偏移并有效地移除控制。保持最早和最晚的 transformer 块精确是当你想要速度而不失去遵从性时的安全默认设置。预计在 Triton 编译内核后运行速度会更快;第一次通过主要测量编译时间。

03 · 采样和输出 采样、解码和保存遵循 Graph 2。使用固定种子比较 SolAttn 开启与关闭,以判断你的内容的质量和遵从性。如果控制在 SolAttn 下显得较弱,请在调整强度之前仔细检查 morton 是否已禁用。

Comfyui MiniMax H3 Fun Control 工作流程中的关键节点#

Apply H3 Fun ControlNet (#23) 向当前模型添加一个控制流,并从你的控制视频中提取的控制帧批处理中获取。使用 strength 作为依从性预算:对于单控起始于 1.0;当链式控制时保持总和接近 1.0 以避免细节被冲淡。计划窗口(start_percentend_percent)决定控制何时激活;结束在 0.6 附近通常能保留控制无法描述的纹理。

Prompt + first frame -> conditioning (#31) 从你的文本提示和一个可选的首帧构建条件,以便模型可以尊重初始构图。如果省略首帧,提示单独引导内容。宽度、高度和长度在此处设置;H3 接受在其 17n + 5 网格上的长度,每秒 24 帧,因此围绕这些时长计划编辑。

Positive: references + prompt (#1031) 将持久图像参考和提示文本输入 H3,以便身份和风格贯穿每一帧。ref_image_sizemax 使用更大的标记以更高的成本提供更强的身份;match 更快,身份压力较轻。如果你需要强烈的排除项,请将其与负面分支和 CFGGuider 配对。

CFGGuider: the negative only works here (#1040) 启用分类器自由引导,以便负面条件生效。更高的引导增强提示和参考依从性,但增加计算量,因为每一步都运行正面和负面。对于长时间、特定风格的简报,中等的 cfg 可以显著改善依从性;使用固定种子进行并排测试。

Sigma shift (video 12 / audio 3) (#24) 调整扩散计划,以便视频路径和音频路径在采样之前具有适当的 sigma 配置文件。当你计划解码音频时,将其保留在链中,以便音频 VAE 接收兼容的潜在分布。

Sol-Attn (OPTIONAL, needs the SolAttn node pack + Triton) (#2060) 应用稀疏注意力内核以加速 H3,而不改变图形。保持 morton 禁用;启用它会重新排序标记,使 ControlNet 的贡献错过预期的行,这看起来像是完美的输出,简单地忽略了控制。对于保守的加速,保持最早和最晚的 transformer 块精确,并在 Triton 编译后进行配置。

BasicScheduler (#42) 为采样提供 sigma 计划和步数。对于严格控制的镜头,多几步可以帮助在控制消失之前稳定结构;对于快速风格通过,修剪步骤以节省时间。将调度器调整与控制窗口结合,以平衡遵从性和纹理。

可选附加项#

  • 控制视频必须与生成宽度、高度和帧数完全匹配;节点会检查并在不一致时提高这两个数字。
  • 使用曲线形式的 ControlNet 检查点;原始全宽发布不会加载在 H3FunControlLoader 中。
  • 如果你的控制传递有大面积无特征区域,请在 0.6 附近结束控制窗口,以便后期步骤可以从提示中添加纹理。
  • 对于身份关键的剪辑,偏好 Graph 2 或 Graph 3,使用 MiniMaxH3ReferenceToVideo 并考虑 ref_image_size: max
  • 在 Graph 1 中需要负面?替换为 CFGGuider 或移动到 Graph 2/3,负面分支已连接。
  • 项目资源:自定义节点 ComfyUI-H3-FunControl,曲线形式 ControlNet MiniMax-H3-Fun-Controlnet-Union,社区 H3 权重 MiniMax-H3-experimental,可选加速 ComfyUI-SolAttn_triton

致谢#

此工作流实现并基于以下作品和资源。我们感谢 wyzborrero 提供的 ComfyUI-H3-FunControl 自定义节点,alibaba-pai 提供的 MiniMax H3 Fun ControlNet Union 模型,Kijai 提供的 MiniMax H3 实验模型文件,kijai 提供的 SolAttn Triton 可选加速节点,以及 RunComfy 提供的 Cloud Save 工作流的贡献和维护。有关权威细节,请参阅下面链接的原始文档和存储库。

资源#

注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的相关许可证和条款。

RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。