3D AI 渲染与 MINIMAX H3:从泥塑到电影的 ComfyUI 工作流程#
这个由 Mickmumpitz 创建的 ComfyUI 图形将普通灰色 3D "泥塑" 渲染转变为具有可选同步音频的电影级、全纹理化视频。它使用原始动画作为结构,因此构图、几何形状和运动保持不变,同时模型添加材质、照明、环境和逼真的细节。
专为 3D 艺术家、动画师和电影制作者设计,3D AI 渲染与 MINIMAX H3 桥接了 DCC 动画和 AI 视频生成。提供 24 fps 的泥塑通道用于运动,一个或多个静态 "样式板" 用于风格,然后用简洁的提示和时间线引导结果。工作流程生成一个精致的镜头和一个可选的并排比较以便快速审查。
ComfyUI 3D AI 渲染与 MINIMAX H3 工作流程中的关键模型#
- MiniMax‑H3 ref2va 扩散模型。核心视频生成器,遵循参考视频的结构,同时合成帧和音频。使用为 ComfyUI 提供的 ref2va 变体:minimax_h3_ref2va_pruned_int8_convrot.safetensors。 Model
- Qwen‑VL 32B 文本编码器用于 MiniMax H3。将提示、标签和时间线编码为 H3 理解的条件。使用 MiniMax 调整的文件 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors。 Encoder
- MiniMax‑H3 视频 VAE (fp16)。将视频潜在变量解码为 RGB 帧。 VAE video
- MiniMax‑H3 音频 VAE (fp32)。将音频潜在变量解码为跟踪生成视觉的声音。 VAE audio
- MiniMax‑H3 FL2VA 4 步 Turbo LoRA (可选)。在需要时加速推理并增加细节。 LoRA
- MiniMax‑H3 精简 w4a8 混合 (可选较小基座)。如果需要节省 VRAM,这是一个精简的替代方案。 Alternative base
如何使用 ComfyUI 3D AI 渲染与 MINIMAX H3 工作流程#
简而言之,泥塑视频定义运动,样式板静态图像定义材质和照明,提示将它们结合在一起。渲染组将这些信号输入 MiniMax H3,然后输出组解码帧和音频并保存您的结果,包括一个并排比较器。
组 1 — 加载 MINIMAX H3 模型#
此组准备 3D AI 渲染与 MINIMAX H3 的模型堆栈。UNETLoader (#8) 加载 MiniMax‑H3 ref2va 扩散权重,CLIPLoader (#9) 加载 Qwen‑VL 32B 文本编码器,两个 VAELoader 节点(#11 用于视频,#13 用于音频)提供解码器。小型 Set_* 和 Get_* 辅助工具缓存这些组件以便在图形中重用。保持两个 VAE 活跃,因为 MiniMax‑H3 可以在单次传递中生成图像和声音。如果切换到较小的 Kijai 变体,只需更改扩散模型文件。
组 2 — 速度#
此区域加速迭代,同时保持对泥塑通道的结构锁定。LoraLoaderModelOnly (#16) 应用 4 步 Turbo LoRA 以获得更快、更清晰的预览。MiniMaxH3SigmaShift (#17) 调整时间表以适应 LoRA,EasyCache (#18) 避免运行之间的冗余工作。使用 LoRA 进行快速风格开发;如果您想要最大忠实度或更柔和的效果,请绕过它并使用组 5 中的多步计划进行渲染。
组 3 — 设置#
在这里,工作流程为 3D AI 渲染与 MINIMAX H3 派生出最安全的画布。MinimaxH3Resolution (#121) 读取参考图像以建议 H3 原生网格上的宽度和高度,防止扭曲和时间闪烁。轻量级控制保持步骤和种子,而 PreviewAny (#122) 回显活动分辨率以便快速检查。长度计算一次并存储,以便图像和音频在管道中保持对齐。为了可重复的重拍,请保持一个固定的种子。
组 4 — 输入#
使用 VHS_LoadVideo (#30) 导入您的 24 fps 泥塑渲染。工作流程将镜头长度捕捉到 H3 的内部帧网格,以便时间保持稳定;如果需要每一帧,请修剪或填充您的源以达到最近的有效长度。使用 LoadImage (#36, #38, #40) 添加一到三个样式板。样式板是代表最终材质、颜色和照明的静态照片或概念图像;它不是泥塑视频的帧,也不会改变布局。如果您希望将音频带入生成中,可以使用 LoadAudio (#34) 可选加载外部音频文件。如果您计划生成语音,您将把此音频连接到组 5 中的渲染节点。
组 5 — 渲染#
在 PROMPT (#44) 中表达您的意图。保留标签 <Video 1> 用于泥塑通道,<Picture 1> 用于第一个样式板,然后写出清晰的指令式文本加上贯穿整个剪辑的 Timeline:。3D AI 渲染与 MINIMAX H3 的核心是 MiniMaxH3ReferenceToVideo (#45),将提示、样式板、泥塑视频和可选语音融合为条件和起始潜在变量。该潜在变量通过 BasicGuider (#57)、BasicScheduler (#58)、KSamplerSelect (#59)、RandomNoise (#60) 和 SamplerCustomAdvanced (#61) 流动,生成最终视频潜在变量。组 3 的宽度、高度和长度会自动传入,因此生成的运动和任何音频都与您的参考保持同步。
组 6 — 输出#
VAEDecode (#67) 将视频潜在变量转换为帧,VAEDecodeAudio (#68) 发出声音。AudioAdjustVolume (#69) 提供简单的音量调整,然后 CreateVideo (#70) 将图像和音频合并为主文件,SaveVideo (#71) 将其写入磁盘。同时,审查分支通过 ImageFromBatch (#76) 和 ImageScale (#124) 修剪和缩放泥塑通道,通过 ImageStitch (#77) 将其与 AI 结果并排缝合,然后通过 CreateVideo (#78) 和 SaveVideo (#79) 导出比较剪辑。这使得验证几何形状、构图和动画保持忠实变得容易。
ComfyUI 3D AI 渲染与 MINIMAX H3 工作流程中的关键节点#
MiniMaxH3Resolution (#121)#
从您的参考中确定安全、原生的宽度和高度,以便 H3 落在其纵横比例网格上。通过更改泥塑输入来改变纵横比例,而不是强制自定义大小。如果必须偏离,请保持网格对齐的值以避免闪烁。
VHS_LoadVideo (#30)#
摄入驱动结构的泥塑通道。为可靠的运动锁定,提供 24 fps 源并避免在节点内重新采样。如果出现时间漂移,请以 24 fps 重新导出您的泥塑通道,并确保工作流程的捕捉长度与剪辑匹配。
MiniMaxH3ReferenceToVideo (#45)#
将提示、样式板、参考视频和可选语音合并为视频和音频潜在变量的中央渲染器。保留提示中的 <Video 1> 和 <Picture 1> 标签,以便模型绑定到正确的输入。对于对话,将语音轨路由到节点的参考视频音频输入,以便唇部动作与语音对齐。
LoraLoaderModelOnly (#16)#
应用 4 步 Turbo LoRA 以获得快速、清晰的预览。用于探索和每日更新。当您需要更温和的外观或与泥塑通道最接近的匹配时,禁用 LoRA 并在 BasicScheduler (#58) 和 KSamplerSelect (#59) 中使用多步计划进行渲染。
BasicScheduler (#58) 和 KSamplerSelect (#59)#
控制噪声随时间的去除方式,这会影响纹理清晰度、运动平滑度和对泥塑通道的忠实度。低步数计划与 Turbo LoRA 速度配合良好,而无需 LoRA 的多步计划强调准确性和更柔和的效果。如果结果看起来过于锐利,请尝试不同的采样器策略和更多步骤。
VAEDecodeAudio (#68)#
解码生成的音频潜在变量。如果您的混音需要快速音量更改,请将其与 AudioAdjustVolume (#69) 配对,然后在 CreateVideo (#70) 中合并。为了获得清晰的对话,将您的源语音填充到确切的剪辑长度以避免重复。
可选附加项#
- 样式板:使用捕捉材质、照明和颜色的高质量静态图像。它们是风格参考,而不是布局参考。不要将泥塑通道中的帧作为样式板。
- 提示:书写指令而非禁止。像 "one continuous take" 这样的短语比 "no camera move" 更有效。包括一个贯穿最后一帧的
Timeline:,以便图像和声音不会拖尾。 - 音频提示:对于语音,将语音连接到渲染节点的参考视频音频输入。用静音填充录音以匹配捕捉的剪辑长度。在提示中将所说的台词放在引号中,并注明 "once and only once"。
- 帧率:以 24 fps 导出泥塑通道。不同的速率会被压缩在时间上,运动可能会偏离您的原始动画。
- 长度网格:工作流程将长度捕捉到 H3 的固定帧网格以确保稳定性。如果需要精确的持续时间,请将泥塑通道修剪到下一个有效网格值或相应地填充音频。
- 更快的迭代:保持 Turbo LoRA 开启以进行外观开发,使用内置并排导出评估结构,然后切换到多步计划以获得最终效果,如果您更喜欢更柔和、更忠实的渲染。
- 在此工作流程中使用的有用节点:ComfyUI‑KJNodes, ComfyUI‑VideoHelperSuite, 和 ComfyUI‑Mickmumpitz‑Nodes。
通过这些组件,3D AI 渲染与 MINIMAX H3 为您提供了从未纹理化动画到完成的电影镜头的快速、可控路径,同时保留您在 3D 工具中制作的布景和运动。
致谢#
此工作流程实现并建立在以下作品和资源之上。我们感谢 Mickmumpitz 为 3D AI 渲染与 MINIMAX H3 工作流程和指南的贡献和维护。有关权威详细信息,请参阅下面链接的原始文档和存储库。
资源#
- Mickmumpitz/3D AI 渲染与 MINIMAX H3 工作流程源
- Hugging Face: Comfy-Org/MiniMax-H3
- 文档 / 发布说明: 3D AI 渲染与 MINIMAX H3 工作流程源
注意:使用参考的模型、数据集和代码需遵循其作者和维护者提供的各自许可和条款。

