MiniMax H3 性能捕捉用于 ComfyUI#
MiniMax H3 性能捕捉将您的表演转化为新角色,同时保留您的原始音频。工作流程将面部表情、嘴形、眼睛方向和头部运动从源剪辑转移到目标生物或全身角色,然后将结果合成回画面。围绕 MiniMax-H3 参考条件视频、自动面部遮罩和可选姿势引导构建,已在创意转换(如狼、机器人和外星人)上进行了测试,同时保留了场景和音轨。由 Mickmumpitz 设计的工作流程。
这个 ComfyUI MiniMax H3 性能捕捉工作流程是简单的“渲染”版本:默认一个相机,可选头部相机和手动面具,可选姿势控制,以及两个保存的视频(带音频的最终渲染,加上比较剪辑)。
Comfyui MiniMax H3 性能捕捉工作流程中的关键模型#
- MiniMax-H3 参考到视频扩散 UNet (minimax_h3_ref2va_pruned_int8_convrot)。核心生成器,将参考、提示和音频融合为视频潜在变量。模型文件
- Qwen3-VL 32B MiniMax-H3 文本编码器 (qwen3vl_32b_minimax_h3_nvfp4_awq)。对提示进行编码以引导身份和表演风格。模型文件
- MiniMax-H3 视频 VAE FP16 和音频 VAE FP32。视频 VAE 解码图像潜在变量;音频 VAE 条件化唇同步和表演时机。VAEs
- MiniMax-H3 Turbo 8 步 768p LoRA。加速 H3 采样以实现快速、高质量的渲染。模型卡
- MiniMax-H3 角色转换 LoRA。增强头部和身体的稳健转换,适用于风格化或生物外观。模型卡
- FUN ControlNet Union 2.0 模型补丁用于 H3。添加来自骨骼的可选身体姿势引导。模型文件
- Segment Anything Model 3.1 Multiplex。生成要再生区域的自动面具。检查点
- DWPose (通过 ControlNet Aux)。检测身体和手部骨骼以进行姿势引导和头部裁剪逻辑。仓库
如何使用 Comfyui MiniMax H3 性能捕捉工作流程#
工作流程从左到右运行,通过八个标记的组。首先加载您的表演剪辑,以及可选的手动面具、头部相机特写和角色表。然后管道准备一个画面和面具,从您的面部构建表演参考,可选地引导身体姿势,使用 MiniMax H3 渲染,并保存一个比较剪辑。
1 加载模型#
此组加载 MiniMax-H3 UNet、文本编码器和 VAEs,然后应用 Turbo 和角色转换 LoRAs。UNETLoader (#1001) 和 CLIPLoader (#1006) 提供核心生成器和提示编码器。LoraLoaderModelOnly (#1003, #1004) 附加速度和转换适配器。BlockSparseAttention (#1009) 和 MiniMaxH3SigmaShift (#1002) 被连接以加速采样和平衡音视频引导。
2 您的镜头#
使用 BODY CLIP (您的表演 + 声音) (#1012) 加载主要拍摄,嵌入单声道或立体声音频。您可以通过 LoadImage (#1016) 添加 CREATURE SHEET 以在镜头间锁定外观,并在 PROMPT (转换, 生物, 其表演) (#1018) 中设置提示。可选输入包括一个 HEAD-CAM 特写 VHS_LoadVideo (#1013) 用于宽镜头中的小面孔,以及一个 MANUAL MASK 视频 VHS_LoadVideo (#1014) 如果您想覆盖自动遮罩。快速控制在这里:WHAT GETS REPLACED (头/人) (#1017), SEED (#1019), GROW MASK px (#1020), FACE CROP (#1021) 和 PERSON (#1022)。切换节点 (NO HEAD-CAM #1227, NO MANUAL MASK #1228, NO CHARACTER SHEET #1229, NO POSE CONTROL #1230) 使常见设置一键完成。
3 准备#
WORKING SIZE (草稿: 896x512) (#1028) 将输入标准化为稳定分辨率,并且 length: next 17k+5 up (#1030) 将运行限制为短而快速的预览长度。PREPARE (画面 + 再生区域) (#1231) 构建一个干净的画面,跟踪要替换的内容,使用 SAM 3 和您的文本 WHAT GETS REPLACED,如果存在,摄取您的手动面具。结果是一个视频画面加上一个或两个面具,准备进行受控再生。
4 再生区域#
REGENERATED AREA (生长, 块, 保持) (#1233) 是决定 MiniMax H3 可绘制区域的面具逻辑。它扩展面具,使耳朵或角等特征有空间,将其转换为时间块以稳定运动,并保持变化几帧,以便细节不会闪烁。如果您提供了手动面具,[MANUAL MASK] 合成 (#1074 到 #1105) 将其按绘制方式传递。
5 表演参考#
ACTING REFERENCE (您的脸在灰色背景上 | 头部相机) (#1232) 找到选定的人,裁剪面部区域与 DWPose,并生成携带您的表情、眼线和头部旋转的参考视频。启用头部相机时,它会构建一个分屏,以便头部方向跟随宽相机,而精细面部运动跟随头部相机。预览 PREVIEW: 表演参考 (<Video 1>) (#1130) 让您在渲染之前确认跟踪。
6 姿势控制(可选)#
对于全身生物转换,[POSE] DWPose 骨架 (#1131) 从您的画面中提取身体和手部关键点。MiniMaxH3FunControlNetApply (#1132) 将该运动作为补丁输入 H3,使四肢和躯干跟随您的表演,而面部保持参考驱动。用于在帧之间保持一致的手臂和腿;对于仅头部转换和四足动物,请关闭它。
7 渲染#
H3 参考 + 提示 MiniMaxH3ReferenceToVideo (#1134) 结合提示、角色表、表演参考、音频和工作尺寸以生成 H3 条件和起始潜在变量。H3 RENDER (#1234) 然后注入画面潜在变量,应用再生面具,使只有面具区域发生变化,并使用 Turbo 日程进行采样。输出是干净的渲染和“再生显示”预览;SAVE: H3 渲染 1344x768 + 声音 (#1150) 写入一个带有原始音频的 MP4。
8 比较视频#
COMPARISON VIDEO (#1235) 将画面、渲染、表演参考和(如果使用)生物表叠加到一个帧中以供审查。SAVE: 比较视频 + 声音 (#1158) 导出一个带有相同音轨的 MP4,以便您可以将结果与您的表演进行 A/B 比较。
Comfyui MiniMax H3 性能捕捉工作流程中的关键节点#
BODY CLIP (您的表演 + 声音) (#1012)#
加载您的表演和音频,驱动唇形同步和时机。保持横向构图以获得最佳构图,并确保文件有音频。如果面部在框架中很小,请添加头部相机输入以获得更清晰的表情跟踪。
WHAT GETS REPLACED (头/人) (#1017)#
这段简短的文本引导 SAM 3.1 到 H3 将再生的区域。使用 head 进行头部转换或 person 进行全身替换。如果头盔或头顶设备应消失,包含诸如头部、头盔或相机设备等词语;避免使用屏幕、显示器或电缆等通用词语,除非您打算移除背景中的类似物体。
REGENERATED AREA (生长, 块, 保持) (#1233)#
定义 H3 可以重绘的图像区域及其随时间的演变。增加增长以留出耳朵、角或毛发的空间;降低它以避免在宽镜头中扩展到背景中。块和保持阶段稳定运动,以便细节在帧之间不会闪烁。
ACTING REFERENCE (您的脸在灰色背景上 | 头部相机) (#1232)#
创建 MiniMax H3 将模仿的表演轨迹。FACE CROP 控制分析的头部和颈部的范围,PERSON 选择当多个演员可见时的演员。只有当宽镜头面部非常小时才启用头部相机;一个相机通常最好地跟随头部转动。
MiniMaxH3ReferenceToVideo (#1134)#
合并提示、参考和音频以生成条件和初始潜在变量的枢纽。保持宽度和高度与工作尺寸对齐,并让工作流程自动限制预览的长度。提示中已包含一条句子,告诉 H3 如何使用表演参考。
MiniMaxH3FunControlNetApply (#1132)#
添加来自 DWPose 的可选身体姿势引导。适用于全身生物,以便躯干和四肢逼真地跟随,同时面部遵循表演参考。对于仅头部转换或不匹配人类骨架的四足运动,请关闭它。
H3 RENDER (#1234)#
应用面具,使只有选定区域发生变化,然后使用 Turbo 日程采样视频,并使用瓦片 VAE 解码以提高 VRAM 效率。使用 SEED 调整外观和微动;当角色的外观与表或描述偏离时更改它。
可选额外功能#
- MiniMax H3 性能捕捉拍摄技巧:横向拍摄,保持曝光稳定,包含干净的制作音频;如果您在 iPhone 上拍摄 HDR,运行前转换为 SDR。
- 角色表指南:包括正面和侧面视图以及一些小表情头像;这比单纯的文本更好地锁定身份。
- 多人场景:将
PERSON设置为正确的索引,并在 SAM 文本中描述主题,然后在渲染前验证面具预览。 - 手动面具:提供一个与身体剪辑时间匹配的黑白视频;将其绘制得略大于预期的生物,以便 H3 不会回落到原始面孔。
- 何时启用姿势控制:用于全身人形或有手臂和腿的生物;对于仅头部转换和四足动物,请关闭它。
- 性能说明:启用稀疏注意力以加速渲染并减少内存;如果 VRAM 紧张,在
CLIPLoader中在 CPU 上运行文本编码器。使用的自定义节点包括 ComfyUI-VideoHelperSuite、ComfyUI-KJNodes、comfyui_controlnet_aux、ComfyUI-H3-FaceRefine 和 ComfyUI-Mickmumpitz-Nodes。
致谢#
此工作流程实现并构建在以下作品和资源之上。我们感谢 Mickmumpitz 提供的 ComfyUI 性能捕捉工作流程和 Comfy-Org 提供的 MiniMax H3 模型的贡献和维护。有关权威详细信息,请参阅下面链接的原始文档和存储库。
资源#
- 由 Mickmumpitz 设计的工作流程
- MiniMax H3 模型
- Hugging Face: Comfy-Org/MiniMax-H3
注意:引用的模型、数据集和代码的使用受其作者和维护者提供的各自许可证和条款的约束。

