MiniMax H3 ComfyUI 参考到视频4步Turbo#
MiniMax H3 ComfyUI 参考到视频4步Turbo是一个RunComfy-ready参考到视频工作流程,它从静止图像中锁定一个或多个角色身份,并在单次加速通过中生成带有原生立体声音频的短片。它专为需要在场景中保持一致的面孔、服装和布景,同时保持摄像机运动、对话和口型同步的一致性。
该图使用MiniMax H3的ref2va管道加上Turbo LoRA,以便多主体身份、运动和语音保持统一,无需较长的默认计划。在提示中标记您的静止图像为<Picture N>,可选地带来参考视频和音频,并直接在RunComfy上的ComfyUI中渲染干净的片段。
Comfyui MiniMax H3 ComfyUI 参考到视频4步Turbo工作流程中的关键模型#
- MiniMax-H3 Reference-to-Video扩散模型(ref2va)。提供用于在静止图像、可选视频和文本上进行条件生成一致镜头的核心生成骨干。权重在Hugging Face的MiniMax-H3的Comfy-Org包装中提供。Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE。编码和解码视频潜在变量,采样器在其上操作,保持时间平滑和细节。与相同的包一起分发。Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE。与视频一起处理原生立体声音频轨道,因此语音和环境音与镜头一起创作。与视频组件一起包含。Comfy-Org/MiniMax-H3
- Qwen-VL 32B文本编码器,针对MiniMax-H3进行了调整。将包括<Picture N>标记和舞台方向在内的提示翻译成H3使用的条件信号。打包在Comfy-Org发布中。Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA。一个加速LoRA,压缩计划,使镜头能够在快速通过中生成,同时保持身份和运动一致性。larryvrh/MiniMax-H3-Turbo-Lora
如何使用Comfyui MiniMax H3 ComfyUI 参考到视频4步Turbo工作流程#
该工作流程从参考和时间安排开始,到模型设置、条件、采样和最终混合。您可以仅使用静止图像运行,也可以将静止图像与可选的参考视频和音频结合使用。
阶段1 — 参考、提示和时间安排#
通过LoadImage节点加载一个或多个静止图像,并计划在提示中将它们引用为<Picture 1>、<Picture 2>等。如果您有指导片段,请通过VHS_LoadVideo节点传送;它们的音频也可以传递,以指导节奏和能量。要提供定制的对话或环境音,请使用LoadAudio节点,此外或代替参考视频音频。在Input Text (Prompt)中输入您的完整镜头描述,包括任何角色锁定、摄像机移动和对话。工作流程会自动将您期望的持续时间转换为稳定的帧数,将时间轴与MiniMax H3的内部步幅对齐。
阶段2 — 模型设置和Turbo加速#
在“核心工作区”中加载核心H3 ref2va UNet、文本编码器以及视频和音频VAEs。内存高效的注意力补丁使典型GPU上更大的镜头或更高分辨率成为可能,而无需更改您的使用。Turbo 4-step LoRA由LoraLoaderModelOnly (#164)应用,因此您可以保持步骤计数较低,同时保持身份锁定和运动。一切都已预连接,无需手动连接即可在RunComfy上运行。如果您不使用某些输入,请使用Ctrl+B切换未使用的Load Image / Load Video / Load Audio节点以保持运行精简。
阶段3 — 条件和潜在组装#
MiniMaxH3ReferenceToVideo (#136)摄取您的提示、静止图像和任何可选的视频或音频参考,以构建条件和初始潜在时间线。使用<Picture N>标签清晰地将每个人或物体绑定到特定的静止图像;顺序遵循您填写的参考槽。您可以用自然语言指导摄像机行为、口型同步和环境音。宽度、高度和持续时间流入此节点,以便框架和时间与您的意图匹配。如果您有很多静止图像,只保留那些真正定义当前节拍中身份和服装的图像。
阶段4 — 采样#
图表通过最小计划和由KSamplerSelect (#123)选择的快速采样器引导潜在变量,BasicGuider (#126)引导。BasicScheduler (#124)提供Turbo LoRA期望的步长模式,平衡速度和保真度。SamplerCustomAdvanced (#125)使用种子噪声在一个高效的通过中解决时间线以实现可重复性。在大多数情况下,您可以将这些组件保持为配置状态,专注于提示、参考和框架。
阶段5 — 解码、混合和保存#
采样后,VAEDecode恢复视频帧,VAEDecodeAudio恢复立体声轨道。CreateVideo (#130)将图像和音频多路复用成可播放文件,具有您选择的速率和位深度。最后,SaveVideo (#92)使用选定的容器和编解码器将结果写入磁盘。输出是一个短片,具有身份锁定的角色、摄像机运动和由MiniMax H3 ComfyUI参考到视频4步Turbo创作的原生立体声音频。
Comfyui MiniMax H3 ComfyUI 参考到视频4步Turbo工作流程中的关键节点#
MiniMaxH3ReferenceToVideo (#136)#
这是将提示文本、静止参考和可选的视频/音频融合成条件和初始化潜在变量的工作流程核心。调整prompt以包括<Picture N>标记和清晰的摄像机、对话和环境音的舞台方向。调整width、height和length以设置镜头的框架和持续时间。如果您需要在静止图像上平衡细节与速度,请在匹配渲染大小与调整大小以便轻量运行等模式之间切换ref_image_size。保持您的参考集专注于您实际需要的场景身份。
LoraLoaderModelOnly (#164)#
将MiniMax-H3 Turbo 4-step LoRA应用于ref2va模型,以便可以压缩计划以进行快速推理。strength控制LoRA对骨干的影响强度;较高的值偏向速度和Turbo外观,而较低的值则向基础H3混合回去。如果您注意到在极端加速下细节丢失,请稍微降低LoRA强度或在调度程序中延长计划以恢复保真度。请参阅LoRA模型卡以获取版本说明和预期用途。MiniMax-H3 Turbo LoRA
MiniMaxH3MemoryEfficientSageAttentionPatch (#163)#
启用与MiniMax H3兼容的内存高效注意力实现,因此您可以在有限的VRAM上运行更高的分辨率或更长的镜头。此图中无参数;只需保持启用即可获得最佳容量。该节点是KJNodes for ComfyUI的一部分。kijai/ComfyUI-KJNodes
BasicScheduler (#124)#
定义采样期间使用的扩散计划。在Turbo LoRA激活的情况下,保持步骤计数紧凑以提高速度,只有在需要额外的清晰度或稳定性时才调整。denoise允许您在提示要求较大更改时推进更强的参考重解释。此处的更改与LoRA强度和选择的采样器相互作用,因此请小幅调整。
KSamplerSelect (#123)#
选择通过的采样算法。简单、稳定的采样器与Turbo计划配合良好,有助于在帧之间保持身份。如果您强调风格化或非常快速的摄像机运动,请尝试其他可能在增加运动纹理的同时造成轻微变化的采样器。
CreateVideo (#130)和SaveVideo (#92)#
CreateVideo将解码帧和音频组装成最终流,您可以设置fps和bit_depth以满足您的交付需求。SaveVideo选择导出的容器和编解码器;使用广泛支持的组合进行一般共享,或使用高质量变体进行后期处理。如果您快速迭代,请保持设置轻量级,然后为最终渲染切换到生产设置。
可选附加功能#
- 对于多个角色,请将最清晰的面部正面静止图像放在首位,并将它们引用为<Picture 1>、<Picture 2>等。每个主题使用一到两个额外的静止图像以覆盖角度或服装。
- 如果您提供参考视频,请在提示中包括所需摄像机行为的简短描述,以便H3知道要保留什么以及如何重新解释。
- 持续时间控制在内部捕捉到H3的安全帧数;如果您在
CreateVideo中更改目标帧率,请重新检查提示中的时间说明。 - 视频和音频辅助节点来自Video Helper Suite;它们在ComfyUI中提供稳健的媒体I/O。Kosinkadink/ComfyUI-VideoHelperSuite
- 寻找MiniMax H3参考到视频在ComfyUI中的基线比较工作流程?查看官方模板并根据需要调整想法。Comfy-Org workflow template
致谢#
该工作流程实现并构建在以下作品和资源之上。我们对MiniMax Research的MiniMax H3模型、Comfy.org的MiniMax H3 ComfyUI工作流程示例、Comfy-Org的MiniMax-H3模型权重以及larryvrh的MiniMax-H3 Turbo LoRA的贡献和维护表示感谢。有关权威详细信息,请参阅下列链接的原始文档和存储库。
资源#
- MiniMax Research/MiniMax H3官方公告
- 文档/发布说明:MiniMax H3官方公告
- Comfy.org/MiniMax H3教程
- GitHub: comfy-org/docs
- 文档/发布说明:MiniMax H3: ComfyUI工作流程示例
- Comfy-Org/MiniMax-H3模型权重
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
注意:使用参考模型、数据集和代码需遵循其作者和维护者提供的相应许可证和条款。


