MiniMax H3 ComfyUI 图像到视频4步Turbo#
MiniMax H3 ComfyUI 图像到视频4步Turbo是一个RunComfy准备好的工作流程,可以在ComfyUI中将单个静止图像转换为带有原生立体音频的短视频。它运行MiniMax H3 (Hailuo) 图像到视频的流程,并应用Turbo LoRA,使您可以在比默认计划少得多的采样步骤中预览运动和对话。
该图表适用于希望在不离开ComfyUI画布的情况下快速获取I2V草稿的创作者:会说话的角色、快速产品旋转或带有同步声音的环境场景。提供一个开始帧和一个运动/对话提示;工作流程会生成视频帧和立体音频,然后将它们合并成一个您可以下载的成品剪辑。
Comfyui MiniMax H3 ComfyUI 图像到视频4步Turbo工作流程中的关键模型#
- MiniMaxAI/MiniMax-H3多模态视频模型。官方H3模型生成带有同步立体音频的视频,并支持首帧I2V;此工作流程使用Comfy-Org为ComfyUI重新打包的模型。MiniMaxAI/MiniMax-H3 和 Comfy-Org/MiniMax-H3
- MiniMax H3 视频 VAE。对H3的扩散骨干使用的视频潜在变量进行编码/解码。包括在Comfy-Org重新打包中。Comfy-Org/MiniMax-H3
- MiniMax H3 音频 VAE。将模型的音频潜在变量解码为与帧对齐的原生立体波形。包括在Comfy-Org重新打包中。Comfy-Org/MiniMax-H3
- Qwen3‑VL 32B 文本编码器 (MiniMax H3变体)。将您的运动和对话提示解析为H3的条件。随Comfy-Org发布的文本编码器一起打包。Comfy-Org/MiniMax-H3
- MiniMax‑H3 Turbo LoRA (4步)。一种加速H3采样的LoRA,使在非常低的步骤计数下可以实现清晰的预览。larryvrh/MiniMax-H3-Turbo-Lora 和LoRA概念论文 LoRA: Low‑Rank Adaptation
如何使用Comfyui MiniMax H3 ComfyUI 图像到视频4步Turbo工作流程#
整体流程。图表会缩放您上传的图像,将您的持续时间转换为有效的H3帧计数,然后将开始帧和提示输入到H3中,并应用Turbo LoRA。采样器生成联合视频和音频潜在变量,这些变量被解码并合并为一个可下载的剪辑。
上传图像。使用 LoadImage (#114) 提供您想要动画化的第一个帧。图像由 LayerUtility: ImageScaleByAspectRatio V2 (#167) 自动缩放到目标长边,同时保留纵横比;派生的 width/height 输入到核心H3节点。当需要时,使用信箱格式以避免失真。这确保您的构图在匹配H3的首选网格时保持完整。
参数和提示。使用持续时间控制(标签为“Duration (sec)”) 设置剪辑长度,该控制将输入一个小的数学节点,ComfyMathExpression (#134),将秒数转换为电影速率的帧数,并对齐到H3的有效网格。在绿色的 easy positive 提示节点 (#152) 中输入您的运动和对话;您可以编写自然句子和引用的讲话。提示通过 CLIPLoader (#130) 的Qwen3‑VL文本编码器进行编码,为模型准备条件。
核心生成。UNETLoader (#129) 加载MiniMax H3的扩散骨干,VAELoader (#121, #122) 加载视频和音频VAEs。Turbo LoRA在运行时由 LoraLoaderModelOnly (#171) 合并,内存高效注意力补丁 (MiniMaxH3MemoryEfficientSageAttentionPatch (#170)) 有助于减少VRAM。主要节点 MiniMaxH3ImageToVideo (#133) 接收您的开始帧、提示和计算出的宽度/高度/长度,然后生成同步的视频和音频潜在变量。
采样和解码。一个紧凑的采样器堆栈 (KSamplerSelect (#125), BasicScheduler (#126), BasicGuider (#128), SamplerCustomAdvanced (#127), RandomNoise (#131)) 通过非常少的迭代进行去噪,得益于Turbo LoRA。VAEDecode (#124) 将视频潜在变量转换为帧,VAEDecodeAudio (#123) 生成与这些帧对齐的立体音频。您无需调整解码设置;它们已连接以进行干净的预览。
输出。CreateVideo (#132) 将帧和音频合并为单个剪辑,以工作帧速率输出,SaveVideo (#92) 以配置的文件名前缀写入,使您可以立即从RunComfy下载。结果是一个短的、同步的视频,反映您的开始帧、运动提示和对话。
Comfyui MiniMax H3 ComfyUI 图像到视频4步Turbo工作流程中的关键节点#
MiniMaxH3ImageToVideo (#133)。图表的核心:它消耗开始帧、编码的提示和您的目标大小/长度,并生成联合的视频和音频潜在变量。仅调整在此工作流程中暴露给您的几个输入:提供强有力的描述性提示(包括引用的对话)并设置现实的持续时间;节点使用来自Comfy-Org重新打包的H3模型和VAEs处理其余部分。Comfy-Org/MiniMax-H3
LoraLoaderModelOnly (#171)。注入MiniMax‑H3 Turbo LoRA,以便采样器可以在非常少的步骤中达到高锐度。如果您需要在速度与伪影之间进行权衡,可以稍微降低LoRA强度;如果看到运动模糊,可以稍微增加。LoRA设计用于跨常见的H3基础变体,包括修剪和量化的重新打包。larryvrh/MiniMax-H3-Turbo-Lora
BasicScheduler (#126) 和 SamplerCustomAdvanced (#127)。它们共同控制去噪时间表和步进行为。借助Turbo LoRA,您可以在非常低的步骤计数下运行以快速预览;如果您有时间,可以增加步骤来适度提高稳定性。除非您有特定的外观需求,否则保持调度器和采样器选择常规。
LayerUtility: ImageScaleByAspectRatio V2 (#167)。确保上传的静止图像在保留纵横比的同时调整为干净的、对模型友好的分辨率。在切换源图像时使用此功能以避免意外的裁剪或变形;节点输出核心H3节点消耗的确切 width/height。ComfyUI_LayerStyle
ComfyMathExpression (#134)。将秒数转换为帧数,并将计数调整为H3的有效帧网格,以便音频保持与视频的相位锁定。您可以将其视为一种“安全保护”,避免H3不支持的帧计数,防止混合阶段的微妙不同步。输入是您在画布顶部设置的简单英文持续时间。
MiniMaxH3MemoryEfficientSageAttentionPatch (#170)。应用一种实验性的注意力优化,在H3采样期间降低峰值VRAM。在较大尺寸或有限内存的GPU上工作时开启此功能;它在提高适合性的同时保持创意意图。ComfyUI‑KJNodes
可选附加功能#
- 为唇同步提示:在引号中编写实际台词(例如,“Dinner’s up — try this carbonara.”),并用普通语言描述环境和相机运动。
- 先构图:选择一个已经将您的主题框定在预期距离的开始帧;动画将尊重该构图。
- 速度与精细:MiniMax H3 ComfyUI 图像到视频4步Turbo设置针对快速预览进行调优;如果镜头重要,请增加更多步骤或稍微降低LoRA强度以抑制过锐的颗粒。
- 运行时余量:如果达到VRAM限制,请尝试较小的最大图像边长、缩短持续时间或启用内存高效注意力补丁。
- 探索基础:工作流程兼容Comfy‑Org H3重新打包变体(bf16, int8 convrot, pruned)。如果更改基础,请保持Turbo LoRA连接在模型加载器和采样器之间,以实现相同的加速效果。Comfy-Org/MiniMax-H3
致谢#
此工作流程实现并基于以下作品和资源。我们感谢MiniMax提供的MiniMax H3模型,Comfy.org提供的MiniMax H3 ComfyUI工作流程教程,Comfy-Org提供的MiniMax-H3模型权重,以及larryvrh提供的MiniMax-H3 Turbo LoRA的贡献和维护。有关权威详情,请参阅下面链接的原始文档和存储库。
资源#
- MiniMax/MiniMax H3官方公告
- 文档/发布说明:MiniMax H3官方公告
- Comfy.org/MiniMax H3教程
- GitHub: Comfy-Org/docs
- 文档/发布说明: MiniMax H3教程
- Comfy-Org/MiniMax-H3模型权重
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的相应许可和条款。

