MiniMax H3 参考至视频 ComfyUI:原生立体声 Ref2VA 工作流#
这个适用于 RunComfy 的 MiniMax H3 参考至视频 ComfyUI 工作流将连接的参考图像转化为短电影视频,并同时生成原生立体声。构建于 Comfy.org 参考至视频模板,并经过开放的 Comfy-Org MiniMax-H3 权重验证,非常适合角色一致、参考驱动的镜头、风格化场景测试和概念片段,其中提示词和标签如 <Picture 1> 和 <Picture 2> 十分重要。
开箱即用,图表连接两个图像参考和一个自由形式的提示词,一次通过即可生成带同步声音的视频。核心节点还提供可选输入,用于更多参考图像、带有音频的参考视频以及独立的音频参考,因此您可以根据需要调整条件强度。如果您想要与原始设计一致的起点,请参阅 GitHub 上的 Comfy.org 模板文件 video_minimax_h3_r2v.json。
MiniMax H3 参考至视频 ComfyUI 工作流中的关键模型#
- Comfy-Org/MiniMax-H3 扩散权重 (Ref2VA):用于参考至视频和音频的生成核心,通过
UNETLoader使用。它从文本和视觉/音频参考中学习,生成同时包含视频和立体声的潜在单元。模型卡和文件 - MiniMax H3 视频 VAE (FP16):将联合潜在单元的视频部分解码为高视觉保真度的帧。minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 音频 VAE (FP32):将联合潜在单元的音频部分解码为原生立体声波形。minimax_h3_audio_vae_fp32.safetensors
- Qwen3-VL 32B MiniMax-H3 文本图像编码器 (AWQ):对提示词加上参考标签和视觉标记进行编码。qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
如何使用 MiniMax H3 参考至视频 ComfyUI 工作流#
此工作流将您的参考和提示词路由到 MiniMax H3 的 Ref2VA 核心,采样一个包含视频和音频的单一潜在单元,然后解码并将结果合并为一个带同步声音的 MP4。下列组映射到图表中,以便您可以看到需要更改的地方和原因。
用户输入#
使用 LoadImage (#137) 和 LoadImage (#139) 提供两个视觉参考。提示词放在 Input Text (Prompt) (#138) 中;按连接顺序明确引用每个输入,例如 <Picture 1> 和 <Picture 2>,然后描述场景、动作和声音。在 Resolution Selector (Size) (#115) 中设置目标宽高比和像素数。选择视频时长(以秒为单位)通过 Float (Duration) (#132);它由 ComfyMathExpression (#131) 自动转换为有效的帧长度,以便音频和视频保持同步。
模型#
UNETLoader (#127) 加载驱动生成的 MiniMax H3 Ref2VA 扩散权重。CLIPLoader (#128) 加载用于对您的文本和参考标签进行标记化的 Qwen3-VL 32B 编码器。两个 VAELoader 节点(#119 视频,#120 音频)提供配对的解码器,稍后将联合潜在单元解码回帧和立体声音频。这些模型是您在迁移到相同任务系列中的不同 MiniMax H3 变体时需要交换的唯一资产。
条件#
MiniMaxH3ReferenceToVideo (#136) 是管道的核心。它接受您的文本提示词、宽度、高度和计算出的 length(帧数),以及任何连接的 ref_images、ref_videos 和可选的音频参考。该节点发出正向条件流用于指导,并初始化潜在单元,根据您的参考和标签锚定身份、构图、动作和声音设计。为了从图像中获得身份保真度,请连接光线良好、符合模型的参考,并在提示词中精确引用它们;对于动作或节奏,您可以添加带或不带音频的视频参考。
采样#
RandomNoise (#129) 启动过程,KSamplerSelect (#123) 选择采样器变体,BasicScheduler (#124) 设置步骤计划。BasicGuider (#126) 应用 MiniMax H3 节点产生的条件,SamplerCustomAdvanced (#125) 执行实际的去噪步骤,以发展联合音频+视频潜在单元。这里的选择主要在速度、保真度和参考一致性之间进行权衡;请先保持默认值,然后在获得基线外观和声音后进行实验。
解码和创建视频#
采样器的联合潜在单元传递到 VAEDecode (#122) 进行帧解码,VAEDecodeAudio (#121) 进行立体声解码。CreateVideo (#130) 将解码的图像和音频合并为可播放的流,SaveVideo (#92) 将最终文件写入您的输出文件夹。因为视频和音频是一起生成的,所以时间是一致的,无需任何后期对齐或外部 TTS。
MiniMax H3 参考至视频 ComfyUI 工作流中的关键节点#
MiniMaxH3ReferenceToVideo (#136) 此节点将文本、视觉和可选的音频参考组合成 MiniMax H3 的 Ref2VA 条件和一个初始潜在单元,该单元已经“了解”身份、风格、动作和声音。在您的提示词中使用与连接顺序匹配的精确参考标签,并根据您的目标选择 ref_image_size:匹配生成分辨率时更快迭代,保持更大参考标记时更强身份。对于较长镜头,请优先使用清晰的场景和动作描述,以便模型可以保持连续性。
Resolution Selector (Size) (#115) 控制整个图表将遵循的目标宽高比和像素数。选择一个符合您将展示片段方式的形状,并在细节与吞吐量之间取得平衡,以便您可以快速迭代。较高的分辨率会增加 VRAM 和时间,但更好地保留来自参考的精细特征。
ComfyMathExpression (#131) 将用户面向的持续时间(以秒为单位)转换为采样器和解码器喜欢的帧数。表达式夹紧到一个合理的最小值,并对内部友好的步骤进行捕捉,以便视频和音频保持同步。仅调整秒输入;节点处理数学。
KSamplerSelect (#123) 和 BasicScheduler (#124) 它们一起决定去噪路径。使用提供的采样器和计划开始,以获得强大的参考一致性;如果您的镜头漂移或感觉细节不足,请测试替代计划或略微不同的采样器系列,并进行并排比较。
可选附加功能#
- 保持提示词具体并以参考为先:以 <Picture 1> 和 <Picture 2> 等标签开头,然后描述镜头类型、动作、灯光和您期望的声音。
- 为了从图像中获得更强的身份,提高参考保真度,使用更大的参考大小模式;为了更快的外观开发,使用匹配大小模式。
- 如果您未连接任何音频参考,MiniMax H3 将仅根据提示词合成原生立体声;描述环境声、拟音和声音语调以指导它。
- 当您最关心动作节奏或相机行为时,添加一个短参考视频;当您希望将其声音特征带入生成中时,添加其配对音频。
- 首先在适中的分辨率和时长下进行迭代,然后在时间、身份和构图保持一致后进行放大。
参考资料#
- MiniMax H3 权重和模型资产在 Hugging Face 上:Comfy-Org/MiniMax-H3
- 本工作流遵循的官方 Comfy.org 模板:video_minimax_h3_r2v.json
- MiniMax H3 的上游 ComfyUI 集成:ComfyUI PR #15224
致谢#
此工作流实现并基于以下作品和资源进行构建。我们诚挚感谢 Comfy-Org 提供的 MiniMax H3 R2V ComfyUI 工作流模板和 MiniMax H3 教程,MiniMax 提供的 MiniMax H3 模型和官方公告,以及 Comfy-Org 提供的 MiniMax-H3 模型权重,感谢他们的贡献和维护。有关权威详情,请参阅下文链接的原始文档和存储库。
资源#
- Comfy-Org/MiniMax H3 R2V 工作流模板
- Comfy-Org/MiniMax H3 教程
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- 文档 / 发布说明: MiniMax H3 教程
- MiniMax/MiniMax H3 官方公告
- 文档 / 发布说明: MiniMax H3 官方公告
- Comfy-Org/MiniMax-H3 模型权重
- Hugging Face: Comfy-Org/MiniMax-H3
注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的相应许可证和条款。

