ComfyUI>工作流>MiniMax H3 参考至视频 ComfyUI | 立体声

MiniMax H3 参考至视频 ComfyUI | 立体声

Workflow Name: RunComfy/MiniMax-H3-Ref2Video
Workflow ID: 0000...1473
将两个参考图像转化为电影片段。保持角色一致性。生成与视频同步的原生立体声。使用精确的图片标签进行提示控制。快速测试风格化场景。使用 MiniMax H3 Ref2VA 图表创建精美的音视频概念。

MiniMax H3 Reference to Video ComfyUI Workflow

MiniMax H3 Ref to Video in ComfyUI | Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 Reference to Video ComfyUI Examples

MiniMax H3 参考至视频 ComfyUI:原生立体声 Ref2VA 工作流#

这个适用于 RunComfy 的 MiniMax H3 参考至视频 ComfyUI 工作流将连接的参考图像转化为短电影视频,并同时生成原生立体声。构建于 Comfy.org 参考至视频模板,并经过开放的 Comfy-Org MiniMax-H3 权重验证,非常适合角色一致、参考驱动的镜头、风格化场景测试和概念片段,其中提示词和标签如 <Picture 1> 和 <Picture 2> 十分重要。

开箱即用,图表连接两个图像参考和一个自由形式的提示词,一次通过即可生成带同步声音的视频。核心节点还提供可选输入,用于更多参考图像、带有音频的参考视频以及独立的音频参考,因此您可以根据需要调整条件强度。如果您想要与原始设计一致的起点,请参阅 GitHub 上的 Comfy.org 模板文件 video_minimax_h3_r2v.json

MiniMax H3 参考至视频 ComfyUI 工作流中的关键模型#

如何使用 MiniMax H3 参考至视频 ComfyUI 工作流#

此工作流将您的参考和提示词路由到 MiniMax H3 的 Ref2VA 核心,采样一个包含视频和音频的单一潜在单元,然后解码并将结果合并为一个带同步声音的 MP4。下列组映射到图表中,以便您可以看到需要更改的地方和原因。

用户输入#

使用 LoadImage (#137) 和 LoadImage (#139) 提供两个视觉参考。提示词放在 Input Text (Prompt) (#138) 中;按连接顺序明确引用每个输入,例如 <Picture 1> 和 <Picture 2>,然后描述场景、动作和声音。在 Resolution Selector (Size) (#115) 中设置目标宽高比和像素数。选择视频时长(以秒为单位)通过 Float (Duration) (#132);它由 ComfyMathExpression (#131) 自动转换为有效的帧长度,以便音频和视频保持同步。

模型#

UNETLoader (#127) 加载驱动生成的 MiniMax H3 Ref2VA 扩散权重。CLIPLoader (#128) 加载用于对您的文本和参考标签进行标记化的 Qwen3-VL 32B 编码器。两个 VAELoader 节点(#119 视频,#120 音频)提供配对的解码器,稍后将联合潜在单元解码回帧和立体声音频。这些模型是您在迁移到相同任务系列中的不同 MiniMax H3 变体时需要交换的唯一资产。

条件#

MiniMaxH3ReferenceToVideo (#136) 是管道的核心。它接受您的文本提示词、宽度、高度和计算出的 length(帧数),以及任何连接的 ref_imagesref_videos 和可选的音频参考。该节点发出正向条件流用于指导,并初始化潜在单元,根据您的参考和标签锚定身份、构图、动作和声音设计。为了从图像中获得身份保真度,请连接光线良好、符合模型的参考,并在提示词中精确引用它们;对于动作或节奏,您可以添加带或不带音频的视频参考。

采样#

RandomNoise (#129) 启动过程,KSamplerSelect (#123) 选择采样器变体,BasicScheduler (#124) 设置步骤计划。BasicGuider (#126) 应用 MiniMax H3 节点产生的条件,SamplerCustomAdvanced (#125) 执行实际的去噪步骤,以发展联合音频+视频潜在单元。这里的选择主要在速度、保真度和参考一致性之间进行权衡;请先保持默认值,然后在获得基线外观和声音后进行实验。

解码和创建视频#

采样器的联合潜在单元传递到 VAEDecode (#122) 进行帧解码,VAEDecodeAudio (#121) 进行立体声解码。CreateVideo (#130) 将解码的图像和音频合并为可播放的流,SaveVideo (#92) 将最终文件写入您的输出文件夹。因为视频和音频是一起生成的,所以时间是一致的,无需任何后期对齐或外部 TTS。

MiniMax H3 参考至视频 ComfyUI 工作流中的关键节点#

MiniMaxH3ReferenceToVideo (#136) 此节点将文本、视觉和可选的音频参考组合成 MiniMax H3 的 Ref2VA 条件和一个初始潜在单元,该单元已经“了解”身份、风格、动作和声音。在您的提示词中使用与连接顺序匹配的精确参考标签,并根据您的目标选择 ref_image_size:匹配生成分辨率时更快迭代,保持更大参考标记时更强身份。对于较长镜头,请优先使用清晰的场景和动作描述,以便模型可以保持连续性。

Resolution Selector (Size) (#115) 控制整个图表将遵循的目标宽高比和像素数。选择一个符合您将展示片段方式的形状,并在细节与吞吐量之间取得平衡,以便您可以快速迭代。较高的分辨率会增加 VRAM 和时间,但更好地保留来自参考的精细特征。

ComfyMathExpression (#131) 将用户面向的持续时间(以秒为单位)转换为采样器和解码器喜欢的帧数。表达式夹紧到一个合理的最小值,并对内部友好的步骤进行捕捉,以便视频和音频保持同步。仅调整秒输入;节点处理数学。

KSamplerSelect (#123) 和 BasicScheduler (#124) 它们一起决定去噪路径。使用提供的采样器和计划开始,以获得强大的参考一致性;如果您的镜头漂移或感觉细节不足,请测试替代计划或略微不同的采样器系列,并进行并排比较。

可选附加功能#

  • 保持提示词具体并以参考为先:以 <Picture 1> 和 <Picture 2> 等标签开头,然后描述镜头类型、动作、灯光和您期望的声音。
  • 为了从图像中获得更强的身份,提高参考保真度,使用更大的参考大小模式;为了更快的外观开发,使用匹配大小模式。
  • 如果您未连接任何音频参考,MiniMax H3 将仅根据提示词合成原生立体声;描述环境声、拟音和声音语调以指导它。
  • 当您最关心动作节奏或相机行为时,添加一个短参考视频;当您希望将其声音特征带入生成中时,添加其配对音频。
  • 首先在适中的分辨率和时长下进行迭代,然后在时间、身份和构图保持一致后进行放大。

参考资料#

致谢#

此工作流实现并基于以下作品和资源进行构建。我们诚挚感谢 Comfy-Org 提供的 MiniMax H3 R2V ComfyUI 工作流模板和 MiniMax H3 教程,MiniMax 提供的 MiniMax H3 模型和官方公告,以及 Comfy-Org 提供的 MiniMax-H3 模型权重,感谢他们的贡献和维护。有关权威详情,请参阅下文链接的原始文档和存储库。

资源#

注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的相应许可证和条款。

RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。