MiniMax H3 T2V ComfyUI:从提示到视频的原生立体声#
MiniMax H3 T2V ComfyUI 将单个提示转换为具有同步立体声的短片电影。基于官方 Comfy.org 模板和开放的 Comfy-Org MiniMax-H3 权重构建,遵循 FL2VA 路径,因此运动和声音是一起生成的,而不是事后拼接的。这非常适合快速探索仅提示场景、对话或歌唱片段以及需要视觉和声音一致的概念镜头。
在一个块中描述镜头、摄像机、表演和音频提示,选择大小和时长,然后排队图表。工作流程加载正确的 MiniMax-H3 组件,采样联合音视频潜在变量,将其解码为帧和立体声,合并结果,并保存成品视频文件。
Comfyui MiniMax H3 T2V ComfyUI 工作流程中的关键模型#
- MiniMax-H3 FL2VA 扩散模型。核心 UNet 执行联合音视频去噪,使运动和声音保持相位对齐。权重由 Comfy-Org 提供,在 diffusion_models 下。模型文件
- MiniMax-H3 视频 VAE。将视觉潜在变量编码和解码为 RGB 帧,保留电影细节和运动连续性。minimax_h3_video_vae_fp16.safetensors
- MiniMax-H3 音频 VAE。将音频潜在变量编码和解码为每个片段的时间对齐立体声波形。minimax_h3_audio_vae_fp32.safetensors
- Qwen3-VL 32B 文本编码器(AWQ 用于 MiniMax-H3)。将提示解释为涵盖场景语义、时间和音频意图的条件。qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
如果您想比较此图表构建的原始模板,请参见 Comfy.org 参考。模板 JSON
如何使用 Comfyui MiniMax H3 T2V ComfyUI 工作流程#
在高层次上,您设置目标分辨率和时长,编写包含视觉和音频的单个提示,选择性地添加第一帧和最后一帧,然后运行。在子图中,MiniMax-H3 创建同步的视频和音频潜在变量,解码后组合成 24 fps 的电影并保存。
ResolutionSelector (#115)#
选择长宽比和比例以设置 width 和 height。选择器四舍五入为 32 的有效倍数,并将这些值提供给 MiniMax-H3 子图,因此您无需手动计算尺寸。从中等尺寸开始以更快地迭代,然后在提示读取正确后放大。改变长宽比是预告片、垂直剪辑和方形预览的强大创意杠杆。
Image to Video (MiniMax H3) (#105)#
此子图协调 MiniMax H3 T2V ComfyUI 管道。粘贴一个描述镜头、编辑和配乐的连贯提示,并可选提供 first_frame 和 last_frame 图像以锚定入口和出口。设置一个人性化的 duration,图表将其转换为模型的有效帧数。子图返回同步的音视频潜在变量,继续解码和合并。
模型组#
模型组加载此工作流程的确切 MiniMax-H3 组件。UNETLoader (#6) 拉取 FL2VA 扩散模型,CLIPLoader (#13) 加载 Qwen3-VL 编码器,两个 VAELoader 节点(#11 视频,#24 音频)准备解码器。这些指向 Comfy-Org MiniMax-H3 文件,因此您可以无需手动连接即可运行。将模型集中在此处使将来的更换或升级变得简单。
條件組#
MiniMaxH3ImageToVideo (#104) 将您的提示、可选的 first_frame 和 last_frame,以及所选的 width、height 和 length 转换为 MiniMax-H3 条件加上初始潜在变量。想法是让模型同时读取场景内容和音频意图,这导致更紧密的同步。如果您提供参考帧,则入口和退出将被引导以保持连续性;如果您将它们留空,生成将从冷启动开始。
采样组#
采样由 RandomNoise (#15)、KSamplerSelect (#17)、BasicScheduler (#9)、BasicGuider (#16) 和主要的 SamplerCustomAdvanced (#14) 处理。它们一起去噪联合潜在变量,使画面运动和声音事件同步发展。您可以使用新种子重新运行以获得备用拍摄,同时保持相同的创意方向。一旦您感到舒适,可以通过采样选择或日程安排实验来略微改变运动能量和声音纹理。
解码和创建视频组#
VAEDecode (#10) 从视频潜在变量重建帧序列,VAEDecodeAudio (#23) 从音频潜在变量重建立体声波形。CreateVideo (#91) 将帧和音频合并为 24 fps 的成品剪辑。这是提示中指定的干净剪切和节拍在时间轴上汇聚的地方。输出继续保存。
SaveVideo (#92)#
将最终视频写入您的 ComfyUI 输出下的视频/MiniMax_H3。节点使用自动命名,以便您可以快速迭代,您可以更改路径以保持不同项目的分离。输出包含生成的画面和立体声音频。
Comfyui MiniMax H3 T2V ComfyUI 工作流程中的关键节点#
MiniMaxH3ImageToVideo (#104)#
MiniMax-H3 的核心条件节点,接受 prompt、可选的 first_frame 和 last_frame,以及 width、height 和 length。保持提示简洁但具电影感,并在同一文本块中包含音频提示,如环境音效、SFX、对话和音乐打击。需要特定入口或出口时使用参考帧;省略它们以获得更自由的舞台。
ComfyMathExpression (#107)#
将可读的 duration(秒)映射到模型期望的整数 length,对齐到模型的帧网格以获得干净的时间。将浮点数设置为您预期的剪辑长度,让节点处理转换。稍短的剪辑往往在更高分辨率下保留清晰的运动和声音同步。
SamplerCustomAdvanced (#14)#
根据所选采样器和日程安排驱动去噪过程。使用固定的 noise_seed 锁定拍摄以进行比较,然后仅更改种子以探索新变化。如果运动感觉过于混乱或僵硬,请在 KSamplerSelect (#17) 中尝试不同的采样器或调整 BasicScheduler (#9) 中的日程安排。
CreateVideo (#91)#
将解码的帧和立体声音频组合成单个视频流,按您选择的帧率。对于节奏驱动的编辑,请设置 fps 以匹配您在提示中描述的节奏。节点也是您想要更慢或更快速的感觉时更改 fps 的地方。
ResolutionSelector (#115)#
一个控制长宽比和总像素数的控件,自动四舍五入为模型友好的尺寸。首先选择长宽比,然后微调比例以平衡速度和保真度。较大的画布奖励仔细的提示和更短的时长。
SaveVideo (#92)#
在磁盘上完成剪辑。将其指向项目子文件夹以保持实验组织良好,当您找到满意的作品时明智地重命名。
可选附加功能#
- 将提示写成带有时间提示和明确音频节拍的小型故事板,以实现可靠的同步。
- 包含音频意图词,如风、脚步声、人群、混响或特定乐器,以引导配乐。
- 在提示中直接添加对话或歌唱的台词,并注明说话者的语气。
- 锁定
noise_seed以比较提示调整,仅更改种子以探索备用拍摄。 - 使用
first_frame和last_frame在需要跨剪辑连续性或精确最终姿势时进行运动括号。
致谢#
此工作流程实现并建立在以下作品和资源之上。我们对 Comfy-Org 提供的 MiniMax H3 T2V 工作流程模板和 MiniMax-H3 模型权重、Comfy.org 提供的 MiniMax H3 教程以及 MiniMax 官方的 MiniMax H3 公告表示诚挚感谢,感谢他们的贡献和维护。有关权威详细信息,请参阅以下链接的原始文档和存储库。
资源#
- Comfy-Org/MiniMax H3 T2V 工作流程模板
- GitHub: video_minimax_h3_t2v.json
- Comfy.org/MiniMax H3 教程
- 文档/发布说明: MiniMax H3 教程
- MiniMax/MiniMax H3 官方公告
- 文档/发布说明: MiniMax H3 官方公告
- Comfy-Org/MiniMax-H3 模型权重
- Hugging Face: Comfy-Org/MiniMax-H3
注意:使用引用的模型、数据集和代码须遵循其作者和维护者提供的各自许可证和条款。


