MiniMax H3 ComfyUI 文本到视频 4步 Turbo:在一次通过中生成带有本地音频的短片#
这个工作流程将单个电影提示转换为带有共同生成的立体声的短视频,使用 MiniMax H3。它应用 Turbo 4步加速 LoRA,使您可以快速迭代对话、歌唱和环境场景,同时保持运动和声音的紧密结合。
专为希望仅使用提示草稿的创作者设计,MiniMax H3 ComfyUI 文本到视频 4步 Turbo 工作流程生成干净的语音或人声、一致的环境声音以及一致的电影摄影,无需手动音频组装。图形自动处理长度对齐、潜在采样、解码和合并,因此您可以专注于讲故事和表演提示。
Comfyui MiniMax H3 ComfyUI 文本到视频 4步 Turbo 工作流程中的关键模型#
- MiniMax H3 扩散模型 (FL2VA UNet)。核心视听生成器,可以学习图片和声音的共享潜在,使得从同一采样过程中同步运动和音频。权重:Comfy-Org/MiniMax-H3。
- Qwen3-VL 32B 文本编码器用于 H3 (AWQ/NVFP4 变体)。将丰富的多句提示编码为驱动场景布局、表演和音频事件的条件。打包在 Comfy-Org/MiniMax-H3。
- MiniMax H3 视频 VAE。将采样的视频潜在解码为具有电影色调和细节的帧。文件:minimax_h3_video_vae_fp16.safetensors。
- MiniMax H3 音频 VAE。将共享的潜在解码为时间对齐的立体声音频,用于语音、歌唱和环境。文件:minimax_h3_audio_vae_fp32.safetensors。
- MiniMax H3 Turbo 4步 LoRA。应用加速配方,同时保持场景保真度并实现非常快速的采样。文件:minimax_h3_turbo_4step_pruned_comfyui.safetensors。
如何使用 Comfyui MiniMax H3 ComfyUI 文本到视频 4步 Turbo 工作流程#
在高层次上,您的提示被编码,Turbo 增强的 H3 模型采样单个视听潜在,然后视频和音频 VAE 解码该潜在,最终剪辑被合并为一个可播放的文件。
1) 编写电影提示并设置持续时间#
使用 easy positive (#147) 文本字段描述外观、动作和表演。要指导声音或音乐,请包括明确的提示,如“Audio: middle‑aged male voice delivers the line... rain ambience... low thriller underscore.” Float (duration) 控制器 (#133) 设置剪辑长度(以秒为单位)。一个数学节点将您的持续时间转换为帧,并默默地将计数对齐到 H3 所需的节奏,因此您不需要管理帧数学。
2) 加载 H3、文本编码器、VAE 和 Turbo LoRA#
UNETLoader (#127) 加载 MiniMax H3 扩散模型,CLIPLoader (#128) 加载为 H3 量身定制的 Qwen3‑VL 文本编码器。两个 VAELoader 节点引入视频 VAE (#119) 和音频 VAE (#120)。LoraLoaderModelOnly (#153) 将 MiniMax H3 Turbo 4步 LoRA 应用于模型,使调度程序和采样器在快速模式下运行而不失去视听一致性。
3) 构建条件和初始视听潜在#
MiniMaxH3ImageToVideo (#131) 将您的提示转换为正条件,并准备一个与您选择的宽度、高度和帧数对齐的初始潜在。可选的 first_frame 和 last_frame 输入存在用于锚定开始或结束图像,如果您选择稍后扩展图形。节点输出将下游采样将完善的条件和潜在。
4) 使用 Turbo 采样#
BasicGuider (#126) 将模型与您的条件配对,KSamplerSelect (#123) 选择采样算法,BasicScheduler (#124) 设置与 Turbo LoRA 一起工作的步骤计划。RandomNoise (#129) 为生成设置种子以实现可重复性。SamplerCustomAdvanced (#125) 执行去噪过程以生成最终共享的潜在,编码视频和音频。
5) 解码并导出最终剪辑#
VAEDecode (#122) 从潜在重建图像帧,而 VAEDecodeAudio (#121) 重建同步的立体声音频。CreateVideo (#130) 将帧和音频合并为一个单一流,然后 SaveVideo (#92) 使用您设置的文件名前缀将文件写入磁盘。
Comfyui MiniMax H3 ComfyUI 文本到视频 4步 Turbo 工作流程中的关键节点#
MiniMaxH3ImageToVideo (#131)#
根据您的提示、分辨率和长度生成正条件并初始化视听潜在。调整 width、height 或 length 会改变运动规模和屏幕上可以容纳多少动作。如果您稍后扩展图形,first_frame 和 last_frame 允许您在镜头之间锁定连续性。
LoraLoaderModelOnly (#153)#
将 Turbo 4步 LoRA 应用于加载的 H3 模型。将调度程序保持在低步数模式,以便从 Turbo 中受益;大幅提高步数会使外观偏离预期的快速迭代行为。该 LoRA 专为 MiniMax H3 设计,与 H3 仓库中的主要权重一起存在。
BasicScheduler (#124)#
控制采样器遵循的去噪计划。使用它来平衡速度和保真度,同时保持与 Turbo LoRA 的兼容性。如果更改采样器算法,请重新审视计划选择以保持稳定的运动和干净的音频。
SamplerCustomAdvanced (#125)#
在给定噪声、引导器、采样器、sigma 和初始潜在条件下运行实际的去噪。它是纹理、时间和视听清晰度的最终仲裁者。在比较提示调整时使用相同的种子,以便您可以将差异归因于文本更改而不是噪声。
PathchSageAttentionKJ (#150)#
在 LoRA 注入之前应用一个注意力优化,以提高大分辨率的吞吐量。由 KJNodes 提供,它为 ComfyUI 提供性能辅助。仓库:ComfyUI-KJNodes。
CreateVideo (#130)#
将解码的帧与解码的音频组合成同步的剪辑。如果您需要匹配交付规格,可以在此处更改帧率或位深度。节点保持从共享潜在衍生的视听同步。
SaveVideo (#92)#
使用您选择的文件名前缀、容器和编解码器将渲染的剪辑写入磁盘。使用一致的命名来跟踪同一场景和种子的迭代。
可选附加功能#
- 提示语音:在“Audio:”后放置确切的台词,并描述声音的年龄、性别、语调和节奏。对于歌唱,指定风格和节奏。对于环境,列出来源、强度以及是否只需背景音乐。
- 分辨率和持续时间权衡:更高的像素数和更长的剪辑需要更多的采样时间。如果您需要多次拍摄,请先从较小的开始,然后在时间和交付感觉正确后放大或延长。
- 可重复性:在仅调整文本时保持相同的种子,以便您可以 A/B 测试小提示编辑。
- 长度对齐是自动的:图形将秒转换为帧,并将计数对齐到 H3 的内部节奏,以实现稳定的视听合成。
- 连续性选项:模型节点公开可选的
first_frame和last_frame。如果您稍后扩展工作流程,请将图像连接到那里,以匹配编辑中的镜头开始或结束。 - 安全性:避免在提示中使用未经同意的受版权保护的角色、真实人物肖像以及屏幕上的标志或字幕。
致谢#
此工作流程实现并构建在以下作品和资源之上。我们对 MiniMax 在 MiniMax H3 多模态生成模型和公告中的贡献表示感谢,对 Comfy.org 在 ComfyUI MiniMax H3 工作流程教程中的贡献表示感谢,并对 Comfy-Org 在 MiniMax-H3 模型权重中的贡献表示感谢。有关权威详细信息,请参阅下文链接的原始文档和仓库。
资源#
- MiniMax/MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Docs / Release Notes: MiniMax H3 official announcement
- Comfy.org/MiniMax H3: ComfyUI Workflow Examples
- GitHub: Comfy-Org/docs
- Docs / Release Notes: Comfy.org MiniMax H3 tutorial
- Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
Note: Use of the referenced models, datasets, and code is subject to the respective licenses and terms provided by their authors and maintainers.

