MiniMax H3 8步加速:一体化多模态视频生成与本地音频#
MiniMax H3 8步加速是一体化的ComfyUI工作流,用于创建带有同步本地音频的电影视频。通过统一的MiniMaxH3Unified节点,它支持图像参考、视频参考、带有伴随音频的视频和独立音频参考在一个简化的工作流中。
即用的示例使用单张图像和一个面向运动的文本提示,但参考到视频只是使用工作流的一种方式。其统一的多模态设计支持不同的视觉和音频指导组合,无需为每种输入类型创建单独的工作流图。
该工作流结合了MiniMax H3 FL2VA骨干与LightX2V Turbo LoRA和紧凑的8步、两次采样计划。它旨在用于电影角色镜头、对话场景、大气微故事和其他多模态视频任务,这些任务受益于更快的迭代和同步本地音频。
ComfyUI MiniMax H3 8步加速工作流中的关键模型#
- MiniMax-H3官方权重。视听扩散骨干,从提示和多模态参考生成视频和本地音频。MiniMaxAI/MiniMax-H3
- MiniMax H3视频VAE和音频VAE。配对的编码器和解码器,用于在像素空间、音频波形和H3潜在之间移动。包含在Comfy-Org分发中。Comfy-Org/MiniMax-H3
- Qwen3-VL 32B文本编码器(AWQ,MiniMax调优)。为驱动MiniMax H3时的提示和参考提供语言和视觉基础。与Comfy-Org MiniMax H3包一起分发。Comfy-Org/MiniMax-H3
- LightX2V MiniMax H3 Turbo LoRA。一种面向速度的LoRA,收紧轨迹,使H3可以在8步时间表下有效收敛。lightx2v/Minimax-h3-Turbo
- MiniMax H3潜在升级器3D。用于通道之间增加空间细节而不破坏音频对齐的H3原生潜在升级器。
如何使用ComfyUI MiniMax H3 8步加速工作流#
在一个较高的层次上,该工作流通过一个统一的输入节点收集提示和多模态参考,构建一个紧凑的8步时间表,并运行一个快速的高西格玛通道以建立运动和场景结构。然后可以在运行低西格玛精炼通道之前在3D中扩展视频潜在,解码同步的音频和视频,并将结果导出为MP4。
输入和大小调整#
使用Resolution Selector (Size)(#115)选择目标宽度和高度。在Input Text (Prompt)(#217)中输入您的场景描述;如果您希望在生成的剪辑中包含台词,可以包括引用的对话。
一体化的MiniMaxH3Unified节点(#212)充当工作流的多模态参考中心。它支持图像参考、视频参考、带有音频的视频和独立音频参考,以及提示、大小调整和持续时间控制。
包含的示例配置了一个参考图像和一个运动提示以供立即使用。您可以更换该图像或在同一统一节点内配置其他支持的参考类型,而无需重建采样、升级、解码或导出阶段。
您可以在MiniMaxH3Unified中设置duration,或者在使用外部音频参考引导时序时切换auto_length_from_audio。
模型设置和加速补丁#
UNETLoader(#127)引入MiniMax H3 FL2VA检查点。MiniMaxH3MemoryEfficientSageAttentionPatch(#160)和ModelAttentionBackend(#168)然后激活VRAM友好的注意力后端。
MiniMaxH3SigmaShift(#207)对齐视频和音频去噪视野以适应短时间表。LoraLoaderModelOnly(#167)应用LightX2V Turbo LoRA,使MiniMax H3 8步加速无需单独的加速图。
8步时间表构建器#
BasicScheduler(#163)构建一个紧凑的轨迹,由ExtendIntermediateSigmas(#220)和H3SigmaRefiner(#209)针对H3的视听动态进行微调。
SplitSigmas(#197)将时间表分为结构的高西格玛区块和细节的低西格玛区块。单个RandomNoise(#129)种子为两个通道提供输入,以帮助保持运动和音频一致。
首次采样器:高西格玛#
高西格玛区块流入SamplerCustomAdvanced(#125),由BasicGuider(#126)和MiniMaxH3Unified(#212)的正向条件引导。
此通道在统一的视听潜在中建立构图、运动节奏和粗略的音频基础。其去噪输出随后准备进行中管道增强。
潜在空间升级#
LTXVSeparateAVLatent(#199)分离视听潜在,因此只有视频通道由MinimaxH3LatentUpscaler3D(#226)升级。音频潜在保持不变以保持同步。
LTXVConcatAVLatent(#198)然后将增强的视频潜在与原始音频潜在重新组合,创建一个更清晰但仍然同步的视听潜在用于精炼。
第二次采样器:低西格玛#
重新组合的潜在在SamplerCustomAdvanced(#177)中使用低西格玛区块和BasicGuider(#178)进行精炼。
此通道增加表面细节,清理面部特征,并抛光音频纹理,同时保持首次通道建立的运动和时序。
解码和导出#
VAEDecode(#186)将视频潜在转换为帧,而VAEDecodeAudio(#185)重建本地音轨。
VHS_VideoCombine(#189)将结果混合为MP4,默认帧率为24 fps,生成一个可分享的视听剪辑。
ComfyUI MiniMax H3 8步加速工作流中的关键节点#
MiniMaxH3Unified(#212)。MiniMax H3的一体化多模态参考中心。它将图像、视频、视频音频、独立音频、提示、大小调整和持续时间控制整合到一个节点中,允许不同的H3参考任务使用相同的加速生成管道。H3SigmaRefiner(#209)。调整时间表以优先考虑H3最受益的轨迹部分。如果您需要在同样的速度下获得更清晰的细节,增加一点精炼;如果您优先考虑最大吞吐量,则保持精炼。SplitSigmas(#197)。将紧凑的时间表分为两次通道计划。使用8步时间表,中点分割平衡速度和质量;移动分割将更多步骤分配给结构或细节。MiniMaxH3SigmaShift(#207)。偏移视频和音频的西格玛范围,以便在短时间表下干净地收敛。除非您了解其对同步和稳定性的影响,否则请保持提供的偏移不变。LoraLoaderModelOnly(#167)。应用LightX2V Turbo LoRA。降低强度会柔化Turbo效果以实现更温和的运动;提高强度可能增加快感,但可能过度强调纹理。MinimaxH3LatentUpscaler3D(#226)。在通道之间增加空间细节,同时保持音频潜在完整。使用适中的mode.scale进行720p类型输出,或在VRAM允许的情况下使用更大的倍增器进行1080p。VHS_VideoCombine(#189)。处理最终混合和导出。调整frame_rate,设置文件名前缀,并可选地使用修剪或乒乓循环进行预览。
可选附加功能#
- 多模态参考。使用统一的H3节点处理图像参考、视频参考、带有音频的视频或独立音频参考,而无需切换到单独的生成图。
- 快速启动提示。MiniMax H3对电影动词和相机语言反应良好。简短、具体的提示,如“慢推入”、“手持摇摆”或引用的对话通常会产生更强的运动和更清晰的语音。
- 分辨率快捷方式。0.4 MP与1.6倍潜在升级接近720p。0.5 MP首次通道与2倍升级接近1080p。如果您达到VRAM限制,请在更改步进时间表之前减少百万像素。
- 稳定性提示。保持相同的种子以获得可重复的拍摄。仅更改种子即可快速变化,同时保留其余时间和场景方向。
- 何时绕过升级器。如果您优先考虑速度或内存,将潜在升级器的倍增器设置为1以有效跳过增强阶段。
- 适合场景。此MiniMax H3 8步加速工作流非常适合中近景角色镜头、带有环境声音的对话、视听场景参考、短大气节拍和多模态视频任务,其中快速迭代很重要。
致谢#
此工作流实现并构建在以下作品和资源之上。我们感谢RunningHub提供的工作流参考,感谢MiniMaxAI提供的MiniMax-H3官方模型,感谢Comfy-Org提供的MiniMax-H3模型权重,以及感谢lightx2v提供的MiniMax H3 Turbo LoRA。
有关权威详细信息、许可信息和模型使用条款,请参阅下面链接的原始文档和存储库。
资源#
- RunningHub工作流来源和参考
- 文档 / 发布说明:工作流来源和参考
- MiniMaxAI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
- lightx2v/Minimax-h3-Turbo
- Hugging Face: lightx2v/Minimax-h3-Turbo
注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的各自许可和条款。

