Minimax H3 I2V双时钟8步高质量超高速#
此适用于RunComfy的ComfyUI工作流程将单个参考图像和结合的运动及音频提示转换为短的、同步的视频,具有原生立体声。基于MiniMax H3 Ref2VA条件和8步双时钟采样器构建,提供快速图像动画和紧密耦合的声音,同时不牺牲视觉连贯性。
使用Minimax H3 I2V双时钟8步高质量超高速工作流程进行电影图像动画、角色表演、车辆、产品拍摄和受益于同步运动和生成音频的氛围场景。图形集成了SageAttention以实现内存高效的推理,并使用MiniMax-H3 Turbo LoRA加速生成,同时保持用户面向的I2V体验简单。
Comfyui Minimax H3 I2V双时钟8步高质量超高速工作流程中的关键模型#
- MiniMax-H3 AV基础模型。核心视听变换器,支持参考图像条件、运动生成和原生音频合成。查看Hugging Face上的官方模型卡:MiniMaxAI/MiniMax-H3。
- MiniMax-H3 Turbo LoRA V4 step600。一个轻量级适配器,加速并稳定MiniMax-H3的8步采样,同时保持保真度。模型卡:larryvrh/MiniMax-H3-Turbo-Lora。
- MiniMax-H3视频VAE和音频VAE。配对解码器,将视听潜在变量转换为RGB帧和立体波形。它们确保在采样期间高效的潜在传输和高质量解码。
如何使用Comfyui Minimax H3 I2V双时钟8步高质量超高速工作流程#
此工作流程从左到右运行,分为三个分组阶段:模型和资产设置、双时钟采样以及解码加MP4复用。您需要提供一个参考图像和一个包含视觉方向和“Audio:”部分的单一提示,描述所需的声音。
H3加载器+ Turbo LoRA (EMA)#
此组准备MiniMax-H3堆栈并应用Turbo LoRA以提高速度。将您的参考图像加载到LoadImage中,然后在CR Prompt Text中编写一个描述性运动提示,以“Audio: …”结尾。使用ResolutionSelector选择输出尺寸,以保持视频稳定性,将尺寸保持为32的倍数。使用Float (duration)控制设置目标持续时间(秒);图形的内部数学将其转换为与模型时间对齐的帧数,以便采样器平稳运行。应用SageAttention补丁到模型,以减少VRAM使用并提高吞吐量,同时不改变最终外观。
STABLE: video 4 / audio 4#
此组使用8步MiniMax H3双时钟采样器进行生成核心。条件块使用Ref2VA将您的参考图像和文本提示融合为AV潜在变量,锚定身份、构图和高级声音提示。双时钟采样器通过单独但同步的时钟推进视频和音频,使运动和声音自然锁定。如果您需要校正感知上的提前或滞后,请调整视频和音频时钟偏移,以微调任一流的前进或后退,直到表演与同步。基本的CFG风格指导器在保持对提示的忠实度和模型的学习先验之间取得平衡,以实现干净的电影运动。
解码+同步MP4#
解码器使用专用的MiniMax-H3 VAE将最终AV潜在变量转换为帧序列和立体音轨。VHS_VideoCombine阶段将帧和音频打包成单个H.264 MP4,按您选择的帧速率保存,准备好分享的视频。如果您稍后带来自己的音频,可以根据音频长度进行修剪或仅导出图像以供外部编辑。结果是一个紧凑的、同步的剪辑,保留了参考图像的外观,同时增加了生动的运动和声音。
Comfyui Minimax H3 I2V双时钟8步高质量超高速工作流程中的关键节点#
MiniMaxH3AudioConditioningT8 (#6)#
此节点实现Ref2VA条件,采用您的提示、参考图像、目标宽度、高度和长度,创建视听潜在变量和正面条件。使用它来设定创意意图:描述运动、相机行为和场景连续性,然后添加一个“Audio:”段,指定乐器、音色、氛围和动态。保持宽度和高度与参考图像的纵横比一致,以获得最连贯的布局。长度控制将您的持续时间映射到与采样器内部时间对齐的帧,这有助于保持平滑的运动和稳定的音频。由ComfyUI MiniMax H3 Turbo项目提供:Larryvrh/ComfyUI-MiniMax-H3-Turbo。
MiniMaxH3DualClockSamplerT8 (#7)#
一个专为MiniMax-H3 AV生成设计的8步采样器,具有单独的视频和音频时钟。通过协调两个时间线,同时尊重您的Ref2VA约束,产生快速、高质量的结果。如果视觉相对于节拍或动作略显提前或滞后,请以小增量调整视频和音频时钟偏移,以重新居中同步。保持步数为八,以实现预期的高质量超高速平衡。在同一插件中实现:Larryvrh/ComfyUI-MiniMax-H3-Turbo。
LoraLoaderBypassModelOnly (#2)#
将MiniMax-H3 Turbo LoRA注入基础模型,以加速收敛并在低步下提高稳定性。如果您注意到某些图像过度锐化或身份漂移,请稍微减少LoRA强度以恢复中性。对于更有力的细节或更强的时间锁定,请适度增加强度。LoRA参考:larryvrh/MiniMax-H3-Turbo-Lora。
MiniMaxH3MemoryEfficientSageAttentionPatch (#17)#
将内存高效的注意力实现应用于MiniMax-H3模型,以提高典型GPU上的吞吐量。按原样使用它,以减少更大分辨率和更长持续时间上的VRAM压力。补丁是ComfyUI的KJNodes套件的一部分:kijai/ComfyUI-KJNodes。
MiniMaxH3AVDecodeT8 (#11)#
使用配对的MiniMax-H3 VAE将视听潜在变量解码为RGB帧和立体音频。这是实现最终保真度的地方,因此请保持分辨率选择与您的GPU实际相符,以避免解码瓶颈。节点输出与采样器时钟时间对齐的帧和音频信号,准备复用。由MiniMax H3 Turbo插件提供:Larryvrh/ComfyUI-MiniMax-H3-Turbo。
VHS_VideoCombine (#12)#
使用Video Helper Suite将解码的帧和立体音频合并为单个MP4。设置您首选的帧速率,如果您稍后替换自定义音频,请启用修剪。此节点完成交付,以便您可以快速预览和导出。项目参考:Kosinkadink/ComfyUI-VideoHelperSuite。
可选额外功能#
- 提示效果最佳时,将视觉方向和声音设计分开。先编写场景,然后添加“Audio:”,包含乐器、风格、房间类型和强度。
- 从与您的图像纵横比匹配的中等尺寸开始。一旦您喜欢运动和时间安排,再进行放大。
- 如果同步感觉不对劲,请微调视频或音频时钟偏移,而不是更改持续时间。微小的调整可以将表演锁定到节拍。
- 对于角色镜头,选择具有清晰主体分离和一致光照的图像,以通过运动保持身份。
- 重新种子探索短语和时间安排的微小变化,同时保持相同的设置。
致谢#
此工作流程实现并建立在以下作品和资源之上。我们感谢RunningHub提供的Source工作流程模板,MiniMaxAI提供的MiniMax-H3模型权重,以及Larryvrh提供的MiniMax-H3 Turbo LoRA和ComfyUI MiniMax H3 Turbo项目的贡献和维护。有关权威细节,请参阅下面链接的原始文档和存储库。
资源#
- RunningHub/Source工作流程模板
- 文档/发布说明:Source工作流程模板
- MiniMaxAI/MiniMax H3模型权重
- Hugging Face: MiniMaxAI/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
- Larryvrh/ComfyUI MiniMax H3 Turbo项目
注意:所引用的模型、数据集和代码的使用受其作者和维护者提供的各自许可证和条款的约束。


