MiniMax 音乐视频:ComfyUI 中的歌曲到场景生成#
此工作流程使用 MiniMax H3 将完整的歌曲转化为节奏感知的视频镜头序列,可选的音乐创作由 MiniMax Music 3 提供支持。它结合文本提示、参考图像和主音轨生成电影剪辑,跟踪声乐、节拍和情感。结果是一个连贯的 MiniMax 音乐视频,具有一致的角色身份和自然的镜头过渡。
为艺术家、编辑和创作者而建,工作流程支持表演剪辑、歌词驱动的视觉效果和叙事插入。您可以带入自己的曲目或先生成一个,然后组装一个保持视觉连续性的 MiniMax 音乐视频,同时随着歌曲结构的发展而演变。
Comfyui MiniMax 音乐视频工作流程中的关键模型#
- MiniMax H3 扩散模型。核心视频生成器,使用参考和提示条件生成与音频对齐的镜头序列。模型资产在 Hugging Face 上以 Comfy‑Org 名称空间发布,包括视频 VAE 和文本编码器。 Comfy‑Org/MiniMax‑H3
- MiniMax H3 视频 VAE。将潜在帧解码为图像以供预览和导出。 minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 音频 VAE。当需要时解码模型的辅助音频潜在。 minimax_h3_audio_vae_fp32.safetensors
- MiniMax H3 文本编码器 (Qwen3VL 32B 变体为 H3 打包)。提供多模态提示理解,用于参考到视频生成。 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
- MiniMax Music 3 扩散模型。文本到音乐生成器,从标题和歌词计划中创建完整的歌曲;当您想在 ComfyUI 内创作曲目时使用。 Comfy‑Org/MiniMax‑Music‑3
- MiniMax Music 3 文本编码器。将标题和歌词编码为音乐生成的条件。 minimax_music3_text_encoder_pruned_int8_convrot.safetensors
- MiniMax Music 3 DAV VAE。将音频潜在解码为最终波形。 minimax_music3_dav.safetensors
如何使用 Comfyui MiniMax 音乐视频工作流程#
整体流程。图形有两个协作部分:1) 可选的音乐创作,生成主音轨,2) 参考到视频合成,构建与歌曲同步的视觉一致镜头。您可以将它们一起运行或插入自己的音频并跳过音乐创作。最后一步将帧和音频组装成一个渲染的 MiniMax 音乐视频。
1) 音乐创作(可选)#
此组计划并合成一个曲目使用 MiniMax Music 3。以 M3SongPlanner (#6171) 开始起草结构化标题和歌词;两者都可以在画布文本查看器中编辑,然后进行编码。MiniMaxMusic3TextEncode (#6157) 将该计划转化为条件并提供目标持续时间。创建一个潜在音频容器,由 KSampler (#6162) 与 MiniMax Music 3 UNet (UNETLoader (#6156)) 采样,然后通过 DAV VAE 使用标准或平铺解码,具体取决于 VRAM。生成的音频被保存并设置为视频工作流程的源轨道。
2) 用户输入#
提供或生成一个主歌曲。使用 VHS_LoadAudioUpload (#6170) 上传外部曲目,或使用步骤 1 中生成的歌曲。使用 LoadImage (#6110) 或路径加载器添加一个或多个参考图像以获取外观和身份;图像由 ImageResizeKJv2 (#6090, #6091) 正常化以获得稳定的条件。在 (input:prompt) 文本提示 (#138) 中设置您的创意简报 — 此提示支持主题定义、镜头注释和时间提示。通过 Resolution Selector (Size) (#115) 和 (input:duration) Duration (#132) 选择纵横比和大致持续时间。
3) 补丁#
PathchSageAttentionKJ (#142) 激活优化的注意力实现,可以改善某些 GPU 的吞吐量和内存行为。此补丁在加载 MiniMax H3 模型之前运行采样。除非遇到设备特定的问题,否则请保持启用。
4) 模型#
UNETLoader (#127) 加载 MiniMax H3 主干用于参考到视频,并使用 LoraLoaderModelOnly (#5959) 应用可选的 Turbo LoRA,以获得更快、更有力的结果。视频和音频 VAEs (VAELoader (#119), VAELoader (#120)) 准备解码。这些资产定义了质量范围,应该在镜头之间保持一致以保持统一的外观。
5) 条件#
MiniMaxH3ReferenceToVideo (#136) 将您的文本提示、参考图像、目标大小和长度融合成条件和初始潜在。它是创意简报与采样器将渲染的桥梁。您可以在此模板中输入两个参考图像以指导服装、身份和调色板。该组还根据请求的持续时间计算镜头长度,以便帧与音乐对齐。
6) 采样#
采样堆栈结合了 BasicScheduler (#124), BasicGuider (#126) 和 SamplerCustomAdvanced (#125) 与 RandomNoise (#129)。MiniMaxH3SigmaShift (#5960) 位于上游,以偏移 sigma 范围以获得更清晰的视频运动和稳定的音频对齐。它们共同迭代潜在以生成遵循您参考和节拍的图像。为了可重复性,在迭代提示和参考时保持种子固定。
7) 解码和创建视频#
VAEDecode (#122) 将采样的潜在转换为帧,并准备 Set_video_1 (#5651) 以供导出。最终组装使用 VHS_VideoCombine (#5645),将帧拼接到选择的源音频,并应用存储的 src_fps 值中的目标帧率。输出是一个准备分享的 MiniMax 音乐视频剪辑,与轨道保持同步。
8) 参考到视频#
该组是管道的创意核心,用于针对主歌曲构建镜头序列。它接收准备好的 H3 模型、您的参考和计算的镜头长度,然后每个剪辑运行一次采样。使用它围绕同一主题迭代多个连接的剪辑,以便身份、服装和调色板保持一致。每个歌曲部分重复,以匹配视觉效果覆盖介绍、段落、合唱和桥段。
Comfyui MiniMax 音乐视频工作流程中的关键节点#
MiniMaxH3ReferenceToVideo (#136)#
创建将提示、参考和目标几何与潜在采样联系起来的条件。使用它通过一小组高质量图像和清晰的镜头注释来引导身份和艺术方向。如果一个镜头需要更强的面部或服装依从性,请保持参考风格相似,并避免极端裁剪。调整提示措辞,而不是改变采样设置,因为这个节点最强烈地影响屏幕上出现的内容和人物。
MiniMaxH3SigmaShift (#5960)#
在 MiniMax H3 堆栈中偏移 sigma 计划,以平衡时间变化和音频对齐。当您希望在镜头内获得更多运动和视觉演变时增加视频偏移;增加音频偏移以支持紧密的节奏和唇感。使用适度的变化,并在提交整个场景之前在短片上测试。
SamplerCustomAdvanced (#125)#
使用所选调度器和引导器运行去噪循环。在这里,您可以用时间换取质量和纹理。对于快速构思,减少步骤并保持种子固定;对于最终版,增加步骤并微调指导以在不失去身份的情况下细化细节。当结果超出您的简报时,首先简化提示或减少冲突的参考。
VHS_VideoCombine (#5645)#
将解码的帧与所选音频组合成一个视频文件。保持帧率在所有计划一起编辑的剪辑中保持一致。如果视觉效果偏离节拍,请确认镜头长度和 fps 与源音轨一致。仅在渲染与工作流程中的节奏和歌词提示匹配后,在您的 NLE 中进行修剪。
MiniMaxMusic3TextEncode (#6157)#
编码定义 MiniMax Music 3 结构、编排和声乐特征的标题和歌词。用涵盖全局元数据、声乐细节和编排的章节编写标题,以便模型理解意图。使用歌词章节标签,例如 [Intro]、[Verse] 和 [Chorus] 标记生成器可以遵循的过渡。有关提示帮助,请参阅官方存储库的指导和工具。 MiniMax‑AI/MiniMax‑Music3
ComfyMathExpression (#131)#
根据您的目标持续时间计算内部帧计数,并将其固定到 H3 时间堆栈在所选 fps 下偏好的节奏上。这可以避免细微的不同步和卡顿。如果您更改 fps 或持续时间,让此节点重新计算长度,以便采样落在节拍上。
可选附加项#
- 使用稳定的结构编写提示:主题定义、一句简要总结,然后是 1–3 段镜头段落和时间提示。保持时态和语态一致。
- 每个主题使用 1–2 张干净的参考图像。偏爱中性照明和包括头发和服装细节的中等裁剪,以提高身份保留。
- 先将场景映射到歌曲。为每个部分(介绍、段落、合唱)渲染短片并连接它们;这使得 MiniMax 音乐视频保持连贯,同时允许局部变化。
- 保持分辨率和帧率在所有计划一起编辑的剪辑中保持一致。中途更改任何一个项目会使连续性更难。
- 在低 VRAM 机器上,为长歌曲启用平铺音频解码;在高 VRAM 上,标准解码通常会更干净一些。
- 为了可靠的重新渲染,在导出最终版之前锁定视频采样器和音乐采样器上的种子。
致谢#
此工作流程实现并构建在以下作品和资源之上。我们由衷感谢 Innovate Futures @ Benji 为 MiniMax Music VideoWorkflow Source 的贡献和维护。有关权威的详细信息,请参阅以下链接的原始文档和存储库。
资源#
- Innovate Futures @ Benji/MiniMax Music VideoWorkflow Source
- 文档 / 发布说明: MiniMax Music VideoWorkflow Source
注意:引用的模型、数据集和代码的使用受其作者和维护者提供的相应许可和条款的约束。

