ComfyUI>工作流>MiniMax Music 3 ComfyUI | 完整的文本到歌曲 AI

MiniMax Music 3 ComfyUI | 完整的文本到歌曲 AI

Workflow Name: RunComfy/MiniMax-Music-3
Workflow ID: 0000...1498
使用 MiniMax Music 3 文本到音乐的图表将想法转化为完整的歌曲。您可以指导流派、情绪、声乐、节奏、调性和乐器。添加标记的歌词来塑造段落。预设渲染为 60 秒。您可以在 RunComfy 上快速草拟原创声乐曲目。

MiniMax Music 3 ComfyUI Workflow

MiniMax Music 3 ComfyUI | Captions and Lyrics to Full Songs
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax Music 3 ComfyUI Examples

MiniMax Music 3 ComfyUI 文本到音乐的工作流程用于结构化歌曲#

MiniMax Music 3 ComfyUI 将详细的字幕和分段标记的歌词转化为 RunComfy 上 ComfyUI 内的完整歌曲。图表预设为默认生成 60 秒的曲目,底层模型支持长达约五分钟的歌曲。您可以通过文本引导流派、情绪、声乐、乐器、节奏、调性和结构,模型将其视为创意方向而非严格保证。

这个 MiniMax Music 3 ComfyUI 工作流程非常适合希望从文本草拟原创声乐曲目或结构化歌曲概念的制作人、声音设计师和创作者。它专注于干净的文本到音乐生成,不包括参考音频、封面、续集或音频编辑模式。

MiniMax Music 3 ComfyUI 工作流程中的关键模型#

  • MiniMax Music 3 Diffusion Transformer (DiT)。核心生成器从文本条件中合成歌曲在潜在音频空间。使用 FP16 权重以获得最佳质量或使用 INT8 ConvRot 变体以降低 VRAM。FP16 权重INT8 权重
  • MiniMax Music 3 Text Encoder。将您的字幕和歌词转换为生成器理解的条件,包括从目标持续时间得出的时间信号。文本编码器
  • MiniMax Music 3 DAV (Decoding Audio VAE)。在采样结束时将潜在音频解码为全频波形。VAE
  • 项目资源和提示示例由作者维护在此处:MiniMax-Music3 on GitHub

如何使用 MiniMax Music 3 ComfyUI 工作流程#

在高层次上,工作流程对您的字幕和歌词进行编码,创建请求持续时间的潜在音频时间轴,采样歌曲,将其解码为波形,然后保存结果。主要控件位于 Text to Music (MiniMax Music 3) (#37) 节点。

字幕和歌词创作#

将字幕写成三个简短部分:全局元数据、声乐细节和编排。用简单的语言描述流派、情绪、节奏、调性、乐器、混音特性和声乐风格。在歌词中,使用像 [Intro]、[Verse]、[Chorus]、[Bridge]、[Outro] 这样的分段标签来定义结构;标签是驱动形式的,而单词主要传达氛围和语音。保持字幕简洁和具体,以引导风格而不限制创意。对于纯乐器曲目,在字幕中声明不需要声乐。

MiniMaxMusic3TextEncode (#13)#

此节点接收字幕和标记的歌词,生成捕捉风格、编排意图和声乐存在的条件。它还会发出图表用来调整潜在音频时间轴大小的时间值,因此您的 max_duration 设置直接决定歌曲长度。如需可重复的录音,请设置种子;在改进文本以迭代相同编排时保持不变。编码器与图表中加载的 MiniMax CLIP 系列文本模型配对,因此很少需要切换编码器。

EmptyMiniMaxMusic3LatentAudio (#15)#

创建与编码器的持续时间信号匹配的空潜在音频画布。将其视为生成器将根据您的文本填充鼓、贝斯、和声、旋律和声乐的空白多轨时间线。更长的持续时间会增加 VRAM 需求和渲染时间。使用它在短想法和完整歌曲之间移动,而不更改管道的任何其他部分。

UNETLoader (#6) 和 KSampler (#9)#

UNETLoader 选择 MiniMax Music 3 DiT 权重。KSampler 使用文本中的正条件和由 ConditioningZeroOut (#10) 提供的空白负条件应用扩散过程。步数和采样器选择影响细节和节奏感觉,而引导尺度则在文本遵从度与生成自由之间取得平衡。保持种子不变以公平比较字幕,并更改它以探索新的旋律和结构替代方案。

解码和 VRAM 控制:VAEDecodeAudio (#12)、VAEDecodeAudioTiled (#42)、ComfySwitchNode (#43)#

采样后,潜在音频由 DAV 解码为波形。对于长歌曲或低 VRAM 情况,启用主节点上的 tiled_decode 开关,以通过 VAEDecodeAudioTiled 路由,处理重叠的瓷砖以减少内存使用。瓷砖解码稍慢,并可能在边缘情况下引入轻微的边界伪影,因此在资源允许的情况下优先使用标准解码。ComfySwitchNode 根据您的切换自动选择适当的路径。

输出:SaveAudioAdvanced (#35)#

最终音频以您选择的格式(如 MP3 或 WAV)保存到磁盘。使用此节点设置适合草稿或共享的文件名约定和质量设置。对于生产用途,考虑导出无损文件以进行下游混音和母带处理。

MiniMax Music 3 ComfyUI 工作流程中的关键节点#

MiniMaxMusic3TextEncode (#13)#

是风格和结构的核心。调整 max_duration 设置目标长度和 seed 以实现可重复性。如果结果感觉偏离主题,首先优化字幕的全局元数据,然后调整声乐细节和编排以重新平衡乐器和混音特性。

KSampler (#9)#

控制细节、时机感觉以及歌曲跟随文本的强度。增加步数以在速度成本下获得更丰富的纹理,尝试不同的采样器以获得不同的律动和瞬态,并调整引导尺度以在精度和创意之间进行权衡。在 A/B 测试字幕时保持相同的种子以隔离提示更改。

VAEDecodeAudioTiled (#42)#

在生成较长曲目或在有限的 GPU 上工作时使用。通过在重叠的瓷砖中解码波形来降低峰值内存。仅在需要时启用以避免小缝隙风险和额外的渲染时间。

UNETLoader (#6)#

根据 VRAM 在 FP16 和 INT8 DiT 权重之间切换。FP16 建议用于最高保真度,而 INT8 ConvRot 变体有助于将更长的歌曲放在较小的卡上。

SaveAudioAdvanced (#35)#

控制导出格式和质量。选择 MP3 进行快速共享或 WAV 以获得无损的音轨和后期处理。设置清晰的文件名前缀以保持多个录音的组织。

可选额外功能#

  • 使用简洁、具体的字幕。强大的全局元数据段落,包括流派、BPM 感觉、调性、混音形容词和制作时代,通常比长篇大论更重要。
  • 歌词中的分段标签驱动结构。保持标签简单,避免嵌套,让乐器段落通过省略标签之间的单词来呼吸。
  • 要推动声乐向前,强调字幕中的声乐音色和位置。对于乐器输出,明确表示不需要声乐。
  • 为了更多的变化,改变种子。为了专注于优化,保持种子不变并迭代文本。
  • 模型将节奏、调性和乐器视为指导。期待创意偏差并迭代朝目标方向发展。
  • 此 MiniMax Music 3 ComfyUI 工作流程不包括参考音频、封面、续集或音频编辑模式。有关高级提示技术和示例,请参见官方项目资源:MiniMax-Music3 on GitHubHugging Face 上的模型文件。

鸣谢#

此工作流程实现并建立在以下作品和资源之上。我们非常感谢 ComfyUI 提供 MiniMax Music 3: Text to Music 工作流程模板,MiniMax-AI 提供 MiniMax Music 3 官方项目,以及 Comfy-Org 提供 MiniMax Music 3 模型权重的贡献和维护。有关权威详细信息,请参阅下面链接的原始文档和存储库。

资源#

注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的各自许可和条款。

RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。