ComfyUI>工作流>VDN H3 ComfyUI 文本转视频 | 更快的MiniMax H3 VDN 8步工作流,无需LoRA

VDN H3 ComfyUI 文本转视频 | 更快的MiniMax H3 VDN 8步工作流,无需LoRA

Workflow Name: RunComfy/VDN-H3-Text-To-Video
Workflow ID: 0000...1513
从文本提示创建带有音频的MiniMax H3视频。您将获得使用Video DeltaNet混合注意力的8步采样。构建幻想、驾驶或战斗场景。与FastVideo分支比较输出。优化提示以获得创意控制。

VDN H3 ComfyUI Text To Video Workflow

VDN H3 ComfyUI Text To Video | 8-Step Video and Audio
想要运行这个工作流吗?
  • 完全可操作的工作流
  • 没有缺失的节点或模型
  • 无需手动设置
  • 具有惊艳的视觉效果

VDN H3 ComfyUI Text To Video Examples

VDN H3 MiniMax ComfyUI 文本转视频#

VDN H3 ComfyUI 文本转视频将自然语言提示转换为短片电影视频,并同步音频。它结合了MiniMax H3系列与Video DeltaNet混合注意力和8步采样,从单个提示生成视频和音频。非常适合分镜、产品剪辑和风格化场景,如电影幻想、拉力驾驶和装甲剑斗。

图包括两个独立可选分支。VDN-H3分支应用了Video DeltaNet补丁,并用于生成包括的示例。提供FastVideo分支以比较输出和生成时间与VDN路径。两个分支都以您选择的帧率渲染带有音频的MP4。

基于开放组件构建:MiniMax H3的VDN GitHubHugging Face,Saganaki22的VDN-H3 ComfyUI节点 GitHub,以及基础MiniMax H3权重和VAE Hugging Face

Comfyui VDN H3 ComfyUI 文本转视频工作流中的关键模型#

  • MiniMax-H3扩散模型(UNet)。驱动去噪过程,将噪声转化为连贯的时空视频和音频潜在。权重在MiniMax H3捆绑包中提供于 Hugging Face
  • Qwen3-VL 32B MiniMax-H3文本编码器。将您的提示转换为视频和音频生成的条件,针对H3系列进行调优。包含在MiniMax H3发布中 Hugging Face
  • MiniMax-H3视频VAE。将视频潜在解码为RGB帧。可在VAE部分中找到 Hugging Face
  • MiniMax-H3音频VAE。从音频潜在重建波形音频。也提供于 Hugging Face
  • VDN-H3补丁权重。Video DeltaNet对MiniMax H3应用混合注意力。从 Hugging Face 获取检查点。
  • FastVideo UNet变体。比较分支使用minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensors 来自 Kijai/MiniMax-H3-experimental

如何使用Comfyui VDN H3 MiniMax ComfyUI 文本转视频工作流#

首先设置您的提示、分辨率、时长和帧率。选择VDN-H3分支或FastVideo分支进行单独运行。队列所有可以执行两个启用的分支并生成两个MP4;独立图分支不保证同时GPU执行。两个分支都配置为8步采样。

用户输入#

使用(input:prompt) 文本提示面板用简单语言描述视觉和声音。对于音频,添加以Audio:开头的最后一行以请求特定的Foley或环境音,例如“Audio: 有节奏的马蹄声,风声,远处的咆哮。”通过(input:Resolution) 像素控制视觉大小,该像素送入ResolutionSelector以生成计算友好的宽度和高度。设置(input:Duration) 秒(input:FPS)以定义剪辑应有的时长和流畅度。工作流将持续时间和FPS转换为有效的帧数,并悄悄地将其调整为H3内部良好播放的序列长度。

模型#

CLIPLoader提供用于条件的MiniMax调优文本编码器。两个VAELoader节点引入MiniMax-H3 视频VAE和音频VAE,以便解码的帧和声音与模型的潜在空间匹配。这些加载器由两个分支共享,以确保苹果对苹果的A/B结果。

条件#

MiniMaxH3ImageToVideo (#219) 将您的提示加上大小和长度转化为初始的视频和音频潜在以及正向条件。可选的图像输入可以在需要特定进入或退出姿势时锁定第一帧或最后一帧。在这个阶段,您的叙述决策最为重要:摄像机运动、主体动作、照明和Audio:行都将成为采样器下游的指导。

VDN-H3补丁#

VDN分支通过ApplyVDNH3Advanced (#6126) 应用Video DeltaNet升级。它应用了选定的混合注意力补丁。MiniMaxChunkFeedForwardModelPatchTorchSettings 配置内存和执行设置。MiniMaxH3SigmaShift 在采样开始前调整视频和音频的噪声计划。

采样 (VDN-H3)#

VDN采样从RandomNoise (#6141) 开始,与BasicGuider (#6134) 合并指导,在KSamplerSelect (#6137) 中选择求解器,并在BasicScheduler (#6136) 中安排少量扩散步骤。SamplerCustomAdvanced (#6135) 执行全序列的去噪以生成精炼的视频和音频潜在。保持种子固定以便重复或更改以在相同提示下探索新变体。

解码和创建视频 (VDN-H3)#

VAEDecode (#6146) 重构帧,而VAEDecodeAudio (#6145) 重建音轨。VHS_VideoCombine (#6170) 将帧和音频合并为MP4,遵循您先前设置的帧率并保存为可预览的文件。VDN输出以独特的文件名前缀保存,因此很容易与FastVideo结果进行比较。

FastVideo比较分支#

FastVideo路径加载速度调优的MiniMax H3 UNet,并在采样前应用轻量级注意力补丁。它重用您的提示、大小和帧数,以便您可以直接比较时间和外观。采样镜像VDN分支的结构,也配置为8步。帧和音频被解码并与VHS_VideoCombine (#6104) 合并以生成第二个MP4。使用这些并排输出来确定哪个分支最适合您的场景。

Comfyui VDN H3 ComfyUI 文本转视频工作流中的关键节点#

  • ApplyVDNH3Advanced (#6126)。使用VDN-H3发布中的选定检查点在MiniMax H3上启用Video DeltaNet。仅在想要更改VDN检查点或切换注意力后端时调整;对于一般使用,保持混合注意力默认值。参考实现:Saganaki22/ComfyUI-VDN-H3
  • MiniMaxH3ImageToVideo (#219)。故事和时间的中央控制点,接受文本提示、计算的宽度和高度以及派生的帧数。对于音频,在提示中附加单个Audio:行以引导Foley和环境音,同时避免除非明确要求的语音。
  • MiniMaxH3SigmaShift (#6131, #6007)。重新平衡视频和音频流的sigma计划,这有助于在低步数下减少抖动并保留细节。仅在更改模型变体或注意到运动不稳定时考虑小调整。
  • VHS_VideoCombine (#6170, #6104)。将解码的帧和音频合并为MP4,使用您选择的帧率和文件名前缀。实用选项包括修剪到音频长度和选择所需的H.264像素格式。项目页面:ComfyUI-VideoHelperSuite

可选扩展#

  • 提示技巧:以一句话开头设定主题、动作和摄像机移动,然后添加外观和感觉提示以及一行Audio:用于Foley。
  • 对于较长的剪辑,优先选择适度的像素而不是高分辨率,以保持运动稳定并控制内存使用。
  • 当您想要一致的迭代时,在RandomNoise中修复种子;改变它以探索变化。
  • 在您自己的场景中比较两个分支以评估输出质量和生成时间。
  • 如果遇到内存限制,首先减少像素或持续时间;分块前馈已经有助于较长序列。

致谢#

此工作流实现并构建在以下作品和资源之上。我们感谢OpenVDN提供的vdn-minimax-h3模型、权重和存储库,Saganaki22提供的ComfyUI-VDN-H3节点,以及Benji (AI Future Tech) 提供的VDN-H3工作流,感谢他们的贡献和维护。有关权威详细信息,请参阅下面链接的原始文档和存储库。

资源#

注意:使用引用的模型、数据集和代码需遵循其作者和维护者提供的相应许可和条款。

RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。