FastH3 8步V2 ComfyUI工作流程:双帧条件的MiniMax H3视频与音频#
FastH3 8步V2 ComfyUI工作流程将首尾参考帧转化为连续的MiniMax H3视频,并生成同步音频。它使用FastVideo FastH3 V2 INT8检查点,采用八步计划、稀疏注意力和明确的首/尾帧条件,提供快速可控的结果。
该工作流程非常适合电影过渡、角色运动、社交视频概念和需要明确开闭构图的短叙事镜头。如果您希望在保持高速度的同时获得稳定的主体、锁定的取景和自然的运动,FastH3 8步V2 ComfyUI工作流程正是为您量身打造的。
ComfyUI FastH3 8步V2 ComfyUI工作流程中的关键模型#
- FastVideo FastH3 8步V2 (INT8)。扩散主干网,在仅八步采样中生成视频和音频潜变量以实现快速迭代。检查点:FastVideo/FastVideo-FastH3-8-Step-V2和ComfyUI准备好的权重在FastVideo/FastVideo-FastH3-Comfy。
- Qwen3-VL 32B文本编码器用于MiniMax H3。将提示编码为用于指导运动、场景细节和音频提示的条件嵌入。权重与官方模型集一起分发在Comfy-Org/MiniMax-H3。
- MiniMax H3视频VAE。将视频潜变量解码为输入指定目标分辨率的RGB帧。见Comfy-Org/MiniMax-H3。
- MiniMax H3音频VAE。将音频潜变量解码为波形音频,并与生成的帧混合。见Comfy-Org/MiniMax-H3。
如何使用ComfyUI FastH3 8步V2 ComfyUI工作流程#
图形遵循官方FastH3图像到视频模式,从左到右组装您的镜头。您提供两个参考图像和一个文本提示,工作流程在八步中计算必要的条件和采样,使用稀疏注意力,然后解码同步视频和音频并保存为可发布文件。
图像/视频输入(2)
- 使用
LoadImage(#136)和LoadImage(#161)加载您的首尾帧。选择来自同一场景和纵横比的图像,以便在整个片段中构图和身份保持一致。 - 第一帧由
ImageScaleToTotalPixels(#142)自动调整大小以适应计算预算,然后GetImageSize(#141)读取其宽度和高度,以便生成的序列匹配该分辨率。 - 使用自然、场景准确的参考帧。最后一帧锚定最终构图,使镜头正好在您想要的地方结束。
处理(19)
- 核心权重通过
UNETLoader(#151)、CLIPLoader(#152)和两个VAELoader节点(#143视频,#144音频)加载。MiniMaxH3ImageToVideo(#155)节点将您的第一帧、最后一帧、提示和目标持续时间融合为单个条件包和初始潜变量。 - 持续时间通过方便的
Float (duration)控制(#157)设置一次。ComfyMathExpression(#156)将该时间转换为与模型步幅对齐的帧数,以便在整个序列中实现平滑注意力。 - 时序和效率助手包括
MiniMaxH3SigmaShift(#160)用于偏置MiniMax H3的计划,ModelAttentionBackend(#159)选择注意力实现,以及BlockSparseAttention(#158)以在保留重要区域的保真度的同时减少计算。 - 去噪核心使用
BasicGuider(#150)从图像到视频节点获取正向条件,八步BasicScheduler(#148),在KSamplerSelect(#147)中选择的res_multistep采样器,以及SamplerCustomAdvanced(#149)以一次通过生成联合视频和音频潜变量。
输出(2)
- 视频潜变量通过
VAEDecode(#146)解码为帧,而音频潜变量通过VAEDecodeAudio(#145)解码。CreateVideo(#154)然后将图像序列和音频混合成一个剪辑。 SaveVideo(#92)写入文件。设置文件名前缀,选择与您的交付平台或编辑管道匹配的格式和编解码器。
ComfyUI FastH3 8步V2 ComfyUI工作流程中的关键节点#
MiniMaxH3ImageToVideo (#155)
- 从您的首尾参考帧加上提示构建条件,并输出用于生成联合视频和音频的初始潜变量。调整文本提示以描述运动、相机、气氛和任何期望的声音提示。保持身份和场景元素与参考一致,以获得最稳定的结果。在左侧组中调整持续时间控制,以更改剪辑长度而不触及采样器设置。
BlockSparseAttention (#158)
- 对加载的模型应用稀疏注意力,以加速采样,同时保留最重要的注意力。如果您在繁忙场景中看到细节损失,请增加保留的比例或为前景对象保留额外的标记。对于简单场景,更强的稀疏性可以显著加快渲染。
MiniMaxH3SigmaShift (#160)
- 移动视频和音频的噪声计划,以便在短八步轨迹中保持时间结构和声音一致。如果运动看起来不稳定,请稍微提高视频移位;如果音频对齐漂移,请稍微调整音频移位。使用小的更改并测试短预览以找到平衡。
SamplerCustomAdvanced (#149)
- 使用
res_multistep采样器和BasicScheduler(#148)的计划运行八步去噪。在RandomNoise(#153)中固定种子以实现可重复性,然后在喜欢运动后更换种子以探索替代方案。BasicGuider(#150)的强大引导有助于在构图复杂时遵循提示。
CreateVideo (#154)
- 将解码后的帧和音频混合成最终剪辑。设置每秒帧数以控制节奏,选择适合您的工作流程的色彩空间,如果计划后期编辑,请选择平衡大小和质量的编解码器以适合您的NLE。
可选附加项#
- 参考选择:从同一镜头和视角中选择两帧,匹配的曝光和白平衡。更清晰的参考通常会产生更干净的纹理。
- 提示:描述主体的动作、相机的行为以及环境的声音。保持与参考一致的措辞以避免身份漂移。
- 分辨率与速度:如果达到内存限制,请在
ImageScaleToTotalPixels(#142)中降低目标像素预算。对于英雄镜头,提高它并渲染更少的变体。 - 持续时间和帧速率:调整持续时间以控制节奏,然后在
CreateVideo(#154)中设置帧速率以控制感觉。工作流程自动对齐帧数以实现稳定的注意力。 - 种子和迭代:锁定噪声种子以完善提示和参考,然后在构图和时间锁定后尝试新的种子以获得替代方案。
- 模板一致性:图形遵循官方FastH3 I2V结构,因此参考模板中的提示在Comfy-Org/workflow_templates中可以直接转移。
致谢#
此工作流程实现并基于以下作品和资源构建。我们感谢FastVideo提供的FastH3 8步V2模型和ComfyUI权重,Comfy-Org提供的FastH3 I2V工作流程模板,以及RunningHub.ai提供的工作流程来源的贡献和维护。有关权威详细信息,请参阅下列链接的原始文档和存储库。
资源#
- RunningHub.ai/Workflow source
- 文档 / 发布说明: RunningHub.ai post
- FastVideo/FastVideo-FastH3-8-Step-V2
- GitHub: hao-ai-lab/FastVideo
- Hugging Face: FastVideo/FastVideo-FastH3-8-Step-V2
- arXiv: 2405.14867
- FastVideo/FastVideo-FastH3-Comfy
- Hugging Face: FastVideo/FastVideo-FastH3-Comfy
- Comfy-Org/workflow_templates (FastH3 I2V template)
- GitHub: Comfy-Org/workflow_templates
注意:使用参考的模型、数据集和代码受其作者和维护者提供的各自许可证和条款的约束。


