FastH3 8-Step V2 ComfyUI 工作流程:雙幀條件的 MiniMax H3 影片及音頻#
FastH3 8-Step V2 ComfyUI 工作流程將第一和最後的參考幀轉換為連續的 MiniMax H3 影片,並同步生成音頻。它使用 FastVideo FastH3 V2 INT8 檢查點,具有八步計劃,稀疏注意力,以及明確的第一/最後幀條件,以提供快速、受控的結果。
此工作流程非常適合電影過渡、角色運動、社交影片概念和需要明確開場和結尾構圖的短敘事鏡頭。如果您想要穩定的主題、鎖定的構圖和自然的運動,同時保持高速度,那麼 FastH3 8-Step V2 ComfyUI 工作流程就是為您而設。
ComfyUI FastH3 8-Step V2 ComfyUI 工作流程中的關鍵模型#
- FastVideo FastH3 8-Step V2 (INT8)。僅需八個採樣步驟即可生成影片和音頻潛變量的擴散骨幹。檢查點:FastVideo/FastVideo-FastH3-8-Step-V2 和 ComfyUI 準備好的權重在 FastVideo/FastVideo-FastH3-Comfy。
- Qwen3-VL 32B 文本編碼器用於 MiniMax H3。將提示編碼為條件嵌入,用於指導運動、場景細節和音頻提示。權重隨官方模型集分發於 Comfy-Org/MiniMax-H3。
- MiniMax H3 影片 VAE。將影片潛變量解碼為 RGB 幀,目標解析度由輸入指定。參見 Comfy-Org/MiniMax-H3。
- MiniMax H3 音頻 VAE。將音頻潛變量解碼為波形音頻,並與生成的幀混合。參見 Comfy-Org/MiniMax-H3。
如何使用 ComfyUI FastH3 8-Step V2 ComfyUI 工作流程#
該圖遵循官方 FastH3 圖像到影片模式,並從左到右組裝您的鏡頭。您提供兩張參考圖片和一個文本提示,工作流程計算必要的條件和採樣,在八步中使用稀疏注意力,然後解碼同步的影片和音頻,並保存一個準備發布的文件。
圖像/影片輸入(2)
- 使用
LoadImage(#136) 和LoadImage(#161) 加載您的第一和最後幀。選擇來自同一場景和長寬比的圖片,以便在整個剪輯中保持構圖和身份一致。 - 第一幀由
ImageScaleToTotalPixels(#142) 自動調整大小以適應計算預算,然後GetImageSize(#141) 讀取其寬度和高度,使生成的序列與該解析度匹配。 - 使用自然、場景精確的參考幀。最後一幀錨定最終構圖,以便鏡頭精確地解決到您想要的位置。
處理(19)
- 核心權重通過
UNETLoader(#151)、CLIPLoader(#152) 和兩個VAELoader節點(#143 影片,#144 音頻)加載。MiniMaxH3ImageToVideo(#155) 節點將您的第一幀、最後幀、提示和目標持續時間融合為單一條件包和初始潛變量。 - 持續時間一次性設置,使用方便的
Float (duration)控制(#157)。ComfyMathExpression(#156) 將該時間轉換為與模型步幅對齊的幀數,以便在序列中保持平滑注意力。 - 時間和效率助手包括
MiniMaxH3SigmaShift(#160) 用於 MiniMax H3 的計劃偏置,ModelAttentionBackend(#159) 用於選擇注意力實施,BlockSparseAttention(#158) 用於減少計算同時保留重要區域的保真度。 - 去噪核心使用
BasicGuider(#150) 與圖像到影片節點的正向條件,八步BasicScheduler(#148),在KSamplerSelect(#147) 中選擇的res_multistep採樣器,以及SamplerCustomAdvanced(#149) 在一次通過中生成聯合影片和音頻潛變量。
輸出(2)
- 影片潛變量通過
VAEDecode(#146) 解碼為幀,而音頻潛變量通過VAEDecodeAudio(#145) 解碼。CreateVideo(#154) 然後將圖像序列和音頻混合為一個剪輯。 SaveVideo(#92) 寫入文件。設置文件名前綴,選擇符合您交付平台或編輯流程的格式和編解碼器。
ComfyUI FastH3 8-Step V2 ComfyUI 工作流程中的關鍵節點#
MiniMaxH3ImageToVideo (#155)
- 從您的第一和最後參考幀加上提示構建條件,並輸出用於聯合影片和音頻生成的初始潛變量。調整文本提示以描述運動、相機、氛圍和任何所需的聲音提示。保持身份和場景元素與參考一致,以獲得最穩定的結果。調整左側組中的持續時間控制以更改剪輯長度而不改動採樣器設置。
BlockSparseAttention (#158)
- 對加載的模型應用稀疏注意力,以加速採樣同時保留重要區域的注意力。如果在繁忙場景中看到細節丟失,增加保留的部分或為前景主題保留額外的標記。對於簡單場景,較強的稀疏性可以顯著加快渲染速度。
MiniMaxH3SigmaShift (#160)
- 調整影片和音頻的噪聲計劃,以便在短短八步軌跡中保持時間結構和聲音的一致性。如果運動看起來不穩定,將影片移動提高;如果音頻對齊漂移,稍微調整音頻移動。使用小的變化並測試短預覽以找到平衡。
SamplerCustomAdvanced (#149)
- 使用
res_multistep採樣器和BasicScheduler(#148) 的計劃運行八步去噪。將RandomNoise(#153) 中的種子固定以確保可重現性,然後在喜歡運動後變化它以探索替代選項。來自BasicGuider(#150) 的強引導有助於在構圖複雜時遵循提示。
CreateVideo (#154)
- 將解碼的幀和音頻混合為最終剪輯。設置每秒幀數以控制節奏,選擇適合您的工作流程的色彩空間,如果計劃稍後進行編輯,選擇一個平衡大小和質量的編解碼器以適合您的 NLE。
可選附加功能#
- 參考選擇:從同一鏡頭和視角中挑選兩個幀,匹配曝光和白平衡。更清晰的參考通常會產生更乾淨的紋理。
- 提示:寫下主題的動作、相機的行為以及環境的聲音。保持措辭與您的參考一致,以避免身份漂移。
- 解析度與速度:如果達到內存限制,降低
ImageScaleToTotalPixels(#142) 中的目標像素預算。對於英雄鏡頭,提高它並渲染更少的變體。 - 持續時間和 fps:調整持續時間以調節節奏,然後在
CreateVideo(#154) 中設置 fps 以控制感覺。工作流程自動對齊幀數以保持穩定的注意力。 - 種子和迭代:鎖定噪聲種子以完善提示和參考,然後在構圖和時間鎖定後嘗試新種子以獲得替代品。
- 模板一致性:該圖遵循官方 FastH3 I2V 結構,因此來自參考模板的提示在 Comfy-Org/workflow_templates 直接轉移。
致謝#
該工作流程實現並建立在以下作品和資源之上。我們感謝 FastVideo 提供的 FastH3 8-Step V2 模型和 ComfyUI 權重,Comfy-Org 提供的 FastH3 I2V 工作流程模板,以及 RunningHub.ai 的工作流程來源,感謝他們的貢獻和維護。欲了解權威詳情,請參閱以下鏈接的原始文檔和存儲庫。
資源#
- RunningHub.ai/Workflow source
- Docs / Release Notes: RunningHub.ai post
- FastVideo/FastVideo-FastH3-8-Step-V2
- GitHub: hao-ai-lab/FastVideo
- Hugging Face: FastVideo/FastVideo-FastH3-8-Step-V2
- arXiv: 2405.14867
- FastVideo/FastVideo-FastH3-Comfy
- Hugging Face: FastVideo/FastVideo-FastH3-Comfy
- Comfy-Org/workflow_templates (FastH3 I2V template)
- GitHub: Comfy-Org/workflow_templates
注意:所引用的模型、數據集和代碼的使用受其作者和維護者提供的相應許可證和條款約束。

