全方位 MiniMax H3 ComfyUI 多參考加速:多參考 Ref2VA 影片,附同步立體聲音效#
這個全方位 MiniMax H3 ComfyUI 多參考加速工作流程將多達九個視覺參考加上可選的影片和音頻提示轉化為一個短的電影剪輯,並附有原生立體聲音軌。設計給希望保持角色一致的創作者,能夠合併多個身份、道具或地點,同時保持像 <Picture 1> 這樣的提示標籤與正確的參考對齊。
圍繞開放的 Comfy-Org MiniMax-H3 Ref2VA 堆疊構建,該圖形啟用 SageAttention 加速,以便在支持的 GPU 上更快取樣,並使用 int8 修剪模型來控制 VRAM,而不犧牲一致性。結果是一個單一的 RunComfy 準備好的 MiniMax H3 畫布,提供多參考指導、時間安排、解析度和輸出。
Comfyui 全方位 MiniMax H3 ComfyUI 多參考加速工作流程中的關鍵模型#
- MiniMax-H3 Ref2VA 擴散模型(修剪 int8 convrot)。核心生成器,將您的參考和提示融合成聯合的影片和音頻潛變。權重:Comfy-Org/MiniMax-H3。
- Qwen3-VL 32B 文本-圖像-語言編碼器(AWQ,隨 MiniMax-H3 發布)。解釋您的提示,包括 <Picture 1> 這樣的標籤,並調節生成器。權重包括在 Comfy-Org/MiniMax-H3 中。
- MiniMax H3 Video VAE (FP16)。以高保真度解碼影片潛變為幀。權重:Comfy-Org/MiniMax-H3。
- MiniMax H3 Audio VAE (FP32)。解碼音頻潛變為準備混音的清晰立體波形。權重:Comfy-Org/MiniMax-H3。
如何使用 Comfyui 全方位 MiniMax H3 ComfyUI 多參考加速工作流程#
在高層次上,您加載模型,提供參考和提示,工作流程構建 MiniMax-H3 條件,運行加速取樣器,然後解碼並結合影片幀與生成的立體聲音頻。組合按順序工作:用戶輸入提供條件,驅動取樣;解碼結果輸出到輸出。
用戶輸入#
使用 LoadImage 節點連接多達九個參考。保持一致的順序,以便像 <Picture 1>、<Picture 2> 這樣的提示標籤與預期的圖片匹配。在 Input Text (Prompt) 字段中編寫您的場景和對話,明確將身份或資產映射到提示頂部的編號標籤。在 Resolution Selector (Size) 中選擇縱橫比和大小;它輸出寬度和高度,調整為 32 像素的倍數以保持穩定。設置剪輯持續時間(以秒為單位);內部表達式將其轉換為接近 24 fps 的幀數,並調整為模型友好的倍數,以獲得平滑的取樣。
模型#
這組加載 MiniMax-H3 UNet、Qwen3-VL 32B 文本編碼器和兩個 VAE。int8 修剪的 Ref2VA 模型在保留運動和唇同步質量的同時減少了內存。文本編碼器為 MiniMax-H3 初始化,因此提示中的視覺標籤綁定到正確的參考。單獨的視頻和音頻 VAE 保持解碼準確且高效。這些模型與官方 Ref2VA 模板使用的同一系列,這裡調整為多參考控制和聯合音頻。參考:MiniMax-H3 R2V template。
條件#
MiniMaxH3ReferenceToVideo 構建實際的 H3 條件和初始潛變剪輯。它攝取您的 CLIP、VAE、所有連接的參考圖片、提示和選擇的寬度、高度和長度。該節點尊重佔位符標籤,從而使身份、地點和道具保持與正確參考的關聯。使用參考大小模式以相對於輸出保持組成比例。該節點發出正面條件流和潛變剪輯,兩者共同推動取樣器。
取樣#
在取樣之前,圖形使用 PathchSageAttentionKJ 將模型包裹起來,以啟用 SageAttention 加速,然後通過 VRAM 管理器路由,以便更大剪輯可以更舒適地適應。BasicGuider、BasicScheduler 和 KSamplerSelect 定義指導策略、步驟安排和取樣器算法。RandomNoise 為過程播種,而 SamplerCustomAdvanced 執行對模型和條件的去噪通過,生成精緻的視頻和音頻潛變。布局在保持設置可接近性的同時,平衡速度和 MiniMax-H3 的質量。
輸出#
VAEDecode 和 VAEDecodeAudio 將最終潛變轉換為幀和立體波形。VHS_VideoCombine 然後將幀和音頻合併為單個 MP4,按照您選擇的幀速率,並通過 CRF 進行質量控制,並使用簡單的文件名前綴進行組織。您可以立即預覽結果並將其保存到輸出文件夾。如果您稍後提供外部參考音頻,導出器可以修剪到該音軌長度以實現完美對齊。導出器來自廣泛使用的 Video Helper Suite for ComfyUI:ComfyUI-VideoHelperSuite。
Comfyui 全方位 MiniMax H3 ComfyUI 多參考加速工作流程中的關鍵節點#
MiniMaxH3ReferenceToVideo (#136) 這是工作流程的核心,將參考、提示、大小和長度融合為 MiniMax-H3 條件和潛變剪輯。調整 prompt 文本,使用明確的標籤映射,例如 <Picture 1> = character A 以鎖定身份。調整 width、height 和 length 以設置構圖和運行時間;上游選擇器和持續時間控制負責安全倍數。使用參考大小模式以平衡主題比例與輸出幀。該節點支撐了官方的 Ref2VA 路徑,並在這裡調整為多參考控制。
PathchSageAttentionKJ (#144) 使用 SageAttention 包裹模型,以加速注意層並減少支持的 GPU 上的內存壓力。對於大多數卡,將加速模式保持在 auto;僅在您的環境受益時啟用模型編譯。如果您觀察到不穩定,請將模式關閉以比較性能。來源:ComfyUI-KJNodes。
BasicScheduler (#124) 定義去噪期間使用的 sigma 計劃和總步驟。增加步驟可以增加細節,但會增加渲染時間;在此處進行任何更改時,請配對兼容的取樣器類型。將 denoise 保持在接近滿值,以實現純生成,並僅在進行強度限制的精細化時考慮降低它。
SamplerCustomAdvanced (#125) 使用選定的取樣器、計劃和指導運行擴散循環。默認取樣器在保持 MiniMax-H3 的時間穩定性和運動平滑性方面保持平衡。如果更改計劃程序系列,請選擇為其設計的取樣器,以避免工件。
Resolution Selector (Size) (#115) 輸出寬度和高度,調整為 32 像素倍數,以實現 GPU 友好的形狀。設置 megapixels 以快速進行質量與速度的權衡,並選擇例如 16:9 的寬屏鏡頭。使用適度的尺寸進行草稿預覽,然後在時間和構圖鎖定後放大。
ComfyMathExpression (#131) 將請求的秒數轉換為接近 24 fps 的幀數,並對齊為與取樣器和模型合作的倍數。這有助於避免時間抖動和超出一個的時間問題。您幾乎不需要觸碰它;從秒數輸入控制時間。
VHS_VideoCombine (#143) 將幀和生成的立體聲音頻合併為最終可交付成果。設置 frame_rate 以匹配您的目標時間線並調整 crf 以獲得質量。當您提供外部音軌並希望完美剪切到長度時,使用 trim_to_audio。
可選附加項#
- 快速渲染且外觀乾淨的快速 16:9 尺寸:1056×608 (0.6 MP)、1216×672 (0.8 MP)、1344×768 (0.98 MP)、1664×928 (1.5 MP)、1920×1088 (2.0 MP)。
- 保持提示明確:以映射塊開始,將
<Picture 1..9>綁定到身份、服裝、道具或地點,然後描述鏡頭。 - 為了保持面部一致性,使用清晰的正面圖片,僅稍微改變照明或角度。
- 對話和擬音效果良好時,將其寫成簡短、自然的句子;音頻 VAE 將從 Ref2VA 潛變中合成清晰的立體聲音軌。
- 如果 VRAM 緊張,先渲染較短的剪輯或降低像素,然後在對運動和構圖滿意後放大或延長。
- 此布局遵循官方 Ref2VA 模板傳承,適應多參考控制和加速。請參閱基礎模板以獲取上下文:MiniMax-H3 R2V template。
致謝#
此工作流程實現並基於以下作品和資源構建。我們衷心感謝 MiniMax 提供的 MiniMax H3,Comfy-Org 提供的 MiniMax-H3 模型權重和 MiniMax H3 R2V 工作流程模板,以及 Comfy.org 提供的 MiniMax H3 教程,感謝他們的貢獻和維護。欲了解詳細信息,請參考下方鏈接的原始文檔和資源庫。
資源#
- MiniMax H3 官方公告
- 文件 / 發布說明:MiniMax H3 announcement
- Comfy-Org MiniMax-H3 模型權重
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org MiniMax H3 教程
- 文件 / 發布說明:Comfy.org tutorial
- Comfy.org MiniMax H3 R2V 模板
- GitHub: Comfy-Org/workflow_templates
注意:使用引用的模型、數據集和代碼需遵循其作者和維護者提供的各自許可和條款。

