MiniMax H3 參考至影片 ComfyUI:原生立體聲音頻 Ref2VA 工作流程#
此適用於 RunComfy 的 MiniMax H3 參考至影片 ComfyUI 工作流程將連接的參考圖片轉換為帶有共同生成的原生立體聲音頻的短片電影。基於 Comfy.org 參考至影片模板構建並經過開放的 Comfy-Org MiniMax-H3 權重驗證,適合角色一致的參考驅動鏡頭、風格化場景測試和概念剪輯,其中提示字詞和標籤如 <Picture 1> 和 <Picture 2> 重要。
開箱即用,該圖表將兩張圖片參考和一個自由形式的提示連接起來,以一次通過生成帶有同步聲音的視頻。核心節點還暴露了更多參考圖片、參考視頻及其音頻和獨立音頻參考的可選輸入,因此您可以根據需要擴大調節強度。如果您想要一個與原始設計一致的起點,請參閱 GitHub 上的 Comfy.org 模板文件 video_minimax_h3_r2v.json。
MiniMax H3 參考至影片 ComfyUI 工作流程中的關鍵模型#
- Comfy-Org/MiniMax-H3 擴散權重 (Ref2VA):專門用於參考至影片和音頻的生成核心,通過
UNETLoader使用。它從文本和視覺/音頻參考中學習以生成同時攜帶視頻和立體聲音頻的單個潛在。 模型卡和文件 - MiniMax H3 Video VAE (FP16):解碼聯合潛在的視頻部分為高視覺保真度的幀。 minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 Audio VAE (FP32):解碼聯合潛在的音頻部分為原生立體波形。 minimax_h3_audio_vae_fp32.safetensors
- Qwen3-VL 32B MiniMax-H3 文本-圖像編碼器 (AWQ):編碼您的提示加上參考標籤和視覺標記以進行調節。 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
如何使用 MiniMax H3 參考至影片 ComfyUI 工作流程#
此工作流程將您的參考和提示引導至 MiniMax H3 的 Ref2VA 核心,對單個潛在樣本進行取樣,該潛在樣本同時包含視頻和音頻,然後解碼並將結果合併為帶有同步聲音的 MP4。以下組對應於圖表,讓您可以看到需要更改的內容及原因。
用戶輸入#
使用 LoadImage (#137) 和 LoadImage (#139) 提供兩個視覺參考。提示放入 Input Text (Prompt) (#138);按您連接的順序明確引用每個輸入,例如 <Picture 1> 和 <Picture 2>,然後描述場景、運動和聲音。在 Resolution Selector (Size) (#115) 中設置您的目標比例和像素數;選擇 Float (Duration) (#132) 中的視頻持續時間(以秒為單位);它會自動轉換為 ComfyMathExpression (#131) 的有效幀長度,以便音頻和視頻保持同步。
模型#
UNETLoader (#127) 加載驅動生成的 MiniMax H3 Ref2VA 擴散權重。CLIPLoader (#128) 加載用於標記化您的文本和參考標籤的 Qwen3-VL 32B 編碼器。兩個 VAELoader 節點(#119 視頻,#120 音頻)提供後來將聯合潛在解包回幀和立體聲音頻的配對解碼器。這些模型是您在同一任務家族中遷移到不同 MiniMax H3 變體時需要更換的唯一資產。
調節#
MiniMaxH3ReferenceToVideo (#136) 是管道的核心。它接受您的文本提示、寬度、高度和計算的 length(幀),加上任何連接的 ref_images、ref_videos 和可選的音頻參考。該節點發出正向調節流以進行指導,並初始化潛在,以根據您的參考和標籤對身份、構圖、運動和聲音設計進行錨定。為了從圖片中獲得身份保真,連接光線充足的模型參考並在提示中準確地引用它們;為了運動或節奏,您可以添加帶或不帶音頻的視頻參考。
取樣#
RandomNoise (#129) 種子過程,而 KSamplerSelect (#123) 選擇取樣器變體,BasicScheduler (#124) 設置步驟計劃。BasicGuider (#126) 應用 MiniMax H3 節點生成的調節,SamplerCustomAdvanced (#125) 執行實際的去噪步驟以發展聯合音頻+視頻潛在。此處的選擇主要在速度與保真度和參考依從之間進行權衡;首先保留默認設置,然後在您有基線外觀和聲音後進行實驗。
解碼和創建視頻#
取樣器的聯合潛在進入 VAEDecode (#122) 用於幀和 VAEDecodeAudio (#121) 用於立體聲音頻。CreateVideo (#130) 將解碼的圖像和音頻合併為可播放的流,SaveVideo (#92) 將最終文件寫入您的輸出文件夾。因為視頻和音頻是一起生成的,所以時間一致,無需任何後期對齊或外部 TTS。
MiniMax H3 參考至影片 ComfyUI 工作流程中的關鍵節點#
MiniMaxH3ReferenceToVideo (#136) 此節點將文本、視覺和可選的音頻參考組合成 MiniMax H3 的 Ref2VA 調節和已經“知道”身份、風格、運動和聲音的初始潛在。使用與連接順序匹配的精確參考標籤在您的提示中,並根據您的目標選擇 ref_image_size:在匹配生成分辨率時進行更快的迭代,在保持較大參考標記時增強身份。對於更長的鏡頭,偏好清晰的場景和動作描述,以便模型可以保持連續性。
Resolution Selector (Size) (#115) 控制整個圖表將遵循的目標比例和像素數。選擇一個符合您將如何呈現剪輯的形狀,並在細節與吞吐量之間取得平衡,以便您可以快速迭代。更高的分辨率會提高 VRAM 和時間,但更好地保留來自您的參考的精細特徵。
ComfyMathExpression (#131) 將用戶面向的持續時間(以秒為單位)轉換為取樣器和解碼器喜歡的幀數。表達式夾到合理的最小值並捕捉到內部友好的步驟,以便視頻和音頻保持同步。僅調整秒數輸入;該節點處理數學。
KSamplerSelect (#123) 和 BasicScheduler (#124) 它們共同決定去噪路徑。從提供的取樣器和計劃開始,以實現強大的參考依從性;如果您的鏡頭偏移或感覺細節不足,請測試替代計劃或稍微不同的取樣器家族,並進行並排比較。
可選附加項#
- 保持提示具體且以參考為主:以標籤如 <Picture 1> 和 <Picture 2> 開始,然後描述鏡頭類型、運動、照明和您期望的聲音。
- 為了從圖片中獲得更強的身份,通過使用較大的參考尺寸模式來增加參考保真度;為了更快的外觀開發,使用匹配尺寸模式。
- 如果您不連接任何音頻參考,MiniMax H3 將僅從提示中合成原生立體聲音頻;描述環境、音效和聲音語調以指導它。
- 當您最關心運動節奏或攝像機行為時,添加一個短參考視頻;當您希望將其聲音特徵帶入生成時,添加其配對音頻。
- 首先在適中的分辨率和持續時間下迭代,然後在時間、身份和構圖保持一致後進行擴大。
參考#
- MiniMax H3 權重和模型資產在 Hugging Face 上:Comfy-Org/MiniMax-H3
- 此工作流程遵循的官方 Comfy.org 模板:video_minimax_h3_r2v.json
- MiniMax H3 的上游 ComfyUI 集成:ComfyUI PR #15224
感謝#
此工作流程實施並基於以下作品和資源。我們由衷感謝 Comfy-Org 提供的 MiniMax H3 R2V ComfyUI 工作流程模板和 MiniMax H3 教程,MiniMax 提供的 MiniMax H3 模型和官方公告,以及 Comfy-Org 提供的 MiniMax-H3 模型權重,感謝他們的貢獻和維護。欲了解權威詳情,請參閱下面鏈接的原始文檔和存儲庫。
資源#
- Comfy-Org/MiniMax H3 R2V 工作流程模板
- Comfy-Org/MiniMax H3 教程
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- 文檔/發佈說明: MiniMax H3 教程
- MiniMax/MiniMax H3 官方公告
- 文檔/發佈說明: MiniMax H3 官方公告
- Comfy-Org/MiniMax-H3 模型權重
- Hugging Face: Comfy-Org/MiniMax-H3
注意:使用參考的模型、數據集和代碼需遵循其作者和維護者提供的相應許可和條款。

