ComfyUI>工作流程>MiniMax H3 多參考到影片4步Turbo

MiniMax H3 多參考到影片4步Turbo

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1485
將參考圖像轉換為短的Hailuo H3影片。在多個主題中保持面部和服裝的一致性。在一個提示中指導鏡頭運動和對話。生成帶有片段的原生立體聲音頻。4步Turbo LoRA縮短渲染時間。更快速地製作對唱、產品場景和角色節拍。

MiniMax H3 ComfyUI Reference to Video 4-step Turbo Workflow

MiniMax H3 ComfyUI - 4-Step Reference-to-Video Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Reference to Video 4-step Turbo Examples

MiniMax H3 ComfyUI 參考到影片4步Turbo#

MiniMax H3 ComfyUI 參考到影片4步Turbo是一個RunComfy-ready參考到影片工作流程,從靜態圖像鎖定一個或多個角色身份,並在單次加速通過中生成帶有原生立體聲音頻的短片。它專為需要在場景中保持一致的面孔、服裝和佈景的創作者設計,同時保持鏡頭運動、對話和唇同步的一致性。

此圖使用MiniMax H3的ref2va管道加上Turbo LoRA,使多主題身份、運動和語音保持統一,而不必使用較長的預設時間表。在提示中標記您的靜態圖像為<Picture N>,可選擇帶來參考影片和音頻,並在RunComfy上的ComfyUI中直接渲染乾淨的片段。

Comfyui MiniMax H3 ComfyUI 參考到影片4步Turbo工作流程中的關鍵模型#

  • MiniMax-H3 Reference-to-Video diffusion model (ref2va)。提供核心生成後端,用於基於靜態圖像、可選影片和文本生成一致的鏡頭。權重可在Hugging Face上的Comfy-Org包裝中獲得。 Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE。編碼和解碼影片潛變量,保留時間平滑性和細節。與同一包一起分發。 Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE。與影片一起處理原生立體聲音軌,以便與鏡頭共同創作語音和環境聲音。與影片組件一起包含。 Comfy-Org/MiniMax-H3
  • Qwen-VL 32B文本編碼器,針對MiniMax-H3進行調整。將提示,包括<Picture N>標記和舞台指令,轉換為H3使用的條件信號。在Comfy-Org發行中打包。 Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-step LoRA。一個加速LoRA,壓縮時間表,使鏡頭能夠在快速通過中生成,同時保持身份和運動一致性。 larryvrh/MiniMax-H3-Turbo-Lora

如何使用Comfyui MiniMax H3 ComfyUI 參考到影片4步Turbo工作流程#

工作流程從參考和時間安排到模型設置、條件設置、採樣和最終多路複用。您可以僅使用靜態圖像運行,或將靜態圖像與可選的參考影片和音頻結合使用。

階段1 — 參考、提示和時間安排#

通過LoadImage節點加載一個或多個靜態圖像,並計劃在提示中將它們作為<Picture 1>、<Picture 2>等進行引用。如果您有指導片段,請通過VHS_LoadVideo節點提供;它們的音頻也可以傳遞以指導節奏和能量。要提供定制對話或環境聲音,請使用LoadAudio節點,作為參考影片音頻的補充或替代。在Input Text (Prompt)中輸入您的完整鏡頭描述,包括任何角色鎖定、鏡頭運動和對話。工作流程會自動將您所需的持續時間轉換為穩定的幀數,將時間軸對齊到MiniMax H3的內部步幅。

階段2 — 模型設置和Turbo加速#

在“核心工作空間”中加載核心H3 ref2va UNet、文本編碼器以及影片和音頻VAE。記憶體高效的注意力補丁使您可以在典型的GPU上運行更大的鏡頭或更高的分辨率,而不改變您的使用。Turbo 4-step LoRA由LoraLoaderModelOnly (#164)應用,因此您可以保持步數低,同時保留身份鎖定和運動。無需手動接線;圖形已預先連接好RunComfy。如果您未使用某些輸入,請使用Ctrl+B將未使用的Load Image / Load Video / Load Audio節點關閉,以保持運行精簡。

階段3 — 條件設置和潛變量組裝#

MiniMaxH3ReferenceToVideo (#136)攝取您的提示、靜態圖像和任何可選的影片或音頻參考,以構建條件和初始潛變量時間線。使用<Picture N>標籤明確綁定每個人或物體到特定的靜態圖像;順序遵循您填寫的參考插槽。您可以用自然語言指導鏡頭行為、唇同步和環境聲音。寬度、高度和持續時間流入此節點,以便框架和時間與您的意圖匹配。如果您有很多靜態圖像,請僅保留真正定義當前節拍身份和服裝的那些。

階段4 — 採樣#

圖形將潛變量通過最小的時間表和由KSamplerSelect (#123)選擇的快速採樣器路由,由BasicGuider (#126)引導。BasicScheduler (#124)提供Turbo LoRA期望的步驟模式,平衡速度和保真度。SamplerCustomAdvanced (#125)使用種子噪聲在一個高效的通過中解析時間線,以實現可重現性。在大多數情況下,您可以將這些組件保持為配置狀態,專注於提示、參考和框架。

階段5 — 解碼、多路複用和保存#

採樣後,VAEDecode恢復影片幀,VAEDecodeAudio恢復立體聲軌。CreateVideo (#130)將圖像和音頻多路複用為可播放的文件,您可以設置fpsbit_depth以匹配您的交付需求。最後,SaveVideo (#92)使用選定的容器和編解碼器將結果寫入磁碟。輸出是一個帶有身份鎖定角色、鏡頭運動和由MiniMax H3 ComfyUI 參考到影片4步Turbo創作的原生立體聲音頻的短片。

Comfyui MiniMax H3 ComfyUI 參考到影片4步Turbo工作流程中的關鍵節點#

MiniMaxH3ReferenceToVideo (#136)#

這是工作流程的核心,將提示文本、靜態參考和可選的影片/音頻融合為條件和已初始化的潛變量。調整prompt以包括<Picture N>標記和清晰的舞台指令,用於鏡頭、對話和環境聲音。調整widthheightlength以設置鏡頭的框架和持續時間。如果您需要在靜態圖像上平衡細節和速度,請在匹配渲染大小與調整大小以輕量運行之間切換ref_image_size模式。保持您的參考集專注於您實際需要的場景中的身份。

LoraLoaderModelOnly (#164)#

將MiniMax-H3 Turbo 4-step LoRA應用於ref2va模型,以便時間表可以壓縮以快速推理。strength控制LoRA對後端的影響程度;較高的強調速度和Turbo外觀,而較低的則回到基本H3。如果您發現極端加速時細節丟失,稍微降低LoRA強度或在調度器中延長時間表以恢復保真度。查看LoRA模型卡以獲取版本說明和預期使用。 MiniMax-H3 Turbo LoRA

MiniMaxH3MemoryEfficientSageAttentionPatch (#163)#

啟用與MiniMax H3兼容的記憶體高效注意力實現,以便您可以在有限的VRAM上運行更高的分辨率或更長的鏡頭。此圖中不含參數;只需保持啟用以獲得最佳容量。此節點是KJNodes for ComfyUI的一部分。 kijai/ComfyUI-KJNodes

BasicScheduler (#124)#

定義採樣過程中的擴散時間表。在Turbo LoRA啟動時,保持步數緊湊以獲得速度,僅在需要額外的清晰度或穩定性時進行微調。denoise允許您在提示要求進行較大更改時推進更強的參考再解釋。此處的更改會與LoRA強度和選擇的採樣器互動,因此請小幅調整。

KSamplerSelect (#123)#

選擇通過的採樣算法。簡單、穩定的採樣器與Turbo時間表搭配良好,有助於保持帧間的一致性。如果您強調風格化或非常快速的鏡頭運動,請嘗試其他採樣器,這些採樣器可能會增加運動紋理,但代價是略微的變異性。

CreateVideo (#130) 和 SaveVideo (#92)#

CreateVideo將解碼的幀和音頻組裝成最終流,您可以設置fpsbit_depth以匹配您的交付需求。SaveVideo選擇容器和編解碼器進行導出;使用廣泛支持的組合進行一般共享或高質量的變體進行後期工作。如果您快速迭代,請保持設置輕量,然後在最終渲染時切換到生產設置。

可選附加功能#

  • 對於多個角色,將最清晰的正面靜態圖像放在首位,並將其作為<Picture 1>、<Picture 2>等進行引用。每個主題使用一到兩個附加靜態圖像以覆蓋角度或服裝。
  • 如果您帶來參考影片,請在提示中包括對所需鏡頭行為的簡短描述,以便H3知道要保留什麼和重新解釋什麼。
  • 持續時間控制在H3內部會自動對齊到安全的幀數;如果您在CreateVideo中更改目標幀率,請重新檢查提示中的時間安排說明。
  • 影片和音頻助手節點來自Video Helper Suite;它們提供ComfyUI內的強大媒體I/O。 Kosinkadink/ComfyUI-VideoHelperSuite
  • 尋找MiniMax H3參考到影片在ComfyUI中的基準比較工作流程?查看官方模板並根據需要調整想法。 Comfy-Org workflow template

致謝#

此工作流程實施並建立在以下作品和資源的基礎上。我們對MiniMax Research的MiniMax H3模型,Comfy.org的MiniMax H3 ComfyUI工作流程示例,Comfy-Org的MiniMax-H3模型權重以及larryvrh的MiniMax-H3 Turbo LoRA的貢獻和維護表示感謝。有關權威細節,請參閱以下鏈接的原始文檔和存儲庫。

資源#

注意:使用所引用的模型、數據集和代碼受其作者和維護者提供的各自許可和條款的約束。

RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。