ComfyUI>工作流程>MiniMax H3 Fun Control | 精確的圖像到影片轉換

MiniMax H3 Fun Control | 精確的圖像到影片轉換

Workflow Name: RunComfy/MiniMax-H3-Control
Workflow ID: 0000...1506
將參考圖像轉換為可控影片。保持主題的身份、服裝和場景一致。使用 H3 Fun ControlNet 指導運動。選擇單一控制或深度加姿勢分支。使用可選的 SolAttn 以更快的速度運行。創建乾淨的行走、轉身、揮手和全身運動。

ComfyUI MiniMax H3 Fun Control Workflow

MiniMax H3 Fun Control in ComfyUI | Depth and Pose Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Fun Control Examples

MiniMax H3 Fun Control:在 ComfyUI 中的可控參考圖像到影片生成#

這個 RunComfy-ready 畫布將 MiniMax H3 Fun Control 帶到 ComfyUI,用於精確且可提示的圖像到影片轉換。它遵循您的結構通道(深度、canny、姿勢、HED 或 MLSD),同時尊重第一幀參考或完整的角色/風格參考。默認佈局附帶三個準備運行的分支,因此您可以從簡單開始,並在需要時擴大控制。

Graph 1 運行單一控制流,並預設啟用。Graph 2 添加了連鎖的深度加姿勢設置,具有角色/風格參考和真實的負面提示。Graph 3 鏡像 Graph 2,但包括可選的 SolAttn 加速補丁。您可以在加載工作流程後啟用或繞過任何準備好的分支。

Comfyui MiniMax H3 Fun Control 工作流程中的關鍵模型#

  • MiniMax H3 基本 UNet(fl2va)和參考到影片 UNet(ref2va)。這些是影片骨幹,從提示和第一幀(fl2va)或持續的圖像參考(ref2va)中合成運動。ComfyUI 的社區打包權重可在 Hugging Face 的 MiniMax H3 實驗集上獲得:MiniMax-H3-experimental
  • MiniMax H3 Video VAE 和 Audio VAE。這些編碼和解碼 H3 使用的潛在影片和音頻流,因此管道可以有效地採樣,然後將結果轉回像素和聲音。請參見相同的模型包:MiniMax-H3-experimental
  • Qwen-VL 系列文本編碼器。工作流程使用 MiniMax 調整的 Qwen-VL 系列變體來解析提示並將文本條件輸入 H3。有關此模型系列的背景,請參見官方儲存庫:Qwen2-VL
  • MiniMax H3 Fun ControlNet Union(曲線形式)。這個單一的 ControlNet 支持多個控制通道(深度、canny、HED、姿勢、MLSD),讓您可以在幀之間引導場景結構。使用官方發布的曲線形式檢查點:MiniMax-H3-Fun-Controlnet-Union

如何使用 Comfyui MiniMax H3 Fun Control 工作流程#

畫布包含三個準備好的分支。Graph 1(單一控制)已啟用,Graph 2(深度+姿勢參考)和 Graph 3(SolAttn 加速)已繞過。當您準備好時,切換一個分支,只有啟用的分支會運行。

01 · 單一控制 · 預設啟用#

01 · 模型 此組加載 MiniMax H3 基本 UNet、Qwen-VL 文本編碼器和 H3 的影片和音頻 VAE。它還加載曲線形式 MiniMax H3 Fun ControlNet Union,因此單一控制流可以引導結構。除非您想從不同的檢查點集交換權重,否則不需要在此處更改任何內容。

01 · 控制:這是節點 加載一個控制影片,其寬度、高度和幀數與您的預期輸出匹配;節點檢查並會提高這兩個數字如果它們不符。根據最佳捕捉您的運動和輪廓,選擇任何支持的通道(深度、canny、姿勢、HED、MLSD)。強度如同遵從預算;1.0 是單一控制的正確起點,並且提高往往會飽和細節。控制時間表窗口定義控制在採樣期間的活躍時間;將窗口結束設置在 0.6 附近通常會早期鎖定結構,同時釋放後期步驟以添加細紋。使用曲線形式的 ControlNet 檢查點;全寬變體將無法在此節點加載。

01 · 條件 撰寫您的提示並可選擇提供第一幀。使用第一幀,模型從該圖像初始化,並傾向於保持構圖;沒有它,僅提示驅動外觀。在此設置寬度、高度和長度;MiniMax H3 在其有效網格上以 24 fps(17n + 5)快照長度,因此請根據這些計數計劃您的編輯。保持第一和最後幀未設置使用模型的自然開始和結束;添加最後一幀對此分支不是必需的。

01 · 採樣 採樣器運行時使用基本指導器,沒有 CFG 和負面輸入,這意味著此處的文本中的負面會被忽略;如果您需要負面,請使用 Graph 2 或切換至 CFG 指導器。應用 Sigma shift 平衡影片和音頻擴散時間表,以便後來穩定解碼。此分支中的時間表和採樣器選擇經過調整,以獲得合理的質量與速度折衷;一旦有了基線,請隨意進行實驗。

01 · 輸出 採樣的潛在變量與 H3 Video VAE 和(如果存在)Audio VAE 一起解碼。幀和音頻被混合成影片並保存到您的輸出中。使用保存的結果作為風格檢查,並根據需要返回控制強度、時間表窗口或提示。

02 · 深度 + 姿勢參考 · 預設繞過#

02 · 模型 此分支加載 H3 參考到影片 UNet,旨在使身份和風格從靜止圖像跨過每個幀保持一致。它共享 Qwen-VL 文本編碼器和 H3 VAE。此處重用了曲線形式的 MiniMax H3 Fun ControlNet Union 以驅動結構。

02 · 控制:連鎖,強度總和約為 1.0 兩個 Apply 節點連鎖,因此每個控制流都添加自己的貢獻,首先是深度,然後是姿勢。將強度視為預算:兩個強度相加,並且將總數推高至 1.0 以上會沖淡細節並模糊主題。深度適用於粗略幾何和相機位置;姿勢鎖定四肢和關節。通過將一個強度設置為零並傾聽另一個來調整,然後將它們總和接近 1.0。

02 · 條件和參考 使用 MiniMaxH3ReferenceToVideo 與您的提示一起提供真實的參考圖像,以便身份和風格在所有幀中持續。ref_image_sizemax 提供最強的身份(較大的參考標記)以計算成本;match 更快,通常足以進行較鬆的風格控制。添加一個帶有相同參考和負面文本的負面分支,以便 CFG 指導器可以減去您不想要的內容。長度、大小和幀數遵循與 Graph 1 相同的規則。

02 · 採樣 切換到 CFGGuider,以便負面條件實際應用;指導增加成本,因為模型在每一步都評估正面和負面。此處的步驟設置得較高,以便連鎖控制和參考有空間解決;一旦您喜歡外觀,可以修剪以提高速度。種子控制可重複性;在您平衡深度和姿勢預算時保持固定。

02 · 輸出 解碼和影片組裝鏡像 Graph 1。如果輸出匹配結構但看起來過於平滑,請將控制窗口結束降低至 0.6 附近,或稍微降低總控制強度。如果身份滑動,請提高 ref_image_size 或添加第二個參考圖像。

03 · 可選的 Sol-Attn 加速 · 預設繞過#

03 · 模型 此分支鏡像 Graph 2 的模型和控制,但添加了一個稀疏注意力加速補丁。它需要 SolAttn Triton 擴展。如果您沒有 Triton 或節點包安裝,請保持此分支繞過。

03 · 控制:連鎖,強度總和約為 1.0 相同的深度加姿勢連鎖適用;保持合併強度接近 1.0 以獲得清晰的結果。使用與 Graph 2 相同的調整方法找到最適合您的鏡頭和主題大小的分割。

03 · 條件和參考 與 Graph 2 相同。保持正面和負面分支中的參考一致,以便 CFG 減去正確的特徵。如果您想要最大的身份,將 ref_image_size: max 與稍高的步數結合。

03 · 可選:稀疏注意力 SolAttnPatch 加速注意力密集的區塊,同時在最需要的地方保持質量。保持 morton 關閉,因為按 Z 順序重新排列影片標記會錯位 ControlNet 應用其行偏移的位置,這看起來像是完美的輸出,但完全忽略了控制。當您想要速度而不失去遵從時,保持最早和最新的 transformer 區塊精確是一個安全的默認設置。預期在 Triton 編譯其內核後運行速度更快;第一次執行主要測量編譯時間。

03 · 採樣和輸出 採樣、解碼和保存遵循 Graph 2。打開或關閉 SolAttn,使用固定種子來判斷質量和遵從度。如果控制看起來較弱,請檢查 morton 是否禁用,然後再調整強度。

Comfyui MiniMax H3 Fun Control 工作流程中的關鍵節點#

Apply H3 Fun ControlNet (#23) 向當前模型添加一個控制流,並從您的控制影片中提取一批控制幀。將 strength 作為遵從預算:單一控制從 1.0 開始;當連鎖控制時,保持總和接近 1.0,以避免沖淡細節。時間表窗口 (start_percent, end_percent) 確定控制何時活躍;結束在 0.6 附近通常保留控制無法描述的紋理。

Prompt + first frame -> conditioning (#31) 從您的文本提示和可選的第一幀構建條件,以便模型可以尊重初始構圖。如果省略第一幀,僅提示驅動內容。寬度、高度和長度居住在此處;H3 在其 17n + 5 網格上以 24 fps 接受長度,因此計劃編輯到那些持續時間。

Positive: references + prompt (#1031) 將持久的圖像參考和提示文本輸入 H3,以便身份和風格在每個幀中保持。ref_image_sizemax 使用較大的標記以更強的身份,但成本較高;match 更快,身份壓力較輕。與負面分支和 CFGGuider 配對,如果您需要強烈的排除。

CFGGuider: the negative only works here (#1040) 啟用無分類指導,以便負面條件有效。較高的指導加強提示和參考的遵從,但增加了計算,因為每一步都運行正面和負面。對於長而具體的風格簡報,適度的 cfg 可以顯著改善遵從;使用固定種子進行並排測試。

Sigma shift (video 12 / audio 3) (#24) 調整擴散時間表,以便影片路徑和音頻路徑在採樣前獲得適當的 sigma 配置文件。當您計劃解碼音頻時,保持這部分在鏈中,以便音頻 VAE 接收兼容的潛在分佈。

Sol-Attn (OPTIONAL, needs the SolAttn node pack + Triton) (#2060) 應用稀疏注意力內核,以加速 H3 而不改變圖表。保持 morton 禁用;啟用它會重新排列標記,使 ControlNet 的貢獻錯過預期的行,看起來像完美輸出,但完全忽略控制。對於保守的速度提升,保持最早和最新的 transformer 區塊準確,並在 Triton 編譯後進行配置。

BasicScheduler (#42) 提供 sigma 時間表和採樣的步數。對於嚴格控制的鏡頭,多幾步可以幫助在控制消失前穩定結構;對於快速風格通過,修剪步驟以節省時間。將調度程序調整與控制窗口結合,以平衡遵從和紋理。

可選附加功能#

  • 控制影片必須與生成的寬度、高度和幀數完全匹配;節點檢查並提高這兩個數字如果它們不同。
  • 使用曲線形式的 ControlNet 檢查點;原始全寬版本將無法在 H3FunControlLoader 中加載。
  • 如果您的控制通道有大面積無特徵區域,將控制窗口結束在 0.6 附近,以便後期步驟可以從提示中添加紋理。
  • 對於身份關鍵的片段,偏好 Graph 2 或 Graph 3,使用 MiniMaxH3ReferenceToVideo,並考慮 ref_image_size: max
  • 在 Graph 1 中需要負面?替換為 CFGGuider 或移至 Graph 2/3,負面分支已經連接。
  • 項目資源:自定義節點 ComfyUI-H3-FunControl,曲線形式 ControlNet MiniMax-H3-Fun-Controlnet-Union,社區 H3 權重 MiniMax-H3-experimental,可選加速 ComfyUI-SolAttn_triton

致謝#

此工作流程實現並建立在以下作品和資源的基礎上。我們感謝 wyzborrero 提供的 ComfyUI-H3-FunControl 自定義節點,alibaba-pai 提供的 MiniMax H3 Fun ControlNet Union 模型,Kijai 提供的 MiniMax H3 實驗模型文件,kijai 提供的 SolAttn Triton 可選加速節點,以及 RunComfy 提供的 Cloud Save 工作流程的貢獻和維護。詳細信息,請參閱以下鏈接的原始文檔和儲存庫。

資源#

注意:使用所引用的模型、數據集和代碼須遵循其作者和維護者提供的相應許可和條款。

RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。