ComfyUI>工作流程>MiniMax H3 性能捕捉:AI 動作轉移

MiniMax H3 性能捕捉:AI 動作轉移

Workflow Name: RunComfy/MiniMax-H3-Performance-Capture
Workflow ID: 0000...1528
將您的錄製表演轉換為由 H3 驅動的角色演出。您保留面部表情、頭部運動和原始音頻。面具隔離表演者。姿勢指導提高控制。參考圖片塑造狼、機器人或外星人。您保留周圍的場景。

ComfyUI MiniMax H3 Performance Capture Workflow

MiniMax H3 Performance Capture | Character-Swap Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Performance Capture Examples

MiniMax H3 性能捕捉用於 ComfyUI#

MiniMax H3 性能捕捉將您的表演轉換為新角色,同時保留您的原始音頻。該工作流程將面部表情、口型、眼睛方向和頭部運動從源片段轉移到目標生物或全身角色,然後將結果合成回畫面。基於 MiniMax-H3 參考條件影片、自動面部遮罩和可選的姿勢指導,它已在創意替換如狼、機器人和外星人中進行測試,同時保留了場景和音軌。工作流程由 Mickmumpitz 提供。

這個 ComfyUI MiniMax H3 性能捕捉工作流程是簡單的“渲染”版本:默認一個攝像機,可選的頭部攝像機和手動遮罩,可選的姿勢控制,以及兩個保存的影片(最終渲染帶音頻,加上對比剪輯)。

Comfyui MiniMax H3 性能捕捉工作流程中的關鍵模型#

  • MiniMax-H3 Reference-to-Video diffusion UNet (minimax_h3_ref2va_pruned_int8_convrot)。核心生成器將參考、提示和音頻融合到影片潛在變量中。模型文件
  • Qwen3‑VL 32B MiniMax‑H3 文本編碼器 (qwen3vl_32b_minimax_h3_nvfp4_awq)。編碼提示以引導身份和表演風格。模型文件
  • MiniMax‑H3 Video VAE FP16 和 Audio VAE FP32。視頻 VAE 解碼圖像潛在變量;音頻 VAE 條件化唇同步和表演時序。VAEs
  • MiniMax‑H3 Turbo 8‑step 768p LoRA。加速 H3 取樣以獲得快速、高質量的渲染。模型卡
  • MiniMax‑H3 Character Swap LoRA。加強對風格化或生物外觀的堅固的頭部和身體替換。模型卡
  • FUN ControlNet Union 2.0 模型補丁用於 H3。從骨架中添加可選的身體姿勢指導。模型文件
  • Segment Anything Model 3.1 Multiplex。生成區域的自動遮罩。檢查點
  • DWPose (via ControlNet Aux)。檢測身體和手部骨架以提供姿勢指導和頭部裁剪邏輯。倉庫

如何使用 Comfyui MiniMax H3 性能捕捉工作流程#

該工作流程從左到右穿過八個標籤組。首先加載您的表演剪輯,並可選地使用手動遮罩、頭部攝像機特寫和角色表。然後管道準備一個畫面和遮罩,從您的面部構建表演參考,選擇性地引導身體姿勢,使用 MiniMax H3 渲染,並保存對比剪輯。

1 加載模型#

該組加載 MiniMax‑H3 UNet、文本編碼器和 VAEs,然後應用 Turbo 和 Character‑Swap LoRAs。UNETLoader (#1001) 和 CLIPLoader (#1006) 提供核心生成器和提示編碼器。LoraLoaderModelOnly (#1003, #1004) 附加速度和替換適配器。BlockSparseAttention (#1009) 和 MiniMaxH3SigmaShift (#1002) 被接入以加速取樣並平衡音視頻指導。

2 您的鏡頭#

使用 BODY CLIP (your performance + voice) (#1012) 加載帶有嵌入單聲道或立體聲音頻的主鏡頭。您可以通過 LoadImage (#1016) 添加 CREATURE SHEET 以鎖定外觀,並在 PROMPT (the swap, the creature, its acting) (#1018) 中設置提示。可選輸入包括一個 HEAD‑CAM 特寫 VHS_LoadVideo (#1013) 用於寬鏡頭中的小面孔和一個 MANUAL MASK 視頻 VHS_LoadVideo (#1014) 如果您想覆蓋自動遮罩。快速控制集中在這裡:WHAT GETS REPLACED (head / person) (#1017), SEED (#1019), GROW MASK px (#1020), FACE CROP (#1021) 和 PERSON (#1022)。切換節點 (NO HEAD‑CAM #1227, NO MANUAL MASK #1228, NO CHARACTER SHEET #1229, NO POSE CONTROL #1230) 使常見設置一鍵完成。

3 準備#

WORKING SIZE (draft: 896x512) (#1028) 將輸入標準化為穩定分辨率,並且 length: next 17k+5 up (#1030) 將運行時間限制在一個簡短而快速的預覽長度。PREPARE (plate + regenerated area) (#1231) 構建一個乾淨的畫面,跟蹤需要用 SAM 3 替換的內容,使用 WHAT GETS REPLACED 中的文本,並如果有,攝入您的手動遮罩。結果是一個視頻畫面加上一個或兩個遮罩,準備進行受控的再生。

4 再生區域#

REGENERATED AREA (grow, blocks, hold) (#1233) 是決定 MiniMax H3 可以在哪裡繪製的遮罩邏輯。它擴展了遮罩,使耳朵或角等特徵有空間,將其轉換為時間塊以穩定運動,並保持更改幾幀以防止細節閃爍。如果您提供了手動遮罩,[MANUAL MASK] 合成 (#1074 到 #1105) 會將其按繪製通過。

5 表演參考#

ACTING REFERENCE (your face on grey | head‑cam) (#1232) 找到選定的人,裁剪面部區域並產生帶有您的表情、眼線和頭部旋轉的參考影片。啟用頭部攝像機時,它會構建一個分屏,使頭部方向遵循寬鏡頭,而細微的面部運動則遵循頭部攝像機。預覽 PREVIEW: acting reference (<Video 1>) (#1130) 讓您在渲染前確認跟蹤。

6 姿勢控制(可選)#

對於全身生物替換,[POSE] DWPose skeleton (#1131) 從您的畫面中提取身體和手部關鍵點。MiniMaxH3FunControlNetApply (#1132) 將該運動作為補丁輸入 H3,使四肢和軀幹跟隨您的表演,而面部則保持參考驅動。當手臂和腿必須在幀之間保持一致時使用;對於純頭部替換和四足動物將其關閉。

7 渲染#

H3 references + prompt MiniMaxH3ReferenceToVideo (#1134) 結合提示、角色表、表演參考、音頻和工作尺寸以生成 H3 條件和初始潛在變量。H3 RENDER (#1234) 然後注入畫面潛在變量,應用再生遮罩,使只有被遮罩的區域發生變化,並使用 Turbo 計劃進行取樣。輸出是一個乾淨的渲染和“再生顯示”預覽;SAVE: H3 render 1344x768 + voice (#1150) 寫入帶有原始音頻的 MP4。

8 對比影片#

COMPARISON VIDEO (#1235) 將畫面、渲染、表演參考和(如果使用)生物表堆疊到一個框架中以供審查。SAVE: comparison video + voice (#1158) 導出具有相同音軌的 MP4,以便您將結果與您的表演進行 A/B 比較。

Comfyui MiniMax H3 性能捕捉工作流程中的關鍵節點#

BODY CLIP (your performance + voice) (#1012)#

加載您的表演和音頻,驅動唇同步和時序。保持橫向構圖以獲得最佳構圖,並確保文件有音頻。如果面部在畫面中很小,請添加頭部攝像機輸入以獲得更清晰的表情跟蹤。

WHAT GETS REPLACED (head / person) (#1017)#

這段短文本引導 SAM 3.1 到 H3 將再生的區域。使用 head 進行頭部替換或 person 進行全身替換。如果頭盔或頭上裝置應該消失,請包括像頭部、頭盔或攝像機裝置這樣的詞;除非您打算移除背景中類似的物體,否則避免使用螢幕、顯示器或電纜等通用詞。

REGENERATED AREA (grow, blocks, hold) (#1233)#

定義 H3 可以重繪圖像的多少以及該區域隨時間如何演變。增加增長以為耳朵、角或毛皮留出空間;降低它以避免在廣角鏡頭中擴展到背景。塊和保持階段穩定運動,以防止細節在幀之間閃爍。

ACTING REFERENCE (your face on grey | head‑cam) (#1232)#

創建 MiniMax H3 將模仿的表演軌跡。FACE CROP 控制分析多少頭部和頸部,PERSON 選擇當多個人可見時的演員。只有當寬鏡頭面孔非常小時才啟用頭部攝像機;通常一個攝像機最好跟隨頭部轉動。

MiniMaxH3ReferenceToVideo (#1134)#

將提示、參考和音頻合併以生成條件和初始潛在變量的樞紐。保持寬度和高度與工作尺寸對齊,讓工作流程自動限制預覽的長度。提示已包含一句告訴 H3 如何使用表演參考的句子。

MiniMaxH3FunControlNetApply (#1132)#

從 DWPose 添加可選的身體姿勢指導。對於全身生物很有用,使軀幹和四肢能夠可信地跟隨,而面部則遵循表演參考。對於僅頭部替換或不匹配人類骨架的四足運動,將其關閉。

H3 RENDER (#1234)#

應用遮罩,使只有選定的區域發生變化,然後使用 Turbo 計劃進行取樣,並使用平鋪 VAE 解碼以提高 VRAM 效率。使用 SEED 微調外觀和微運動;當角色的外觀偏離表或描述時更改它。

可選額外功能#

  • MiniMax H3 性能捕捉的拍攝技巧:以橫向拍攝,保持曝光穩定,包含乾淨的製作音頻;如果您在 iPhone 上拍攝了 HDR,請在運行前轉換為 SDR。
  • 角色表指南:包括前視圖和側視圖加上一些小表情頭;這樣比僅文本更能鎖定鏡頭間的身份。
  • 多人場景:設置 PERSON 為正確的索引,並在 SAM 文本中描述主題,然後在渲染前驗證遮罩預覽。
  • 手動遮罩:提供一個與身體剪輯時序匹配的黑白影片;將其畫得比預期的生物稍大,以免 H3 回退到原始面孔。
  • 何時啟用姿勢控制:用於全身人形或有手臂和腿的生物;對於僅頭部替換和四足動物將其關閉。
  • 性能注意事項:啟用稀疏注意以加速渲染並減少內存;如果 VRAM 緊張,請在 CLIPLoader 中在 CPU 上運行文本編碼器。使用的自定義節點包括 ComfyUI‑VideoHelperSuite, ComfyUI‑KJNodes, comfyui_controlnet_aux, ComfyUI‑H3‑FaceRefine 和 ComfyUI‑Mickmumpitz‑Nodes.

致謝#

此工作流程實現並構建在以下作品和資源之上。我們感謝 Mickmumpitz 提供的 ComfyUI 性能捕捉工作流程和 Comfy-Org 提供的 MiniMax H3 模型的貢獻和維護。有關權威詳細信息,請參考下面鏈接的原始文檔和倉庫。

資源#

注意:使用引用的模型、數據集和代碼需遵循其作者和維護者提供的相應許可和條款。

RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。