3D AI 渲染與 MINIMAX H3: Clay‑to‑Cinema ComfyUI 工作流程#
這個由 Mickmumpitz 設計的 ComfyUI 圖形將普通灰色 3D “黏土”渲染轉換為電影級、完全紋理化的視頻,並可選擇同步音頻。它使用原始動畫作為結構,因此構圖、幾何形狀和運動保持不變,而模型則添加材料、照明、環境和逼真的細節。
為 3D 藝術家、動畫師和電影製作人而設計,3D AI 渲染與 MINIMAX H3 橋接了 DCC 動畫和 AI 視頻生成。提供 24 fps 的黏土通道用於運動,一個或多個靜態“外觀板”用於風格,然後用簡潔的提示和時間線引導結果。該工作流程生成了一個精緻的鏡頭和一個可選的並排比較以供快速查看。
ComfyUI 3D AI 渲染與 MINIMAX H3 工作流程中的關鍵模型#
- MiniMax‑H3 ref2va 擴散模型。核心視頻生成器,遵循參考視頻的結構,同時合成幀和音頻。使用為 ComfyUI 提供的 ref2va 變體:minimax_h3_ref2va_pruned_int8_convrot.safetensors。 Model
- Qwen‑VL 32B 文本編碼器用於 MiniMax H3。將提示、標籤和時間線編碼為 H3 理解的條件。使用 MiniMax 調整的文件 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors。 Encoder
- MiniMax‑H3 視頻 VAE (fp16)。將視頻潛變量解碼為 RGB 幀。 VAE video
- MiniMax‑H3 音頻 VAE (fp32)。將音頻潛變量解碼為與生成的視覺效果同步的聲音。 VAE audio
- MiniMax‑H3 FL2VA 4‑step Turbo LoRA (可選)。在需要時加快推理速度並增加強烈的細節。 LoRA
- MiniMax‑H3 pruned w4a8 混合 (可選較小基礎)。如果需要節省 VRAM,這是一個縮小尺寸的替代選擇。 Alternative base
如何使用 ComfyUI 3D AI 渲染與 MINIMAX H3 工作流程#
概覽中,黏土視頻定義運動,外觀板靜態圖像定義材料和照明,提示將它們結合在一起。渲染組將這些信號輸入 MiniMax H3,然後輸出組解碼幀和音頻並保存您的結果,包括並排比較器。
Group 1 — 載入 MINIMAX H3 模型#
此組準備 3D AI 渲染與 MINIMAX H3 的模型堆棧。UNETLoader (#8) 載入 MiniMax‑H3 ref2va 擴散權重,CLIPLoader (#9) 載入 Qwen‑VL 32B 文本編碼器,兩個 VAELoader 節點(#11 用於視頻,#13 用於音頻)提供解碼器。小型 Set_* 和 Get_* 幫助器緩存這些組件以便在圖中重用。保持兩個 VAE 活躍,因為 MiniMax‑H3 可以在一次通過中生成圖像和聲音。如果切換到較小的 Kijai 變體,只需更改擴散模型文件即可。
Group 2 — 速度#
此區域在保留結構鎖定的同時加速迭代。LoraLoaderModelOnly (#16) 應用 4 步 Turbo LoRA 以獲得更快、更清晰的預覽。MiniMaxH3SigmaShift (#17) 調整計劃以適應 LoRA,EasyCache (#18) 避免在運行之間重複工作。使用 LoRA 進行快速外觀開發;如果您想要最大忠實度或更柔和的效果,請繞過它並在 Group 5 中使用多步計劃進行渲染。
Group 3 — 設置#
這裡的工作流程推導出 3D AI 渲染與 MINIMAX H3 的最安全畫布。MinimaxH3Resolution (#121) 讀取參考圖像以在 H3 的本機網格上建議寬度和高度,防止扭曲和時間閃爍。輕量級控件保持步驟和種子,而 PreviewAny (#122) 回顯活動分辨率以快速檢查。長度計算一次並存儲,因此圖像和音頻在管道中保持對齊。為了可重複的重拍,保持固定的種子。
Group 4 — 輸入#
使用 VHS_LoadVideo (#30) 導入您的 24 fps 黏土渲染。工作流程將鏡頭長度鎖定到 H3 的內部幀網格,以便時間保持穩定;如果需要每一幀,請修剪或填充您的源以達到最近的有效長度。使用 LoadImage (#36, #38, #40) 添加一到三個外觀板。外觀板是代表最終材料、顏色和照明的靜態照片或概念圖像;它不是黏土視頻中的幀,並且不會改變佈局。如果您想將聲音或音效帶入生成,請使用 LoadAudio (#34) 選擇性載入外部音頻文件。如果您計劃生成語音,您將在 Group 5 中將此音頻連接到渲染節點。
Group 5 — 渲染#
在 PROMPT (#44) 中撰寫您的意圖。保留標籤 <Video 1> 用於黏土通道,<Picture 1> 用於第一個外觀板,然後撰寫清晰的說明風格文本加上一個 Timeline:,涵蓋整個剪輯。3D AI 渲染與 MINIMAX H3 的核心是 MiniMaxH3ReferenceToVideo (#45),它將提示、外觀板、黏土視頻和可選的聲音融合為條件和起始潛變量。該潛變量通過 BasicGuider (#57)、BasicScheduler (#58)、KSamplerSelect (#59)、RandomNoise (#60) 和 SamplerCustomAdvanced (#61) 流動,生成最終的視頻潛變量。Group 3 中的寬度、高度和長度自動傳入,以便生成的運動和任何音頻保持與您的參考同步。
Group 6 — 輸出#
VAEDecode (#67) 將視頻潛變量轉換為幀,VAEDecodeAudio (#68) 發出聲音。AudioAdjustVolume (#69) 提供簡單的音量修整,然後 CreateVideo (#70) 將圖像和音頻合併為主文件,SaveVideo (#71) 將其寫入磁盤。並行地,一個審查分支使用 ImageFromBatch (#76) 和 ImageScale (#124) 修剪和縮放黏土通道,通過 ImageStitch (#77) 將其與 AI 結果並排縫合,然後通過 CreateVideo (#78) 和 SaveVideo (#79) 導出比較剪輯。這使得驗證幾何、框架和動畫保持忠實變得容易。
ComfyUI 3D AI 渲染與 MINIMAX H3 工作流程中的關鍵節點#
MiniMaxH3Resolution (#121)#
根據您的參考確定安全的本機寬度和高度,以便 H3 落在其縱橫比網格上。通過更改黏土輸入來更改縱橫比,而不是強制自定義尺寸。如果必須偏離,請保持網格對齊的值以避免閃爍。
VHS_LoadVideo (#30)#
攝取驅動結構的黏土通道。為了可靠的運動鎖定,提供 24 fps 的源,並避免在節點內進行重採樣。如果出現時間漂移,請以 24 fps 重新導出您的黏土通道,並確保工作流程的鎖定長度與剪輯匹配。
MiniMaxH3ReferenceToVideo (#45)#
合併提示、外觀板、參考視頻和可選聲音到視頻和音頻潛變量中的中央渲染器。保持提示中的 <Video 1> 和 <Picture 1> 標籤,以便模型綁定到正確的輸入。對於對話,將您的語音軌道路由到節點的參考視頻音頻輸入,以便唇部運動與語音對齊。
LoraLoaderModelOnly (#16)#
應用 4 步 Turbo LoRA 以獲得快速、清晰的預覽。用於探索和日常工作。當您需要更柔和的外觀或最接近黏土通道的匹配時,禁用 LoRA 並在 BasicScheduler (#58) 和 KSamplerSelect (#59) 中使用多步計劃進行渲染。
BasicScheduler (#58) 和 KSamplerSelect (#59)#
控制隨著時間的推移如何去除噪音,這會影響紋理銳度、運動平滑度和對黏土通道的忠實度。低步數計劃與 Turbo LoRA 配合得很好以提高速度,而無 LoRA 的多步計劃則強調準確性和更柔和的效果。如果結果顯得過度銳化,嘗試不同的采樣策略和更多步驟。
VAEDecodeAudio (#68)#
解碼生成的音頻潛變量。如果您的混音需要在 CreateVideo (#70) 合併之前進行音量快速調整,請與 AudioAdjustVolume (#69) 配對。為了獲得清晰的對話,將您的源語音填充到精確的剪輯長度以避免重複。
可選附加項#
- 外觀板:使用高質量靜態圖像捕捉材料、照明和顏色。它們是風格參考,而不是佈局參考。請勿將黏土通道中的幀作為外觀板。
- 提示:撰寫說明,而不是禁令。像“一個連續的鏡頭”這樣的短語比“沒有相機移動”效果更好。包括一個
Timeline:,可以到達最後一幀,以便圖像和聲音不會拖尾。 - 音頻提示:對於語音,將您的語音連接到渲染節點的參考視頻音頻輸入。用靜音填充錄音以匹配鎖定的剪輯長度。在提示中用引號括住所說的台詞,並提到“僅一次”。
- 幀速率:以 24 fps 導出黏土通道。不同的速率將被時間壓縮,運動可能會偏離您的原始動畫。
- 長度網格:工作流程將長度鎖定到 H3 的固定幀網格以保持穩定性。如果您需要精確的持續時間,請將黏土通道修剪到下一個有效網格值,或相應地填充您的音頻。
- 更快的迭代:保持 Turbo LoRA 開啟以進行外觀開發,使用內置的並排導出來評估結構,然後如果您更喜歡更柔和、更忠實的渲染,請切換到多步計劃以獲得最終效果。
- 本工作流程中使用的有用節點:ComfyUI‑KJNodes、ComfyUI‑VideoHelperSuite、和 ComfyUI‑Mickmumpitz‑Nodes。
有了這些組件,3D AI 渲染與 MINIMAX H3 為您提供了一個快速、可控的路徑,從無紋理的動畫到完成的電影鏡頭,同時保留您在 3D 工具中創建的布景和運動。
致謝#
此工作流程實施並建立在以下作品和資源之上。我們感謝 Mickmumpitz 為 3D AI 渲染與 MINIMAX H3 工作流程和指南所做的貢獻和維護。欲了解權威細節,請參閱以下鏈接的原始文檔和存儲庫。
資源#
- Mickmumpitz/3D AI 渲染與 MINIMAX H3 工作流程源
- Hugging Face: Comfy-Org/MiniMax-H3
- 文檔 / 發布說明: 3D AI 渲染與 MINIMAX H3 工作流程源
注意:使用參考的模型、數據集和代碼需遵循其作者和維護者提供的相應許可和條款。


