MiniMax H3 Taomate 三步加速:參考影像轉化為電影視頻,並同步音頻#
這個 ComfyUI 工作流程將一或兩張靜態影像和一個電影提示轉化為連貫的視頻,並同步聲音。它以 MiniMax H3 和 TaoMate H3 的三步加速 LoRA 為基礎,實現快速取樣,同時保持主題身份、場景連續性、相機運動和音頻提示。MiniMax H3 Taomate 三步加速管道非常適合角色肖像、科幻節拍、歷史重現和精緻的短格式概念,當你希望強烈的相似性控制和自然運動時。
通過將參考影像與鏡頭結構化的提示配對,MiniMax H3 Taomate 三步加速工作流程在屏幕上產生一致的表現者、穩定的照明和場景布置,以及跟隨文本指導的氛圍音軌。它附帶記憶體高效的注意力補丁和分塊推理,因此您可以在低 VRAM 下運行更大的幀,同時保持音頻和視頻的對齊。
Comfyui MiniMax H3 Taomate 三步加速工作流程中的關鍵模型#
- MiniMax H3 參考到視頻的基礎模型。從文本和視覺參考中驅動聯合視頻和音頻生成。查看官方模型卡的功能和格式:MiniMaxAI/MiniMax-H3。
- TaoMate-H3 三步加速 LoRA。重新安排去噪計劃,使高質量在很少的步驟中即可達成,啟用此工作流程使用的3步風格計劃。項目和權重:TaoMate-H3 on GitHub 和 TaoLiveAIGC/TaoMate-H3。
- Qwen3-VL 32B 文本編碼器變體,用於 MiniMax H3。編碼長的、具鏡頭意識的提示,帶有相機和聲音指令,以獲得更強的條件。隨 Comfy-ready H3 包分發:Comfy-Org/MiniMax-H3。
- MiniMax H3 Video VAE 和 Audio VAE。將共享的潛流解碼為影像幀和同步音頻,確保唇部安全的時間和氛圍連續性。包含在 Comfy-Org/MiniMax-H3 中。
如何使用 Comfyui MiniMax H3 Taomate 三步加速工作流程#
工作流程從輸入流向單一路徑採樣器,發出統一的潛態,用於視頻和音頻,然後解碼並合併成最終文件。組織成組,以便您可以先設置參考和文本,然後讓 MiniMax H3 Taomate 三步加速處理堆棧接管。
影像/視頻輸入(2)#
將一或兩個主題幀加載到 LoadImage (#94) 和 LoadImage (#9) 中。使用乾淨、正面的影像,具有穩定的照明,並且沒有重大的遮擋,以保持身份鎖定。一個強有力的參考就足夠了;第二個角度可以幫助維持服裝、比例和環境。參考供應給 MiniMaxH3ReferenceToVideo 以初始化身份、姿勢範圍和佈局,然後開始去噪。
文本輸入(1)#
在 Prompt (#93) 中輸入您的電影提示。編碼器偏愛結構化的散文,包含鏡頭分解、相機移動、運動動詞和兩個可選的聲音區塊:一條氛圍線和一條非戲劇性音樂線。您可以保留提供的模板風格,並用您的場景和時間標記替換其內容。這些指導條件化影像和聲音,以便 MiniMax H3 Taomate 三步加速堆棧可以將音頻事件與屏幕上的行動對齊。
處理(22)#
此組加載 MiniMax H3,應用 TaoMate 三步加速 LoRA,並安裝記憶體高效的注意力以進行低 VRAM 運行。MiniMaxH3ReferenceToVideo (#11) 將您的參考影像和提示融合成一個潛態計劃;Resolution Selector (Size) (#20) 設置寬度和高度;Float (Duration) (#17) 驅動運行時間。一個小的表達式節點將持續時間轉換為 H3 友好的幀數,與內部步幅對齊,使運動保持平滑。採樣器、引導器、調度器和西格瑪移位然後執行一個短而激進的計劃,專為 MiniMax H3 Taomate 三步加速設計,而不犧牲身份或場景穩定性。
輸出(2)#
採樣器的去噪潛態被解碼兩次:VAEDecode (#25) 產生幀,VAEDecodeAudio (#14) 產生聲音。CreateVideo (#34) 以您選擇的 fps 將幀和音頻合併為一個準備分享的剪輯,並用您的文件名前綴寫入 SaveVideo (#5)。輸出反映您的鏡頭級文本,並保持參考影像中的面部相似性。由於視頻和音頻共享一個潛態,整個過程中保持同步。
Comfyui MiniMax H3 Taomate 三步加速工作流程中的關鍵節點#
MiniMaxH3ReferenceToVideo (#11)#
此節點是文本影像條件進入 H3 管道的入口。使用它提供您的提示、一或兩個參考影像,以及有效的 width、height 和 length。為了精確的時間安排,上游調整持續時間,讓計算出的 length 自動對齊;通過選擇器而不是在此處鍵入原始尺寸來更改分辨率。如果替換或添加參考,請保持影像之間的構圖一致,以避免身份漂移。
LoraLoaderModelOnly (#92) — TaoMate H3 三步加速#
應用使 MiniMax H3 Taomate 三步加速計劃成為可能的 TaoMate H3 LoRA。只有在您需要更多速度或在非常低的步驟中需要更強的指導時才增加其影響;如果觀察到過度銳化或減少的微妙運動,則略微減少。將其與簡潔、具體的提示配對,使短計劃有明確的目標收斂。
MiniMaxH3SigmaShift (#38)#
調整噪聲計劃以平衡視頻中的清晰度和時間一致性,同時保持音頻穩定。如果您的幀看起來太柔和,向上調整視頻移位;如果氛圍變得太主導或脆弱,則緩和音頻移位。進行小的、協調的更改,並在提交完整渲染之前預覽幾秒鐘。
SamplerCustomAdvanced (#21)#
運行短去噪路徑,使用您選擇的採樣器和調度器的西格瑪曲線。當比較提示時,保持採樣器一致,以便可以將更改歸因於文本和參考,而不是採樣。為了多樣性,上游更改 RandomNoise 種子;這會改變微運動和相機感覺,而不會損害身份。
ComfyMathExpression (#19) — 自動幀數#
將持續時間轉換為與 H3 的內部步幅對齊的幀數,防止節奏卡頓。僅編輯持續時間輸入節點;表達式將自動四捨五入到最近的兼容計數。這保持平滑運動,並使音頻床與視覺節拍同步。
Resolution Selector (Size) (#20)#
選擇長寬比和像素預算,同時保持雙維度為模型友好的磚尺寸的倍數。選擇一個匹配您可交付成果的長寬比,然後提高或降低百萬像素以在細節和速度與 VRAM 之間進行交易。使用此功能而不是隨意尺寸,以避免 VAE 和注意力窗口中的錯位。
CreateVideo (#34) 和 SaveVideo (#5)#
將幀和音頻合併為單個文件,並以您首選的前綴和格式保存。此處調整 fps 以改變感知的運動速度和聲音時間,而無需重新採樣模型。當構建系列時,使用一致的位深度和色彩空間,以便剪輯統一分級。
可選附加功能#
- 提示工藝以獲得最佳結果
- 以一句話的場景摘要開頭,然後列出1-3個鏡頭塊,帶有明確的動詞和時間提示。
- 包含一條氛圍線和(可選)一條低調的音樂音符,使音頻感覺有意。
- 避免矛盾的指示;MiniMax H3 Taomate 三步加速中的短計劃獎勵清晰。
- 強烈的參考影像
- 使用乾淨的中或中寬幀,主題的臉部可見,服裝可讀。
- 保持照明溫度和背景與目標場景相似,以減少顏色偏移。
- 快速、穩定的迭代
- 鎖定您的種子以公平比較提示;一次只更改一個控制。
- 以中等分辨率開始,驗證運動和同步,然後以相同的種子進行最終通過。
- 風格控制
- 如果您想要不同的類型外觀,將包含的風格 LoRA 替換為其他 H3 兼容的 LoRA。
- 保持 TaoMate H3 加速 LoRA 活動,以保留 MiniMax H3 Taomate 三步加速速度配置文件。
致謝#
此工作流程實施並基於以下作品和資源。我們感謝 RunningHub.ai 提供工作流程來源,TaoLiveAIGC 提供 TaoMate-H3 項目和模型,以及 MiniMaxAI 提供 MiniMax-H3 模型,感謝他們的貢獻和維護。欲了解權威的詳細信息,請參考下方鏈接的原始文檔和存儲庫。
資源#
- RunningHub.ai/工作流程來源
- 文檔 / 發布說明:RunningHub.ai post
- TaoLiveAIGC/TaoMate-H3 項目
- GitHub: TaoLiveAIGC/TaoMate-H3
- Hugging Face: TaoLiveAIGC/TaoMate-H3
- TaoLiveAIGC/TaoMate-H3 模型
- Hugging Face: TaoLiveAIGC/TaoMate-H3
- GitHub: TaoLiveAIGC/TaoMate-H3
- MiniMaxAI/MiniMax H3 官方模型
- Hugging Face: MiniMaxAI/MiniMax-H3
注意:使用參考的模型、數據集和代碼需遵循其作者和維護者提供的相應許可和條款。

