MiniMax H3 高質量雙採樣工作流程:多參考視頻與同步本地音頻#
MiniMax H3 高質量雙採樣工作流程是一個 RunComfy-ready 的參考到視頻圖形,用於將多個圖像參考和可選的視頻或音頻提示轉換為具有本地音頻的短篇電影剪輯。它通過結合雙採樣計劃、記憶體高效的 H3 注意力、專用視頻和音頻 VAE,以及 turbo 4 步 LoRA 路徑來平衡身份保留、穩定運動和清晰細節。
專為需要產品或角色連續性的創作者設計,這個 MiniMax H3 高質量雙採樣工作流程允許您在一個提示中定義主題、場景和聲音,然後生成拋光的 H3 視頻輸出而無需重建圖形。將一組靜止圖像提供給它,加入音頻風格參考,並導出準備分享的 MP4。
Comfyui MiniMax H3 高質量雙採樣工作流程中的關鍵模型#
- MiniMax H3 參考到視頻擴散模型 (Ref2VA)。核心生成器,將參考和文本轉換為視聽潛在,驅動畫面和本地音頻。查看官方倉庫中的模型包和權重:MiniMaxAI/MiniMax-H3 和 Comfy-Org/MiniMax-H3。
- Qwen3-VL 32B 文本編碼器,專為 MiniMax H3 調整。解釋描述主題、鏡頭和聲音的結構化提示,然後通過 Comfy-Org 模型包中包含的 CLIP 風格嵌入條件化 H3 UNet:Comfy-Org/MiniMax-H3。
- MiniMax H3 視頻 VAE。壓縮和解碼視頻潛在以高效生成高質量畫面,隨 Comfy-Org 發布:Comfy-Org/MiniMax-H3。
- MiniMax H3 音頻 VAE。編碼和解碼本地音頻潛在,以便在同一管道中生成並同步語音和環境音:Comfy-Org/MiniMax-H3。
- MiniMax H3 Turbo 4-step LoRA。輕量級的精細化路徑,改善細節和時間穩定性,同時保持運行速度快。它堆疊在此工作流程的基礎 H3 Ref2VA 模型上。
如何使用 Comfyui MiniMax H3 高質量雙採樣工作流程#
此圖形組織為清晰的組,將工作從參考和提示移交,通過 H3 採樣,到解碼和 MP4 導出。雙採樣首先建立運動和結構,然後在保留身份的同時改進細節和音頻。
參考區域#
加載最多九個靜止參考以供人、物或環境使用。這些供應 H3 參考到視頻節點,以便模型可以鎖定身份、服裝和場景元素。如果需要,您還可以將短片作為視覺參考路由。使用已經匹配目標透視或照明的參考以獲得最佳保留。如果您導入一批或精靈表,GetImageRangeFromBatch (#40) 可以提取您想在下游使用的幀。
視頻參考區域#
如果您希望從參考視頻開始,請使用視頻加載器提取幀並可選地限制持續時間。GetImageRangeFromBatch (#40) 選擇一個連續片段,以便工作流程保持輕量。這些幀作為第一個 H3 通道的結構或運動指導。您可以將視頻與靜止圖像混合;H3 編碼器在採樣前將它們融合。
音頻參考區域#
加載一到三個短音頻片段以引導聲音音色、節拍或環境音。這些不會被逐字複製;而是形成音頻潛在,以便最終的語音或音景遵循相同的風格。對於語音台詞,短而清晰的語音片段,背景噪音最小效果最好。如果省略音頻,工作流程仍然會根據提示生成合理的環境音。
模型#
此組將 H3 UNet、基於 Qwen 的文本編碼器和兩個 VAE 連接起來,然後應用一個記憶體高效的注意力補丁。Lora Loader Stack (rgthree) (#118) 添加了 turbo 4-step LoRA,以便在短時間內獲得更高的細節而不延長時間表。注意力補丁節點減少 VRAM 壓力,這在較大分辨率下很有幫助。它們一起準備了取樣器將使用的條件堆棧。
採樣#
MiniMaxH3ReferenceToVideo (#56) 是您的提示、參考和分辨率結合在一起以生成條件和初始視聽潛在的地方。該節點讀取結構化提示部分,例如 subject_definitions、summary、retention_analysis、detailed_description、overall_soundscape 和 non_diegetic_music。這裡設置了一個基本的 guider 和取樣器選擇,以保持配置簡單,同時仍然能夠實現強大的控制。將其視為在雙採樣精細化器接手之前的舞台區域。
Sigmas#
一個簡短的調度器生成 sigma 時間表,然後分割以驅動雙採樣結構。分支之一強調穩定性和粗略運動,而另一個強調高頻細節和清晰度。當您需要在困難的鏡頭上進行更多清理時,小的布爾開關允許您擴展或繞過中間區域。您不需要在這裡調整數字;只需選擇是否在面孔或標誌需要更高保真度時啟用擴展範圍。
SamplerCustomAdvanced#
第一個 SamplerCustomAdvanced (#108) 通道運行在較低的 sigma 範圍內,以建立佈局、身份和運動節奏。然後將潛在分離為視頻和音頻,並且可以在潛在空間中輕微上升視頻潛在,以增加細節的空間。第二個 SamplerCustomAdvanced (#103) 通道使用較高的 sigma 切片來銳化邊緣和紋理,同時尊重第一通道的 guider。伴隨的 SamplerCustomAdvanced (#106) 通道可以選擇性去噪或保留區域,開關節點決定最佳最終潛在在解碼之前。這種兩通道舞蹈是 MiniMax H3 高質量雙採樣工作流程獲得穩定性和清晰細節的可靠組合。
加速節點#
對於 VRAM 較緊的 GPU,UniBlockSwap 通過暫時將 UNet 區塊交換到系統內存來提供幫助,VRAMReserver 保留足夠的空間以進行解碼和最終合成。這些速度和記憶體幫助器對質量影響最小,當您看到內存不足警告時可以打開它們。將它們保持在圖形中與 UNet 路徑相連。
保存視頻#
專用視頻和音頻 VAE 解碼最終潛在,然後 PixaromaSaveMp4 (#115) 將幀和音頻合成為 MP4。在這裡設置目標幀速率,選擇是否將視頻修剪到生成的音頻長度。文件名前綴和子文件夾使得保持拍攝有序變得容易。當您使用新種子或參考重新運行時,輸出將堆疊在相同的文件夾中。
Comfyui MiniMax H3 高質量雙採樣工作流程中的關鍵節點#
MiniMaxH3ReferenceToVideo (#56)#
將文本、圖像和可選的視頻或音頻參考融合為條件和初始視聽潛在以用於 H3。調整 prompt 以定義主題、場景連續性、鏡頭時間和聲音設計,設置 width、height 和 length 以目標長寬比和持續時間。使用多個參考圖像在連續性重要時鎖定身份和服裝。
Lora Loader Stack (rgthree) (#118)#
在基礎模型上應用 MiniMax H3 turbo 4-step LoRA,以便在短時間表內提高細節。調整 LoRA 強度,如果邊緣過於銳利或基礎模型風格被覆蓋。當參考已經具有強烈的紋理時,保持 LoRA 分層最少。
MiniMaxH3MemoryEfficientSageAttentionPatch (#70)#
啟用 H3 UNet 的記憶體高效注意力,以便您可以在適度的 GPU 上運行更高分辨率或更長的剪輯。對 8 到 12 GB 的顯卡開啟它,或當您看到 VRAM 峰值時。僅在您基準測試高內存 GPU 的原始吞吐量時禁用。
SplitSigmas (#99)#
將調度器分為互補的 sigma 波段,這些波段為兩個取樣器通道提供數據。如果您的場景穩定但缺乏銳利度,將更多權重轉移到高 sigma 分支。如果運動抖動或身份漂移,偏向低 sigma 分支並保持擴展中間開關關閉。
SamplerCustomAdvanced (#108)#
第一通道取樣器,奠定結構、運動和身份。保持 guider 與您的提示和參考一致,以便第二通道有一個乾淨的基礎。使用此通道快速測試種子和框架,然後再承諾進行精細化。
SamplerCustomAdvanced (#103)#
精細化取樣器,使用較高的 sigma 切片來增強細節和修復邊緣。在一個穩固的第一通道之後效果最好;當面孔或標誌開始過度銳化時,避免過度驅動它。僅當您需要額外的紋理空間時,才將其與潛在上升結合。
ComfySwitchNode (#107)#
在雙採樣後選擇替代的潛在精細化。當比較輔助去噪分支與直接精細化分支的結果時切換它。記下哪條路徑對您的主題集保持身份更好。
PixaromaSaveMp4 (#115)#
將解碼的幀和音頻合成為 MP4。設置 fps 以匹配您的運動感覺,並使用 trim_to_audio 以獲得緊密的視聽同步。更新 filename_prefix 以按鏡頭或主題保持拍攝有序。
可選附加#
- 從官方 H3 R2V 模板開始學習核心模式,然後自定義此圖形:Comfy-Org 工作流程模板。
- 使用
ResolutionSelector(#73) 選擇您的 GPU 可以處理的長寬比和百萬像素目標,然後在框架看起來正確後逐漸增加。 - 在模型理解的結構化部分中提示:subject_definitions、summary、retention_analysis、detailed_description、overall_soundscape、non_diegetic_music。這種風格給 H3 更清晰的限制。
- 對於身份至關重要的鏡頭,提供 3 到 5 張同一主題的高質量靜止圖像,匹配光線和角度。避免對參考使用過重的濾鏡。
- 提供 1 到 5 秒的乾淨語音風格片段作為音頻參考,以保持角色的音色一致。保持噪音和音樂低。
- 如果達到 VRAM 限制,啟用注意力補丁和加速節點組。首先降低分辨率,然後是長度。
- 當運動正確但紋理柔和時,保持第一通道不變,增加對第二取樣器分支的依賴,而不是延長整體步驟。
- 經常保存版本。因為 MiniMax H3 高質量雙採樣工作流程同時對視頻和音頻進行條件化,所以小提示編輯會產生巨大影響。
致謝#
此工作流程實施並基於以下作品和資源。我們由衷感謝 MiniMaxAI 提供的 MiniMax-H3 模型,Comfy-Org/Comfy.org 提供的 ComfyUI 模板、權重和 MiniMax H3 教程,以及 RunningHub.ai 提供的工作流程參考,感謝他們的貢獻和維護。有關權威細節,請參閱下面鏈接的原始文檔和倉庫。
資源#
- RunningHub.ai/工作流程來源和參考
- 文檔 / 發布說明:工作流程來源和參考
- MiniMaxAI/MiniMax-H3 (官方模型)
- Hugging Face: MiniMaxAI/MiniMax-H3
- Comfy-Org/MiniMax-H3 (模型權重)
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org/MiniMax H3 教程
- 文檔 / 發布說明:教程
- Comfy-Org/ComfyUI MiniMax H3 R2V 模板
- GitHub: Comfy-Org/workflow_templates
注意:使用所引用的模型、數據集和代碼需遵循其作者和維護者提供的各自許可和條款。


