MiniMax H3 潛在放大器:BUNNY 雙通道視頻生成工作流程#
這個 ComfyUI 工作流程將文字提示和可選的參考圖像轉換為帶有同步音頻的短片電影。它使用 BUNNY 雙通道設計:第一階段以適度的基礎解析度設計運動和構圖,然後 MiniMax H3 潛在放大器放大 3D 視頻-音頻潛在,然後第二階段重建高頻細節並解碼最終幀和聲音。MiniMax H3 潛在放大器集成於生成中,因此不是預先存在視頻的通用增強器;它專為廣告剪輯和風格化電影場景而設計,您希望在不失去運動意圖的情況下增強清晰度。
結果是一個高解析度的剪輯,其外觀由您的提示、參考和一小組 LoRAs 決定,而運動穩定性由雙通道上採樣-重建管道保護。第二階段是必需的,總是在潛在放大後執行實際的細節重建。
Comfyui MiniMax H3 潛在放大器工作流程中的關鍵模型#
- MiniMax H3 視頻-音頻模型和 T8 自定義節點。提供整個管道中使用的核心生成器、條件設置、雙通道計劃和解碼實用程序。請參見 T8 資源庫中的節點套件以獲取模型特定行為和接口。 GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 視頻 VAE。編碼和解碼視頻潛在,第二階段最終將其轉換為幀。包含並由上述 T8 節點消耗。 GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 音頻 VAE。編碼和解碼音頻潛在,以保持環境聲音與視覺運動計劃一致。 GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 潛在放大器 3D。這是一個學習的 3D 潛在放大器,在細節重建之前放大聯合視頻-音頻潛在的寬度和高度,比後處理插值更好地保護時間結構。請使用官方 3D fp16 檢查點。 Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- SageAttention 記憶體高效注意力補丁,用於 H3。作為此工作流程中唯一使用的注意力補丁,用於穩定、節省記憶體的推理。 GitHub: ComfyUI-h3_sage_amd
如何使用 Comfyui MiniMax H3 潛在放大器工作流程#
該工作流程有七個標記組協同生成最終剪輯。第一階段計劃基礎解析度的運動,MiniMax H3 潛在放大器放大潛在內容,第二階段在較大尺寸上重建細節,然後解碼為視頻和音頻。
01 · 輸入、放大和參考#
使用 BUNNY 提示框描述場景、運動、氛圍和音景。可選擇添加最多四張參考圖像以引導身份、調色板或鏡頭設計;保持它們未連接以進行純文字生成。設置您的目標持續時間;幀數會自動計算以匹配模型的取樣網格。選擇適合您硬件的第一階段基礎解析度,然後調整放大比例以確定 MiniMax H3 潛在放大器在潛在空間中放大寬度和高度的程度。請記住像素面積隨著比例因子的平方而擴展,因此 VRAM 和渲染時間隨著較高的放大而增加。
02 · 模型基礎 · 只有 Sage#
此組加載 MiniMax H3 基礎模型,應用可選的 Turbo LoRA 提速,並激活 SageAttention 補丁作為唯一的注意力修改。匹配 MiniMax H3 視頻和音頻 VAE 以及 H3 文本編碼器以確保一致的條件設置和解碼。保持此部分不變,除非您有具體理由更換兼容的模型文件;不建議混合注意力後端。
03 · BUNNY 第一階段和第二階段 LoRAs#
第一階段的 LoRAs 影響運動邏輯、構圖和互動模式;第二階段的 LoRAs 專注於重建放大結構和精細細節。您可以用適合您主題的 LoRA 文件替換它們,並謹慎調整其權重。如果第二階段開始改變運動意圖,請在觸及第一階段之前降低第二階段 LoRA 的強度。切勿將第二階段的 LoRAs 回路到第一階段,也不要繞過第二階段。
04 · 第一階段運動#
Stage 1 Conditioning · AUTO (#7) 解析您的提示和參考,選擇適當的生成模式,並組裝聯合視頻-音頻潛在畫布。Stage 1 Dual Clock (#8) 驅動分開但同步的視頻和音頻計劃,以便運動和聲音協同演變。雙通道計劃節點將小部分預算分配給第一階段的運動結構,並保留更多用於第二階段的細節。Stage 1 · Motion Structure 執行粗略的去噪以確立構圖和時間安排;輸出是一個精緻的潛在,而不是最終幀。
05 · H3 3D 潛在放大#
H3 3D Learned Latent Upscale (#13) 將 MiniMax H3 潛在放大器應用於第一階段潛在,直接在 3D 潛在空間中放大寬度和高度。因為放大發生在細節重建之前,所以時間一致性比幀空間放大器更好地保護。僅使用官方 3D fp16 檢查點,並在此處調整比例,如果您想要不同的最終解析度。節點還會報告新維度,這些維度會自動交給第二階段。
06 · 第二階段 HQ 重建(必須)#
Stage 2 Conditioning · AUTO (#14) 重用您的提示、參考和放大後的尺寸以將指導與較大畫布對齊。Stage 2 Reconcile · Size & Audio (#15) 鎖定這些尺寸和音頻策略,以保持視頻和聲音同步。Stage 2 Detail Mixer · Fixed 5 Steps (#16) 執行決定性的重建通道,增加清晰的紋理,同時尊重第一階段的運動。Stage 2 · 5-Step HQ Reconstruction 從種子噪音去噪到最終潛在,並且 Stage 2 AV Decode (#20) 將其轉換為幀和輸出的生成音頻。
07 · 最終輸出#
CreateVideo 將解碼的幀和音頻打包成您選擇幀速率的視頻流。Clean VRAM After Generation 釋放渲染之間的記憶體。BUNNY HQ · Save Final Video 用您的文件名前綴、格式和編解碼器寫入最終文件。始終從第二階段解碼保存;第一階段的預覽不是最終版本。
Comfyui MiniMax H3 潛在放大器工作流程中的關鍵節點#
Stage 1 Conditioning · AUTO(#7)。文本、參考和模式路由的中央入口。調整提示,必要時調整模式以管理如何使用參考。除非您有明確理由強制模式,否則請將其保持在 AUTO 上,並確保參考與您描述的故事匹配。Stage 1 Dual Clock · Video 12 / Audio 3(#8)。協調視頻和音頻的單獨取樣時鐘,以保持運動節拍和音響事件對齊。如果必須重新定時,請輕輕進行,並確保兩個時鐘與目標節奏保持一致。H3 3D Learned Latent Upscale(#13)。使用官方 3D fp16 檢查點應用 MiniMax H3 潛在放大器。大多數用戶應觸及的唯一參數是比例因子;增加它會在潛在空間中增加寬度和高度,總像素隨該因子的平方增長。使用放大器的驗證檢查點,以避免潛在損壞。 Hugging FaceStage 2 Reconcile · Size & Audio(#15)。確保第二階段的潛在攜帶放大後的尺寸和所選音頻策略,然後再進行重建。如果您嘗試音頻設置,請保持和解啟用,以便時間和尺寸保持一致。Stage 2 Detail Mixer · Fixed 5 Steps(#16)。高解析度重建的核心,增加細節而不重寫運動邏輯。如果結果看起來過於銳化或在動畫中漂移,請先降低第二階段 LoRA 的強度,然後僅在必要時微調混合器平衡。Stage 2 AV Decode(#20)。將重建的潛在解碼為幀和同步音頻。始終從此節點路由輸出到CreateVideo和Save Final Video,以確保正確處理色彩空間和音頻。
可選附加功能#
- 對於純文字生成,斷開所有參考圖像輸入,以便 AUTO 選擇純文字到視頻路徑。
- 當更改放大時,請記住渲染成本隨比例的平方而上升;僅在設置了 MiniMax H3 潛在放大器比例後,才首選提高第一階段基礎解析度。
- 為了提高重試的一致性,請在
Seeded Noise中固定種子,並在探索替代方案時故意改變它。 - 如果第二階段改變運動節拍,請先降低第二階段 LoRA 的權重,然後再觸及取樣器或混合器設置。
- 保持 SageAttention 作為唯一的注意力補丁;避免堆疊額外的注意力後端以保持穩定性。 GitHub
- 使用官方 MiniMax H3 潛在放大器檢查點,以防止無效的張量和不匹配的鍵。 Hugging Face
致謝#
此工作流程實施並基於以下作品和資源。我們感謝 RunningHub.ai 提供工作流程來源,LBH-123-AI 提供 Minimax H3 潛在放大器模型,以及 T8mars 提供 MiniMax H3 自定義節點的貢獻和維護。欲了解權威詳情,請參閱以下鏈接的原始文檔和資源庫。
資源#
- RunningHub.ai/Workflow source
- Docs / Release Notes: runninghub.ai post
- LBH-123-AI/Minimax_h3_latent_Upscaler
- GitHub: LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler
- Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- T8mars/comfyui-minimax-h3-audio-T8
注意:所引用的模型、數據集和代碼的使用受其作者和維護者提供的各自許可和條款約束。

