MiniMax H3 動作場景:參考引導的動作影片生成器,具有原生音效#
MiniMax H3 動作場景是一個 ComfyUI 工作流程,用於創建緊密指導的、參考引導的動作影片,並同步原生音效。您提供兩個角色圖像、一個場景參考和一個結構化提示。工作流程使用 MiniMax H3 Turbo 分階段運動,然後使用 LMS 和 Combat LoRAs 優化構圖和戰鬥可讀性,同時保留原始音效。輸出包括快速的一次通過“基礎”影片和更高保真度的“精細”影片。
此 Comfyui MiniMax H3 動作場景工作流程專為預視、特技和戰鬥設計、遊戲和 VFX 電影以及短社交片段而設計。測試範例包括城堡劍術對決、拳擊館手套練習和太空船棒術演練。在提示中保持角色身份和編舞明確,並快速檢查手或武器接觸是否有可能的瑕疵。
Comfyui MiniMax H3 動作場景工作流程中的關鍵模型#
- Comfy‑Org MiniMax H3 核心套件。提供文本編碼器以及用於構建、分離和解碼聯合音視頻潛在變量的視頻和音頻 VAE。參見官方集合中的模型和 LoRAs。 MiniMax‑H3 models
- Minimax‑h3 Singularity (UNet)。作為基礎的參考到視頻生成器,將參考和提示融合為動作場景的音視頻潛在變量。 Minimax‑h3_Singularity
- MiniMax‑H3 Turbo LoRA。加速第一次通過,使您能夠在細化之前快速迭代運動節拍。包括在官方 MiniMax H3 集合中。 MiniMax‑H3 LoRAs
- MiniMax‑H3 LMS LoRA。增強了適合實景風格輸出的佈局、材料和結構銳度;在第二次通過中使用。 LMS LoRA r64
- H3 Combat LoRA。提高了動作場景中戰鬥輪廓、刀劍接觸和穩健步法的清晰度。包括在 MiniMax H3 集合中。 MiniMax‑H3 models
- H3 Latent Upscaler LMS。一個時間上保持一致的三維上採樣器,在通過之間放大視頻潛在變量,同時保持運動連續性。 Comfyui Minimax H3 Latent Upscaler
如何使用 Comfyui MiniMax H3 動作場景工作流程#
管道在兩次協調的通過中運行。第一次通過使用 Turbo 建立運動和時間以提高速度。然後在第二次通過中使用 LMS 和 Combat LoRAs 放大和精細化視頻潛在變量,同時保留原生音效。您將獲得快速的“基礎”預覽和精緻的“精細”導出。
設置#
使用設置組選擇縱橫比、工作分辨率、片段時長和幀率。時長控制將秒數轉換為與採樣器的分段對齊的幀數,這有助於穩定性。從較低的開始進行快速預覽,然後在框架和節拍看起來正確時進行放大。更高的分辨率和更長的片段會增加 VRAM 和渲染時間。
參考#
加載三個參考:每個角色一個圖像和一個定義環境的圖像。角色圖像作為身份和服裝指南,而不是背景,因此選擇面部清晰可讀和關鍵服裝元素的乾淨肖像。場景參考設置了照明、調色板和建築風格;選擇一個符合您預期的攝像機高度的視圖。您可以自由交換參考以探索不同的匹配和地點。
條件#
MiniMaxH3ReferenceToVideo (#56) 節點將結構化提示與參考和 MiniMax H3 編碼器融合,生成聯合音視頻潛在變量和正向調節。提示在分為標籤部分如 subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape 和 non_diegetic_music 時效果最好。明確指出戰鬥人數、武器、攝影機移動和清晰接觸的確切數量。如果您希望獲得接地結果,請避免多餘的角色、瞬移、超人動作或效果。
LoRAs#
LoRAs 在兩個階段應用。Turbo 被注入第一次通過,以加速運動探索而不犧牲身份保留。LMS LoRA 通過 AdaLN 兼容性修正後流動,然後應用 Combat,使得精細化器強調可讀的輪廓和打擊防禦交換。您可以調整 LoRA 強度,以平衡現實主義與風格化,適合您的類型。
修補#
此組配置性能和計劃整形。PathchSageAttentionKJ (#199) 優化注意力以提高記憶和速度,從而高動作場景保持響應。MiniMaxH3SigmaShift (#297) 將視頻和音頻 sigma 調度對齊,改善相對於運動的唇音和擬音時間。當您看到時間漂移或小的身份不穩定時使用這些。
第一次採樣#
第一次通過初始化噪音,設置緊湊的計劃,並使用 SamplerCustomAdvanced (#238) 進行採樣,由您的正向調節指導。輸出保存為基礎潛在變量,並可以解碼為快速預覽視頻,帶有原生音效以便快速審查。此通過是您評判封鎖、攝影機移動和打擊節奏的地方。如果節拍圖不對,請在此處修改提示和參考,然後再進行精細化。
第二次採樣 + 精細化器#
在精細化之前,音頻和視頻從第一次通過中分離,視頻潛在變量使用 MinimaxH3LatentUpscaler3D (#124) 放大,音頻潛在變量保持不變。然後精細化器使用較低噪音的 sigma 進行採樣,使用 LMS 和 Combat LoRAs 增加材料細節、邊緣保真度和戰鬥可讀性。最後,圖像和保留的音效被解碼並組合成精細化的導出。預期相比基礎通過有更清晰的邊緣、更乾淨的手和刀刃以及更穩定的身份。
Comfyui MiniMax H3 動作場景工作流程中的關鍵節點#
MiniMaxH3ReferenceToVideo (#56)#
使用 MiniMax H3 文本編碼器和 VAE,從您的結構化提示和參考圖像構建同步的音視頻潛在變量。調整 prompt, width, height, 和 length 來控制內容、框架和持續時間。為了獲得最佳結果,保持主題定義和場景限制明確。參考:Comfy‑Org MiniMax‑H3。
MinimaxH3LatentUpscaler3D (#124)#
時間一致的三維潛在上採樣器,在精細化之前放大視頻潛在變量。適度增加 mode.scale 以獲得細節,而不破壞運動穩定性。當您喜歡第一次通過的時間安排但想要更清晰的邊緣和紋理時很有用。參考:Comfyui Minimax H3 Latent Upscaler。
MiniMaxH3SigmaShift (#297)#
調整 MiniMax H3 使用的音視頻 sigma 調度,以保持運動、唇音提示和擬音的對齊。調整 shift_video 和 shift_audio 可以減少對話或影響中的時間漂移。除非您注意到切入或切出時的不同步,否則請保持小偏移。參考:MiniMax‑H3 collection。
VHS_VideoCombine (#264)#
將解碼的幀和音頻組合成最終的 MP4,具有您選擇的幀率和質量設置。啟用元數據保存以在導出中保留來源和工作流程詳細信息。當您的精細化視頻超過保留的音效時,使用 trim_to_audio。參考:ComfyUI‑VideoHelperSuite。
PathchSageAttentionKJ (#199)#
注意力優化,可以提高高細節場景和更大分辨率的吞吐量和穩定性。對於較長的拍攝或複雜的環境,請保持啟用。如果您在較小的片段上遇到性能回退,請嘗試其自動模式。參考:ComfyUI‑KJNodes。
可選附加#
- 提示模式。使用提供的分段格式,並為動作寫出一個節拍圖。指定確切的戰鬥人數和武器、攝影機移動以及可讀接觸的數量和時間。
- 參考策劃。選擇面部清晰和服裝明確的身份照片,以及一個與預期視角和照明匹配的地點圖像。避免角色參考上的繁忙背景,以減少衝突。
- 審查通過。觀看基礎視頻以驗證封鎖和時間,然後再進行精細化。如果接觸看起來模糊,請在提示中增加清晰度,並減少手或刀刃的快速速度。
- 典型問題和修復。快速的手或武器接觸可能會導致小的失真;簡化衝突編舞,縮短交換,或增加與攝影機的距離,以幫助模型清晰渲染該時刻。
- 可交付成果。工作流程會寫出快速的基礎預覽和精細化的導出,以便您比較運動與最終外觀。當身份、環境和節拍符合您的目標時,使用精細化片段進行分享。
使用 MiniMax H3 動作場景,您可以將兩個角色圖像、一個場景參考和一個精確的簡報轉換為接地的、參考忠實的動作片段,並同步原生音效,準備好進行編輯、預視或發佈。
致謝#
此工作流程實施並建立在以下工作和資源之上。我們由衷感謝 Innovate Futures @ Benji 提供的 AI Video MiniMax H3 ComfyUI 工作流程指導,WarmBloodAban 提供的 Minimax-h3_Singularity,以及 Comfy-Org 和 RunningHubAI 提供的 MiniMax-H3 基礎模型和 LMS LoRA 的貢獻和維護。欲了解權威詳情,請參考下列鏈接的原始文檔和庫。
資源#
- Innovate Futures @ Benji/AI Video MiniMax H3 (workflow source)
- Docs / Release Notes: AI Video Minimax H3 Action Scenes Update — New Sampling Settings in ComfyUI
- WarmBloodAban/Minimax-h3_Singularity
- Hugging Face: WarmBloodAban/Minimax-h3_Singularity
- Comfy-Org/MiniMax-H3
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- RunningHubAI/rh-minimax-h3-lms-v1.0-r64-lora
- Hugging Face: RunningHubAI/rh-minimax-h3-lms-v1.0-r64-lora
注意:使用所引用的模型、數據集和代碼須遵循其作者和維護者提供的相應許可和條款。

