MiniMax H3 8步加速:一體化多模態視頻生成與原生音頻#
MiniMax H3 8步加速是一個一體化的ComfyUI工作流程,用於創建帶有同步原生音頻的電影視頻。通過統一的MiniMaxH3Unified節點,它支持圖像參考、視頻參考、帶有伴隨音頻的視頻和獨立音頻參考,在一個流暢的工作流程中實現。
即用的示例使用單個圖像和一個動作導向的文本提示,但參考到視頻只是使用該工作流程的一種方式。其統一的多模態設計支持不同的視覺和音頻指導組合,而不需要為每種類型的輸入單獨的工作流程圖。
該工作流程結合了MiniMax H3 FL2VA骨幹與LightX2V Turbo LoRA和一個緊湊的8步、雙通道採樣計劃。它被設計用於電影角色鏡頭、對話場景、氣氛微故事和其他多模態視頻任務,這些任務受益於更快的迭代和同步的原生音頻。
ComfyUI MiniMax H3 8步加速工作流程中的關鍵模型#
- MiniMax-H3官方權重。從提示和多模態參考生成視頻和原生音頻的視聽擴散骨幹。 MiniMaxAI/MiniMax-H3
- MiniMax H3視頻VAE和音頻VAE。配對的編碼器和解碼器,用於在像素空間、音頻波形和H3潛在之間移動。包含在Comfy-Org分發中。 Comfy-Org/MiniMax-H3
- Qwen3-VL 32B文本編碼器(AWQ,MiniMax調優)。提供語言和視覺基礎,用於驅動MiniMax H3的提示和參考。與Comfy-Org MiniMax H3包一起分發。 Comfy-Org/MiniMax-H3
- LightX2V MiniMax H3 Turbo LoRA。速度導向的LoRA,緊縮軌跡,以便H3能夠在8步計劃下有效收斂。 lightx2v/Minimax-h3-Turbo
- MiniMax H3潛在升頻器3D。一個H3原生的潛在升頻器,用於在通道之間增加空間細節而不破壞音頻對齊。
如何使用ComfyUI MiniMax H3 8步加速工作流程#
在高層次上,該工作流程通過一個統一的輸入節點收集提示和多模態參考,構建一個緊湊的8步計劃,並運行一個快速的高sigma通道以建立運動和場景結構。然後可以在運行低sigma精緻通道之前將視頻潛在升級到3D,解碼同步音頻和視頻,並將結果導出為MP4。
輸入和大小#
使用Resolution Selector (Size)(#115)選擇您的目標寬度和高度。在Input Text (Prompt)(#217)中輸入您的場景描述;如果您希望生成的剪輯中有口語,可以包括引用的對話。
一體化的MiniMaxH3Unified節點(#212)作為工作流程的多模態參考中心。它支持圖像參考、視頻參考、帶有音頻的視頻和獨立音頻參考,並帶有提示、大小和持續時間控制。
包含的示例配置了一個參考圖像和一個動作提示以供立即使用。您可以替換那個圖像或在同一個統一節點中配置另一個支持的參考類型,而無需重建採樣、升級、解碼或導出階段。
您可以在MiniMaxH3Unified中設置duration,或者在使用外部音頻參考進行時間指導時切換auto_length_from_audio。
模型設置和加速補丁#
UNETLoader(#127)引入MiniMax H3 FL2VA檢查點。MiniMaxH3MemoryEfficientSageAttentionPatch(#160)和ModelAttentionBackend(#168)然後激活一個VRAM友好的注意力後端。
MiniMaxH3SigmaShift(#207)對齊視頻和音頻去噪地平線以適應短時間表。LoraLoaderModelOnly(#167)應用LightX2V Turbo LoRA,使MiniMax H3 8步加速無需單獨的加速圖。
8步計劃構建器#
BasicScheduler(#163)構建了一個緊湊的軌跡,由ExtendIntermediateSigmas(#220)和H3SigmaRefiner(#209)對H3的視聽動態進行微調。
SplitSigmas(#197)將計劃分為結構的高sigma塊和細節的低sigma塊。單一的RandomNoise(#129)種子為兩個通道提供輸入,以幫助保持運動和音頻的一致性。
初次通道採樣器:高sigma#
高sigma塊流入SamplerCustomAdvanced(#125),由BasicGuider(#126)與來自MiniMaxH3Unified(#212)的正面條件指導。
這一通道在統一的視聽潛在中建立了構圖、運動節奏和粗糙的音頻基礎。其去噪輸出然後準備進行中間管道增強。
潛在空間升級#
LTXVSeparateAVLatent(#199)分離視聽潛在,以便只有視頻通道由MinimaxH3LatentUpscaler3D(#226)升級。音頻潛在保持不變,以保持同步。
LTXVConcatAVLatent(#198)然後將增強的視頻潛在與原始音頻潛在重新組合,創建一個更清晰但仍然同步的視聽潛在以進行精緻。
第二次通道採樣器:低sigma#
重新組合的潛在在SamplerCustomAdvanced(#177)中使用低sigma塊和BasicGuider(#178)進行精緻。
這一通道增加表面細節,清理面部特徵,並打磨音頻紋理,同時保持初次通道建立的運動和時間。
解碼和導出#
VAEDecode(#186)將視頻潛在轉換為幀,而VAEDecodeAudio(#185)重建原生音頻軌道。
VHS_VideoCombine(#189)將結果混合為MP4,默認情況下選擇的幀速率為24 fps,生成一個可共享的視聽剪輯。
ComfyUI MiniMax H3 8步加速工作流程中的關鍵節點#
MiniMaxH3Unified(#212)。MiniMax H3的中央一體化多模態參考中心。它將圖像、視頻、視頻音頻、獨立音頻、提示、大小和持續時間控制整合到一個節點中,允許不同的H3參考任務使用相同的加速生成管道。H3SigmaRefiner(#209)。調整計劃以偏向於H3最受益的軌跡部分。如果您需要在相同速度下獲得更清晰的細節,增加一點精緻;如果您優先考慮最大吞吐量,保持精簡。SplitSigmas(#197)。將緊湊的計劃分為兩通道計劃。隨著8步計劃,中點分割平衡速度和質量;移動分割將更多步驟分配給結構或細節。MiniMaxH3SigmaShift(#207)。偏移視頻和音頻的sigma範圍,以便在短時間表下清晰地收斂。除非您了解其對同步和穩定性的影響,否則保持提供的偏移不變。LoraLoaderModelOnly(#167)。應用LightX2V Turbo LoRA。降低強度可以軟化Turbo效果以獲得更柔和的運動;提高強度可以增加快速但可能過度強調紋理。MinimaxH3LatentUpscaler3D(#226)。在通道之間增加空間細節,同時保持音頻潛在完整。對於720p類型的輸出使用適度的mode.scale,或在VRAM允許時使用更大的倍增器以獲得1080p。VHS_VideoCombine(#189)。處理最終混合和導出。調整frame_rate,設置文件名前綴,並可選擇使用修剪或乒乓循環進行預覽。
可選附加功能#
- 多模態參考。使用統一的H3節點處理圖像參考、視頻參考、帶有音頻的視頻或獨立音頻參考,而無需切換到單獨的生成圖。
- 快速啟動提示。MiniMax H3對電影動詞和攝影機語言反應良好。簡短、具體的提示如“慢推進”、“手持搖擺”或引用的對話通常會產生更強的運動和更清晰的語音。
- 分辨率快捷方式。0.4 MP與1.6倍潛在升級接近720p。0.5 MP首次通道與2倍升級接近1080p。如果您達到VRAM限制,在更改步驟計劃之前減少百萬像素。
- 穩定性提示。保持相同的種子以獲得可重複的拍攝。僅更改種子以在保留其餘時間和場景方向的同時快速變化。
- 何時繞過升頻器。如果您優先考慮速度或內存,將潛在升頻器的倍增器設置為1,以有效跳過增強階段。
- 適合的場景。此MiniMax H3 8步加速工作流程適用於中近距角色鏡頭、帶有環境聲音的對話、視聽場景參考、短氣氛節拍和多模態視頻任務,這些任務需要快速迭代。
致謝#
此工作流程實施並構建於以下作品和資源之上。我們衷心感謝RunningHub提供的工作流程參考,MiniMaxAI的MiniMax-H3官方模型,Comfy-Org的MiniMax-H3模型權重,以及lightx2v的MiniMax H3 Turbo LoRA。
有關授權信息和模型使用條款的權威細節,請參閱下列鏈接的原始文檔和存儲庫。
資源#
- RunningHub工作流程來源和參考
- 文檔 / 發布說明:工作流程來源和參考
- MiniMaxAI/MiniMax-H3
- Hugging Face:MiniMaxAI/MiniMax-H3
- Comfy-Org/MiniMax-H3
- Hugging Face:Comfy-Org/MiniMax-H3
- lightx2v/Minimax-h3-Turbo
- Hugging Face:lightx2v/Minimax-h3-Turbo
注意:使用所引用的模型、數據集和代碼需遵循其作者和維護者提供的相應許可和條款。


