MiniMax H3 ComfyUI 文字轉影片4步驟Turbo:一次通過的提示到短片,具有原生音訊#
此工作流程將單個電影提示轉化為具有共同生成的立體聲音訊的短影片,使用MiniMax H3。它應用了一個Turbo 4步驟加速LoRA,因此您可以快速迭代對話、歌唱和環境場景,同時保持動作和聲音緊密耦合。
專為希望僅使用提示草稿的創作者而設計,MiniMax H3 ComfyUI 文字轉影片4步驟Turbo工作流程產生乾淨的語音或人聲、一致的環境音效和一致的電影攝影,無需手動音訊組裝。該圖表自動處理長度對齊、潛在取樣、解碼和合併,因此您可以專注於講故事和表演提示。
Comfyui MiniMax H3 ComfyUI 文字轉影片4步驟Turbo工作流程中的關鍵模型#
- MiniMax H3 擴散模型 (FL2VA UNet)。核心視聽生成器,學習圖片和聲音的共享潛在,從同一取樣過程中實現同步的動作和音訊。權重:Comfy-Org/MiniMax-H3。
- Qwen3-VL 32B 文本編碼器用於H3 (AWQ/NVFP4變體)。將豐富的多句提示編碼為驅動場景佈局、演出和音訊事件的條件。包裝在Comfy-Org/MiniMax-H3中。
- MiniMax H3 視訊VAE。將取樣的視訊潛在解碼為具有電影色調和細節的畫面。文件:minimax_h3_video_vae_fp16.safetensors。
- MiniMax H3 音訊VAE。將共享潛在解碼為時間對齊的立體聲音訊,用於語音、歌唱和環境聲音。文件:minimax_h3_audio_vae_fp32.safetensors。
- MiniMax H3 Turbo 4步驟LoRA。應用加速配方,在保持場景保真度的同時實現非常快速的取樣。文件:minimax_h3_turbo_4step_pruned_comfyui.safetensors。
如何使用Comfyui MiniMax H3 ComfyUI 文字轉影片4步驟Turbo工作流程#
從高層次來看,您的提示被編碼,Turbo增強的H3模型取樣單一視聽潛在,並且視訊和音訊VAE在剪輯合併為可播放文件之前解碼該潛在。
1) 寫下電影提示並設置持續時間#
使用easy positive (#147)文本字段描述外觀、動作和表演。為了引導聲音或音樂,包含明確的提示,例如“音訊:中年男性聲音說出這句話...雨聲環境...低音驚悚片背景音。” Float (duration)控制器 (#133)設置剪輯長度(以秒為單位)。一個數學節點將您的持續時間轉換為畫面並安靜地將計數對齊到H3所需的節奏,因此您不需要管理畫面數學。
2) 加載H3、文本編碼器、VAE和Turbo LoRA#
UNETLoader (#127)加載MiniMax H3擴散模型,CLIPLoader (#128)加載為H3量身定制的Qwen3‑VL文本編碼器。兩個VAELoader節點引入視訊VAE (#119)和音訊VAE (#120)。LoraLoaderModelOnly (#153)將MiniMax H3 Turbo 4步驟LoRA應用於模型,使調度器和取樣器在快速模式下運行而不失去視聽一致性。
3) 構建條件和初始視聽潛在#
MiniMaxH3ImageToVideo (#131)將您的提示轉化為積極條件並準備初始潛在,與您選擇的寬度、高度和畫面數一致。如果您選擇稍後擴展圖表,選項first_frame和last_frame輸入存在於鎖定起始或結束圖像。該節點輸出條件和潛在,供後續取樣細化。
4) 使用Turbo取樣#
BasicGuider (#126)將模型與您的條件配對,KSamplerSelect (#123)選擇取樣算法,BasicScheduler (#124)設置與Turbo LoRA配合的步驟計劃。RandomNoise (#129)為生成設置種子以確保可重現性。SamplerCustomAdvanced (#125)執行去噪過程以產生編碼視訊和音訊的最終共享潛在。
5) 解碼並匯出最終剪輯#
VAEDecode (#122)從潛在中重建圖像畫面,而VAEDecodeAudio (#121)重建同步立體聲音訊。CreateVideo (#130)將畫面和音訊合併為單一流,然後SaveVideo (#92)使用您設置的文件名前綴將文件寫入磁碟。
Comfyui MiniMax H3 ComfyUI 文字轉影片4步驟Turbo工作流程中的關鍵節點#
MiniMaxH3ImageToVideo (#131)#
根據您的提示、解析度和長度生成積極條件並初始化視聽潛在。調整width、height或length會改變運動比例和螢幕上可以容納多少動作。如果您稍後擴展圖表,first_frame和last_frame允許您在鏡頭間鎖定連續性。
LoraLoaderModelOnly (#153)#
將Turbo 4步驟LoRA應用於加載的H3模型。保持調度器在低步驟範疇以受益於Turbo;大幅提高步驟會使外觀偏離預期的快速迭代行為。此LoRA專為MiniMax H3設計,並與H3存儲庫中的主要權重一起存在。
BasicScheduler (#124)#
控制取樣器遵循的去噪計劃。使用它來平衡速度和保真度,同時保持與Turbo LoRA的兼容性。如果您更改取樣算法,請重新檢查計劃選擇以保持穩定的運動和清晰的音訊。
SamplerCustomAdvanced (#125)#
在給定噪音、指南、取樣器、西格瑪和初始潛在的情況下運行實際去噪。它是紋理、時序和視聽清晰度的最終仲裁者。在比較提示調整時使用相同的種子,以便您可以將差異歸因於文本更改而不是噪音。
PathchSageAttentionKJ (#150)#
在LoRA注入之前應用注意力優化,以提高大解析度的吞吐量。由KJNodes提供,提供ComfyUI的性能助手。存儲庫:ComfyUI-KJNodes。
CreateVideo (#130)#
將解碼的畫面與解碼的音訊合併為同步剪輯。如果您需要匹配交付規格,可以在此更改幀率或位深度。該節點保持來自共享潛在的音訊-影片同步。
SaveVideo (#92)#
使用您選擇的文件名前綴、容器和編碼器將渲染的剪輯寫入磁碟。使用一致的命名來跟蹤同一場景和種子的迭代。
可選額外功能#
- 語音提示:將確切的台詞放在“音訊:”之後,描述聲音的年齡、性別、音調和速度。對於歌唱,指定風格和節奏。對於環境聲音,列出來源、強度以及是否僅需要背景音。
- 解析度和持續時間的權衡:更高的像素數和更長的剪輯需要更多的取樣時間。如果您需要多次拍攝,從較小的開始,然後在時機和表達感覺正確時放大或延長。
- 可重現性:在僅調整文本時保持相同的種子,以便您可以A/B對小提示編輯進行比較。
- 長度對齊是自動的:圖表將秒數轉換為畫面並將計數對齊到H3的內部節奏,以實現穩定的視聽合成。
- 連續性選項:模型節點暴露了可選的
first_frame和last_frame。如果您稍後擴展工作流程,請在此處連接圖像以匹配編輯間的鏡頭開始或結束。 - 安全性:避免使用受版權保護的角色、未經同意的真實人物肖像以及提示中的螢幕上標誌或字幕。
致謝#
此工作流程實施並基於以下作品和資源。我們感謝MiniMax提供MiniMax H3多模態生成模型和公告,Comfy.org提供ComfyUI MiniMax H3工作流程教程,Comfy-Org提供MiniMax-H3模型權重的貢獻和維護。欲了解權威詳情,請參閱以下鏈接的原始文檔和存儲庫。
資源#
- MiniMax/MiniMax H3:一個打破任務和模態界限的開放模型
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- 文檔/發佈說明:MiniMax H3 官方公告
- Comfy.org/MiniMax H3:ComfyUI工作流程範例
- GitHub: Comfy-Org/docs
- 文檔/發佈說明:Comfy.org MiniMax H3 教程
- Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
注意:使用所引用的模型、數據集和代碼須遵循其作者和維護者提供的相應許可和條款。

