VDN H3 MiniMax ComfyUI 文字轉影片#
VDN H3 ComfyUI 文字轉影片將自然語言提示轉換為短片,具有同步的音頻。它將MiniMax H3系列與Video DeltaNet混合注意力和8步驟取樣結合起來,從單一提示生成視頻和音頻。非常適合分鏡、產品片段和風格化場景,如電影幻想、拉力賽和裝甲劍術對決。
該圖包括兩個可獨立選擇的分支。VDN-H3分支應用了Video DeltaNet補丁,並用於生成附帶的示例。提供FastVideo分支以比較輸出和生成時間與VDN路徑。兩個分支都以您選擇的幀率渲染帶有音頻的MP4。
基於開放組件構建:MiniMax H3的VDN GitHub 和 Hugging Face,由Saganaki22提供的VDN-H3 ComfyUI節點 GitHub,以及基礎MiniMax H3權重和VAE Hugging Face。
Comfyui VDN H3 ComfyUI 文字轉影片工作流程中的關鍵模型#
- MiniMax-H3擴散模型(UNet)。驅動去噪過程,將噪聲轉換為連貫的時空視頻和音頻潛變量。權重在Hugging Face的MiniMax H3包中提供。
- Qwen3-VL 32B MiniMax-H3文本編碼器。將您的提示轉換為視頻和音頻生成的條件,調整以適應H3系列。在Hugging Face的MiniMax H3版本中包含。
- MiniMax-H3視頻VAE。將視頻潛變量解碼為RGB幀。在Hugging Face的VAE部分中可用。
- MiniMax-H3音頻VAE。從音頻潛變量重建波形音頻。也在Hugging Face上提供。
- VDN-H3補丁權重。Video DeltaNet對MiniMax H3應用混合注意力。從Hugging Face獲取檢查點。
- FastVideo UNet變體。比較分支使用
minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensors,來自Kijai/MiniMax-H3-experimental。
如何使用Comfyui VDN H3 MiniMax ComfyUI 文字轉影片工作流程#
首先設置您的提示、分辨率、持續時間和幀率。選擇VDN-H3分支或FastVideo分支進行單獨運行。隊列全部可能會執行兩個啟用的分支並生成兩個MP4;分開的圖形分支不保證同時執行GPU。兩個分支都配置為8個取樣步驟。
用戶輸入#
使用(input:prompt) Text Prompt面板用簡單語言描述視覺和聲音。對於音頻,添加一行以Audio:開頭的行來請求特定的音效或環境,例如“Audio: rhythmic hoofbeats, wind, distant roar.”。使用(input:Resolution) Megapixels控制視覺尺寸,這會將ResolutionSelector餵入以生成計算友好的寬度和高度。設置(input:Duration) Seconds和(input:FPS)以定義剪輯的持續時間和流暢度。工作流程將持續時間和FPS轉換為有效的幀數,並默默地將其調整為與H3內部工作良好的序列長度。
模型#
CLIPLoader提供MiniMax調整的文本編碼器,用於條件設定。兩個VAELoader節點引入MiniMax-H3視頻VAE和音頻VAE,以便解碼的幀和聲音與模型的潛在空間匹配。這些加載器由兩個分支共享,以確保一致的A/B結果。
條件設定#
MiniMaxH3ImageToVideo (#219)將您的提示加上尺寸和長度轉換為初始視頻和音頻潛變量以及正條件。可選的圖像輸入可用於在您需要特定進入或退出姿勢時鎖定第一幀或最後一幀。這個階段是您的敘述決策最重要的地方:相機運動、主題動作、照明和Audio:行都成為下游取樣器的指導。
VDN-H3補丁#
VDN分支使用ApplyVDNH3Advanced (#6126)應用Video DeltaNet升級。它應用所選的混合注意力補丁。MiniMaxChunkFeedForward和ModelPatchTorchSettings配置內存和執行設置。MiniMaxH3SigmaShift在取樣開始前調整視頻和音頻的噪聲時間表。
取樣 (VDN-H3)#
VDN取樣從RandomNoise (#6141)開始,使用BasicGuider (#6134)合併指導,選擇KSamplerSelect (#6137)中的求解器,並在BasicScheduler (#6136)中安排緊湊的擴散步驟數。SamplerCustomAdvanced (#6135)在整個序列上執行去噪,以生成精緻的視頻和音頻潛變量。保持種子固定以保持可重複性,或更改它以在同一提示下探索新變化。
解碼和創建視頻 (VDN-H3)#
VAEDecode (#6146)重建幀,而VAEDecodeAudio (#6145)重建音軌。VHS_VideoCombine (#6170)將幀和音頻合併為MP4,尊重您之前設置的幀率並保存預覽就緒的文件。VDN輸出以獨特的文件名前綴保存,因此很容易與FastVideo結果進行比較。
FastVideo比較分支#
FastVideo路徑加載速度調整的MiniMax H3 UNet並在取樣前應用輕量級注意力補丁。它重用您的提示、尺寸和幀數,以便您可以直接比較時間和外觀。取樣反映了VDN分支的結構,並且也配置為8步驟。幀和音頻被解碼並與VHS_VideoCombine (#6104)結合以生成第二個MP4。使用這些並排的輸出來決定哪個分支最適合您的場景。
Comfyui VDN H3 ComfyUI 文字轉影片工作流程中的關鍵節點#
ApplyVDNH3Advanced(#6126)。在MiniMax H3上啟用Video DeltaNet,使用VDN-H3版本中的所選檢查點。只有在您想更改VDN檢查點或切換注意力後端時才調整;保持混合注意力默認值以供一般使用。參考實現:Saganaki22/ComfyUI-VDN-H3。MiniMaxH3ImageToVideo(#219)。故事和時間控制的中央控制點,接受文本提示、計算出的寬度和高度以及派生的幀數。對於音頻,將單一的Audio:行附加到提示中,以引導音效和環境聲音,同時避免除非明確要求的語音。MiniMaxH3SigmaShift(#6131, #6007)。重新平衡視頻和音頻流的sigma時間表,這可以幫助減少抖動並在低步驟計數時保留細節。僅在您更改模型變體或注意到運動不穩定時考慮小調整。VHS_VideoCombine(#6170, #6104)。將解碼的幀和音頻合併為MP4,使用您選擇的幀率和文件名前綴。有用的選項包括修剪到音頻長度和選擇所需的H.264像素格式。項目頁面:ComfyUI-VideoHelperSuite。
可選附加內容#
- 提示技巧:用單句設置主題、動作和相機移動,然後添加外觀和感覺提示以及一行
Audio:進行音效。 - 對於較長的剪輯,優先選擇適中的像素數而不是高分辨率,以保持運動穩定和內存使用控制。
- 在
RandomNoise中固定種子,當您想要一致的迭代時;更改它以探索變化。 - 在您的場景中比較這兩個分支,以評估輸出質量和生成時間。
- 如果達到內存限制,首先減少像素或持續時間;塊狀前饋已經幫助處理較長的序列。
鳴謝#
此工作流程實現並基於以下作品和資源。我們對OpenVDN的vdn-minimax-h3模型、權重和存儲庫,Saganaki22的ComfyUI-VDN-H3節點以及Benji (AI Future Tech)的VDN-H3工作流程的貢獻和維護表示感謝。欲知權威詳情,請參閱以下鏈接的原始文檔和存儲庫。
資源#
- OpenVDN/vdn-minimax-h3
- GitHub: OpenVDN/vdn-minimax-h3
- Hugging Face: OpenVDN/vdn-minimax-h3
- Saganaki22/ComfyUI-VDN-H3
- GitHub: Saganaki22/ComfyUI-VDN-H3
- Benji (AI Future Tech)/VDN-H3 Workflow
- Docs / Release Notes: AI Future Tech Patreon post
注意:所引用的模型、數據集和代碼的使用受其作者和維護者提供的相應許可和條款約束。


