MiniMax H3 T2V ComfyUI:提示轉換為影片,具原生立體聲音效#
MiniMax H3 T2V ComfyUI 將單一提示轉換為具有同步立體聲音效的短片。基於官方 Comfy.org 模板和開放的 Comfy-Org MiniMax-H3 權重,遵循 FL2VA 路徑,運動和聲音同步生成,而非事後拼接。非常適合快速探索僅提示的場景、對話或歌唱片段,以及需要在一次通過中呈現影像和聲音的概念鏡頭。
在一個區塊中描述鏡頭、攝影機、表演和音頻提示,選擇大小和持續時間,然後排隊圖形。工作流程加載正確的 MiniMax-H3 組件,採樣聯合音視頻潛在變量,解碼為幀和立體聲音頻,混合結果並保存完成的影片文件。
Comfyui MiniMax H3 T2V ComfyUI 工作流程中的關鍵模型#
- MiniMax-H3 FL2VA 擴散模型。核心 UNet 執行聯合音視頻去噪,確保運動和聲音保持相位對齊。權重由 Comfy-Org 在 diffusion_models 下提供。模型文件
- MiniMax-H3 影片 VAE。將視覺潛在變量編碼和解碼為 RGB 幀,保持電影細節和運動連續性。minimax_h3_video_vae_fp16.safetensors
- MiniMax-H3 音頻 VAE。將音頻潛在變量編碼和解碼為每個片段的時間對齊立體波形。minimax_h3_audio_vae_fp32.safetensors
- Qwen3-VL 32B 文本編碼器 (AWQ for MiniMax-H3)。將提示解釋為涵蓋場景語義、時間和音頻意圖的條件。qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
如果您想比較此圖形構建的原始模板,請參閱 Comfy.org 參考。模板 JSON
如何使用 Comfyui MiniMax H3 T2V ComfyUI 工作流程#
在高層次上,您設置目標分辨率和持續時間,撰寫一個包含影像和音頻的單一提示,選擇性地添加首幀和末幀,然後運行。在子圖中,MiniMax-H3 創建同步的視頻和音頻潛在變量,這些變量被解碼、合併成 24 fps 的影片,並保存。
ResolutionSelector (#115)#
選擇一個長寬比和比例來設置 width 和 height。選擇器將四捨五入為 32 的倍數,並將這些值傳遞給 MiniMax-H3 子圖,因此您不需要手動計算尺寸。從中等大小開始以便更快的迭代,然後在提示正確讀取後放大。改變長寬比是預告片、豎直片段和方形預覽的一個強大創意槓桿。
Image to Video (MiniMax H3) (#105)#
此子圖協調 MiniMax H3 T2V ComfyUI 管道。粘貼一個描述鏡頭、編輯和音軌的連貫提示,並選擇性地提供 first_frame 和 last_frame 圖像來錨定入口和出口。設置一個符合人類習慣的 duration,圖形將其轉換為模型的有效幀數。子圖返回同步的音視頻潛在變量,進行解碼和混合。
模型群組#
模型群組加載此工作流程的確切 MiniMax-H3 組件。UNETLoader (#6) 提取 FL2VA 擴散模型,CLIPLoader (#13) 加載 Qwen3-VL 編碼器,兩個 VAELoader 節點 (#11 視頻,#24 音頻) 準備解碼器。這些都指向 Comfy-Org MiniMax-H3 文件,因此您可以在不需要手動連線的情況下運行。將模型集中在這裡使未來的更換或升級變得簡單。
條件群組#
MiniMaxH3ImageToVideo (#104) 將您的提示、選擇性的 first_frame 和 last_frame,以及選定的 width、height 和 length 轉化為 MiniMax-H3 條件加上初始潛在變量。想法是讓模型同時讀取場景內容和音頻意圖,這導致更緊密的同步。如果您提供參考幀,則入口和出口會有連續性指導;如果您留空,則生成從冷啟動開始。
取樣群組#
取樣由 RandomNoise (#15)、KSamplerSelect (#17)、BasicScheduler (#9)、BasicGuider (#16) 和主要的 SamplerCustomAdvanced (#14) 處理。它們一起去噪聯合潛在變量,使畫面運動和聲音事件同步發展。您可以使用新種子重新運行以獲得替代拍攝,同時保持相同的創意方向。一旦舒適後,嘗試更改取樣器選擇或時間表可以稍微改變運動能量和聲音質感。
解碼和創建影片群組#
VAEDecode (#10) 從視頻潛在變量重建幀序列,VAEDecodeAudio (#23) 從音頻潛在變量重建立體波形。CreateVideo (#91) 將幀和音頻在 24 fps 下多路復用為完成的影片。這是提示中指定的清晰剪輯和節拍在時間軸上匯聚的地方。輸出進行保存。
SaveVideo (#92)#
將最終影片寫入您的 ComfyUI 輸出下的 video/MiniMax_H3。此節點使用自動命名,讓您可以快速迭代,並且您可以更改路徑以保持不同項目分開。輸出包含生成的影像和立體聲音頻。
Comfyui MiniMax H3 T2V ComfyUI 工作流程中的關鍵節點#
MiniMaxH3ImageToVideo (#104)#
MiniMax-H3 的核心條件節點,接受 prompt、可選的 first_frame 和 last_frame,以及 width、height 和 length。保持提示簡明但具電影感,並在同一文本塊中包含音頻提示如氛圍、SFX、對話和音樂重點。當需要特定入口或出口時,使用參考幀;省略它們以獲得更自由的場景。
ComfyMathExpression (#107)#
將人類可讀的 duration 映射為模型期望的整數 length,並對齊到模型的幀網格以獲得清晰的時間。將浮點設置為您預期的片段長度,讓節點處理轉換。稍短的片段往往能在更高的分辨率下保持清晰的運動和聲音同步。
SamplerCustomAdvanced (#14)#
根據選擇的取樣器和時間表驅動去噪過程。使用固定的 noise_seed 鎖定一個拍攝進行比較,然後僅更改種子以探索新變化。如果運動感覺太混亂或太僵硬,嘗試在 KSamplerSelect (#17) 中選擇不同的取樣器或在 BasicScheduler (#9) 中調整時間表。
CreateVideo (#91)#
將解碼的幀和立體聲音頻合併為一個單一的影片流,使用您選擇的幀速率。對於節奏驅動的編輯,設置 fps 以匹配您在提示中描述的節奏。此節點也是您想改變 fps 以獲得更慢或更快的感覺的地方。
ResolutionSelector (#115)#
一個控制長寬比和整體像素數的控制器,具有自動四捨五入到模型友好大小的功能。首先選擇長寬比,然後微調比例以平衡速度和清晰度。更大的畫布回報仔細的提示和較短的持續時間。
SaveVideo (#92)#
將片段最終保存到磁碟。將其指向一個項目子文件夾,以保持實驗有序,並在您找到理想片段時明智地重命名。
可選附加功能#
- 將提示寫成迷你分鏡腳本,帶有時間提示和明確的音頻節拍以獲得可靠的同步。
- 包括音頻意圖詞如風、腳步聲、人群、混響或特定樂器以引導音軌。
- 直接在提示中添加對話或歌唱的台詞,並註明說話者的語調。
- 鎖定
noise_seed在比較提示調整時,僅更改種子以探索替代拍攝。 - 在需要跨剪輯的連續性或精確的最終姿勢時,使用
first_frame和last_frame來括住運動。
致謝#
此工作流程實施並基於以下作品和資源。我們感謝 Comfy-Org 提供的 MiniMax H3 T2V 工作流程模板和 MiniMax-H3 模型權重,Comfy.org 的 MiniMax H3 教程,以及 MiniMax 的官方 MiniMax H3 公告對他們的貢獻和維護。如需權威詳情,請參考下列鏈接的原始文件和倉庫。
資源#
- Comfy-Org/MiniMax H3 T2V 工作流程模板
- GitHub: video_minimax_h3_t2v.json
- Comfy.org/MiniMax H3 教程
- Docs / Release Notes: MiniMax H3 教程
- MiniMax/MiniMax H3 官方公告
- Docs / Release Notes: MiniMax H3 官方公告
- Comfy-Org/MiniMax-H3 模型權重
- Hugging Face: Comfy-Org/MiniMax-H3
注意:使用所參考的模型、數據集和代碼需遵循其作者和維護者提供的各自許可和條款。

