MiniMax H3 圖片轉視頻 ComfyUI:首幀動畫與原生音頻#
這個 RunComfy 準備好的圖形將單張圖片轉換為具有同步、模型生成音頻的短篇電影視頻。它是一個圍繞 MiniMax H3 的 FL2VA 路徑構建的緊湊、經過驗證的首幀設置,因此運動和聲音從一個提示中一起生成,而不是在後期疊加。MiniMax H3 圖片轉視頻 ComfyUI 非常適合於當您希望在一次通過中獲得連貫的攝影機運動、場景動作和聲音設計的肖像、動物、產品和大氣場景。
保存的版本僅連接第一幀而不連接最後一幀。這意味著鏡頭從您提供的圖像演變,而不需要強制進行兩幀過渡。您仍然可以編寫一個提示來引導視覺效果和音頻,使 MiniMax H3 圖片轉視頻 ComfyUI 快速迭代並可靠地進行創意指導。
Comfyui MiniMax H3 圖片轉視頻 ComfyUI 工作流程中的關鍵模型#
- MiniMax H3 FL2VA 擴散主幹 (UNet)。提供由文本和關鍵幀條件化的核心視頻生成能力。 模型文件
- Qwen3-VL 32B 編碼器用於 MiniMax H3 (AWQ/NVFP4)。嵌入提示以便模型可以對齊場景內容、運動和音頻提示。 模型文件
- MiniMax H3 視頻 VAE。解碼潛在視頻特徵回到 RGB 幀。 模型文件
- MiniMax H3 音頻 VAE。解碼潛在音頻為波形以輸出原生聲帶。 模型文件
如何使用 Comfyui MiniMax H3 圖片轉視頻 ComfyUI 工作流程#
此工作流程通過 MiniMax H3 動畫單個關鍵幀,然後將解碼的視頻和音頻多路復用到一個文件中。它組織成小的、可讀的組,以便您可以設置幀大小、編寫創意簡報並渲染。包含一個輔助“使用圖像大小”工具,並默認繞過。
加載您的第一幀 (LoadImage (#114))#
導入您想要動畫化的靜態圖像。此圖形故意將 last_frame 保持未使用狀態,因此運動從這一張圖片開始增長。選擇清晰邊緣和平衡曝光的主題,以獲得最佳的時間穩定性。如果您稍後想要從頭到尾的插值,可以將第二張圖片連接到子圖的 last_frame 輸入。
選擇幀大小 (ResolutionSelector (#115))#
選擇一個長寬比預設並縮放以定義 width 和 height。MiniMax H3 最適合使用 32 的倍數和適中的短邊長進行操作。將比例與您的構圖匹配,這樣當攝影機移動時主題保持舒適地框在畫面中。如果您希望精確地鏡像源尺寸,“使用圖像大小”小組可以讀取它們,但在此預設中未連線以覆蓋選擇器。
描述和計時鏡頭 (MiniMaxH3ImageToVideo (#104) + Float (duration) (#111) + ComfyMathExpression (#107))#
編寫一個將圖片和聲音結合的提示:攝影機移動、主題動作、屏幕上的文字、環境聲音和任何約束條件,如“無對話”或“無音樂”。設置以秒為單位的持續時間;數學節點將其轉換為 MiniMax H3 的內部步驟網格的有效幀 length,以便時間保持一致。第一幀圖像錨定構圖,而模型動畫化運動、照明和尊重您描述的效果。在同一提示中清晰的音頻提示引導生成過程中的聲音軌。
取樣和運動感 (RandomNoise (#15) + KSamplerSelect (#17) + BasicScheduler (#9) + SamplerCustomAdvanced (#14))#
取樣定義潛在視頻的演變方式。選擇的取樣器和調度器提供平衡的外觀;您可以固定種子以重現精確的鏡頭,或隨機化以探索運動替代方案。如果您需要更強的框架或動作依從性,請通過更改種子和措辭來迭代,而不是過度指定參數。這樣保持 MiniMax H3 圖片轉視頻 ComfyUI 創意但可控。
解碼和多路復用 (VAELoader (#11, #24) + VAEDecode + VAEDecodeAudio + CreateVideo (#91))#
去噪後,視頻 VAE 重建幀,音頻 VAE 重建聲音軌。CreateVideo 將它們合併為單個、時間對齊的流。這種設計保留同步,因為兩種模式都來自同一生成過程。您可以快速預覽結果而無需外部編輯器。
保存結果 (SaveVideo (#92))#
最終節點將渲染的剪輯寫入磁盤。輸出包含來自模型的圖像和原生音頻,因此 MiniMax H3 圖片轉視頻 ComfyUI 為您提供一個可共享或分級的完成文件。
Comfyui MiniMax H3 圖片轉視頻 ComfyUI 工作流程中的關鍵節點#
MiniMaxH3ImageToVideo (#104)#
圖形的核心。它融合了您的提示、加載的編碼器/VAEs 和第一幀,以生成具有同步音頻的潛在視頻。調整 prompt 以適應場景和聲音,width 和 height 以適應畫布,length 以適應持續時間。保持尺寸為 32 的倍數,並使用簡潔的音頻指令如“風陣、遠處的海浪、無對話”來引導聲音軌。
ComfyMathExpression (#107)#
將您選擇的秒數轉換為與 MiniMax H3 的內部計時步驟一致的幀數。如果節拍或屏幕上的文字必須在精確時刻落下,請在此調整持續時間並重新渲染。這樣保持剪切點和音頻事件在各個迭代中一致。
ResolutionSelector (#115)#
一種快速目標常見長寬比和像素預算的方法,無需手動計算。選擇適合您的主題的比例,然後向上或向下縮放以獲得速度與細節之間的平衡。如果您在高或寬主題上遇到裁剪問題,請切換比例而不是強制極端縮放。
RandomNoise (#15)#
控制初始潛在狀態。鎖定種子以重現精確的鏡頭,或隨機化以探索不同的運動路徑和音頻事件的微調。對於 A/B 比較,只更改種子以隔離其效果。
可選附加功能#
- 在提示中提前編寫音頻,使用簡短、具體的提示,如“輕柔的雨聲、布料沙沙聲、無人聲”,以便模型平衡環境和動作。
- 對於肖像,將眼睛置於第一幀的中央,避免激進的背景雜亂;這改善時間穩定性並保持注意力集中在主題上。
- 為了滿足品牌或平台需求,先選擇長寬比,然後精煉持續時間和提示;MiniMax H3 圖片轉視頻 ComfyUI 將在您迭代時保持圖像和聲音同步。
- 如果您稍後想要兩幀過渡,將第二張圖片連接到子圖
last_frame輸入,並在同一提示中描述剪切或運動。 - 官方 ComfyUI MiniMax H3 I2V 模板是高級自定義的有用參考。 查看模板
鳴謝#
此工作流程實現並基於以下作品和資源構建。我們誠摯感謝 MiniMaxAI 提供的 MiniMax H3 模型集合,Comfy-Org 提供的官方 ComfyUI MiniMax H3 I2V 模板,以及 Comfy.org 和 RunningHub 提供的 MiniMax H3 教程和工作流程來源的貢獻和維護。有關權威細節,請參閱以下鏈接的原始文檔和存儲庫。
資源#
- RunningHub/工作流程來源
- 文檔 / 發布說明: RunningHub 工作流程來源
- MiniMaxAI/MiniMax H3 模型集合
- Hugging Face: MiniMaxAI/MiniMax-H3
- MiniMax/MiniMax H3 官方公告
- 文檔 / 發布說明: MiniMax H3 官方公告
- Comfy.org/MiniMax H3 教程
- 文檔 / 發布說明: Comfy.org MiniMax H3 教程
- Comfy-Org/ComfyUI 官方 MiniMax H3 I2V 模板
- GitHub: Comfy-Org/workflow_templates
- 文檔 / 發布說明: video_minimax_h3_i2v.json
注意:使用參考的模型、數據集和代碼需遵循其作者和維護者提供的各自許可和條款。

