ComfyUI>工作流程>MiniMax H3 T2V ComfyUI - AI 文字轉影片生成器

MiniMax H3 T2V ComfyUI - AI 文字轉影片生成器

Workflow Name: RunComfy/MiniMax-H3-T2V
Workflow ID: 0000...1472
將一個提示轉換為完整的影片場景。您將獲得電影級的運動和原生立體聲音效。創建對話、歌唱或概念鏡頭。MiniMax H3 文字轉影片圖形保持音頻同步。您可以更快地測試想法。在 RunComfy 上直接運行。

MiniMax H3 T2V ComfyUI Workflow

MiniMax H3 T2V ComfyUI - Video and Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 T2V ComfyUI Examples

MiniMax H3 T2V ComfyUI:提示轉換為影片,具原生立體聲音效#

MiniMax H3 T2V ComfyUI 將單一提示轉換為具有同步立體聲音效的短片。基於官方 Comfy.org 模板和開放的 Comfy-Org MiniMax-H3 權重,遵循 FL2VA 路徑,運動和聲音同步生成,而非事後拼接。非常適合快速探索僅提示的場景、對話或歌唱片段,以及需要在一次通過中呈現影像和聲音的概念鏡頭。

在一個區塊中描述鏡頭、攝影機、表演和音頻提示,選擇大小和持續時間,然後排隊圖形。工作流程加載正確的 MiniMax-H3 組件,採樣聯合音視頻潛在變量,解碼為幀和立體聲音頻,混合結果並保存完成的影片文件。

Comfyui MiniMax H3 T2V ComfyUI 工作流程中的關鍵模型#

如果您想比較此圖形構建的原始模板,請參閱 Comfy.org 參考。模板 JSON

如何使用 Comfyui MiniMax H3 T2V ComfyUI 工作流程#

在高層次上,您設置目標分辨率和持續時間,撰寫一個包含影像和音頻的單一提示,選擇性地添加首幀和末幀,然後運行。在子圖中,MiniMax-H3 創建同步的視頻和音頻潛在變量,這些變量被解碼、合併成 24 fps 的影片,並保存。

ResolutionSelector (#115)#

選擇一個長寬比和比例來設置 widthheight。選擇器將四捨五入為 32 的倍數,並將這些值傳遞給 MiniMax-H3 子圖,因此您不需要手動計算尺寸。從中等大小開始以便更快的迭代,然後在提示正確讀取後放大。改變長寬比是預告片、豎直片段和方形預覽的一個強大創意槓桿。

Image to Video (MiniMax H3) (#105)#

此子圖協調 MiniMax H3 T2V ComfyUI 管道。粘貼一個描述鏡頭、編輯和音軌的連貫提示,並選擇性地提供 first_framelast_frame 圖像來錨定入口和出口。設置一個符合人類習慣的 duration,圖形將其轉換為模型的有效幀數。子圖返回同步的音視頻潛在變量,進行解碼和混合。

模型群組#

模型群組加載此工作流程的確切 MiniMax-H3 組件。UNETLoader (#6) 提取 FL2VA 擴散模型,CLIPLoader (#13) 加載 Qwen3-VL 編碼器,兩個 VAELoader 節點 (#11 視頻,#24 音頻) 準備解碼器。這些都指向 Comfy-Org MiniMax-H3 文件,因此您可以在不需要手動連線的情況下運行。將模型集中在這裡使未來的更換或升級變得簡單。

條件群組#

MiniMaxH3ImageToVideo (#104) 將您的提示、選擇性的 first_framelast_frame,以及選定的 widthheightlength 轉化為 MiniMax-H3 條件加上初始潛在變量。想法是讓模型同時讀取場景內容和音頻意圖,這導致更緊密的同步。如果您提供參考幀,則入口和出口會有連續性指導;如果您留空,則生成從冷啟動開始。

取樣群組#

取樣由 RandomNoise (#15)、KSamplerSelect (#17)、BasicScheduler (#9)、BasicGuider (#16) 和主要的 SamplerCustomAdvanced (#14) 處理。它們一起去噪聯合潛在變量,使畫面運動和聲音事件同步發展。您可以使用新種子重新運行以獲得替代拍攝,同時保持相同的創意方向。一旦舒適後,嘗試更改取樣器選擇或時間表可以稍微改變運動能量和聲音質感。

解碼和創建影片群組#

VAEDecode (#10) 從視頻潛在變量重建幀序列,VAEDecodeAudio (#23) 從音頻潛在變量重建立體波形。CreateVideo (#91) 將幀和音頻在 24 fps 下多路復用為完成的影片。這是提示中指定的清晰剪輯和節拍在時間軸上匯聚的地方。輸出進行保存。

SaveVideo (#92)#

將最終影片寫入您的 ComfyUI 輸出下的 video/MiniMax_H3。此節點使用自動命名,讓您可以快速迭代,並且您可以更改路徑以保持不同項目分開。輸出包含生成的影像和立體聲音頻。

Comfyui MiniMax H3 T2V ComfyUI 工作流程中的關鍵節點#

MiniMaxH3ImageToVideo (#104)#

MiniMax-H3 的核心條件節點,接受 prompt、可選的 first_framelast_frame,以及 widthheightlength。保持提示簡明但具電影感,並在同一文本塊中包含音頻提示如氛圍、SFX、對話和音樂重點。當需要特定入口或出口時,使用參考幀;省略它們以獲得更自由的場景。

ComfyMathExpression (#107)#

將人類可讀的 duration 映射為模型期望的整數 length,並對齊到模型的幀網格以獲得清晰的時間。將浮點設置為您預期的片段長度,讓節點處理轉換。稍短的片段往往能在更高的分辨率下保持清晰的運動和聲音同步。

SamplerCustomAdvanced (#14)#

根據選擇的取樣器和時間表驅動去噪過程。使用固定的 noise_seed 鎖定一個拍攝進行比較,然後僅更改種子以探索新變化。如果運動感覺太混亂或太僵硬,嘗試在 KSamplerSelect (#17) 中選擇不同的取樣器或在 BasicScheduler (#9) 中調整時間表。

CreateVideo (#91)#

將解碼的幀和立體聲音頻合併為一個單一的影片流,使用您選擇的幀速率。對於節奏驅動的編輯,設置 fps 以匹配您在提示中描述的節奏。此節點也是您想改變 fps 以獲得更慢或更快的感覺的地方。

ResolutionSelector (#115)#

一個控制長寬比和整體像素數的控制器,具有自動四捨五入到模型友好大小的功能。首先選擇長寬比,然後微調比例以平衡速度和清晰度。更大的畫布回報仔細的提示和較短的持續時間。

SaveVideo (#92)#

將片段最終保存到磁碟。將其指向一個項目子文件夾,以保持實驗有序,並在您找到理想片段時明智地重命名。

可選附加功能#

  • 將提示寫成迷你分鏡腳本,帶有時間提示和明確的音頻節拍以獲得可靠的同步。
  • 包括音頻意圖詞如風、腳步聲、人群、混響或特定樂器以引導音軌。
  • 直接在提示中添加對話或歌唱的台詞,並註明說話者的語調。
  • 鎖定 noise_seed 在比較提示調整時,僅更改種子以探索替代拍攝。
  • 在需要跨剪輯的連續性或精確的最終姿勢時,使用 first_framelast_frame 來括住運動。

致謝#

此工作流程實施並基於以下作品和資源。我們感謝 Comfy-Org 提供的 MiniMax H3 T2V 工作流程模板和 MiniMax-H3 模型權重,Comfy.org 的 MiniMax H3 教程,以及 MiniMax 的官方 MiniMax H3 公告對他們的貢獻和維護。如需權威詳情,請參考下列鏈接的原始文件和倉庫。

資源#

注意:使用所參考的模型、數據集和代碼需遵循其作者和維護者提供的各自許可和條款。

RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。