MiniMax H3 ComfyUI 說話與唱歌雙角色四步加速#
這個 RunComfy-ready 工作流程將兩張肖像靜態圖片和一段短的演講或唱歌音軌轉換為單一口型同步影片,兩個角色共享場景。基於 MiniMax H3 參考到影片與官方 Turbo LoRA,提供少步驟生成,同時保持兩者身份穩定,口型運動鎖定到您的源音頻。
MiniMax H3 ComfyUI 說話與唱歌雙角色四步加速是二重唱、兩人對話節拍、預告片或快速表演預覽的理想選擇。您帶來兩張圖片和一個音頻文件,添加一個簡短的提示,選擇一個尺寸,圖表會渲染一個帶有原聲音軌的 mp4。
Comfyui MiniMax H3 ComfyUI 說話與唱歌雙角色四步加速工作流程中的關鍵模型#
- MiniMax-H3 參考到影片骨幹來自 Comfy-Org — 生成模型將您的參考和文本映射到音頻-視覺潛在空間進行影片合成。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — 編碼和解碼影片潛在空間,以便幀可以有效去噪並以高保真度重建。包含在模型包中。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — 在潛在空間中表示驅動音頻,因此您的音軌學習口型運動和時間。包含在模型包中。Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B 文本編碼器 (AWQ/NVFP 變種打包給 H3) — 解釋您的提示以設置場景、風格和雙角色合成的鏡頭意圖。包含在模型包中。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA — 加速取樣,您可以用四個去噪步驟渲染,同時保留身份和口型同步。Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
如何使用 Comfyui MiniMax H3 ComfyUI 說話與唱歌雙角色四步加速#
這個圖從左到右流動:您加載兩張角色靜態圖片和一段音頻剪輯,設置提示和尺寸,然後核心 H3 路徑將參考和音頻融合成一個 AV 潛在空間。一個短的音頻鎖定階段保留您的原聲音軌,同時驅動口型運動,Turbo LoRA 的取樣器執行少步驟去噪,然後組裝最終影片。
- 上傳圖片 (角色 A)
- 將一張清晰、正面面向的靜態圖片放入
LoadImage(#227) 給角色 A。優先選擇與角色 B 相似的頭部大小和光線以保持穩定共存。背景可以簡單,身份和姿勢是優先事項。這個節點將餵給 H3 參考堆疊,以便模型學習誰是共享場景中的第一位講者。
- 將一張清晰、正面面向的靜態圖片放入
- 上傳圖片 (角色 B)
- 在
LoadImage(#137) 提供角色 B。保持取景、方向和表情與角色 A 大致相同,以減少鏡頭間的漂移。這第二個參考讓 H3 合成一個雙鏡頭,其中兩個人保持一致,同時對彼此說話或唱歌。
- 在
- 上傳音頻
- 在
LoadAudio(#171) 添加您的對話或歌聲。使用AudioCrop(#177) 設置開始和結束時間,以便剪輯長度符合您想要的段落。清晰、居中的音頻改善口型表達並減少時間抖動。
- 在
- 提示
- 在
Input Text (Prompt)(#138) 中描述鏡頭。簡短的電影式措辭效果很好,例如描述相機距離、背景和兩個角色的情緒。提示引導布局和風格,而不取代靜態圖片的身份指導和您的音軌的時間。
- 在
- 分辨率選擇器 (尺寸)
- 在
Resolution Selector (Size)(#115) 中選擇縱橫比和目標尺寸。選擇器輸出已對齊到模型友好倍數的寬度和高度,以平衡細節和速度。內建的尺寸說明提供即用的 16:9 預設,您可以選擇適合您的 GPU 預算的百萬像素等級。
- 在
- 結果
- 幀解碼並在
VHS_VideoCombine(#142) 中與原始音頻混合生成 mp4。如果您的渲染稍微長或短,使用此步驟中的內建切換來修剪到音頻長度。文件名和格式已預配置以便快速迭代。
- 幀解碼並在
- 核心 (請勿修改)
- 在這個保護區域內,
MiniMaxH3ReferenceToVideo(#136) 將兩個參考圖像、提示和裁剪的音頻融合成一個聯合 AV 潛在空間和正向調節。VRGDG_MiniMaxH3AudioDrive(#172) 鎖定源音頻,使口型同步跟隨您的音軌,同時原聲音軌不變地傳遞。UNet 已修補以提高記憶效率,LoraLoaderModelOnly(#234) 在取樣器去噪之前應用 Turbo 4-step LoRA,VAEDecode重建幀。這些內部已調整為穩定性和速度,因此通常不需要調整它們。
- 在這個保護區域內,
Comfyui MiniMax H3 ComfyUI 說話與唱歌雙角色四步加速工作流程中的關鍵節點#
MiniMaxH3ReferenceToVideo(#136)- 圖的核心,攝取兩個角色靜態圖片、您的提示、寬度、高度和自動計算的剪輯長度。它還接受裁剪的音頻作為參考,以便音素時間和表情形狀與聲音軌道對齊。如果您需要更緊密的控制,可以直接調整
prompt、width、height,或覆蓋length以適應特殊時間。
- 圖的核心,攝取兩個角色靜態圖片、您的提示、寬度、高度和自動計算的剪輯長度。它還接受裁剪的音頻作為參考,以便音素時間和表情形狀與聲音軌道對齊。如果您需要更緊密的控制,可以直接調整
VRGDG_MiniMaxH3AudioDrive(#172)- 確保最終影片使用相同的音頻軌道,同時將口型運動鎖定到提供的源音頻。當您需要精確的歌詞或對話時間而不進行任何生成音頻更改時,使用此功能。提供乾淨的歌聲或對話以獲得最佳效果。
LoraLoaderModelOnly(#234)- 加載 MiniMax-H3 Turbo 4-step LoRA,以便取樣器可以在非常少的步驟中收斂。如果您偏好較慢但可能更保守的去噪,可以減少 LoRA 的影響;為了最大速度,保持默認強度。模型參考:MiniMax-H3 Turbo LoRA。
SamplerCustomAdvanced(#125)- 使用上游選擇的計劃器和取樣器進行實際去噪。Turbo LoRA 啟動時,您可以用最少步驟快速渲染;僅在您看到運動不穩定時增加步驟。種子控制來自
RandomNoise(#129) 以便於重現的採樣。
- 使用上游選擇的計劃器和取樣器進行實際去噪。Turbo LoRA 啟動時,您可以用最少步驟快速渲染;僅在您看到運動不穩定時增加步驟。種子控制來自
Resolution Selector (Size)(#115)- 輸出模型對齊的寬度和高度,這樣您不需要處理倍數或縱橫比數學。使用它在預覽、中等和最終尺寸之間跳轉,同時保持構圖一致。較大尺寸增加身份細節,但需要更多 VRAM 和時間。
AudioCrop(#177)- 修剪輸入音頻到您想要動畫的精確段落。使用此功能剪除靜音或隔離一段詩句或對話節拍。清晰的進出點幫助口型開合時間。
VHS_VideoCombine(#142)- 將解碼幀和傳遞音頻組合成可共享的 mp4。使用內建選項將持續時間對齊到聲音軌道,並設置文件名慣例。這是 MiniMax H3 ComfyUI 說話與唱歌雙角色四步加速輸出的最終交付步驟。
可選附加項#
- 匹配兩張圖片中的主題比例和面部角度,以最小化身份漂移。
- 保持提示簡潔且視覺化:相機距離、設置、情緒和光照提示。
- 在迭代時使用噪聲種子,以便可靠地 A/B 變更。
- 如果剪輯稍微超出,啟用合併步驟的修剪以獲得幀準確的同步。
- 從中等分辨率開始,然後在屏蔽和時間看起來正確後再放大。
致謝#
此工作流程實施並建立在以下工作和資源之上。我們衷心感謝 MiniMax Research 提供的 MiniMax H3,Comfy.org 提供的 ComfyUI MiniMax H3 教程,以及 Comfy-Org 和 larryvrh 提供的 MiniMax-H3 模型權重和 MiniMax-H3 Turbo LoRA 的貢獻和維護。欲了解更多詳細信息,請參閱以下鏈接的原始文檔和存儲庫。
資源#
- MiniMax Research/MiniMax H3 官方公告
- 文檔 / 發布說明: MiniMax H3 官方公告
- Comfy.org/MiniMax H3 教程
- GitHub: Comfy-Org/docs
- 文檔 / 發布說明: Comfy.org MiniMax H3 教程
- Comfy-Org/MiniMax-H3 模型權重
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
注意:使用引用的模型、數據集和代碼需遵循其作者和維護者提供的各自許可和條款。

