ComfyUI MiniMax H3 說話數位人類:從肖像和語音到嘴唇同步的化身影片#
此工作流程將單個正面肖像和短語音參考轉換為高質量的說話頭片段,並在 RunComfy 上同步語音。圍繞 MiniMax H3 參考到影片和音頻的 QwenVL 圖像基礎構建,它在生成您的樣本語音時保持身份和背景。ComfyUI MiniMax H3 說話數位人類非常適合產品解說、主持人化身、社交帖子和短代言人影片,而無需單獨的 TTS 或嘴唇同步堆疊。
您提供一張圖像和一段語音片段。工作流程推斷面部和場景的緊湊描述,並以該指導條件 MiniMax H3,協同生成影片幀和匹配的音頻在統一的潛在中,使嘴唇和語音保持對齊。結果被渲染為單一影片文件,您可以下載和分享。
Comfyui ComfyUI MiniMax H3 說話數位人類工作流程的關鍵模型#
- MiniMax H3 Reference-to-Video-and-Audio 擴散模型。核心生成器,使用肖像和可選音頻作為參考,生成同步的說話頭。由 Comfy-Org 託管,便於在 ComfyUI 中使用。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Video VAE。編碼和解碼 MiniMax H3 使用的共享潛在空間的影片部分,有助於保持身份和背景穩定。與相同模型包分發。Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Audio VAE。編碼和解碼共享潛在的音頻部分,使語音與嘴巴運動同步生成。同樣可在模型包中獲得。Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 4B Instruct。用於在上傳的肖像中基於視覺細節進行提示的視覺語言模型,提高身份保留和場景一致性。Hugging Face: Qwen/Qwen3-VL-4B-Instruct
如何使用 Comfyui ComfyUI MiniMax H3 說話數位人類工作流程#
此工作流程分為四個區域:上傳和編輯部分、持續時間助手、MiniMax H3 生成核心和輸出階段。從左到右工作,從媒體輸入開始,然後是提示指導,然後運行生成並保存影片。
上傳/編輯區域:通常僅在此更改;其餘保持默認#
使用 LoadImage (#137) 上傳單個正面角色肖像。正面或接近正面的取景,眼睛和嘴巴可見,最適合自然的嘴唇運動。使用 LoadAudio (#141) 上傳您想模仿音色的乾淨語音樣本;它可以是幾秒鐘的談話,背景噪音最小。如果需要,使用 AudioCrop (#142) 修剪語音樣本,設置開始和結束為您希望化身匹配的語段。在 Prompt (#138) 中添加任何風格或內容指導;工作流程將附加自動圖像基礎細節以提高一致性。
影片持續時間(秒):#
使用持續時間組頂部的數字控制設置目標持續時間。助手 ComfyMathExpression (#131) 將秒數轉換為模型的有效幀數,並將其對齊到採樣器的要求。這保持時間穩定,避免在音素中途截斷。如果您稍後更改持續時間,請更新音頻修剪,以便最終語音和嘴唇運動對齊。
MiniMax-H3 開源 - 圖像說話數位人類#
這是圍繞 MiniMaxH3ReferenceToVideo (#136) 構建的核心生成路徑。節點接受您的肖像作為參考圖像,您的修剪語音片段作為參考音頻,以及選擇器的寬度、高度和長度。基於 QwenVL 的肖像描述與您的書面提示結合,以便模型獲得視覺基礎和您的指示。模型發出一個包含影片和音頻的單一潛在,以及採樣器堆疊使用的條件,因此嘴唇同步在沒有單獨嘴唇同步階段的情況下非常穩定。
使用 QwenVL 進行提示基礎#
AILab_QwenVL (#152) 分析上傳的肖像並返回簡潔、事實性的描述。工作流程通過 JoinStrings (#150, #148, #144) 將該描述與您的指令文本連接起來,生成最終提示,告訴模型保持背景不變並使用您的音頻作為語音。這種自動基礎顯著增強了身份和背景的穩定性。您可以保持書面提示簡短,讓基礎填寫準確的面部和場景細節。
分辨率/影片縱橫比#
使用 ResolutionSelector (#115) 選擇縱橫比和目標分辨率。它輸出寬度和高度,對模型和您的 GPU 友好,核心節點直接使用。對於肖像化身,較高的縱橫比保持更多主體,同時為自然的頭部運動留出空間。如果在測試後調整縱橫比,請在輸入肖像中保持相同的取景,以獲得一致的結果。
輸出生成的影片#
採樣器路徑去噪聯合潛在,然後 VAEDecode (#122) 將其轉換為幀,而 VAEDecodeAudio (#121) 將其轉換為波形。CreateVideo (#130) 合併幀和音頻成單個片段,您選擇的幀率,SaveVideo (#92) 寫入文件。保存的結果包含來自相同生成運行的圖片和同步語音。下載並檢查;如果時間感覺不對,調整音頻修剪或持續時間,然後再次運行。
Comfyui ComfyUI MiniMax H3 說話數位人類工作流程的關鍵節點#
MiniMaxH3ReferenceToVideo (#136)#
管道的核心,接受參考肖像和語音樣本,協同生成影片和音頻。關鍵控制項是內容和風格的 prompt、取景的 width 和 height、以及幀數的 length。使用單一、清晰的肖像作為第一個參考圖像,並保持 ref_image_size 匹配,以便面部比例正確轉移。如果看到漂移或背景變化,請加強您的指令文本,明確保持背景不變。
ResolutionSelector (#115)#
設置縱橫比和整體像素數,然後發出對模型友好的寬度和高度。選擇與肖像裁剪匹配的縱橫比,以減少重採樣工件。增加總分辨率可以提高細節,但也會增加 VRAM 和時間;在放大之前,在較小的設置下測試。保持跨運行的一致取景以獲得可重現的身份。
AudioCrop (#142)#
將上傳的參考語音修剪到您希望化身說的片段。設置開始和結束為語段,末端留出小的沉默餘量,以便自然的開始和結束。將修剪的音頻長度與目標影片持續時間匹配,有助於生成器將音素與嘴形對齊。如果爆破音或齒擦音看起來不對,嘗試更乾淨的錄音或縮短修剪範圍。
AILab_QwenVL (#152)#
生成自動附加到您的提示的圖像基礎描述。這增加了關於面部、頭髮、衣服和背景的具體細節,這有助於模型保持身份和場景。如果基礎描述過度約束風格,保持您的書面提示簡潔和中性,以便基礎能夠發揮作用。對於多角色圖像,請上傳更緊密的裁剪,以便描述專注於單一主題。
CreateVideo (#130)#
將解碼的幀和音頻合併為單個可播放文件。如果需要與下游時間線匹配,可以更改 fps,但請保持與之前的持續時間到幀轉換一致。如果在某些平台上看到卡頓,請以該平台的常見幀率重新導出。bit_depth 控制可以保留默認值以便在網絡上傳輸。
ComfyMathExpression (#131)#
將您的持續時間(秒)轉換為生成器的有效幀數,並將其對齊到採樣器的步幅。這防止了可能導致時間漂移的部分步驟。如果您在下游更改幀率,請重新訪問持續時間以保持嘴唇運動與音節對齊。將此節點視為整個運行的時間來源真相。
可選附加項#
- 使用乾淨、光線均勻的肖像,眼睛和嘴巴不被遮擋,以獲得最自然的表達。
- 在安靜的房間中錄製 5 到 10 秒的清晰語音;避免在參考剪輯中出現音樂或重度壓縮。
- 為獲得可重現的結果,將
RandomNoise種子固定在RandomNoise(#129) 中,而不是在運行之間隨機化。 - 如果需要字幕,請在後期添加,而不是將其嵌入提示中,這樣模型可以專注於面部和語音。
- 創建 ComfyUI MiniMax H3 說話數位人類時,請尊重真實人物的肖像和語音權利。
致謝#
此工作流程實現並建立在以下作品和資源之上。我們感謝 MiniMax 提供的 MiniMax H3 模型,Comfy-Org 提供的 MiniMax-H3 模型權重,以及 Comfy.org 提供的 MiniMax H3 教程的貢獻和維護。有關權威詳細信息,請參閱以下鏈接的原始文檔和存儲庫。
資源#
- MiniMax/MiniMax H3 官方公告
- 文檔/發布說明:MiniMax H3 官方公告
- Comfy-Org/MiniMax-H3 模型權重
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org/MiniMax H3 教程
- GitHub: comfy-org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- 文檔/發布說明:Comfy.org MiniMax H3 教程
注意:使用參考的模型、數據集和代碼需遵循其作者和維護者提供的相應許可和條款。

