ComfyUI>工作流程>LTX 2.3 語音與歌唱口型同步視頻製作

LTX 2.3 語音與歌唱口型同步視頻製作

Workflow Name: RunComfy/LTX-2.3-Talking-Sync
Workflow ID: 0000...1461
此工作流程讓您將肖像圖像轉變為語音或歌唱視頻,擁有自然的嘴部同步。它幫助設計師和創作者賦予靜態角色生命,用於故事敘述、音樂視頻或互動內容。基於先進的音頻分離技術,它確保清晰的聲音和精確的嘴部運動。您可以輕鬆生成電影級質量的結果,匹配面部表情和語音節奏。適合數字人類動畫、虛擬歌手和表演測試。

ComfyUI LTX 2.3 Talking and Singing Lip Sync Workflow

LTX 2.3 Talking and Singing Lip Sync in ComfyUI | Portrait2Video Sync
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Talking and Singing Lip Sync Examples

LTX 2.3 語音與歌唱口型同步:肖像到表演的 ComfyUI 工作流程#

LTX 2.3 語音與歌唱口型同步將清晰的正面肖像和語音或歌曲轉變為具有表情豐富、同步嘴部運動的數字人類影片。專為 RunComfy 打造,使用 LTX 2.3 視頻生成與 LTXV ComfyUI 節點和 Mel-Band RoFormer 音頻分離技術,確保面部可讀性,同時匹配語音或歌詞。

此 ComfyUI 工作流程適用於 AI 音樂視頻、虛擬歌手、角色表演測試和創作者演示,要求螢幕上的表演者和最終音頻都保持可用性。您提供肖像圖像和音頻軌道,選擇幀率和時長,管道將生成一個與您的音軌同步的 mp4。

注意: 為了獲得特別令人印象深刻的結果,我們強烈建議使用 Ace Step Model 生成歌曲,然後使用 Seedream 5.0 Pro 創建清晰的電影肖像。使用這兩個資產作為音頻和肖像輸入,以獲得更精緻的歌唱數字人類表演。

Comfyui LTX 2.3 語音與歌唱口型同步工作流程中的關鍵模型#

  • LTX-2.3 視頻生成模型由 Lightricks 開發。一個基於變換器的音視頻生成器,將音頻特徵與視覺運動結合,生成適合語音和歌唱的時間連貫幀。模型卡官方倉庫
  • LTX-2.3 視頻 VAE 和音頻 VAE。潛在編碼器/解碼器,將視頻和音頻打包進入 LTX-2.3 使用的 AV 潛在空間,確保高效取樣和清晰重建。在 LTX ComfyUI 集成中實現。ComfyUI-LTXVideo
  • MelBandRoFormer。這裡使用的現代音樂源分離模型,用於選擇性提取人聲,以便在保持原始混音的同時進行更清晰的嘴部條件。權重ComfyUI 節點

如何使用 Comfyui LTX 2.3 語音與歌唱口型同步工作流程#

該工作流程分三個階段運行:輸入、LTX 2.3 生成和導出。組合端對端協作,將您的肖像和音頻轉變為同步表演。

輸入#

使用 Character Image (front view + 9:16, recommended) (#444) 加載正面肖像。圖像會被調整大小以適合模型,並輕微預處理以保留身份和嘴部區域細節。使用 Upload Song or Voice (#1755) 上傳您的歌曲或語音,然後設置 Start lip-sync from which second? e.g. 10.0 (seconds) (#1776) 如果您想跳過引言或靜音部分。選擇一個持續時間,使用 Duration in seconds (best under 35s; enter 0 for full audio) (#1583) 並設置 Frame Rate (#1586) 為渲染。寫下意圖提示在 Prompt (#1624) 中,以指導表情和攝像機行為;工作流還注入有用的負面提示以避免字幕、水印和靜態幀。

LTX2.3 數字人類語音/歌唱口型同步#

您的肖像通過 LTXV Preprocess (#446) 和 LTXVImgToVideoInplaceKJ (#1762) 轉變為初始潛在片段。使用 IMG STRENGTH. Set 0 for T2I mode (#1722) 控制肖像的強制程度:更高的值會鎖定照片,而較低的值允許更多生成運動。音頻路徑修剪您的上傳,選擇性地用 Mel-Band RoFormer Sampler (#1599) 分離人聲,並通過 LTXV Audio VAE Encode (#1605) 編碼選擇的曲目。音頻和視頻潛在內容由 LTXV Concat AV Latent (#350) 融合,並由 CLIP Text Encode 節點驅動的文本條件來驅動整體場景意圖和清潔度,通過 LTXVConditioning (#164) 實現。使用 LTX2 NAG (#508) 修補和指導 LTX-2.3 模型以達到嘴部精度,然後在選定的調度器和取樣器下使用 SamplerCustomAdvanced (#161) 進行取樣。

導出和保存#

取樣後,視頻潛在內容通過 VAE Decode (#1318) 解碼為幀。Video Combine 🎥🅥🅗🅢 (#1747) 將這些幀與修剪過的原始音頻合併,生成您選擇幀率的 mp4。如果您啟用了僅有人聲以進行條件化,最終導出仍使用完整混音,因此您的結果仍然可以共享。輸出以清晰的前綴保存,以便輕鬆版本控制。

Comfyui LTX 2.3 語音與歌唱口型同步工作流程中的關鍵節點#

LTXVImgToVideoInplaceKJ (#1762)#

將參考肖像轉換為初始潛在視頻。調整 IMG STRENGTH. Set 0 for T2I mode (#1722) 以平衡身份鎖定與運動自由度。為了保持緊密的相似性和穩定的頭部姿勢,保持強度更高;為了更具表演性的運動,減少強度。如果您將其設置為 0,請將工作流視為文本到視頻,更多依賴於提示和音頻。

Mel-Band RoFormer Sampler (#1599)#

從歌曲中分離人聲,以提供更清晰的語音特徵給模型使用。當樂器主導或輔音丟失時,使用 USE VOCALS ONLY (#1616);當您希望完整混音影響表現力時,保持關閉。最終渲染使用修剪過的原始音頻,保留您預期的音軌。請參閱 ComfyUI 擴展和權重中鏈接的模型詳細信息。

LTXV Audio VAE Encode (#1605)#

將選擇的音頻編碼到 LTX 音頻潛在空間中,驅動嘴部形狀和微表情。在編碼前修剪明顯的靜默以實現更快速的對齊。如果您的歌詞不從 0 秒開始,請搭配開始時間偏移使用。

LTX2 NAG (#508)#

應用針對 LTX 2.3 的噪聲增強引導,以加強音頻到嘴部的耦合。如果嘴部動畫不夠,稍微提高其引導;如果牙齒或嘴部形狀過度驅動,降低效果。小的、漸進的變化效果最好,因為此控制與您的提示強度和取樣器設置相互作用。參考實現位於 LTX 倉庫中。

SamplerCustomAdvanced (#161)#

使用您選擇的 KSamplerSelect (#154)、CFG Guider (#153) 和調度器運行去噪過程。較低的分類器自由引導通常有利於自然運動和身份保留;較高的值增加提示優勢但可能使嘴部僵硬。如果您更換取樣器,保持其餘設置不變以進行公平的 A/B 比較。

Video Combine 🎥🅥🅗🅢 (#1747)#

通過合併幀和修剪過的音頻寫入最終 mp4。保持默認設置以獲得廣泛的兼容性,或者如果您計劃稍後進行色彩調整,則提高質量。確保 frame_rate 符合您的創意意圖並與您先前設置的匹配。

可選附加功能#

  • 使用乾淨、正面的肖像,具有中性光線和 9:16 裁剪,以獲得最令人信服的 LTX 2.3 語音與歌唱口型同步結果。
  • 如果樂器掩蓋了輔音,啟用 USE VOCALS ONLY (#1616),使模型在條件化時使用更清晰的人聲干軌,而導出保留完整混音。
  • 將片段保持在約 35 秒以下,以便更快速的迭代;如果您正在製作長音樂視頻,請在外部拼接片段。
  • 當運動過於靜態時,降低 IMG STRENGTH;當身份漂移時,提高它並簡化提示。
  • 通過修剪前導靜音和使用開始時間偏移控制來對齊歌詞,以便嘴部形狀正好從您的第一個字開始。
  • 設置固定的 Start Seed 以重現一次拍攝,然後變更種子以獲得替代方案。
  • 在公共項目中使用此 LTX 2.3 語音與歌唱口型同步工作流程時,尊重肖像和音樂權利。

官方資源鏈接

致謝#

此工作流程實現並基於以下作品和資源。我們誠摯地感謝 Lightricks 的 LTX-Video(包括 LTX 2.3 模型和 ComfyUI-LTXVideo 節點)、Kijai 的 MelBandRoFormer(ComfyUI 節點和模型權重)以及 RunningHub 的工作流程源文章對他們的貢獻和維護。欲了解權威詳情,請參考下方鏈接的原始文檔和倉庫。

資源#

注意:使用參考模型、數據集和代碼需遵守其作者和維護者提供的相關許可和條款。

RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。