LTX 2.3 Sincronizzazione delle Labbra Parlante e Cantante: Flusso di Lavoro ComfyUI da Ritratto a Performance#
LTX 2.3 Sincronizzazione delle Labbra Parlante e Cantante trasforma un ritratto frontale chiaro e una voce o canzone in un video digitale umano cinematografico con movimento della bocca espressivo e sincronizzato. Costruito per RunComfy, utilizza la generazione video LTX 2.3 con nodi LTXV ComfyUI e separazione audio Mel-Band RoFormer per mantenere il volto leggibile mentre abbina discorsi o testi.
Questo flusso di lavoro ComfyUI è adatto a video musicali AI, cantanti virtuali, test di performance di personaggi e demo di creatori dove sia il performer sullo schermo che l'audio finale devono rimanere utilizzabili. Fornisci un'immagine di ritratto e una traccia audio, scegli una frequenza di fotogrammi e una durata, e la pipeline renderizza un mp4 con sincronizzazione labiale allineata alla tua traccia.
Nota: Per risultati particolarmente impressionanti, consigliamo vivamente di generare la canzone con Ace Step Model, quindi creare un ritratto cinematografico chiaro con Seedream 5.0 Pro. Usa questi due asset come input audio e ritratto per questo flusso di lavoro per ottenere una performance di umani digitali più raffinata.
Modelli chiave nel flusso di lavoro Comfyui LTX 2.3 Sincronizzazione delle Labbra Parlante e Cantante#
- Modello di generazione video LTX-2.3 di Lightricks. Un generatore audio-video basato su transformer che accoppia caratteristiche audio con movimento visivo per produrre fotogrammi temporalmente coerenti adatti a parlato e canto. Model card e repository ufficiale.
- LTX-2.3 Video VAE e Audio VAE. Codificatori/decodificatori latenti che impacchettano video e audio nello spazio latente AV utilizzato da LTX-2.3, garantendo campionamento efficiente e ricostruzione pulita. Implementato nell'integrazione LTX ComfyUI. ComfyUI-LTXVideo.
- MelBandRoFormer. Un moderno modello di separazione delle fonti musicali utilizzato qui per estrarre opzionalmente voci per un condizionamento labiale più pulito mantenendo il mix originale per il render finale. Weights e nodo ComfyUI.
Come usare il flusso di lavoro Comfyui LTX 2.3 Sincronizzazione delle Labbra Parlante e Cantante#
Il flusso di lavoro si svolge in tre fasi: Input, generazione LTX 2.3 e Esportazione. I gruppi lavorano insieme da un capo all'altro per trasformare il tuo ritratto e audio in una performance sincronizzata.
INPUT#
Carica un ritratto frontale usando Character Image (front view + 9:16, recommended) (#444). L'immagine viene ridimensionata per il modello e leggermente preprocessata per preservare l'identità e i dettagli della regione della bocca. Carica la tua canzone o voce con Upload Song or Voice (#1755), quindi imposta Start lip-sync from which second? e.g. 10.0 (seconds) (#1776) se vuoi saltare le barre introduttive o il silenzio. Scegli una durata con Duration in seconds (best under 35s; enter 0 for full audio) (#1583) e imposta Frame Rate (#1586) per il render. Scrivi un prompt di intento in Prompt (#1624) per guidare l'espressione e il comportamento della telecamera; il flusso di lavoro inietta anche utili suggerimenti negativi per evitare sottotitoli, filigrane e fotogrammi statici.
LTX2.3 Umano Digitale Parlante/Cantante Sincronizzazione delle Labbra#
Il tuo ritratto viene trasformato in una clip latente iniziale da LTXV Preprocess (#446) e LTXVImgToVideoInplaceKJ (#1762). Controlla quanto fortemente il ritratto viene applicato usando IMG STRENGTH. Set 0 for T2I mode (#1722): valori più alti bloccano sulla foto, mentre valori più bassi consentono più movimento generativo. Il percorso audio taglia il tuo upload, separa opzionalmente le voci con Mel-Band RoFormer Sampler (#1599), e codifica la traccia scelta attraverso LTXV Audio VAE Encode (#1605). I latenti audio e video sono fusi da LTXV Concat AV Latent (#350), e il condizionamento del testo dai nodi CLIP Text Encode guida l'intento generale della scena e la pulizia tramite LTXVConditioning (#164). Il modello LTX-2.3 viene patchato e guidato per la precisione labiale usando LTX2 NAG (#508), quindi campionato con SamplerCustomAdvanced (#161) sotto il pianificatore e il campionatore selezionati.
Esporta e salva#
Dopo il campionamento, il latente video viene decodificato da VAE Decode (#1318) in fotogrammi. Video Combine 🎥🅥🅗🅢 (#1747) combina quei fotogrammi con il tuo audio originale tagliato per produrre un mp4 alla frequenza di fotogrammi scelta. Se hai attivato solo voci per il condizionamento, l'esportazione finale utilizza comunque il mix completo in modo che il tuo risultato rimanga pronto per essere condiviso. L'output viene salvato con un prefisso chiaro per una facile versioning.
Nodi chiave nel flusso di lavoro Comfyui LTX 2.3 Sincronizzazione delle Labbra Parlante e Cantante#
LTXVImgToVideoInplaceKJ (#1762)#
Converte il ritratto di riferimento in un video latente iniziale. Regola IMG STRENGTH. Set 0 for T2I mode (#1722) per bilanciare il blocco dell'identità rispetto alla libertà di movimento. Per una somiglianza stretta e una postura della testa stabile, mantieni la forza più alta; per un movimento più performante, riducila. Se lo imposti a 0, tratta il flusso di lavoro come text-to-video e affidati di più al prompt e all'audio.
Mel-Band RoFormer Sampler (#1599)#
Separa le voci da una canzone per alimentare caratteristiche del discorso più pulite nel modello. Usa USE VOCALS ONLY (#1616) quando lo strumentale è dominante o quando le consonanti si perdono; tienilo spento quando vuoi che il mix completo influenzi l'espressività. Il render finale utilizza l'audio originale tagliato, preservando la tua colonna sonora prevista. Vedi i dettagli del modello nell'estensione ComfyUI e nei pesi collegati sopra.
LTXV Audio VAE Encode (#1605)#
Codifica l'audio selezionato nello spazio latente audio LTX che guida le forme della bocca e le micro-espressioni. Taglia i silenzi evidenti prima della codifica per un allineamento più rapido. Abbina con l'offset del tempo di inizio se il tuo ingresso lirico non inizia a 0 secondi.
LTX2 NAG (#508)#
Applica una guida aumentata dal rumore adattata per LTX 2.3 per affinare il collegamento audio-labiale. Se le labbra sembrano poco animate, aumenta leggermente la sua guida; se i denti o le forme della bocca sembrano esagerati, riduci l'effetto. Piccoli cambiamenti incrementali funzionano meglio perché questo controllo interagisce con la forza del tuo prompt e le impostazioni del campionatore. L'implementazione di riferimento vive nei repository LTX.
SamplerCustomAdvanced (#161)#
Esegue il processo di denoising con il tuo KSamplerSelect (#154), CFG Guider (#153) e pianificatore selezionati. Una guida senza classificatore più bassa favorisce generalmente un movimento naturale e una ritenzione dell'identità; valori più alti aumentano la dominanza del prompt ma possono irrigidire le labbra. Se cambi campionatori, mantieni intatte le altre impostazioni per un confronto A/B equo.
Video Combine 🎥🅥🅗🅢 (#1747)#
Scrive l'mp4 finale combinando i fotogrammi e l'audio tagliato. Lascia i valori predefiniti per una compatibilità ampia o aumenta la qualità se intendi eseguire una colorazione successiva. Assicurati che la frame_rate corrisponda alla tua intenzione creativa e corrisponda a ciò che hai impostato in precedenza.
Extra opzionali#
- Usa un ritratto pulito e frontale con illuminazione neutra e un ritaglio 9:16 per i risultati più convincenti di LTX 2.3 Sincronizzazione delle Labbra Parlante e Cantante.
- Se gli strumenti mascherano le consonanti, abilita
USE VOCALS ONLY(#1616) in modo che il modello si condizioni su uno stem vocale più pulito mentre la tua esportazione mantiene il mix completo. - Mantieni le clip sotto circa 35 secondi per iterazioni più rapide; unisci le riprese esternamente se stai costruendo un lungo video musicale.
- Quando il movimento è troppo statico, abbassa
IMG STRENGTH; quando l'identità si allontana, alzala e semplifica il prompt. - Allinea i testi tagliando il silenzio iniziale e usando il controllo dell'offset del tempo di inizio in modo che le forme delle labbra inizino esattamente sulla tua prima parola.
- Imposta un
Start Seedfisso per riprodurre una ripresa, quindi varia il seed per le alternative. - Rispetta i diritti di somiglianza e musicali quando usi questo flusso di lavoro LTX 2.3 Sincronizzazione delle Labbra Parlante e Cantante in progetti pubblici.
Link alle risorse ufficiali
- Model card LTX-2.3: Lightricks/LTX-2.3
- Repository LTX-Video: Lightricks/ltx-video
- ComfyUI-LTXVideo: Lightricks/ComfyUI-LTXVideo
- ComfyUI-MelBandRoFormer: kijai/ComfyUI-MelBandRoFormer
- Pesi MelBandRoFormer: Kijai/MelBandRoFormer_comfy
Ringraziamenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo vivamente Lightricks per LTX-Video (incluso il modello LTX 2.3 e i nodi ComfyUI-LTXVideo), Kijai per MelBandRoFormer (nodi ComfyUI e pesi del modello), e RunningHub per l'articolo sorgente del flusso di lavoro per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- RunningHub/RunningHub fonte del flusso di lavoro
- Documenti / Note di rilascio: RunningHub Post
- Lightricks/LTX 2.3 modello
- GitHub: Lightricks/ltx-video
- Hugging Face: Lightricks/LTX-2.3
- Lightricks/LTX-Video repository ufficiale
- GitHub: Lightricks/ltx-video
- Hugging Face: Lightricks/LTX-2.3
- Nodi Lightricks/ComfyUI-LTXVideo
- GitHub: Lightricks/ComfyUI-LTXVideo
- Nodi Kijai/ComfyUI-MelBandRoFormer
- GitHub: kijai/ComfyUI-MelBandRoFormer
- Hugging Face: Kijai/MelBandRoFormer_comfy
- Pesi del modello ComfyUI Kijai/MelBandRoFormer
- Hugging Face: Kijai/MelBandRoFormer_comfy
- GitHub: kijai/ComfyUI-MelBandRoFormer
Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

