LTX 2.3 Synchronisation labiale pour parler et chanter : Flux de travail ComfyUI Portrait-to-Performance#
LTX 2.3 Synchronisation labiale pour parler et chanter transforme un portrait de face clair et une voix ou une chanson en une vidéo numérique cinématographique avec un mouvement de bouche expressif et synchronisé. Conçu pour RunComfy, il utilise la génération de vidéos LTX 2.3 avec des nœuds LTXV ComfyUI et la séparation audio Mel-Band RoFormer pour garder le visage lisible tout en correspondant au discours ou aux paroles.
Ce flux de travail ComfyUI convient aux clips musicaux IA, aux chanteurs virtuels, aux tests de performance de personnages et aux démos de créateurs où l'interprète à l'écran et l'audio final doivent rester utilisables. Vous fournissez une image de portrait et une piste audio, choisissez une fréquence d'images et une durée, et le pipeline rend un mp4 avec une synchronisation labiale alignée sur votre piste.
Note : Pour des résultats particulièrement impressionnants, nous recommandons fortement de générer la chanson avec Ace Step Model, puis de créer un portrait cinématographique clair avec Seedream 5.0 Pro. Utilisez ces deux éléments comme entrées audio et portrait pour ce flux de travail afin d'obtenir une performance numérique plus soignée.
Modèles clés dans le flux de travail Comfyui LTX 2.3 Synchronisation labiale pour parler et chanter#
- Modèle de génération vidéo LTX-2.3 par Lightricks. Un générateur audio-vidéo basé sur un transformateur qui couple les caractéristiques audio avec le mouvement visuel pour produire des images temporellement cohérentes adaptées à la parole et au chant. Fiche du modèle et répertoire officiel.
- LTX-2.3 Video VAE et Audio VAE. Encodeurs/décodeurs latents qui emballent la vidéo et l'audio dans l'espace latent AV utilisé par LTX-2.3, assurant un échantillonnage efficace et une reconstruction propre. Implémenté dans l'intégration LTX ComfyUI. ComfyUI-LTXVideo.
- MelBandRoFormer. Un modèle moderne de séparation des sources musicales utilisé ici pour extraire optionnellement les voix pour un conditionnement labial plus propre tout en gardant votre mix original pour le rendu final. Poids et nœud ComfyUI.
Comment utiliser le flux de travail Comfyui LTX 2.3 Synchronisation labiale pour parler et chanter#
Le flux de travail se déroule en trois étapes : Entrée, génération LTX 2.3 et Exportation. Les groupes travaillent ensemble de bout en bout pour transformer votre portrait et votre audio en une performance synchronisée.
ENTRÉE#
Chargez un portrait de face à l'aide de Character Image (front view + 9:16, recommended) (#444). L'image est redimensionnée pour le modèle et légèrement prétraitée pour préserver l'identité et le détail de la région de la bouche. Téléchargez votre chanson ou votre voix avec Upload Song or Voice (#1755), puis définissez Start lip-sync from which second? e.g. 10.0 (seconds) (#1776) si vous souhaitez sauter les mesures d'introduction ou le silence. Choisissez une durée avec Duration in seconds (best under 35s; enter 0 for full audio) (#1583) et définissez Frame Rate (#1586) pour le rendu. Rédigez une invite d'intention dans Prompt (#1624) pour guider l'expression et le comportement de la caméra ; le flux de travail injecte également des indices négatifs utiles pour éviter les sous-titres, les filigranes et les images statiques.
LTX2.3 Humain numérique Synchronisation labiale pour parler/chanter#
Votre portrait est transformé en un clip latent de départ par LTXV Preprocess (#446) et LTXVImgToVideoInplaceKJ (#1762). Contrôlez la force avec laquelle le portrait est appliqué en utilisant IMG STRENGTH. Set 0 for T2I mode (#1722) : des valeurs plus élevées verrouillent la photo, tandis que des valeurs plus basses permettent plus de mouvement génératif. Le chemin audio coupe votre chargement, sépare optionnellement les voix avec Mel-Band RoFormer Sampler (#1599), et encode la piste choisie via LTXV Audio VAE Encode (#1605). Les latents audio et vidéo sont fusionnés par LTXV Concat AV Latent (#350), et le conditionnement textuel des nœuds CLIP Text Encode dirige l'intention générale de la scène et la propreté via LTXVConditioning (#164). Le modèle LTX-2.3 est patché et guidé pour la précision labiale à l'aide de LTX2 NAG (#508), puis échantillonné avec SamplerCustomAdvanced (#161) sous le planificateur et l'échantillonneur sélectionnés.
Exporter et sauvegarder#
Après l'échantillonnage, le latent vidéo est décodé par VAE Decode (#1318) en images. Video Combine 🎥🅥🅗🅢 (#1747) multiplexe ces images avec votre audio original coupé pour produire un mp4 à votre fréquence d'images choisie. Si vous avez activé uniquement les voix pour le conditionnement, l'exportation finale utilise toujours le mix complet pour que votre résultat soit prêt à être partagé. La sortie est enregistrée avec un préfixe clair pour un versionnage facile.
Nœuds clés dans le flux de travail Comfyui LTX 2.3 Synchronisation labiale pour parler et chanter#
LTXVImgToVideoInplaceKJ (#1762)#
Convertit le portrait de référence en une vidéo latente initiale. Ajustez IMG STRENGTH. Set 0 for T2I mode (#1722) pour équilibrer le verrouillage de l'identité par rapport à la liberté de mouvement. Pour une ressemblance serrée et une pose de tête stable, gardez la force plus élevée ; pour un mouvement plus performatif, réduisez-la. Si vous le réglez sur 0, traitez le flux de travail comme un texte-à-vidéo et reposez-vous davantage sur l'invite et l'audio.
Mel-Band RoFormer Sampler (#1599)#
Sépare les voix d'une chanson pour alimenter des caractéristiques vocales plus propres dans le modèle. Utilisez USE VOCALS ONLY (#1616) lorsque l'instrumental est dominant ou lorsque les consonnes se perdent ; gardez-le désactivé lorsque vous voulez que le mix complet influence l'expressivité. Le rendu final utilise l'audio original coupé, préservant votre bande sonore prévue. Voir les détails du modèle dans l'extension ComfyUI et les poids liés ci-dessus.
LTXV Audio VAE Encode (#1605)#
Encode l'audio sélectionné dans l'espace latent audio LTX qui pilote les formes de bouche et les micro-expressions. Coupez les silences évidents avant l'encodage pour un alignement plus rapide. Associez-le au décalage de l'heure de début si votre entrée lyrique ne commence pas à 0 seconde.
LTX2 NAG (#508)#
Applique une guidance augmentée par le bruit adaptée à LTX 2.3 pour affiner le couplage audio-à-lèvres. Si les lèvres semblent sous-animées, augmentez légèrement sa guidance ; si les dents ou les formes de la bouche semblent exagérées, réduisez l'effet. De petits changements progressifs fonctionnent mieux car ce contrôle interagit avec la force de votre invite et les paramètres de l'échantillonneur. L'implémentation de référence se trouve dans les répertoires LTX.
SamplerCustomAdvanced (#161)#
Exécute le processus de débruitage avec votre KSamplerSelect (#154), CFG Guider (#153), et planificateur choisis. Une guidance sans classificateur plus basse favorise généralement un mouvement naturel et une rétention de l'identité ; des valeurs plus élevées augmentent la dominance de l'invite mais peuvent raidir les lèvres. Si vous changez d'échantillonneurs, gardez le reste des paramètres intacts pour une comparaison équitable.
Video Combine 🎥🅥🅗🅢 (#1747)#
Écrit le mp4 final en combinant les images et l'audio coupé. Laissez les paramètres par défaut pour une large compatibilité ou augmentez la qualité si vous prévoyez de faire une correction des couleurs plus tard. Assurez-vous que le frame_rate correspond à votre intention créative et à ce que vous avez défini précédemment.
Suppléments optionnels#
- Utilisez un portrait clair, de face, avec un éclairage neutre et un recadrage 9:16 pour des résultats de synchronisation labiale parlante et chantante LTX 2.3 les plus convaincants.
- Si les instruments masquent les consonnes, activez
USE VOCALS ONLY(#1616) pour que le modèle se conditionne sur une tige vocale plus propre tandis que votre exportation garde le mix complet. - Gardez les clips sous environ 35 secondes pour une itération plus rapide ; assemblez les prises en externe si vous construisez un long clip musical.
- Lorsque le mouvement est trop statique, réduisez
IMG STRENGTH; lorsque l'identité dérive, augmentez-la et simplifiez l'invite. - Alignez les paroles en coupant le silence d'introduction et en utilisant le contrôle de décalage de l'heure de début pour que les formes de lèvres commencent exactement sur votre premier mot.
- Définissez une
Start Seedfixe pour reproduire une prise, puis variez la graine pour des alternatives. - Respectez les droits à la ressemblance et à la musique lorsque vous utilisez ce flux de travail LTX 2.3 Synchronisation labiale pour parler et chanter dans des projets publics.
Liens vers les ressources officielles
- Fiche du modèle LTX-2.3 : Lightricks/LTX-2.3
- Répertoire LTX-Video : Lightricks/ltx-video
- ComfyUI-LTXVideo : Lightricks/ComfyUI-LTXVideo
- ComfyUI-MelBandRoFormer : kijai/ComfyUI-MelBandRoFormer
- Poids MelBandRoFormer : Kijai/MelBandRoFormer_comfy
Remerciements#
Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Lightricks pour LTX-Video (y compris le modèle LTX 2.3 et les nœuds ComfyUI-LTXVideo), Kijai pour MelBandRoFormer (nœuds ComfyUI et poids du modèle), et RunningHub pour l'article source du flux de travail pour leurs contributions et leur maintenance. Pour des détails autorisés, veuillez vous référer à la documentation originale et aux répertoires liés ci-dessous.
Ressources#
- Source du flux de travail RunningHub/RunningHub
- Docs / Notes de version : RunningHub Post
- Modèle Lightricks/LTX 2.3
- GitHub : Lightricks/ltx-video
- Hugging Face : Lightricks/LTX-2.3
- Répertoire officiel Lightricks/LTX-Video
- GitHub : Lightricks/ltx-video
- Hugging Face : Lightricks/LTX-2.3
- Nœuds Lightricks/ComfyUI-LTXVideo
- GitHub : Lightricks/ComfyUI-LTXVideo
- Nœuds Kijai/ComfyUI-MelBandRoFormer
- GitHub : kijai/ComfyUI-MelBandRoFormer
- Hugging Face : Kijai/MelBandRoFormer_comfy
- Poids du modèle Kijai/MelBandRoFormer ComfyUI
- Hugging Face : Kijai/MelBandRoFormer_comfy
- GitHub : kijai/ComfyUI-MelBandRoFormer
Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

