LTX 2.5 ComfyUI Texte en Vidéo : De l'invite à la vidéo avec audio synchronisé#
LTX 2.5 ComfyUI Texte en Vidéo est un flux de travail prêt pour RunComfy qui transforme une courte invite écrite en une vidéo cinématographique avec une piste audio alignée. Il combine le transformateur distillé LTX-2.5 de Lightricks pour la génération de texte en vidéo, des VAE vidéo/audio compacts pour la reconstruction, un suréchantillonneur latent pour des détails plus nets, et une amélioration d'invite basée sur Gemma pour une meilleure adhérence à l'invite.
Conçu pour les créateurs qui souhaitent une itération rapide et locale dans ComfyUI, ce graphique excelle dans les scènes atmosphériques, les prises de vue de produits, les moments de personnages et les pièces d'ambiance. Avec LTX 2.5 ComfyUI Texte en Vidéo, vous pouvez passer de l'idée à l'aperçu en quelques minutes, puis affiner le mouvement, l'apparence et le timing sans quitter RunComfy.
Modèles clés dans le flux de travail Comfyui LTX 2.5 ComfyUI Texte en Vidéo#
- Lightricks LTX-2.5. Le transformateur distillé principal qui synthétise une vidéo temporellement cohérente à partir de texte. Il équilibre la fidélité à l'invite et le réalisme du mouvement tout en maintenant une inférence rapide. Voir la carte du modèle officiel sur Lightricks/LTX-2.5 et le pipeline de référence sur Lightricks/LTX-2.5-Diffusers.
- Google Gemma 2 Instruct. Un modèle de langage compact ajusté par instruction utilisé pour étendre et clarifier les invites utilisateur avant la génération, améliorant la guidance de style et l'intention de prise de vue. Un point de contrôle représentatif est google/gemma-2-9b-it.
- Hub d'organisation Lightricks. Liste centrale pour les versions et mises à jour LTX de la famille texte en vidéo, utile pour les notes de modèle et les comportements connus : huggingface.co/Lightricks.
Comment utiliser le flux de travail Comfyui LTX 2.5 ComfyUI Texte en Vidéo#
Ce flux de travail suit un chemin clair de l'invite à la vidéo : amélioration de l'invite, conditionnement du texte, synthèse vidéo latente, mise à l'échelle, décodage, alignement audio et exportation. Les sections ci-dessous expliquent chaque étape en termes simples afin que vous sachiez quoi changer et pourquoi.
Invites et préréglages#
Commencez par écrire une invite concise qui indique le sujet, le décor, l'éclairage, la sensation de l'objectif ou de la caméra, et l'intention de mouvement. Ajoutez éventuellement une invite négative pour vous éloigner des éléments indésirables. Choisissez un préréglage de style si disponible pour définir rapidement les tendances de couleur et de contraste. Si le graphique expose le contrôle des graines, gardez la graine stable pendant que vous itérez le libellé afin que les différences reflètent vos modifications, pas le hasard. LTX 2.5 ComfyUI Texte en Vidéo bénéficie de verbes de mouvement explicites comme "ralenti dolly in", "caméra à la main" ou "brise subtile".
Conditionnement du texte#
Votre invite est tokenisée et encodée, puis légèrement réécrite par Gemma pour renforcer l'intention et éliminer l'ambiguïté. Le texte amélioré crée des vecteurs de conditionnement que le modèle vidéo utilise pour décider de la disposition, de l'apparence du sujet et des indices de mouvement. Gardez les descriptions concrètes et visuelles ; évitez les longues listes de modificateurs qui se concurrencent. Si vous avez besoin d'une identité ou d'un branding cohérent, placez ces termes tôt dans l'invite. C'est à cette étape que LTX 2.5 ComfyUI Texte en Vidéo s'accroche au sens avant que des pixels ne soient générés.
Synthèse vidéo latente#
Le flux de travail initialise une chronologie latente dimensionnée selon le rapport d'aspect et la durée choisis. LTX-2.5 débruite itérativement cette vidéo latente, tissant structure, mouvement et apparence dans chaque image tout en maintenant la cohérence temporelle. Les prises de vue plus courtes convergent plus rapidement et sont plus faciles à diriger ; prolongez la durée uniquement après avoir aimé le premier battement. Utilisez des invites négatives pour supprimer les artefacts comme des membres supplémentaires, des scintillements ou des superpositions de texte. L'objectif ici est un clip latent propre, conforme au briefing, qui se lit déjà comme votre scène prévue.
Mouvement et timing#
Pendant le débruitage, le modèle équilibre les détails spatiaux avec un mouvement fluide. Des indices de mouvement forts dans votre invite aident à éviter les clips à l'apparence statique ; trop de demandes de texture fine peuvent réduire la clarté du mouvement. Si le graphique inclut un contrôle de la force du mouvement, augmentez-le pour des prises de vue dynamiques et réduisez-le pour les portraits ou les angles de produit macro. Lors des tests de variations, changez un élément à la fois pour pouvoir attribuer les différences à une modification spécifique. LTX 2.5 ComfyUI Texte en Vidéo récompense généralement des verbes de caméra clairs et un seul sujet focalisé.
Mise à l'échelle latente#
Un suréchantillonneur latent dédié affine les détails sans rompre la stabilité temporelle. Activez ce passage une fois que le mouvement de base et la composition semblent corrects. Si les reflets s'épanouissent ou si les bords sont trop aiguisés, réduisez légèrement la force et relancez ; si l'image semble douce, augmentez-la. La mise à l'échelle après que le mouvement se soit stabilisé préserve mieux la cohérence que de commencer à une résolution de base plus élevée. Cette étape donne à LTX 2.5 ComfyUI Texte en Vidéo sa netteté sans introduire de scintillement.
Décodage et couleur#
Le VAE vidéo décode les latents en images, appliquant un espace colorimétrique et un mappage de tons adaptés à l'aperçu et à l'exportation. Si disponible, choisissez un profil d'apparence qui correspond à votre intention : neutre pour la gradation ultérieure, cinématographique pour les quotidiens prêts à partager. Un léger bandeau ou scintillement indique souvent un affûtage trop agressif en amont ; ajustez la force du suréchantillonneur plutôt que de forcer un contraste postérieur plus lourd. Gardez le rapport d'aspect cohérent entre les exécutions pour comparer les résultats équitablement. Le décodage est le moment où vos images deviennent des pixels que vous pouvez évaluer.
Génération et synchronisation audio#
Un module audio génère une bande sonore légère à partir de la même invite et l'aligne sur la chronologie de la vidéo. Utilisez des mots d'ambiance comme "drone inquiétant", "synthé entraînant" ou "pluie douce" pour orienter la piste. Si le flux de travail expose un basculement audio, vous pouvez le désactiver tout en explorant le mouvement, puis l'activer pour les finales. De légères modifications de l'invite peuvent changer le rythme et l'intensité ; verrouillez votre graine visuelle lors de l'audition de variations audio. L'objectif est un audio cohérent qui soutient la scène sans la combattre.
Exportation et révision#
Choisissez votre conteneur et votre préréglage de codec pour un aperçu compact ou un fichier partageable de qualité supérieure. Si le graphique inclut une exportation d'image par image, vous pouvez inspecter chaque image pour détecter les artefacts avant de vous engager dans une exécution complète. Gardez une trace de l'invite, de la graine et de tous les basculements afin de pouvoir reproduire ou développer des idées. Pour une revue sociale ou de produit, utilisez le préréglage d'aperçu ; pour les bobines ou les decks client, utilisez le préréglage de haute qualité. LTX 2.5 ComfyUI Texte en Vidéo est optimisé pour que vous puissiez itérer rapidement, puis mettre à l'échelle et exporter lorsque vous êtes prêt.
Extras optionnels#
- Écrivez des invites en langage de prise de vue : sujet + décor + éclairage + objectif + mouvement (par exemple, "produit héros sur marbre, rétroéclairage doux, 50 mm, arc lent à gauche").
- Préférez un indice de style décisif à plusieurs faibles. Trop d'adjectifs diluent la guidance.
- Utilisez des invites négatives pour supprimer les superpositions de texte, le grain excessif ou les formes ressemblant à des logos lorsqu'elles ne sont pas souhaitées.
- Verrouillez la graine pour comparer les modifications de l'invite ; changez la graine pour explorer de nouvelles compositions.
- Commencez court, puis prolongez la durée une fois que le mouvement est bien lisible ; les clips plus longs composent de petits problèmes.
- Si les visages sont centraux, gardez le mouvement de la caméra doux et l'éclairage stable pour réduire la dérive temporelle.
- Pour des exportations propres, évitez de redimensionner en post-production ; définissez l'aspect et la résolution dans le graphique et gardez-les cohérents.
Ce flux de travail LTX 2.5 ComfyUI Texte en Vidéo est conçu pour vous aider à obtenir un mouvement convaincant, des détails nets et un audio aligné avec un minimum de configuration. Itérez rapidement, guidez avec une intention claire et laissez le graphique faire le gros du travail de texte à vidéo.
Remerciements#
Ce flux de travail met en œuvre et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Comfy.org pour le modèle de flux de travail source, Lightricks pour les poids du modèle LTX-2.5, et Lightricks pour le projet LTX-2.5 Diffusers pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation originale et aux référentiels liés ci-dessous.
Ressources#
- Comfy.org/Modèle de flux de travail source
- Docs / Notes de version : Modèle de flux de travail source
- Lightricks/LTX-2.5
- Hugging Face : Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face : Lightricks/LTX-2.5-Diffusers
- Lightricks/Hugging Face organisation
- Hugging Face : Lightricks
Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.


