LTX 2.5 Premier Dernier Cadre à Vidéo : clips cinématiques ancrés à deux cadres avec audio synchronisé#
Ce flux de travail prêt pour RunComfy transforme une image de début et de fin assortie en une courte vidéo cinématique avec un audio synchronisé. En guidant la génération à partir de vos ancres de premier et dernier cadre, il préserve la composition, l'éclairage, l'identité du sujet et le style tout en créant un mouvement cohérent entre les deux. LTX 2.5 Premier Dernier Cadre à Vidéo est idéal pour les actions de personnages contrôlées, les temps forts de produits, les mouvements de caméra et les transitions de scène à l'intérieur de ComfyUI.
Sous le capot, il associe le transformateur LTX-2.5 de Lightricks avec des VAE vidéo et audio dédiés plus un amplificateur d'invite basé sur Gemma. Le graphique est livré avec des groupes clairs pour l'Invite, les Paramètres Vidéo, la préparation du Premier/Dernier Cadre, le Conditionnement, l'Échantillonnage et le Décodage afin que vous puissiez obtenir des résultats fiables et répétables sans toucher au câblage bas niveau.
Modèles clés dans le flux de travail Comfyui LTX 2.5 Premier Dernier Cadre à Vidéo#
- Transformateur distillé Lightricks LTX-2.5. Le générateur vidéo principal qui apprend le mouvement, l'apparence et la cohérence temporelle à partir de guides textuels et visuels. Page du modèle
- VAE Vidéo LTX-2.5. Compresse et décode les latents vidéo pour des cadres nets tout en gardant l'utilisation de la mémoire pratique. Inclus dans le dépôt LTX-2.5. Page du modèle
- VAE Audio LTX-2.5. Génère et reconstruit les latents audio synchronisés pour correspondre aux événements visuels. Inclus dans le dépôt LTX-2.5. Page du modèle
- Encodeur de texte Gemma 4 12B avec projection pour LTX-2.5. Encode votre invite en un conditionnement riche qui couvre les sujets, les actions, l'éclairage et la direction de la caméra. Inclus dans les actifs LTX-2.5. Page du modèle
- Variante d'instruction-tuning Gemma 4 E2B pour l'amélioration de l'invite. Développe les entrées courtes en directions cinématiques lorsque l'amélioration est activée. Page du modèle
- Référence Diffusers optionnelle pour les pipelines LTX-2.5 et le comportement de planification. Utile pour comprendre les compromis de l'échantillonneur. Page du projet
Comment utiliser le flux de travail Comfyui LTX 2.5 Premier Dernier Cadre à Vidéo#
Le flux de travail prend deux images comme ancres, les transforme en guides, puis débruite les latents vidéo et audio sous contrôle textuel avant de décoder en un clip prêt à partager. Chaque groupe ci-dessous joue un rôle spécifique; la plupart des utilisateurs ne toucheront qu'à l'Invite, l'Amélioration de l'Invite et les Paramètres Vidéo.
Invite#
Écrivez une instruction concise mais descriptive dans le nœud Prompt (#252). Le texte positif est encodé par CLIPTextEncode (#222) en utilisant l'encodeur Gemma 4 12B pour que le modèle comprenne les sujets, les actions, l'éclairage et l'intention de la caméra. Décrivez l'état final aussi bien que le début pour aider le modèle à respecter les deux ancres. Si vous avez besoin de formulation stricte ou de termes de marque, écrivez-les explicitement dans l'invite.
Amélioration de l'Invite#
Les invites courtes peuvent être automatiquement développées avec TextGenerateLTX2Prompt (#247). Le ComfySwitchNode (#248) oriente soit votre invite brute, soit le texte amélioré vers l'encodeur, et PreviewAny (#249) vous permet d'inspecter le texte final. Activez l'amélioration lorsque vous souhaitez une formulation cinématographique et des indices de mouvement plus riches; désactivez-la lorsque la formulation de l'invite doit rester exacte.
Paramètres Vidéo#
Définissez la longueur du clip, la fréquence d'images et la résolution avec Duration (#198), Frame Rate(int) (#205), Width (#215) et height (#216). Le graphique calcule le nombre total de cadres via ComfyMathExpression (#226) et alloue les latents vidéo dans EmptyLTXVLatentVideo (#201) et les latents audio dans LTXVEmptyLatentAudio (#197). Une résolution ou une fréquence d'images plus élevée augmente la VRAM et le temps; commencez modestement, puis échellez une fois que vous aimez le mouvement.
Premier Cadre#
Chargez votre image de départ, qui est redimensionnée dans ResizeImageMaskNode (#213) pour correspondre à la résolution cible. LTXVPreprocess (#199) normalise le ton et le détail pour un guidage stable. Des images claires, bien exposées et compositionnellement claires permettent au modèle de se verrouiller plus rapidement et de réduire la dérive non intentionnelle de l'ancre.
Dernier Cadre#
Chargez votre image de fin; elle est redimensionnée dans ResizeImageMaskNode (#214) et normalisée dans LTXVPreprocess (#195). Visez un rapport d'aspect, une perspective et une échelle de sujet assortis par rapport au premier cadre afin que la transition semble physiquement plausible et que l'ancre soit préservée à la fin.
Conditionnement#
Le conditionnement textuel est composé dans LTXVConditioning (#202), qui reçoit également la fréquence d'images cible afin que le timing s'aligne sur les branches. Le guidage d'image est attaché en deux passes avec LTXVAddGuide (#206) pour le premier cadre et LTXVAddGuide (#204) pour le dernier cadre, garantissant que les deux ancres influencent la trajectoire. LTXVCropGuides (#200) réconcilie toute différence de taille résiduelle afin que le guidage s'aligne parfaitement avec la toile latente.
Échantillonnage#
Le bruit est semé dans RandomNoise (#196), et le débruitage est dirigé par SamplerCustomAdvanced (#211) avec SamplerEulerAncestral (#208) et un calendrier ManualSigmas (#239) pour des mises à jour nettes et stables en mouvement. Le guidage provient de LTXVDualCFGGuider (#235) alimenté par le UNETLoader (#230), mélangeant des conditions positives et négatives pour diriger l'aspect et le mouvement. Les latents audio et vidéo sont concaténés puis séparés avec LTXVConcatAVLatent (#210) et LTXVSeparateAVLatent (#221) afin que le mouvement et le son évoluent ensemble.
Décodage et sortie#
Les latents sont décodés en images avec VAEDecodeTiled (#219) en utilisant le VAE vidéo et en audio avec LTXVAudioVAEDecode (#220) en utilisant le VAE audio. CreateVideo (#218) multiplexe les images et l'audio à votre FPS choisi pour produire un clip final. De retour dans le graphique principal, SaveVideo (#68) écrit le résultat; renommez ou changez d'emplacement là si désiré.
Nœuds clés dans le flux de travail Comfyui LTX 2.5 Premier Dernier Cadre à Vidéo#
TextGenerateLTX2Prompt (#247)#
Développe les entrées brèves en une invite cinématique, compatible LTX. Utilisez-le lorsque vous souhaitez des verbes plus riches, un langage d'éclairage et de caméra avec un minimum d'effort. Si vous avez besoin de formulation exacte ou de mots sûrs pour la marque, désactivez l'amélioration via ComfySwitchNode (#248) et fournissez le texte final vous-même.
LTXVDualCFGGuider (#235)#
Combine le modèle LTX-2.5 avec un conditionnement positif et négatif pour équilibrer l'adhérence et la liberté. Augmentez le guidage pour une fidélité plus forte à l'invite et à l'ancre; réduisez-le pour un mouvement plus lâche et organique. Un guidage extrêmement élevé peut surcontraindre le mouvement ou introduire une saturation, alors ajustez en tandem avec votre force d'invite négative.
SamplerCustomAdvanced (#211)#
Exécute la boucle de débruitage en utilisant SamplerEulerAncestral (#208) et le calendrier de sigma choisi. Utilisez des calendriers plus courts pour les tests de vitesse et des plus longs lorsque vous avez besoin de plus de rétention de détail à travers le mouvement. Si le mouvement semble saccadé, essayez une rampe de sigma plus douce ou réduisez légèrement le guidage pour réduire la surcorrection entre les étapes.
ManualSigmas (#239)#
Définit le calendrier du bruit qui échange la netteté contre la douceur temporelle. Un bruit chargé à l'avant peut encourager des mouvements plus importants tôt, tandis qu'une queue plus douce peut préserver les détails près de l'ancre finale. Ajustez uniquement après être satisfait de l'invite et des ancres.
VAEDecodeTiled (#219)#
Décode les latents vidéo en images en utilisant un traitement par tuiles pour s'adapter à des résolutions plus grandes en mémoire. Des tuiles plus petites réduisent la VRAM mais peuvent risquer des coutures de tuiles; des tuiles plus grandes sont plus propres mais plus lourdes. Gardez la résolution et la taille des tuiles en équilibre pour votre GPU.
LTXVAudioVAEDecode (#220)#
Reconstruit la piste audio synchronisée à partir des latents audio. Pour exporter un clip silencieux, désactivez temporairement la branche audio à l'intérieur du sous-graphe avant CreateVideo (#218). Si le son final semble trop chargé, réduisez la densité d'action dans l'invite afin que le modèle audio suive un rythme plus simple.
RandomNoise (#196)#
Sème la génération. Pour des résultats reproductibles, ouvrez le sous-graphe et définissez une graine fixe au lieu de randomiser. Lors de l'exploration des options de mouvement à partir des mêmes ancres et invite, variez la graine pour échantillonner différentes trajectoires.
Extras optionnels#
- Pour les transitions les plus propres, gardez les premiers et derniers cadres alignés en aspect ratio, horizon et échelle de sujet; les discordances forcent le modèle à déformer la géométrie.
- Décrivez le mouvement explicitement : "commence face à gauche, se tourne vers la caméra, la main s'ouvre, le cristal bleu monte au-dessus de la paume" se lit mieux qu'une invite uniquement de style.
- La durée et le FPS interagissent; augmenter les deux augmente la mémoire et le temps de rendu. Étirez l'un à la fois et prévisualisez avant d'échelle.
- Si les bords scintillent, réduisez les adjectifs de texture fine dans l'invite ou abaissez légèrement le guidage pour favoriser la stabilité temporelle.
- Pour accélérer l'itération, testez à une résolution plus petite, puis augmentez la largeur et la hauteur une fois que le mouvement et le cadrage sont verrouillés.
- Lorsque vous avez besoin de cadres finaux parfaits pour la marque, mettez-les en avant dans l'invite et gardez le dernier cadre propre et à fort contraste pour que LTX 2.5 Premier Dernier Cadre à Vidéo puisse se verrouiller de manière fiable.
Remerciements#
Ce flux de travail met en œuvre et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Comfy.org pour le modèle de flux de travail Source, Lightricks pour les poids du modèle LTX-2.5, et Lightricks pour le projet Diffusers LTX-2.5 pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation et aux dépôts originaux liés ci-dessous.
Ressources#
- Comfy.org/Source modèle de flux de travail
- Docs / Notes de version : Modèle de flux de travail Source
- Lightricks/LTX-2.5
- Hugging Face : Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face : Lightricks/LTX-2.5-Diffusers
- Organisation Lightricks/Hugging Face
- Hugging Face : Lightricks
Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

