ComfyUI>Workflows>LTX 2.5 ComfyUI Image to Video | Mouvement Réaliste & Audio Natif

LTX 2.5 ComfyUI Image to Video | Mouvement Réaliste & Audio Natif

Workflow Name: RunComfy/LTX-2.5-ComfyUI
Workflow ID: 0000...1489
Vous pouvez transformer une image en un court-métrage cinématographique. Guidez le mouvement avec une invite en langage naturel. Obtenez un mouvement plus net et un audio synchronisé. Utilisez l'amélioration des invites pour un meilleur contrôle de la scène. Animez des portraits, des produits, des animaux ou des lieux. Exécutez le workflow LTX-2.5 dans RunComfy sans configuration supplémentaire.

LTX 2.5 ComfyUI Workflow

LTX 2.5 ComfyUI Image to Video | Synced Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

LTX 2.5 ComfyUI Examples

LTX 2.5 ComfyUI Image to Video avec Audio Synchronisé#

Ce workflow LTX 2.5 ComfyUI prêt pour RunComfy transforme une seule première image et une invite de mouvement en une courte vidéo cinématographique avec un audio cohérent, en modèle. Il est propulsé par la famille Lightricks LTX-2.5, combinant la Pixel Diffusion, un amplificateur d'invite basé sur Gemma, des VAE vidéo et audio, et un redimensionnement latent pour un mouvement net et une adhérence forte à l'invite.

Utilisez ce graphique LTX 2.5 ComfyUI pour animer des portraits, des lieux atmosphériques, des produits, des animaux et des prises de concept tout en restant dans ComfyUI. Fournissez une image de départ, décrivez l'action et la caméra, définissez la durée et la cadence, et rendez une prise qui maintient le caractère, l'éclairage et le style à travers les images.

Modèles clés dans le workflow Comfyui LTX 2.5 ComfyUI#

Comment utiliser le workflow Comfyui LTX 2.5 ComfyUI#

Ce workflow étend et conditionne votre invite, construit des latents vidéo et audio, échantillonne un passage basse résolution, effectue un redimensionnement latent, puis décode en images et audio synchronisé pour le multiplexage final. Le contrôleur de haut niveau est Image to Video (LTX-2.5) (#398), qui prend votre première image, votre invite texte et vos paramètres clés, puis les dirige vers le sous-graphe.

Prétraitement de l'image#

Fournissez votre image de départ à Load First Frame (#395). L'image est standardisée dans LTXVPreprocess (#350) pour une base propre et adaptée au modèle. Utilisez ResolutionSelector (#403) pour choisir l'aspect et l'échelle ; il produit une largeur et une hauteur alignées sur des multiples adaptés au modèle. Les premières images de bonne qualité sont nettes, bien éclairées et composées pour le mouvement que vous prévoyez de décrire. Le prétraitement évite les changements destructeurs tout en préparant l'image pour l'échantillonnage latent.

Amélioration de l'invite#

Écrivez votre invite de mouvement et de caméra dans Prompt (#376). Si vous activez l'amplificateur intégré, TextGenerateLTX2Prompt (#380) enrichit votre texte avec des détails sur les temps forts, la continuité et le cadrage en utilisant un modèle basé sur Gemma. Le commutateur ComfySwitchNode (#382) vous permet de router soit votre texte brut, soit la version enrichie pour le conditionnement. Cette étape améliore l'adhérence à l'invite pour les entrées courtes et aide à maintenir les sujets et le style à travers les images. Vous pouvez prévisualiser le texte étendu dans PreviewAny (#381) avant le rendu.

Modèle#

Le sous-graphe charge le générateur distillé dans UNETLoader (#384) et les décodeurs dans VAELoader pour la vidéo (#385) et l'audio (#386). Le modèle de redimensionnement latent est préparé par LatentUpscaleModelLoader (#371) pour un passage de détail x2 propre plus tard. Ce bloc garantit que la même famille de modèles LTX-2.5 est utilisée à travers l'encodage, l'échantillonnage et le décodage, ce qui préserve la cohérence temporelle.

Invite#

CLIPLoader (#387) et CLIPTextEncode positif (#364) transforment votre invite descriptive en conditionnement. Un encodeur négatif dédié (#373) supprime les traits indésirables comme la basse qualité ou les artefacts. LTXVConditioning (#365) fusionne le conditionnement du texte avec votre cadence choisie pour que les conseils de timing s'écoulent dans le flux latent audio-visuel. Garder le langage de la caméra et de l'action clair mène à un mouvement plus stable et à une latitude d'édition.

Paramètres Vidéo#

La durée, la largeur, la hauteur, la cadence et la graine sont définies dans le groupe Video Settings (par exemple, Duration (#362) et Frame Rate (#361)). Les assistants mathématiques simples calculent le nombre total d'images et fournissent des valeurs uniformes là où nécessaire. Choisissez une cadence qui correspond à l'ambiance que vous souhaitez ; une action plus lente peut mieux paraître à une fréquence d'images plus basse, tandis qu'un mouvement rapide bénéficie d'une fréquence d'images plus élevée. Pour des prises reproductibles, fixez la graine ; variez-la pour explorer des alternatives.

Latent Vide#

EmptyLTXVLatentVideo (#356) crée un latent vidéo de la bonne taille et longueur, tandis que LTXVEmptyLatentAudio (#366) construit un latent audio aligné dans le temps. Cela garantit que les flux vidéo et audio partagent le timing dès le début. Avec une longueur dérivée de la durée et de la cadence, l'échantillonneur reçoit des tenseurs correctement formés. Le résultat est une base synchronisée pour le débruitage audio-visuel conjoint.

Générer Basse Résolution#

Un premier passage d'échantillonnage construit un mouvement cohérent à une résolution gérable. LTXVDualCFGGuider (#388) applique une guidance à double modalité pour que le texte et le timing façonnent ensemble les latents vidéo et audio. SamplerCustomAdvanced (#344) exécute les étapes de diffusion avec votre échantillonneur et votre planificateur choisis, semé par RandomNoise (#339). La contrainte du premier cadre est appliquée par LTXVImgToVideoInplace (#357), qui maintient l'identité, l'éclairage et la composition ancrés à votre image fournie. Après l'échantillonnage, LTXVConcatAVLatent et LTXVSeparateAVLatent mélangent les latents audio et vidéo selon les besoins pour les étapes suivantes.

Redimensionnement Latent#

LTXVLatentUpsampler (#348) effectue un redimensionnement x2 dans l'espace latent pour affiner les textures et les microdétails avant le décodage. LTXVImgToVideoInplace (#349) réaligne le latent redimensionné avec le cadre de départ pour que l'identité et la mise en page restent stables. Faire cela dans l'espace latent préserve une fluidité temporelle meilleure que le redimensionnement en espace pixel. Cette étape contribue grandement à la netteté finale.

Générer Haute Résolution#

Un échantillonneur de raffinement (KSamplerSelect (#341) plus SamplerCustomAdvanced (#368)) fonctionne sur le latent redimensionné avec un programme plus court, stabilisant les bords et enrichissant les détails. LTXVDualCFGGuider (#391) maintient la guidance cohérente avec votre texte tout en préservant le mouvement défini au premier passage. Le latent combiné est ensuite divisé par LTXVSeparateAVLatent (#369) pour le décodage. VAEDecodeTiled (#374) transforme le latent vidéo en images et LTXVAudioVAEDecode (#358) produit un audio synchronisé.

Rendre et Sauvegarder#

CreateVideo (#370) multiplexe les images et l'audio à votre cadence choisie dans un seul flux vidéo. De retour sur le graphique externe, SaveVideo (#75) écrit le résultat dans votre sortie ComfyUI normale. Vous pouvez également auditionner l'audio seul via un nœud de prévisualisation dans l'enveloppe de haut niveau avant les rendus complets.

Nœuds clés dans le workflow Comfyui LTX 2.5 ComfyUI#

Image to Video (LTX-2.5) (#398)#

C'est le contrôleur tout-en-un pour tout le pipeline. Fournissez la première image, votre invite, la durée, la résolution, la cadence et si vous souhaitez activer l'amélioration de l'invite. Utilisez-le pour itérer rapidement ; lorsque vous êtes prêt à peaufiner, cliquez sur Entrer dans le sous-graphe pour ajuster les échantillonneurs, la guidance et le décodage. Si vous avez besoin d'une vidéo uniquement texte, ouvrez le sous-graphe et activez le contournement interne du texte à la vidéo sur les nœuds image à vidéo.

LTXVDualCFGGuider (#388)#

Applique une guidance sans classificateur à travers le latent audio-visuel conjoint, équilibrant l'adhérence à l'invite avec la stabilité temporelle. Augmentez la guidance pour un suivi plus fort de l'invite et un mouvement plus percutant ; réduisez-la pour diminuer le scintillement ou pour préserver davantage les nuances du cadre de départ. Gardez la guidance vidéo et audio dans le même ordre de grandeur pour que la bande sonore reste alignée avec l'action à l'écran.

SamplerCustomAdvanced (#344)#

Conduit la diffusion avec votre échantillonneur choisi et un programme sigma personnalisé. Utilisez ce nœud pour explorer la qualité du mouvement par rapport à la stabilité en changeant les variantes d'échantillonneur ou en éditant les programmes. Associez-le à une graine fixe pour comparer les paramètres de manière équitable, puis randomisez la graine pour rechercher la meilleure prise.

LTXVLatentUpsampler (#348)#

Augmente l'échelle dans l'espace latent avec le modèle dédié LTX-2.5 x2, améliorant le détail sans introduire de vacillement temporel. Si vous prévoyez des recadrages importants ou des gros plans serrés, gardez cela activé pour que les petites caractéristiques survivent au décodage. Pour des limites VRAM extrêmes, vous pouvez contourner l'augmentation d'échelle au prix d'une certaine netteté.

VAEDecodeTiled (#374)#

Décode les latents vidéo haute résolution en images en utilisant le carrelage pour contrôler l'utilisation de la mémoire. Sur une VRAM inférieure, préférez des tuiles plus petites pour éviter les erreurs de mémoire insuffisante. Sur une VRAM supérieure, des tuiles plus grandes peuvent réduire les coutures et accélérer le décodage.

CreateVideo (#370)#

Combine les images décodées avec l'audio généré en un seul flux vidéo à votre cadence d'images sélectionnée. Ajustez la cadence ici pour correspondre à l'intention créative ou pour répondre aux exigences de la plateforme. La sortie multiplexée est ensuite transmise au sauvegardeur dans le graphique externe.

Extras optionnels#

  • Gardez les invites concises mais concrètes : qui/quoi, action, mouvement de caméra, éclairage, ambiance. Laissez l'amplificateur d'invite ajouter des phrases cinématographiques.
  • Évitez les directions de caméra conflictuelles. Un mouvement fort (approche, panoramique, travelling) tend à produire des résultats plus stables que l'empilement de plusieurs.
  • Utilisez des premières images propres et à fort contraste pour les portraits et les prises de produits ; le modèle préservera mieux l'identité et les bords.
  • Commencez avec des durées modérées pour ajuster le mouvement et le cadrage ; prolongez seulement après avoir aimé le comportement.
  • Si les sorties semblent floues, vérifiez que la largeur et la hauteur sont des multiples de 32 et gardez l'amplificateur latent activé.
  • Pour des itérations cohérentes, fixez la graine. Lors de l'exploration d'alternatives, variez la graine tout en gardant les autres paramètres intacts.

Remerciements#

Ce workflow implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Comfy Org pour le modèle de workflow LTX-2.5: Image to Video ComfyUI, Lightricks pour les poids du modèle LTX-2.5, Lightricks pour le projet LTX-2.5 Diffusers, et Lightricks pour les ressources de l'organisation Hugging Face pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.

Ressources#

Note: L'utilisation des modèles, jeux de données et codes référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.