LTX 2.5 GGUF ComfyUI image‑to‑video avec audio synchronisé#
Ce workflow LTX 2.5 GGUF ComfyUI transforme une seule image source et une invite en langage naturel en une courte vidéo avec une piste audio générée et synchronisée. Il utilise la famille de modèles officielle LTX‑2.5 pour la génération vidéo et audio, acheminée à travers un chemin UNet quantifié GGUF pour réduire la VRAM tout en conservant le mouvement cinématographique et la cohérence de la scène.
Le graphe est conçu pour des itérations rapides sur les prises de vue de personnages, les mouvements de machines et d'environnement. Il inclut un commutateur pour image‑à‑vidéo ou texte‑à‑vidéo, un pipeline latent en deux étapes (passage grossier puis suréchantillonnage latent), et un décodage en tuiles pour maintenir une faible pression sur la mémoire. Si vous avez besoin d'un chemin compact et prêt pour la production, ce workflow LTX 2.5 GGUF ComfyUI est un point de départ pratique.
Modèles clés dans le workflow ComfyUI LTX 2.5 GGUF ComfyUI#
- LTX‑2.5 (officiel, par Lightricks). Modèle génératif principal pour vidéo et audio utilisé pour la synthèse de mouvement et la guidance multimodale. Carte du modèle
- LTX‑2.5 Video VAE (bf16). Encode et décode les latents vidéo pour une génération efficace, associé au modèle principal. Inclus dans le dépôt LTX‑2.5 sous vae/. Video VAE
- LTX‑2.5 Audio VAE (bf16). Gère le chemin latent audio pour que le rendu final inclue un son synchronisé. Inclus dans le dépôt LTX‑2.5 sous vae/. Audio VAE
- Encodeur de texte basé sur Gemma 12B avec projection LTX‑2.5. Fournit des embeddings d'invite adaptés à LTX‑2.5, empaqueté par le dépôt LTX sous text_encoders/. Encodeur de texte
- LTX‑2.5 Suréchantillonneur Spatial Latent x2 1.0. Un modèle de super‑résolution dans l'espace latent qui ajoute des détails après le passage grossier. Suréchantillonneur
- LTX‑2.5 UNet Distillé (quantifié GGUF). Poids UNet quantifiés chargés via le chargeur ComfyUI‑GGUF pour réduire l'utilisation de la mémoire tout en gardant une qualité acceptable. GGUF est le format d'inférence, pas un nom de modèle officiel. ComfyUI‑GGUF
Comment utiliser le workflow ComfyUI LTX 2.5 GGUF ComfyUI#
Le pipeline fonctionne en deux étapes : un passage à basse résolution guidé pour établir le mouvement et le timing, suivi d'un suréchantillonnage latent et d'un raffinement à haute résolution. L'audio est transporté comme un latent apparié tout au long, puis décodé et multiplexé avec les images finales.
Modèle#
Chargez l'UNet quantifié GGUF avec UnetLoaderGGUF (#406). Les VAEs vidéo et audio sont sélectionnés avec VAELoader (#385, #386), et l'encodeur de texte basé sur Gemma est fourni par CLIPLoader (#387). Le suréchantillonneur est choisi avec LatentUpscaleModelLoader (#371). Ce groupe définit l'épine dorsale sur laquelle reposent tous les autres groupes.
Invite#
Rédigez la description de votre scène dans le champ Prompt, en vous concentrant sur les sujets, le mouvement et un mouvement de caméra clair. L'encodeur de texte intègre des invites positives et négatives via LTXVConditioning (#365), qui accepte également le taux d'images choisi pour aligner le timing. Si vous souhaitez un audio de type discours, incluez des lignes courtes entre guillemets ; le chemin audio répondra au contexte textuel tout en restant conscient de la scène. Gardez les invites concises et spécifiques pour éviter des directions conflictuelles.
Paramètres Vidéo#
Définissez la durée, le taux d'images et la taille cible. Les utilitaires convertissent les secondes et fps en nombres d'images afin que le graphe alloue la bonne longueur temporelle. Respectez les tailles qui sont des multiples de 32 pour la stabilité et la vitesse. Utilisez le sélecteur de résolution pour choisir un rapport d'aspect courant, puis ajustez à votre échelle souhaitée.
Prétraitement d'Image#
Chargez le premier (référence) cadre et laissez LTXVPreprocess (#350) le normaliser pour LTX‑2.5. Le commutateur Switch to Text to Video? (#363) contrôle si l'image est utilisée comme ancrage spatial ou contournée pour un pur texte‑à‑vidéo. L'assistant de redimensionnement garde votre entrée cohérente avec la résolution de travail. Un bon prétraitement améliore la préservation de l'identité et la disposition.
Latent Vide#
EmptyLTXVLatentVideo (#356) et LTXVEmptyLatentAudio (#366) préallouent la toile temporelle pour la vidéo et l'audio. Ces longueurs proviennent de vos choix de durée et fps. Cette séparation assure que les chemins vidéo et audio restent synchronisés au fur et à mesure qu'ils se déplacent à travers l'échantillonnage et le raffinement.
Générer Basse Résolution#
Le premier bloc d'échantillonneur utilise LTXVDualCFGGuider (#388) avec votre conditionnement d'invite pour conduire le mouvement et la dynamique de la scène, puis synthétise un latent grossier avec SamplerCustomAdvanced (#344). Si vous faites de l'image‑à‑vidéo, LTXVImgToVideoInplace (#357) injecte le cadre de référence dans le latent pour stabiliser l'identité et la composition ; il est contourné pour le texte‑à‑vidéo. Ce passage est intentionnellement plus léger pour établir le mouvement et le timing avant le suréchantillonnage.
Suréchantillonnage Latent#
LTXVSeparateAVLatent (#367) sépare l'audio et la vidéo afin que le latent vidéo puisse être amélioré par LTXVLatentUpsampler (#348) avec le modèle x2. L'image prétraitée est réappliquée optionnellement avec LTXVImgToVideoInplace (#349) pour garder les détails cohérents après le suréchantillonnage. Le latent audio est ensuite réattaché via LTXVConcatAVLatent (#340), préservant la synchronisation.
Générer Haute Résolution#
Un deuxième bloc d'échantillonneur (LTXVDualCFGGuider (#391) plus SamplerCustomAdvanced (#368)) affine les détails et la cohérence temporelle à l'échelle supérieure. LTXVSeparateAVLatent (#369) passe l'audio à LTXVAudioVAEDecode (#358) tandis que le latent vidéo est décodé avec VAEDecodeTiled (#374) pour réduire les pics de VRAM. CreateVideo (#370) assemble les images et l'audio en une vidéo finale au fps cible.
Nœuds clés dans le workflow ComfyUI LTX 2.5 GGUF ComfyUI#
UnetLoaderGGUF (#406)#
Charge l'UNet distillé LTX‑2.5 au format GGUF. Choisissez le fichier quantifié qui correspond à votre budget VRAM ; une quantification plus légère réduit la mémoire et accélère l'inférence à un certain coût de qualité. Si vous passez à un fichier moins quantifié, attendez-vous à des textures plus nettes et à des mouvements fins plus stables.
LTXVImgToVideoInplace (#357 et #349)#
Injecte le premier cadre dans le latent pour que le mouvement évolue à partir de votre image plutôt que de dériver. Activez l'entrée bypass lors du passage entre image‑à‑vidéo et texte‑à‑vidéo. Utilisez le nœud basse résolution (#357) pour la stabilisation initiale et le nœud haute résolution (#349) pour ré-ancrer les détails après le suréchantillonnage.
LTXVLatentUpsampler (#348)#
Applique le suréchantillonneur spatial latent LTX‑2.5 pour ajouter des détails sans décoder en pixels. Utilisez-le lorsque vous souhaitez plus de définition à un coût mémoire presque identique au passage grossier. Si vous voyez des scintillements après le suréchantillonnage, renforcez légèrement la guidance dans l'étape de raffinement suivante.
ManualSigmas (#397 et #396)#
Contrôle le calendrier de débruitage utilisé par les échantillonneurs. Les calendriers plus courts sont plus rapides mais peuvent réduire l'adhérence ou la fluidité temporelle ; les calendriers plus longs ou chargés à l'avant ajoutent de la stabilité à un coût supplémentaire. Associez cela au choix de l'échantillonneur pour équilibrer la vitesse et la qualité de votre scène.
VAEDecodeTiled (#374)#
Décode le latent vidéo haute résolution en cadres en utilisant des tuiles pour limiter l'utilisation de la VRAM. Si vous manquez de mémoire, réduisez la taille des tuiles ou activez un carrelage plus fort ; si vous voyez des coutures, augmentez le chevauchement ou essayez une tuile plus grande. Gardez votre sélection de VAE alignée avec le VAE vidéo officiel LTX‑2.5.
CreateVideo (#370)#
Multiplexe la séquence d'images et l'audio décodé en un fichier vidéo final. Réglez fps pour correspondre à votre taux de génération afin d'éviter l'étirement temporel. Utilisez ceci comme le seul point de rendu pour des sorties cohérentes à travers les itérations.
Extras optionnels#
- Pour l'image‑à‑vidéo, décrivez un seul mouvement de caméra clair et l'action du sujet ; évitez plusieurs mouvements concurrents.
- Pour le texte‑à‑vidéo, gardez les invites concises et ajoutez des lignes courtes entre guillemets pour un audio de type discours lorsque cela est approprié.
- Conseils de résolution : respectez les multiples de 32 ; les tailles courantes en 16:9 incluent 960x544 (rapide) et 1344x768 ou 1504x832 (plus net). Augmentez uniquement si vous avez de la marge de manœuvre en VRAM.
- Si les résultats ignorent l'invite, augmentez la guidance dans le bloc d'échantillonneur ou simplifiez le langage de l'invite.
- Pour la reproductibilité entre les exécutions, définissez une graine fixe dans le nœud de bruit ; les graines aléatoires sont meilleures pour l'exploration.
- Si la VRAM est limitée, préférez le niveau Q GGUF que vous pouvez vous permettre et gardez le suréchantillonneur activé ; il ajoute des détails pour un coût mémoire minimal.
Liens de référence : les modèles et actifs LTX‑2.5 officiels sont hébergés sur Hugging Face, et le chargeur UNet GGUF provient de ComfyUI‑GGUF.
- Modèles et actifs LTX‑2.5 : Lightricks/LTX‑2.5
- Chargeur GGUF : city96/ComfyUI‑GGUF
Remerciements#
Ce workflow implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Lightricks pour LTX-2.5 et city96 pour ComfyUI-GGUF pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation originale et aux dépôts liés ci-dessous.
Ressources#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
Note : L'utilisation des modèles, ensembles de données et codes référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.


