ComfyUI>Workflows>LTX 2.3 Gros Plans - Image-à-Vidéo Cinématographique

LTX 2.3 Gros Plans - Image-à-Vidéo Cinématographique

Workflow Name: RunComfy/LTX-2.3-Close-Up
Workflow ID: 0000...1469
Transformez votre portrait en une vidéo cinématographique face-à-face. Obtenez un mouvement facial naturel et un audio natif synchronisé. Cadrez étroitement la mode, les dialogues ou les clips sociaux. Deux étapes latentes préservent le détail. La mise à l'échelle 2x aiguise chaque image. Commencez rapidement avec cette configuration LTX prête à l'emploi.

ComfyUI LTX 2.3 Close-Up Shots Workflow

LTX 2.3 Close-Up Shots in ComfyUI - Audio and 2x Upscale
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Close-Up Shots Examples

LTX 2.3 Gros Plans : image de portrait en vidéo avec audio natif#

LTX 2.3 Gros Plans est un flux de travail ComfyUI prêt pour RunComfy qui transforme un seul portrait en un clip cinématographique face-à-face avec audio natif généré conjointement. "Gros Plans" décrit l'objectif de cadrage et le style de prompt, pas une variante de modèle LTX séparée ou LoRA. Le graphique exécute le chemin LTX 2.3 v1.1 GGUF distillé sans LoRA de détaillant actif, utilisant un pipeline latent en deux étapes et un upscaler spatial x2 pour fournir une identité stable, une synchronisation labiale naturelle et un cadrage serré.

Conçu pour les portraits de mode, les dialogues, les interviews et les clips sociaux soignés, cette construction ComfyUI met l'accent sur une composition serrée et un mouvement audio-vidéo cohérent. Avec LTX 2.3 Gros Plans, vous fournissez une image fixe et une description de scène concise ; le flux de travail gère le mouvement, le timing et la voix pour produire un MP4 prêt à être partagé.

Modèles clés dans le flux de travail Comfyui LTX 2.3 Gros Plans#

  • LTX-2.3 22B Distilled 1.1 (Transformer-only). Le générateur vidéo-audio principal distillé pour une inférence plus rapide et une mémoire réduite tout en préservant la qualité. Source : Lightricks/LTX-2.3.
  • LTX-2.3 x2 Spatial Upscaler 1.1. Un upscaler latent natif qui aiguise les détails et améliore la stabilité du mouvement lors de la seconde passe. Inclus dans la version LTX 2.3 : Lightricks/LTX-2.3.
  • LTX-2.3 Video VAE (bf16) et LTX-2.3 Audio VAE (bf16). Décodeurs qui transforment les latents vidéo et audio en images et en formes d'onde tout en gardant la synchronisation serrée. Poids sélectionnés : Kijai/LTX2.3_comfy.
  • Poids GGUF quantifiés pour LTX 2.3 22B 1.1. UNet/transformer et pile de texte économes en mémoire, optimisés pour le déchargement CPU ou les GPU à faible VRAM. Distribution : QuantStack/LTX-2.3-GGUF.
  • Gemma 3 12B Instruct encodeur de texte avec projection de texte LTX. Fournit une compréhension robuste des prompts et des jetons de timing pour les deux modalités, intégré à l'interface CLIP de ComfyUI. Inclus via le pack GGUF : QuantStack/LTX-2.3-GGUF.
  • VAE minuscule optionnel pour des aperçus rapides. Utile pour les aperçus de l'échantillonneur pendant l'itération : madebyollin/taehv.

Comment utiliser le flux de travail Comfyui LTX 2.3 Gros Plans#

Ce flux de travail fonctionne en deux étapes coordonnées. La première passe établit le mouvement en gros plan et l'audio natif à une taille de base. La seconde passe effectue un échantillonnage spatial et affine l'identité et la synchronisation labiale, puis décode et multiplexe la vidéo avec l'audio.

  • MODÈLES Charge le modèle distillé LTX 2.3 22B 1.1 dans GGUF, la pile de texte basée sur Gemma 3, et les VAEs vidéo et audio LTX. Il active également les assistants de séquence-parallèle et d'aperçu pour une itération plus fluide. Aucun LoRA de détaillant n'est actif par défaut, ce qui garde l'apparence des LTX 2.3 Gros Plans propre et cohérente.
  • Paramètres Vidéo Définissez ici votre largeur, hauteur, fréquence d'image et longueur de clip cible. Le graphique impose des dimensions valides en interne, mais choisir des valeurs adaptées à la production donne des résultats plus stables et une lecture plus fluide. Si vous prévoyez d'itérer rapidement, commencez modestement et augmentez lors de la seconde passe.
  • T2V — Mode texte à vidéo Lorsque vous souhaitez générer à partir de texte uniquement, basculez le commutateur texte-à-vidéo fourni. Pour LTX 2.3 Gros Plans, le chemin par défaut est image-à-vidéo, ce qui garde l'identité et le cadrage ancrés à votre portrait.
  • Image d'Entrée Fournissez un portrait propre avec le visage dégagé. Le flux de travail pré-traite et redimensionne l'image, puis utilise LTXVImgToVideoInplace (#161) pour ancrer l'identité et la géométrie de l'objectif. Gardez le fond encombré au minimum et laissez un peu d'espace pour que le zoom lent semble naturel.
  • Prompt Utilisez un prompt positif concis pour décrire la prise de vue au fil du temps, y compris les lectures de lignes, les respirations, les micro-gestes et les événements audibles. Gardez le prompt négatif axé sur la suppression d'artefacts plutôt que sur la police de style. Ne répétez pas les détails déjà visibles dans l'image de référence, car cela peut réduire la fidélité et la stabilité.
  • Préparez le Latent LTX Le graphique crée des latents vidéo et audio vides qui correspondent à vos paramètres, les fusionne en un seul latent AV, et attache votre conditionnement positif et négatif avec la fréquence d'image choisie. Cela garde le timing, le mouvement et l'audio en phase dès le début.
  • Échantillonneur — Première Passe La première passe utilise CFGGuider (#129) avec un échantillonneur optimisé pour la vitesse pour générer un latent AV cohérent à basse résolution. Cette étape verrouille le comportement de la caméra en gros plan, le rythme de la parole, et la synchronisation labiale de base. Considérez-le comme le passage narratif qui établit ce qui se passe.
  • Échantillonneur — Seconde Passe Upscale Le latent AV est divisé, et le chemin vidéo est échantillonné x2 en utilisant LTXVLatentUpsampler (#118). L'identité est re-projetée avec LTXVImgToVideoInplace (#160) pour garder le visage stable à la taille supérieure, puis l'audio et la vidéo sont rejoints et affinés avec un échantillonneur axé sur la fidélité. Cette passe améliore le détail, réduit le scintillement, et polit l'apparence des LTX 2.3 Gros Plans.
  • Décodage Les images vidéo sont décodées avec un VAE en mosaïque pour l'efficacité mémoire, l'audio est décodé via le VAE audio, et VHS_VideoCombine multiplexe le tout dans un MP4 H.264 avec un format de pixel standard 4:2:0. Vous pouvez prévisualiser l'audio pendant l'itération et ajuster la durée finale pour correspondre à la parole générée.
  • Optionnel Si la VRAM est limitée, activez l'option de feed-forward par blocs pour échanger un peu de vitesse contre de la stabilité. Pour un développement rapide, utilisez le petit VAE de prévisualisation. Les utilisateurs de plusieurs GPU peuvent bénéficier du patcher séquence-parallèle pour garder les longues séquences fluides.

Nœuds clés dans le flux de travail Comfyui LTX 2.3 Gros Plans#

  • LTXVImgToVideoInplace (#161 et #160) Ancre le portrait dans la vidéo latente pour que le visage reste stable pendant que des zooms subtils et des micro-mouvements se déroulent. Gardez-le actif pour image-à-vidéo ; éteignez son bypass uniquement lors de l'utilisation du mode texte-à-vidéo. Pour les meilleurs résultats LTX 2.3 Gros Plans, partez d'une référence nette et uniformément éclairée et évitez l'occlusion autour de la bouche.
  • LTXVLatentUpsampler (#118) Applique l'upscaler spatial natif LTX 2.3 x2 dans l'espace latent avant le raffinement de la seconde passe. Cela préserve la cohérence du mouvement tout en augmentant le détail. Pour les gros plans, garder l'upscale à x2 offre généralement le meilleur équilibre entre netteté et stabilité.
  • CFGGuider (#129 et #103) Combine votre conditionnement positif et négatif en un signal de guidage unifié pour les deux modalités. De petits ajustements à la force de guidage peuvent resserrer ou assouplir l'adhésion à votre script et cadrage. Si vous augmentez le guidage, envisagez de légèrement adoucir la liste négative pour éviter de trop contraindre les expressions.
  • SamplerCustomAdvanced (#113 et #119) La première passe favorise une stratégie axée sur la vitesse pour établir rapidement le mouvement et l'audio, tandis que la seconde passe passe à une stratégie axée sur la fidélité pour aiguiser les détails. Si vous changez de stratégie d'échantillonneur, gardez la première passe rapide et la seconde passe précise pour que les LTX 2.3 Gros Plans conservent leur éclat cinématographique.
  • LTX2_NAG (#342) Introduit un guidage conscient du bruit qui équilibre le conditionnement vidéo et audio. Augmenter l'accent vidéo peut renforcer le cadrage et la pose ; augmenter l'accent audio peut durcir la synchronisation labiale. Ajustez de manière conservatrice et en tandem avec CFGGuider pour éviter une contrainte excessive.
  • LTXVConditioning (#107 et #22) Lie vos prompts et la fréquence d'image à la chronologie latente. Maintenez un seul prompt positif au niveau de la scène et un prompt négatif compact pour le meilleur alignement. La fréquence d'image attachée assure que le rythme de la parole et la cadence du mouvement restent synchronisés.
  • VHS_VideoCombine (#140) Encode le résultat final en MP4 avec des réglages de lecture standard. Pour la livraison, augmentez la qualité en abaissant crf; pour l'édition, activez trim_to_audio pour que la longueur du clip corresponde exactement à la parole générée.

Extras optionnels#

  • Conseils de cadrage pour LTX 2.3 Gros Plans Recadrez pour que les yeux se situent près du tiers supérieur, laissez un peu d'espace, et gardez la bouche entièrement visible pour améliorer la synchronisation labiale. Évitez les contre-jours forts ou les filtres lourds dans la référence.
  • Prompting qui fonctionne Écrivez ce qui se passe au fil du temps, y compris les moments audibles comme les respirations, les rires et le bruit de fond. Omettez les attributs déjà présents dans l'image. Gardez la liste négative courte et pratique.
  • Taille et performance Si vous êtes faible en VRAM, essayez d'abord des tailles de base modérées, puis laissez la seconde passe échantillonner. Les dimensions qui suivent les contraintes de grille de LTX échantillonneront plus prévisiblement, et des fréquences d'image plus élevées exigent plus de calcul.
  • Flux de travail d'itération Verrouillez l'image et le prompt, itérez la première passe jusqu'à ce que le mouvement et la lecture soient corrects, puis passez à la seconde passe pour le détail. Utilisez le VAE de prévisualisation minuscule pour accélérer les vérifications, et n'activez le décodage complet que lorsque vous êtes prêt à exporter.
  • Quand utiliser T2V Passez en mode texte-à-vidéo pour les plans B et les gros plans abstraits uniquement pilotés par la narration. Pour les plans basés sur l'identité, gardez le chemin du portrait activé pour préserver l'esthétique des LTX 2.3 Gros Plans.

Remerciements#

Ce flux de travail implémente et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement Lightricks pour le modèle LTX‑2.3, LTX Docs pour le Guide de Flux de Travail Image-à-Vidéo, QuantStack pour les quantifications LTX‑2.3‑GGUF, et iiTzMYUNG pour la vitrine source LTX 2.3 pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation et aux référentiels originaux liés ci-dessous.

Ressources#

Note: L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.

RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.