LTX 2.3 Riprese Ravvicinate: immagine a video con audio nativo#
LTX 2.3 Riprese Ravvicinate è un flusso di lavoro ComfyUI pronto per RunComfy che trasforma un singolo ritratto in un clip cinematografico frontale con audio nativo generato congiuntamente. "Riprese Ravvicinate" descrive l'obiettivo di inquadratura e lo stile del prompt, non una variante del modello LTX separata o LoRA. Il grafico esegue il percorso distillato LTX 2.3 v1.1 GGUF senza LoRA attivo per i dettagli, utilizzando una pipeline latente a due stadi e un upscaler spaziale x2 per offrire identità stabile, sincronizzazione labiale naturale e inquadrature ravvicinate nitide.
Progettato per ritratti di moda, battute di dialogo, interviste e clip sociali rifiniti, questo build di ComfyUI enfatizza la composizione stretta e il movimento audio-video coerente. Con LTX 2.3 Riprese Ravvicinate, fornisci un'immagine fissa e una descrizione concisa della scena; il flusso di lavoro gestisce movimento, tempi e voce per produrre un MP4 pronto per la condivisione.
Modelli chiave nel flusso di lavoro Comfyui LTX 2.3 Riprese Ravvicinate#
- LTX-2.3 22B Distilled 1.1 (Solo Trasformatore). Il generatore principale video-audio distillato per inferenza più veloce e memoria ridotta mantenendo la qualità. Fonte: Lightricks/LTX-2.3.
- LTX-2.3 x2 Spatial Upscaler 1.1. Un upscaler latente nativo che affina i dettagli e migliora la stabilità del movimento durante il secondo passaggio. Incluso nel rilascio LTX 2.3: Lightricks/LTX-2.3.
- LTX-2.3 Video VAE (bf16) e LTX-2.3 Audio VAE (bf16). Decoder che trasformano latenze video e audio in fotogrammi e forme d'onda mantenendo la sincronizzazione stretta. Pesi curati: Kijai/LTX2.3_comfy.
- Pesi GGUF quantizzati per LTX 2.3 22B 1.1. UNet/trasformatore e stack di testo efficienti in memoria, ottimizzati per il trasferimento su CPU o GPU a basso VRAM. Distribuzione: QuantStack/LTX-2.3-GGUF.
- Gemma 3 12B Instruct text encoder con proiezione di testo LTX. Fornisce una robusta comprensione del prompt e token di temporizzazione per entrambe le modalità, cablato nell'interfaccia CLIP di ComfyUI. Incluso tramite il pacchetto GGUF: QuantStack/LTX-2.3-GGUF.
- VAE opzionale di piccole dimensioni per anteprime rapide. Utile per anteprime del campionatore durante l'iterazione: madebyollin/taehv.
Come utilizzare il flusso di lavoro Comfyui LTX 2.3 Riprese Ravvicinate#
Questo flusso di lavoro si esegue in due stadi coordinati. Il primo passaggio stabilisce il movimento ravvicinato e l'audio nativo a una dimensione di base. Il secondo passaggio esegue l'upsampling spaziale e affina identità e sincronizzazione labiale, quindi decodifica e muxa video con audio.
- MODELLI Carica il modello distillato LTX 2.3 22B 1.1 in GGUF, lo stack di testo basato su Gemma 3 e i VAE video e audio LTX. Abilita anche gli helper di sequenza-parallela e anteprima per un'iterazione più fluida. Nessun LoRA per i dettagli è attivo per impostazione predefinita, il che mantiene l'aspetto LTX 2.3 Riprese Ravvicinate pulito e coerente.
- Impostazioni Video Imposta qui la larghezza, l'altezza, il frame rate e la durata del clip desiderati. Il grafico applica dimensioni valide internamente, ma scegliere valori compatibili con la produzione offre risultati più stabili e riproduzione più fluida. Se prevedi di iterare rapidamente, inizia modestamente e scala nel secondo passaggio.
- T2V — Modalità testo a video Quando vuoi generare solo dal testo, attiva l'interruttore fornito testo-a-video. Per LTX 2.3 Riprese Ravvicinate il percorso predefinito è immagine-a-video, che mantiene identità e inquadratura ancorate al tuo ritratto.
- Immagine di Input Fornisci un ritratto pulito con il volto non ostruito. Il flusso di lavoro pre-elabora e ridimensiona l'immagine, quindi utilizza
LTXVImgToVideoInplace(#161) per ancorare identità e geometria dell'obiettivo. Mantieni il disordine di sfondo minimo e concedi un po' di margine superiore in modo che la spinta lenta sembri naturale. - Prompt Usa un prompt positivo conciso per descrivere la ripresa nel tempo, inclusi letture di linee, respiri, micro-gesti ed eventi udibili. Mantieni il prompt negativo focalizzato sulla rimozione di artefatti piuttosto che sulla polizia dello stile. Non ripetere dettagli già visibili nell'immagine di riferimento, poiché ciò può ridurre la fedeltà e la stabilità.
- Prepara LTX Latent Il grafico crea latenze video e audio vuote che corrispondono alle tue impostazioni, le fonde in un singolo AV latente e attacca il tuo condizionamento positivo e negativo con il frame rate scelto. Questo mantiene tempi, movimento e audio in sincronia fin dall'inizio.
- Campionatore — Primo Passaggio Il primo passaggio utilizza
CFGGuider(#129) con un campionatore ottimizzato per la velocità per generare un AV latente coerente a bassa risoluzione. Questo stadio blocca il comportamento della telecamera ravvicinata, la cadenza del discorso e la sincronizzazione labiale di base. Pensalo come il passaggio narrativo che stabilisce cosa succede. - Campionatore — Secondo Passaggio Upscale L'AV latente viene diviso e il percorso video viene scalato x2 usando
LTXVLatentUpsampler(#118). L'identità viene riproiettata conLTXVImgToVideoInplace(#160) per mantenere il volto stabile alla dimensione più grande, quindi audio e video vengono riuniti e affinati con un campionatore focalizzato sulla fedeltà. Questo passaggio migliora i dettagli, riduce lo sfarfallio e perfeziona l'aspetto LTX 2.3 Riprese Ravvicinate. - Decodifica I fotogrammi video vengono decodificati con un VAE a piastrelle per l'efficienza della memoria, l'audio viene decodificato tramite il VAE audio e
VHS_VideoCombinemuxa tutto in un MP4 H.264 con formato pixel standard 4:2:0. Puoi visualizzare in anteprima l'audio durante l'iterazione e tagliare la durata finale per corrispondere al discorso generato. - Opzionale Se la VRAM è stretta, abilita l'opzione di feed-forward a blocchi per scambiare un po' di velocità per stabilità. Per uno sviluppo look più veloce, usa il piccolo VAE di anteprima. Gli utenti multi-GPU possono beneficiare del patcher di sequenza-parallela per mantenere sequenze lunghe fluide.
Nodi chiave nel flusso di lavoro Comfyui LTX 2.3 Riprese Ravvicinate#
LTXVImgToVideoInplace(#161 e #160) Ancora il ritratto nel video latente in modo che il volto rimanga stabile mentre si svolgono leggeri movimenti e micro-movimenti. Mantienilo attivo per immagine-a-video; commuta il suobypasssolo quando usi la modalità testo-a-video. Per i migliori risultati LTX 2.3 Riprese Ravvicinate, inizia da un riferimento nitido e uniformemente illuminato ed evita l'occlusione della bocca.LTXVLatentUpsampler(#118) Applica l'upscaler spaziale x2 nativo LTX 2.3 nello spazio latente prima della raffinazione del secondo passaggio. Questo preserva la coerenza del movimento aumentando i dettagli. Per i primi piani, mantenere l'upscale a x2 offre tipicamente il miglior equilibrio tra nitidezza e stabilità.CFGGuider(#129 e #103) Combina il tuo condizionamento positivo e negativo in un segnale di guida unificato per entrambe le modalità. Piccole regolazioni della forza di guida possono stringere o allentare l'aderenza al tuo script e inquadratura. Se aumenti la guida, considera di ammorbidire leggermente la lista negativa per evitare di vincolare eccessivamente le espressioni.SamplerCustomAdvanced(#113 e #119) Il primo passaggio favorisce una strategia orientata alla velocità per stabilire rapidamente movimento e audio, mentre il secondo passaggio passa a una strategia orientata alla fedeltà per affinare i dettagli. Se cambi la strategia del campionatore, mantieni il primo passaggio veloce e il secondo passaggio preciso in modo che LTX 2.3 Riprese Ravvicinate mantenga la sua lucidatura cinematografica.LTX2_NAG(#342) Introduce una guida consapevole del rumore che bilancia il condizionamento video e audio. Aumentare l'enfasi video può rafforzare l'inquadratura e la posa; aumentare l'enfasi audio può rafforzare la sincronizzazione labiale. Regola in modo conservativo e in tandem conCFGGuiderper evitare di vincolare eccessivamente.LTXVConditioning(#107 e #22) Vincola i tuoi prompt e il frame rate alla linea temporale latente. Mantieni un singolo prompt positivo a livello di scena e un prompt negativo compatto per l'allineamento più pulito. Il frame rate allegato assicura che il ritmo del discorso e la cadenza del movimento rimangano sincronizzati.VHS_VideoCombine(#140) Codifica il risultato finale in MP4 con impostazioni di riproduzione standard. Per la consegna, aumenta la qualità abbassandocrf; per l'editoriale, abilitatrim_to_audioin modo che la lunghezza del clip corrisponda esattamente al discorso generato.
Extra opzionali#
- Consigli di inquadratura per LTX 2.3 Riprese Ravvicinate Ritaglia in modo che gli occhi si trovino vicino al terzo superiore, concedi un po' di margine superiore e mantieni la bocca completamente visibile per migliorare la sincronizzazione labiale. Evita forti retroilluminazioni o filtri pesanti nel riferimento.
- Prompt che funzionano Scrivi cosa succede nel tempo, inclusi momenti udibili come respiri, risate e tono della stanza. Lascia fuori gli attributi già presenti nell'immagine. Mantieni la lista negativa breve e pratica.
- Dimensionamento e prestazioni Se sei a corto di VRAM, prova prima dimensioni di base moderate, quindi lascia che il secondo passaggio esegua l'upscale. Dimensioni che seguono i vincoli della griglia di LTX campioneranno più prevedibilmente e frame rate più alti richiedono più calcoli.
- Flusso di lavoro di iterazione Blocca immagine e prompt, itera il primo passaggio finché il movimento e la lettura non sembrano corretti, quindi passa al secondo passaggio per i dettagli. Usa il piccolo VAE di anteprima per velocizzare i controlli e abilita la decodifica completa solo quando sei pronto per esportare.
- Quando usare T2V Passa alla modalità testo-a-video per B‑roll e primi piani astratti guidati esclusivamente dalla narrazione. Per riprese guidate dall'identità, mantieni attivo il percorso del ritratto per preservare l'estetica LTX 2.3 Riprese Ravvicinate.
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo sentitamente Lightricks per il modello LTX‑2.3, LTX Docs per la Guida al Flusso di Lavoro Immagine‑a‑Video, QuantStack per le quantizzazioni LTX‑2.3‑GGUF e iiTzMYUNG per la vetrina della fonte LTX 2.3 per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- Lightricks/LTX-2.3
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.3
- arXiv: arXiv:2601.03233
- LTX Docs/Image-to-Video Workflow Guide
- GitHub: Lightricks/ComfyUI-LTXVideo
- Docs / Release Notes: Image-to-Video Workflow Guide
- QuantStack/LTX-2.3-GGUF
- Hugging Face: QuantStack/LTX-2.3-GGUF
- iiTzMYUNG/LTX 2.3 Close-Up Shots Are Absolutely Insane!
- Docs / Release Notes: LTX 2.3 Close-Up Shots Are Absolutely Insane!
Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

