LTX 2.3 클로즈업 샷: 초상화 이미지-투-비디오와 네이티브 오디오#
LTX 2.3 클로즈업 샷은 RunComfy-준비된 ComfyUI 워크플로우로, 단일 초상화를 시네마틱한 얼굴 전면 클립으로 변환하며 네이티브 오디오를 함께 생성합니다. "클로즈업 샷"은 프레이밍 목표와 프롬프트 스타일을 설명하며, 별도의 LTX 모델 변형이나 LoRA가 아닙니다. 이 그래프는 활성 디테일러 LoRA 없이 농축된 LTX 2.3 v1.1 GGUF 경로를 실행하며, 두 단계의 잠재 파이프라인과 x2 공간 업스케일러를 사용하여 안정적인 정체성, 자연스러운 립 싱크, 선명한 클로즈 프레이밍을 제공합니다.
패션 초상화, 대화 비트, 인터뷰, 세련된 소셜 클립을 위해 설계된 이 ComfyUI 빌드는 타이트한 구성과 일관된 오디오-비디오 모션을 강조합니다. LTX 2.3 클로즈업 샷으로, 당신은 정지 이미지를 제공하고 간결한 장면 설명을 제공합니다; 워크플로우는 모션, 타이밍, 목소리를 처리하여 공유 준비 완료된 MP4를 생성합니다.
Comfyui LTX 2.3 클로즈업 샷 워크플로우의 주요 모델들#
- LTX-2.3 22B Distilled 1.1 (Transformer-only). 더 빠른 추론과 낮은 메모리를 위해 농축된 코어 비디오-오디오 생성기이며 품질을 유지합니다. 소스: Lightricks/LTX-2.3.
- LTX-2.3 x2 Spatial Upscaler 1.1. 두 번째 패스 동안 세부 사항을 선명하게 하고 모션 안정성을 향상시키는 네이티브 잠재 업스케일러. LTX 2.3 릴리스에 포함됨: Lightricks/LTX-2.3.
- LTX-2.3 Video VAE (bf16) 및 LTX-2.3 Audio VAE (bf16). 비디오 및 오디오 잠재를 프레임과 파형으로 변환하며 동기화를 유지합니다. 큐레이팅된 가중치: Kijai/LTX2.3_comfy.
- LTX 2.3 22B 1.1을 위한 양자화된 GGUF 가중치. 메모리 효율적인 UNet/트랜스포머 및 텍스트 스택으로, CPU 오프로드 또는 저-VRAM GPU에 최적화됨. 배포: QuantStack/LTX-2.3-GGUF.
- Gemma 3 12B Instruct 텍스트 인코더와 LTX 텍스트 프로젝션. 튼튼한 프롬프트 이해와 타이밍 토큰을 제공하며, ComfyUI의 CLIP 인터페이스에 연결됨. GGUF 팩을 통해 포함됨: QuantStack/LTX-2.3-GGUF.
- 빠른 미리보기를 위한 선택적 작은 VAE. 반복 중 샘플러 미리보기에 유용함: madebyollin/taehv.
Comfyui LTX 2.3 클로즈업 샷 워크플로우 사용법#
이 워크플로우는 두 개의 조정된 단계를 실행합니다. 첫 번째 패스는 기본 크기에서 클로즈업 모션과 네이티브 오디오를 설정합니다. 두 번째 패스는 공간적으로 업샘플링하고 정체성과 립 싱크를 정제한 다음 비디오와 오디오를 디코딩하고 믹스합니다.
- 모델들 GGUF의 농축된 LTX 2.3 22B 1.1 모델, Gemma 3 기반 텍스트 스택, LTX 비디오 및 오디오 VAE를 로드합니다. 또한 매끄러운 반복을 위한 시퀀스 병렬 및 미리보기 도우미를 활성화합니다. 기본적으로 활성 디테일러 LoRA가 없으므로 LTX 2.3 클로즈업 샷의 외관이 깔끔하고 일관되게 유지됩니다.
- 비디오 설정 대상 너비, 높이, 프레임 속도 및 클립 길이를 여기에서 설정하세요. 그래프는 내부적으로 유효한 차원을 강제하지만, 프로덕션 친화적인 값을 선택하면 더 안정적인 결과와 부드러운 재생을 제공합니다. 빠르게 반복할 계획이라면, 처음에는 겸손하게 시작하고 두 번째 패스에서 확장하세요.
- T2V — 텍스트-투-비디오 모드 텍스트만으로 생성하려면 제공된 텍스트-투-비디오 스위치를 토글하세요. LTX 2.3 클로즈업 샷의 기본 경로는 이미지-투-비디오로, 정체성과 프레이밍을 초상화에 고정합니다.
- 입력 이미지 얼굴이 방해받지 않는 깨끗한 초상화 정지를 제공하세요. 워크플로우는 이미지를 사전 처리하고 크기를 조정한 다음,
LTXVImgToVideoInplace(#161)을 사용하여 정체성과 렌즈 기하학을 고정합니다. 배경 혼란을 최소화하고 느린 푸시인이 자연스럽게 느껴지도록 약간의 여유를 두세요. - 프롬프트 시간이 지나면서 샷을 설명하는 간결한 긍정적 프롬프트를 사용하여 줄 읽기, 숨쉬기, 미세 제스처 및 들리는 이벤트를 포함하세요. 스타일 감시보다는 아티팩트 제거에 초점을 맞춘 네거티브 프롬프트를 유지하세요. 참조 이미지에 이미 보이는 세부 사항을 반복하지 마세요. 이는 충실도와 안정성을 감소시킬 수 있습니다.
- LTX 잠재 준비 그래프는 설정에 맞는 빈 비디오 및 오디오 잠재를 생성하고, 이를 단일 AV 잠재로 병합하며, 선택한 프레임 속도로 긍정적 및 네거티브 조건을 부여합니다. 이는 시작부터 타이밍, 모션 및 오디오를 동기화 상태로 유지합니다.
- 샘플러 — 첫 번째 패스 첫 번째 패스는
CFGGuider(#129)를 사용하여 스피드 최적화 샘플러로 일관된 저해상도 AV 잠재를 생성합니다. 이 단계는 클로즈업 카메라 동작, 스피치 속도, 기본 립 싱크를 잠그는 내러티브 패스입니다. - 샘플러 — 두 번째 패스 업스케일 AV 잠재가 분할되고 비디오 경로가
LTXVLatentUpsampler(#118)를 사용하여 x2로 업스케일됩니다. 정체성은LTXVImgToVideoInplace(#160)를 사용하여 더 높은 크기에서 얼굴을 안정적으로 유지하도록 다시 투영되며, 오디오와 비디오는 다시 결합되고 세부 사항에 집중한 샘플러로 정제됩니다. 이 패스는 세부 사항을 향상시키고 깜빡임을 줄이며 LTX 2.3 클로즈업 샷의 외관을 세련되게 만듭니다. - 디코드 비디오 프레임은 메모리 효율성을 위해 타일링된 VAE로 디코드되며, 오디오는 오디오 VAE를 통해 디코드되며,
VHS_VideoCombine은 모든 것을 H.264 MP4로 믹스합니다. 반복 중 오디오를 미리볼 수 있으며, 생성된 스피치에 맞추어 최종 길이를 자를 수 있습니다. - 선택적 VRAM이 부족한 경우, 안정성을 위해 약간의 속도를 희생하는 청크 피드포워드 옵션을 활성화하세요. 더 빠른 룩-데브를 위해 작은 미리보기 VAE를 사용하세요. 멀티-GPU 사용자는 시퀀스 병렬 패처를 사용하여 긴 시퀀스를 부드럽게 유지할 수 있습니다.
Comfyui LTX 2.3 클로즈업 샷 워크플로우의 주요 노드들#
LTXVImgToVideoInplace(#161 및 #160) 초상화를 잠재 비디오에 고정하여 얼굴이 안정적으로 유지되면서 미세한 푸시인과 미세한 움직임이 재생됩니다. 이미지-투-비디오에 대해 활성 상태를 유지하세요; 텍스트-투-비디오 모드를 사용할 때만bypass를 전환하세요. 최상의 LTX 2.3 클로즈업 샷 결과를 위해 날카롭고 균일하게 조명된 참조에서 시작하고 입 부분에 가려짐을 피하세요.LTXVLatentUpsampler(#118) 두 번째 패스 정제 전에 잠재 공간에서 네이티브 LTX 2.3 x2 공간 업스케일러를 적용합니다. 이는 모션의 일관성을 유지하면서 세부 사항을 증가시킵니다. 클로즈업의 경우, 업스케일을 x2로 유지하는 것이 일반적으로 선명함과 안정성의 최상의 균형을 제공합니다.CFGGuider(#129 및 #103) 긍정적 및 네거티브 조건을 통합하여 두 모달리티에 대한 통합된 가이드 신호를 생성합니다. 가이드 강도를 약간 조정하면 스크립트와 프레이밍에 대한 준수를 조이거나 느슨하게 할 수 있습니다. 가이드를 증가시키면, 표현을 과도하게 제한하지 않도록 네거티브 목록을 약간 부드럽게 고려하세요.SamplerCustomAdvanced(#113 및 #119) 첫 번째 패스는 모션과 오디오를 빠르게 설정하기 위해 속도 지향 전략을 선호하며, 두 번째 패스는 세부 사항을 선명하게 하기 위해 충실도 지향 전략으로 전환합니다. 샘플러 전략을 변경할 경우, 첫 번째 패스를 빠르게 유지하고 두 번째 패스를 정밀하게 유지하여 LTX 2.3 클로즈업 샷이 시네마틱한 마무리를 유지하도록 하세요.LTX2_NAG(#342) 비디오 및 오디오 조건을 균형 잡는 노이즈 인식 가이드를 도입합니다. 비디오 강조를 높이면 프레이밍과 포즈를 확고히 할 수 있으며, 오디오 강조를 높이면 립 싱크를 강화할 수 있습니다. 과도한 제약을 피하기 위해CFGGuider와 함께 보수적으로 조정하세요.LTXVConditioning(#107 및 #22) 프롬프트와 프레임 속도를 잠재 타임라인에 바인딩합니다. 단일, 장면 수준의 긍정적 프롬프트와 간결한 네거티브 프롬프트를 유지하여 가장 깨끗한 정렬을 유지하세요. 첨부된 프레임 속도는 스피치 페이싱과 모션 리듬을 일치시킵니다.VHS_VideoCombine(#140) 표준 재생 설정으로 최종 결과를 MP4로 인코드합니다. 전달을 위해crf를 낮춰 품질을 높이세요; 편집을 위해, 생성된 스피치에 맞게 클립 길이가 일치하도록trim_to_audio를 활성화하세요.
선택적 추가 기능#
- LTX 2.3 클로즈업 샷을 위한 프레이밍 팁 눈이 상단 3분의 1에 가깝게 위치하도록 잘라내고, 약간의 여유를 두고 입이 완전히 보이게 하여 립 싱크를 개선하세요. 강한 역광이나 무거운 필터를 참조에서 피하세요.
- 효과적인 프롬프트 작성 시간이 지남에 따라 발생하는 일을 작성하고, 숨소리, 웃음소리, 방음 같은 들리는 순간을 포함하세요. 이미지에 이미 있는 속성은 제외하세요. 네거티브 목록은 짧고 실용적으로 유지하세요.
- 크기 및 성능 VRAM이 부족한 경우, 먼저 적당한 기본 크기를 시도한 다음, 두 번째 패스에서 업스케일하세요. LTX의 그리드 제약을 따르는 차원은 더 예측 가능하게 샘플링되며, 더 높은 프레임 속도는 더 많은 계산을 요구합니다.
- 반복 워크플로우 이미지와 프롬프트를 고정하고, 모션과 리드가 적절해질 때까지 첫 번째 패스를 반복한 다음, 두 번째 패스로 이동하여 세부 사항을 다듬으세요. 체크 속도를 높이기 위해 작은 미리보기 VAE를 사용하고, 내보낼 준비가 되었을 때만 전체 디코딩을 활성화하세요.
- T2V를 사용할 때 순전히 내레이션에 의해 구동되는 B-롤 및 추상 클로즈업을 위해 텍스트-투-비디오 모드로 전환하세요. 정체성 중심의 샷을 위해, 초상화 경로를 유지하여 LTX 2.3 클로즈업 샷의 미학을 보존하세요.
감사#
이 워크플로우는 다음 작업 및 리소스를 구현하고 구축합니다. 우리는 Lightricks의 LTX-2.3 모델, LTX Docs의 이미지-투-비디오 워크플로우 가이드, QuantStack의 LTX-2.3-GGUF 양자화, 그리고 iiTzMYUNG의 LTX 2.3 소스 쇼케이스에 대한 기여와 유지 관리에 감사드립니다. 권위 있는 세부 사항은 아래 링크된 원본 문서 및 저장소를 참조하세요.
리소스#
- Lightricks/LTX-2.3
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.3
- arXiv: arXiv:2601.03233
- LTX Docs/이미지-투-비디오 워크플로우 가이드
- GitHub: Lightricks/ComfyUI-LTXVideo
- Docs / Release Notes: 이미지-투-비디오 워크플로우 가이드
- QuantStack/LTX-2.3-GGUF
- Hugging Face: QuantStack/LTX-2.3-GGUF
- iiTzMYUNG/LTX 2.3 클로즈업 샷이 정말 놀라워요!
- Docs / Release Notes: LTX 2.3 클로즈업 샷이 정말 놀라워요!
Note: 참조된 모델, 데이터세트 및 코드의 사용은 작성자와 유지 관리자가 제공하는 각각의 라이선스 및 조건에 따릅니다.

