LTX 2.5 ComfyUI 이미지에서 비디오로 동기화된 오디오와 함께#
이 RunComfy 준비된 LTX 2.5 ComfyUI 워크플로우는 단일 첫 프레임과 모션 프롬프트를 사용하여 일관된 모델 내 오디오와 함께 짧은 시네마틱 비디오로 변환합니다. 이는 Lightricks LTX-2.5 패밀리에 의해 구동되며, Pixel Diffusion, Gemma 기반 프롬프트 강화기, 비디오 및 오디오 VAE, 선명한 모션과 강력한 프롬프트 준수를 위한 잠재적 업스케일링을 결합합니다.
이 LTX 2.5 ComfyUI 그래프를 사용하여 초상화, 분위기 있는 장소, 제품, 동물 및 개념 촬영을 ComfyUI 내에서 애니메이션화하세요. 시작 이미지를 제공하고, 동작과 카메라를 설명하고, 지속 시간과 프레임 속도를 설정하여 프레임 간에 캐릭터, 조명 및 스타일을 유지하는 촬영을 렌더링하세요.
Comfyui LTX 2.5 ComfyUI 워크플로우의 주요 모델#
- Lightricks LTX-2.5 증류 변환기. 코어 이미지-비디오 생성기는 시간적으로 일관된 모션을 생성하고 오디오-비주얼 잠재성을 융합합니다. 모델 카드: Lightricks/LTX-2.5.
- LTX-2.5 비디오 VAE. 빠른 모션에서 더 높은 충실도와 더 적은 얼룩으로 프레임으로 비디오 잠재성을 디코딩합니다. 가중치: ltx-2.5-video-vae-bf16.safetensors.
- LTX-2.5 오디오 VAE. 시각적 동작 및 타이밍에 맞춰 동기화된 오디오를 생성합니다. 가중치: ltx-2.5-audio-vae-bf16.safetensors.
- Gemma 4 12B 텍스트 인코더와 LTX 프로젝션. 풍부한 다중 엔티티 프롬프트와 카메라 방향을 해석합니다. 가중치: gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors.
- 프롬프트 강화기용 Gemma 4 E2B 지시 변형. 짧은 프롬프트를 낮은 컴퓨팅 비용으로 시네마틱 방향으로 확장합니다. 가중치: gemma4_e2b_it_bf16.safetensors.
- LTX-2.5 잠재적 공간 업스케일러 x2. 디코딩 전에 잠재적 공간에서 업스케일링하여 세부 사항을 선명하게 합니다. 가중치: ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors.
- 파이프라인 및 스케줄러에 대한 참조 구현: LTX-2.5 Diffusers.
Comfyui LTX 2.5 ComfyUI 워크플로우 사용 방법#
이 워크플로우는 프롬프트를 확장하고 조건을 설정하며, 비디오 및 오디오 잠재성을 구성하고, 저해상도 패스를 샘플링하고, 잠재적 업스케일링을 수행한 후 프레임과 동기화된 오디오로 디코딩하여 최종 믹싱을 수행합니다. 최상위 컨트롤러는 Image to Video (LTX-2.5) (#398)이며, 첫 프레임, 텍스트 프롬프트 및 주요 설정을 가져온 후 서브그래프로 라우팅합니다.
이미지 전처리#
Load First Frame (#395)에 시작 이미지를 제공하세요. 프레임은 LTXVPreprocess (#350)에서 깨끗하고 모델 친화적인 기준선으로 표준화됩니다. ResolutionSelector (#403)를 사용하여 비율과 스케일을 선택하세요; 이는 모델 친화적인 배수에 맞춰 너비와 높이를 출력합니다. 좋은 첫 프레임은 선명하고, 잘 조명되고, 설명할 모션에 맞춰 구성되어 있습니다. 전처리기는 잠재적 샘플링을 준비하면서 파괴적 변경을 피합니다.
프롬프트 강화#
Prompt (#376)에 모션 및 카메라 프롬프트를 작성하세요. 내장된 강화기를 활성화하면 TextGenerateLTX2Prompt (#380)이 액션 비트, 연속성 및 프레이밍에 대한 세부 정보를 추가하여 텍스트를 풍부하게 합니다. 스위처 ComfySwitchNode (#382)를 사용하여 원시 텍스트 또는 강화된 버전을 조건에 맞게 라우팅할 수 있습니다. 이 단계는 짧은 입력에 대한 프롬프트 준수를 향상시키고 프레임 간 주제와 스타일을 유지하는 데 도움이 됩니다. 렌더링 전에 PreviewAny (#381)에서 확장된 텍스트를 미리 볼 수 있습니다.
모델#
서브그래프는 UNETLoader (#384)에서 증류된 생성기를 로드하고 VAELoader에서 비디오 (#385) 및 오디오 (#386) 디코더를 로드합니다. 잠재적 업스케일러 모델은 나중에 깨끗한 x2 디테일 패스를 위해 LatentUpscaleModelLoader (#371)에 의해 준비됩니다. 이 블록은 인코딩, 샘플링 및 디코딩 전반에 걸쳐 동일한 LTX-2.5 모델 패밀리가 사용되도록 하여 시간적 일관성을 유지합니다.
프롬프트#
CLIPLoader (#387) 및 CLIPTextEncode 긍정 (#364)은 설명적인 프롬프트를 조건으로 변환합니다. 전용 부정 인코더 (#373)는 낮은 품질이나 아티팩트와 같은 원치 않는 특성을 억제합니다. LTXVConditioning (#365)은 텍스트 조건을 선택한 프레임 속도와 병합하여 타이밍 지침이 오디오-비주얼 잠재 스트림으로 흐르도록 합니다. 카메라 및 동작 언어를 명확하게 유지하면 모션 안정성과 편집 여유가 향상됩니다.
비디오 설정#
지속 시간, 너비, 높이, 프레임 속도 및 시드는 Video Settings 그룹 (예: Duration (#362) 및 Frame Rate (#361))에서 설정됩니다. 간단한 수학 도우미는 총 프레임 수를 계산하고 필요한 곳에 균일한 값을 제공합니다. 원하는 느낌에 맞는 프레임 속도를 선택하세요; 느린 동작은 낮은 fps에서 더 좋아 보일 수 있으며, 빠른 모션은 높은 fps에서 이점이 있습니다. 재현 가능한 촬영을 위해 시드를 고정하세요; 대체를 탐색하기 위해 시드를 변경하세요.
빈 잠재성#
EmptyLTXVLatentVideo (#356)는 적절한 크기와 길이의 비디오 잠재성을 생성하고, LTXVEmptyLatentAudio (#366)는 시간 정렬된 오디오 잠재성을 구성합니다. 이는 비디오 및 오디오 스트림이 처음부터 타이밍을 공유하도록 보장합니다. 지속 시간과 프레임 속도에서 파생된 길이와 함께 샘플러는 올바르게 형성된 텐서를 받습니다. 결과는 공동 오디오-비주얼 노이즈 제거를 위한 동기화된 기반입니다.
저해상도 생성#
첫 번째 샘플링 패스는 관리 가능한 해상도에서 일관된 모션을 구축합니다. LTXVDualCFGGuider (#388)는 듀얼 모달리티 지침을 적용하여 텍스트와 타이밍이 비디오 및 오디오 잠재성을 함께 형성하도록 합니다. SamplerCustomAdvanced (#344)는 선택한 샘플러 및 일정과 함께 확산 단계를 실행하며, RandomNoise (#339)에 의해 시드됩니다. 첫 프레임 제약 조건은 LTXVImgToVideoInplace (#357)에 의해 적용되어 제공된 이미지에 정체성, 조명 및 구성을 앵커합니다. 샘플링 후 LTXVConcatAVLatent 및 LTXVSeparateAVLatent는 다음 단계를 위해 필요에 따라 오디오 및 비디오 잠재성을 섞습니다.
잠재적 업스케일#
LTXVLatentUpsampler (#348)는 디코딩 전에 텍스처와 미세 세부 사항을 선명하게 하기 위해 x2 잠재적 공간 업스케일링을 수행합니다. LTXVImgToVideoInplace (#349)는 시작 프레임과 업스케일된 잠재성을 다시 정렬하여 정체성과 레이아웃이 안정적으로 유지되도록 합니다. 잠재적 공간에서 이 작업을 수행하면 픽셀 공간 리사이징보다 시간적 부드러움을 더 잘 유지합니다. 이 단계는 최종 선명도에 크게 기여합니다.
고해상도 생성#
정제 샘플러 (KSamplerSelect (#341) 및 SamplerCustomAdvanced (#368))는 업스케일된 잠재성을 짧은 일정으로 실행하여 가장자리 안정화 및 세부 사항 풍부화를 수행합니다. LTXVDualCFGGuider (#391)는 텍스트와 일치하면서 첫 번째 패스에서 설정된 모션을 유지하도록 지침을 일관되게 유지합니다. 결합된 잠재성은 LTXVSeparateAVLatent (#369)에 의해 디코딩을 위해 분리됩니다. VAEDecodeTiled (#374)는 비디오 잠재성을 프레임으로 변환하고 LTXVAudioVAEDecode (#358)는 동기화된 오디오를 생성합니다.
렌더 및 저장#
CreateVideo (#370)는 선택한 fps로 프레임과 오디오를 단일 비디오 스트림으로 믹싱합니다. 외부 그래프에서 SaveVideo (#75)는 결과를 일반 ComfyUI 출력에 저장합니다. 최종 렌더 전에 최상위 래퍼의 미리보기 노드를 통해 오디오만 감상할 수도 있습니다.
Comfyui LTX 2.5 ComfyUI 워크플로우의 주요 노드#
Image to Video (LTX-2.5) (#398)#
전체 파이프라인을 위한 원스톱 컨트롤러입니다. 첫 프레임, 프롬프트, 지속 시간, 해상도, 프레임 속도를 제공하고 프롬프트 강화를 활성화할지 여부를 설정하세요. 빠르게 반복하려면 사용하세요; 미세 조정할 준비가 되면 Enter 서브그래프를 클릭하여 샘플러, 지침 및 디코딩을 조정하세요. 텍스트 전용 비디오가 필요한 경우, 서브그래프를 열고 이미지-비디오 노드의 내부 텍스트-비디오 바이패스를 토글하세요.
LTXVDualCFGGuider (#388)#
공동 오디오-비주얼 잠재성에 대한 분류자 없는 지침을 적용하여 프롬프트 준수와 시간적 안정성을 균형 있게 조정합니다. 프롬프트 준수를 강화하고 더 강력한 모션을 위해 지침을 증가시키세요; 깜박임을 줄이거나 시작 프레임의 세부 사항을 더 많이 보존하려면 지침을 낮추세요. 비디오 및 오디오 지침을 동일한 수준으로 유지하여 사운드트랙이 화면 동작과 일치하도록 하세요.
SamplerCustomAdvanced (#344)#
선택한 샘플러 및 사용자 정의 시그마 일정을 사용하여 확산을 구동합니다. 샘플러 변형을 전환하거나 일정을 편집하여 모션 품질 대 안정성을 탐색하려면 이 노드를 사용하세요. 고정된 시드와 쌍을 이루어 설정을 사과 대 사과로 비교한 후, 시드를 무작위화하여 최상의 테이크를 찾으세요.
LTXVLatentUpsampler (#348)#
LTX-2.5 x2 모델을 사용하여 잠재 공간에서 업스케일하여 세부 사항을 개선하고 시간적 흔들림을 도입하지 않습니다. 강한 크롭핑이나 타이트한 클로즈업을 계획 중이라면, 이 기능을 활성화하여 작은 특징이 디코딩을 견딜 수 있도록 하세요. 극단적인 VRAM 제한의 경우, 일부 선명도를 희생하면서 업스케일링을 우회할 수 있습니다.
VAEDecodeTiled (#374)#
타일링을 사용하여 메모리 사용을 제어하면서 고해상도 비디오 잠재성을 프레임으로 디코딩합니다. 낮은 VRAM에서는 더 작은 타일을 선호하여 메모리 부족 오류를 피하세요. 높은 VRAM에서는 더 큰 타일이 이음새를 줄이고 디코딩 속도를 높일 수 있습니다.
CreateVideo (#370)#
디코딩된 프레임과 생성된 오디오를 선택한 프레임 속도로 단일 비디오 스트림으로 결합합니다. 여기에서 fps를 조정하여 창의적 의도에 맞추거나 플랫폼 요구 사항을 충족하세요. 믹싱된 출력은 외부 그래프의 저장장치로 전달됩니다.
선택적 추가 기능#
- 프롬프트를 간결하지만 구체적으로 유지하세요: 누구/무엇, 동작, 카메라 이동, 조명, 분위기. 프롬프트 강화기가 시네마틱 표현을 추가하도록 하세요.
- 상충되는 카메라 방향을 피하세요. 강한 하나의 이동(푸시 인, 팬, 돌리)이 여러 개를 쌓는 것보다 더 안정적인 결과를 생성하는 경향이 있습니다.
- 초상화 및 제품 촬영을 위해 깨끗하고, 대비가 높은 첫 프레임을 사용하세요; 모델은 정체성과 가장자리를 더 잘 보존할 것입니다.
- 모션과 프레이밍을 조정하기 위해 중간 지속 시간으로 시작하세요; 행동이 마음에 들면 연장하세요.
- 출력이 부드러워 보이면 너비와 높이가 32의 배수인지 확인하고 잠재적 업스케일러를 활성 상태로 유지하세요.
- 일관된 반복을 위해 시드를 고정하세요. 대체를 탐색할 때, 다른 설정을 그대로 유지하면서 시드를 변경하세요.
감사의 말#
이 워크플로우는 다음 작업 및 리소스를 구현하고 기반으로 구축합니다. 우리는 LTX-2.5: ComfyUI 워크플로우 템플릿에 대한 Comfy Org, Lightricks의 LTX-2.5 모델 가중치, Lightricks의 LTX-2.5 Diffusers 프로젝트, 그리고 그들의 기여와 유지 보수에 대한 Hugging Face 조직 리소스에 감사드립니다. 권위 있는 세부 정보는 아래에 링크된 원본 문서 및 저장소를 참조하십시오.
리소스#
- Comfy.org/Source 워크플로우 템플릿
- GitHub: Comfy-Org
- 문서 / 릴리스 노트: Source 워크플로우 템플릿
- **Ljson
ightricks/LTX-2.5 모델 가중치**
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.5
- arXiv: 2601.03233
- Lightricks/LTX-2.5 Diffusers 프로젝트
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- arXiv: 2601.03233
- Lightricks/Hugging Face 조직
- GitHub: Lightricks
- Hugging Face: Lightricks
참고: 참조된 모델, 데이터셋 및 코드는 작성자 및 유지 관리자가 제공한 해당 라이선스 및 약관에 따릅니다.

