LTX 2.5 GGUF ComfyUI 이미지에서 비디오로, 동기화된 오디오와 함께#
이 LTX 2.5 GGUF ComfyUI 워크플로우는 단일 소스 이미지와 자연어 프롬프트를 사용하여 생성된 동기화된 오디오 트랙이 있는 짧은 비디오로 변환합니다. 공식 LTX‑2.5 모델 패밀리를 사용하여 비디오 및 오디오를 생성하고, GGUF‑양자화된 UNet 경로를 통해 시네마틱 모션과 장면 일관성을 유지하면서 VRAM을 줄입니다.
이 그래프는 캐릭터 샷, 기계 및 환경 이동에 대한 빠른 반복을 위해 설계되었습니다. 이미지에서 비디오로 또는 텍스트에서 비디오로 전환하는 스위치, 2단계 잠재 파이프라인(거친 패스 후 잠재 업스케일링), 타일 디코딩을 포함하여 메모리 압박을 낮게 유지합니다. 컴팩트하고 프로덕션 준비된 경로가 필요하다면 이 LTX 2.5 GGUF ComfyUI 워크플로우는 실용적인 시작점입니다.
ComfyUI LTX 2.5 GGUF ComfyUI 워크플로우의 주요 모델#
- LTX‑2.5 (official, by Lightricks). 모션 합성과 멀티모달 가이던스를 위한 핵심 비디오 및 오디오 생성 모델입니다. Model card
- LTX‑2.5 Video VAE (bf16). 효율적인 생성을 위해 비디오 잠재를 인코딩하고 디코딩하며, 메인 모델과 함께 사용됩니다. LTX‑2.5 저장소의 vae/에 포함되어 있습니다. Video VAE
- LTX‑2.5 Audio VAE (bf16). 오디오 잠재 경로를 처리하여 최종 렌더링에 동기화된 사운드를 포함합니다. LTX‑2.5 저장소의 vae/에 포함되어 있습니다. Audio VAE
- Gemma‑기반 12B 텍스트 인코더와 LTX‑2.5 투영. LTX‑2.5와 일치하는 프롬프트 임베딩을 제공하며, LTX 저장소의 text_encoders/에 패키지되어 있습니다. Text encoder
- LTX‑2.5 Latent Spatial Upscaler x2 1.0. 거친 패스 후 디테일을 추가하는 잠재적 공간 슈퍼‑해상도 모델입니다. Upscaler
- LTX‑2.5 Distilled UNet (GGUF quantized). ComfyUI‑GGUF 로더를 통해 로드된 양자화된 UNet 가중치를 사용하여 메모리 사용을 줄이면서 품질을 유지합니다. GGUF는 추론 형식이며, 공식 모델 이름이 아닙니다. ComfyUI‑GGUF
ComfyUI LTX 2.5 GGUF ComfyUI 워크플로우 사용 방법#
파이프라인은 두 단계로 실행됩니다: 움직임과 타이밍을 설정하기 위한 저해상도 패스, 잠재적 업스케일링과 고해상도 정제를 따릅니다. 오디오는 전체 과정에서 쌍으로 된 잠재로 유지되며, 최종 프레임과 함께 디코딩되고 믹스됩니다.
모델#
GGUF‑양자화된 UNet을 UnetLoaderGGUF (#406)으로 로드합니다. 비디오 및 오디오 VAE는 VAELoader (#385, #386)로 선택되며, Gemma‑기반 텍스트 인코더는 CLIPLoader (#387)로 제공됩니다. 업스케일러는 LatentUpscaleModelLoader (#371)로 선택됩니다. 이 그룹은 다른 모든 그룹이 의존하는 백본을 정의합니다.
프롬프트#
Prompt 필드에 장면 설명을 작성하고, 주제, 움직임, 그리고 단일 명확한 카메라 이동에 집중합니다. 텍스트 인코더는 LTXVConditioning (#365)을 통해 긍정적 및 부정적 프롬프트를 임베딩하며, 타이밍을 맞추기 위해 선택한 프레임 속도를 수용합니다. 음성 같은 오디오가 필요하다면 짧은 인용문을 포함하세요; 오디오 경로는 장면을 인식하면서 텍스트 컨텍스트에 반응할 것입니다. 프롬프트는 간결하고 구체적으로 유지하여 상충하는 가이던스를 피하세요.
비디오 설정#
지속 시간, 프레임 속도, 목표 크기를 설정합니다. 유틸리티는 초와 fps를 프레임 수로 변환하여 그래프가 올바른 시간 길이를 할당하도록 합니다. 안정성과 속도를 위해 32의 배수 크기를 유지하세요. 일반적인 화면비를 선택한 후 원하는 비율로 조정하세요.
이미지 전처리#
첫 번째 (참조) 프레임을 로드하고 LTXVPreprocess (#350)로 LTX‑2.5에 맞게 정규화하세요. Switch to Text to Video? (#363) 스위치는 이미지가 공간적 앵커로 사용될지 순수 텍스트로 비디오를 만들지 결정합니다. 리사이즈 도우미는 입력을 작업 해상도와 일관되게 유지합니다. 좋은 전처리는 정체성 보존과 레이아웃을 향상시킵니다.
빈 잠재#
EmptyLTXVLatentVideo (#356)와 LTXVEmptyLatentAudio (#366)는 비디오와 오디오를 위한 시간 캔버스를 미리 할당합니다. 이 길이는 지속 시간과 fps 선택에서 나옵니다. 이 분리는 비디오와 오디오 경로가 샘플링과 정제를 통해 동기화 상태를 유지하도록 합니다.
저해상도 생성#
첫 번째 샘플러 블록은 LTXVDualCFGGuider (#388)를 사용하여 프롬프트 조건에 따라 움직임과 장면 역학을 구동하고, SamplerCustomAdvanced (#344)로 거친 잠재를 합성합니다. 이미지에서 비디오로 작업 중이라면, LTXVImgToVideoInplace (#357)가 참조 프레임을 잠재에 주입하여 정체성과 구성을 안정화합니다; 텍스트에서 비디오로 작업할 때는 우회됩니다. 이 패스는 의도적으로 가볍게 설계되어 업스케일링 전에 움직임과 타이밍을 설정합니다.
잠재적 업스케일#
LTXVSeparateAVLatent (#367)는 오디오와 비디오를 분리하여 LTXVLatentUpsampler (#348)로 x2 모델을 사용하여 비디오 잠재를 향상시킵니다. 전처리된 이미지는 LTXVImgToVideoInplace (#349)로 옵션에 따라 다시 적용되어 업스케일 후에도 세부 사항을 일관되게 유지합니다. 오디오 잠재는 LTXVConcatAVLatent (#340)로 다시 연결되어 동기화를 유지합니다.
고해상도 생성#
두 번째 샘플러 블록 (LTXVDualCFGGuider (#391) 및 SamplerCustomAdvanced (#368))은 높은 스케일에서 세부 사항과 시간적 일관성을 정제합니다. LTXVSeparateAVLatent (#369)는 오디오를 LTXVAudioVAEDecode (#358)로 전달하고, 비디오 잠재는 VAEDecodeTiled (#374)로 디코딩되어 VRAM 피크를 줄입니다. CreateVideo (#370)는 프레임과 오디오를 최종 MP4로 조립하여 목표 fps에 맞춥니다.
ComfyUI LTX 2.5 GGUF ComfyUI 워크플로우의 주요 노드#
UnetLoaderGGUF (#406)#
GGUF 형식으로 LTX‑2.5 증류 UNet을 로드합니다. VRAM 예산에 맞는 양자화된 파일을 선택하세요; 가벼운 양자화는 메모리를 줄이고 추론 속도를 높이지만 품질 손실이 있을 수 있습니다. 덜 양자화된 파일로 업그레이드하면 더 선명한 텍스처와 더 안정적인 세부 움직임을 기대할 수 있습니다.
LTXVImgToVideoInplace (#357 및 #349)#
첫 번째 프레임을 잠재에 주입하여 움직임이 이미지에서부터 시작되도록 합니다. 이미지에서 비디오로 및 텍스트에서 비디오로 전환할 때 bypass 입력을 전환하세요. 초기 안정화를 위해 저해상도 노드 (#357)를 사용하고, 업스케일링 후 세부 사항을 다시 고정하기 위해 고해상도 노드 (#349)를 사용하세요.
LTXVLatentUpsampler (#348)#
LTX‑2.5 Latent Spatial Upscaler를 적용하여 픽셀로 디코딩하지 않고 디테일을 추가합니다. 거의 동일한 메모리 비용으로 더 많은 정의가 필요할 때 사용하세요. 업스케일링 후 깜박임이 보이면, 다음 정제 단계에서 가이던스를 약간 강화하세요.
ManualSigmas (#397 및 #396)#
샘플러가 사용하는 디노이즈 스케줄을 제어합니다. 짧은 스케줄은 빠르지만 일관성이나 시간적 부드러움을 줄일 수 있습니다; 더 길거나 앞쪽에 무게가 실린 스케줄은 추가 비용으로 안정성을 추가합니다. 샘플러 선택과 함께 사용하여 장면의 속도와 품질을 균형 있게 조정하세요.
VAEDecodeTiled (#374)#
타일을 사용하여 고해상도 비디오 잠재를 프레임으로 디코딩하여 VRAM 사용을 제한합니다. 메모리가 부족하면 타일 크기를 줄이거나 더 강력한 타일링을 활성화하세요; 이음새가 보이면 오버랩을 늘리거나 더 큰 타일을 시도하세요. VAE 선택을 공식 LTX‑2.5 비디오 VAE와 일치시키세요.
CreateVideo (#370)#
이미지 시퀀스와 디코딩된 오디오를 최종 비디오 파일로 믹스합니다. fps를 생성 프레임 속도와 일치시켜 시간 스트레치를 피하세요. 일관된 출력이 필요한 모든 반복에 대해 이 단일 렌더링 포인트를 사용하세요.
선택적 추가 기능#
- 이미지에서 비디오로 작업할 때는 명확한 카메라 움직임과 주제의 행동만 설명하세요; 여러 경쟁 움직임을 피하세요.
- 텍스트에서 비디오로 작업할 때는 프롬프트를 간결하게 유지하고, 적절할 때 음성 같은 오디오를 위한 짧은 인용문을 추가하세요.
- 해상도 팁: 32의 배수를 유지하세요; 일반적인 16:9 크기로는 960x544 (빠름)과 1344x768 또는 1504x832 (더 선명함)가 있습니다. VRAM 여유가 있다면 증가하세요.
- 프롬프트를 무시하는 결과가 나타나면 샘플러 블록에서 가이던스를 높이거나 프롬프트 언어를 단순화하세요.
- 실행 간 재현성을 위해 노이즈 노드에 고정된 시드를 설정하세요; 무작위 시드는 탐색에 가장 좋습니다.
- VRAM이 부족한 경우, 사용할 수 있는 GGUF Q‑레벨을 선호하고, 업스케일러를 활성화 상태로 유지하세요; 최소 메모리 비용으로 디테일을 추가합니다.
참고 링크: 공식 LTX‑2.5 모델 및 자산은 Hugging Face에 있으며, GGUF UNet 로더는 ComfyUI‑GGUF에서 제공됩니다.
- LTX‑2.5 모델 및 자산: Lightricks/LTX‑2.5
- GGUF 로더: city96/ComfyUI‑GGUF
감사의 말씀#
이 워크플로우는 다음의 작업 및 리소스를 구현하고 구축합니다. 우리는 Lightricks의 LTX-2.5와 city96의 ComfyUI-GGUF에 대한 기여와 유지보수에 감사드립니다. 권위 있는 세부 사항은 아래에 연결된 원본 문서와 저장소를 참조하세요.
리소스#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
주의: 참조된 모델, 데이터셋 및 코드의 사용은 저자 및 유지보수자가 제공한 해당 라이선스 및 조건에 따릅니다.


