LTX 2.5 첫 마지막 프레임에서 비디오로: 두 프레임으로 고정된 시네마틱 클립과 동기화된 오디오#
이 RunComfy 준비된 워크플로우는 일치하는 시작 및 종료 이미지를 짧은 시네마틱 비디오로 변환하고 동기화된 오디오를 제공합니다. 첫 번째와 마지막 프레임 앵커에서 생성 가이드를 하여 구성을 유지하고 조명, 주제 정체성 및 스타일을 유지하면서 두 프레임 간의 일관된 모션을 생성합니다. LTX 2.5 첫 마지막 프레임에서 비디오로는 ComfyUI 내에서 제어된 캐릭터 동작, 제품 비트, 카메라 이동 및 장면 전환에 이상적입니다.
백그라운드에서 Lightricks의 LTX-2.5 변환기와 전용 비디오 및 오디오 VAE, 그리고 Gemma 기반 프롬프트 강화기를 결합합니다. 그래프는 프롬프트, 비디오 설정, 첫/마지막 프레임 준비, 컨디셔닝, 샘플링 및 디코딩을 위한 명확한 그룹을 제공하여 저수준의 배선을 만지지 않고도 신뢰할 수 있고 반복 가능한 결과를 얻을 수 있습니다.
Comfyui LTX 2.5 첫 마지막 프레임에서 비디오로 워크플로우의 주요 모델#
- Lightricks LTX-2.5 디스틸드 변환기. 텍스트 및 시각 가이드에서 모션, 외관 및 시간 일관성을 학습하는 핵심 비디오 생성기. 모델 페이지
- LTX-2.5 비디오 VAE. 비디오 잠재를 압축하고 디코딩하여 메모리 사용을 실용적으로 유지하면서 선명한 프레임을 제공합니다. LTX-2.5 저장소에 포함됩니다. 모델 페이지
- LTX-2.5 오디오 VAE. 시각적 이벤트와 일치하는 동기화된 오디오 잠재를 생성하고 재구성합니다. LTX-2.5 저장소에 포함됩니다. 모델 페이지
- Gemma 4 12B 텍스트 인코더 및 LTX-2.5용 프로젝션. 프롬프트를 주제, 행동, 조명 및 카메라 방향을 포함하는 풍부한 컨디셔닝으로 인코딩합니다. LTX-2.5 자산에 포함됩니다. 모델 페이지
- Gemma 4 E2B 지침 조정 변형 프롬프트 강화. 강화가 활성화되면 짧은 입력을 시네마틱 방향으로 확장합니다. 모델 페이지
- LTX-2.5 파이프라인 및 일정 동작에 대한 선택적 Diffusers 참조. 샘플러 절충점을 이해하는 데 유용합니다. 프로젝트 페이지
Comfyui LTX 2.5 첫 마지막 프레임에서 비디오로 워크플로우 사용 방법#
워크플로우는 두 이미지를 앵커로 사용하여 가이드로 변환한 다음 텍스트 제어 하에 비디오 및 오디오 잠재를 디노이즈하고 준비된 클립으로 디코딩합니다. 아래의 각 그룹은 특정 역할을 수행하며 대부분의 사용자는 프롬프트, 프롬프트 강화 및 비디오 설정만 만질 것입니다.
프롬프트#
Prompt (#252) 노드에 간결하지만 설명적인 지침을 적습니다. 긍정적인 텍스트는 CLIPTextEncode (#222)에서 Gemma 4 12B 인코더를 사용하여 모델이 주제, 행동, 조명 및 카메라 의도를 이해할 수 있도록 인코딩됩니다. 모델이 두 앵커를 존중하도록 하기 위해 종료 상태와 시작 비트를 모두 설명합니다. 엄격한 단어나 브랜드 용어가 필요하면 프롬프트에 명시적으로 작성하십시오.
프롬프트 강화#
짧은 프롬프트는 TextGenerateLTX2Prompt (#247)로 자동 확장될 수 있습니다. ComfySwitchNode (#248)는 원본 프롬프트 또는 강화된 텍스트를 인코더로 라우팅하며, PreviewAny (#249)는 최종 텍스트를 검사할 수 있게 해줍니다. 시네마틱 표현과 더 풍부한 모션 큐를 원할 때 강화 기능을 활성화하고, 프롬프트 단어가 정확하게 유지되어야 할 때는 비활성화하십시오.
비디오 설정#
Duration (#198), Frame Rate(int) (#205), Width (#215), height (#216)를 사용하여 클립 길이, 프레임 속도 및 해상도를 설정합니다. 그래프는 ComfyMathExpression (#226)을 통해 총 프레임 수를 계산하고 EmptyLTXVLatentVideo (#201) 및 LTXVEmptyLatentAudio (#197)에서 비디오 잠재와 오디오 잠재를 할당합니다. 해상도나 프레임 속도가 높을수록 VRAM과 시간이 증가하므로, 모션이 마음에 들면 점진적으로 확장하십시오.
첫 프레임#
시작 이미지를 로드하고 ResizeImageMaskNode (#213)에서 대상 해상도에 맞도록 크기를 조정합니다. LTXVPreprocess (#199)는 안정적인 가이드를 위해 톤과 세부 사항을 정규화합니다. 깨끗하고 잘 노출된, 구성적으로 명확한 이미지는 모델이 더 빠르게 고정되고 앵커에서 의도하지 않은 드리프트를 줄입니다.
마지막 프레임#
종료 이미지를 로드하고 ResizeImageMaskNode (#214)에서 크기를 조정하며 LTXVPreprocess (#195)에서 정규화합니다. 첫 프레임과의 비율, 시점, 주제 스케일을 맞추어 전환이 물리적으로 가능하게 느껴지고 마지막에 앵커가 유지되도록 합니다.
컨디셔닝#
텍스트 컨디셔닝은 LTXVConditioning (#202)에서 구성되며 목표 프레임 속도를 받아 타이밍이 모든 가지에서 일치하도록 합니다. 이미지 가이드는 첫 프레임을 위한 LTXVAddGuide (#206)와 마지막 프레임을 위한 LTXVAddGuide (#204)로 두 번에 걸쳐 첨부되어 두 앵커가 궤적에 영향을 미치도록 합니다. LTXVCropGuides (#200)는 잔여 크기 차이를 조정하여 가이드가 잠재 캔버스와 완벽하게 일치하도록 합니다.
샘플링#
RandomNoise (#196)에서 노이즈가 시드되고 SamplerCustomAdvanced (#211)에서 SamplerEulerAncestral (#208) 및 ManualSigmas (#239) 일정을 사용하여 디노이징이 수행됩니다. 명확하고 움직임이 안정적인 업데이트를 위해 긍정적 및 부정적 조건을 혼합하여 외관과 움직임을 조정합니다. 오디오 및 비디오 잠재는 LTXVConcatAVLatent (#210) 및 LTXVSeparateAVLatent (#221)으로 결합되었다가 나중에 분리되어 모션과 사운드가 함께 발전합니다.
디코딩 및 출력#
잠재는 VAEDecodeTiled (#219)를 사용하여 비디오 VAE로 프레임으로 디코딩되고 LTXVAudioVAEDecode (#220)를 사용하여 오디오 VAE로 오디오로 디코딩됩니다. CreateVideo (#218)는 선택한 FPS로 이미지와 오디오를 혼합하여 최종 클립을 생성합니다. 상위 그래프에서 SaveVideo (#68)가 결과를 기록하며, 원하는 경우 이름을 바꾸거나 위치를 변경하십시오.
Comfyui LTX 2.5 첫 마지막 프레임에서 비디오로 워크플로우의 주요 노드#
TextGenerateLTX2Prompt (#247)#
짧은 입력을 시네마틱, LTX 친화적인 프롬프트로 확장합니다. 더 풍부한 동사, 조명 및 카메라 언어를 최소한의 노력으로 원할 때 사용하십시오. 정확한 표현이나 브랜드 안전한 단어가 필요하면 ComfySwitchNode (#248)를 통해 강화 기능을 비활성화하고 최종 텍스트를 직접 제공하십시오.
LTXVDualCFGGuider (#235)#
LTX-2.5 모델을 긍정적 및 부정적 컨디셔닝과 결합하여 준수와 자유를 균형 있게 조정합니다. 프롬프트와 앵커의 충실도를 높이려면 가이드를 높이고, 느슨하고 유기적인 모션을 원할 때는 낮추십시오. 가이드를 극도로 높이면 움직임을 과도하게 제한하거나 채도를 도입할 수 있으므로 부정적 프롬프트 강도와 함께 조정하십시오.
SamplerCustomAdvanced (#211)#
SamplerEulerAncestral (#208) 및 선택한 시그마 일정을 사용하여 디노이징 루프를 실행합니다. 속도 테스트를 위해 더 짧은 일정을 사용하고, 모션 전반에 걸쳐 더 많은 세부 사항을 유지해야 할 때는 더 긴 일정을 사용하십시오. 모션이 불안정하게 보이면 부드러운 시그마 램프를 시도하거나 스텝 간 오버코렉션을 줄이기 위해 가이드를 약간 낮추십시오.
ManualSigmas (#239)#
명확성과 시간적 부드러움 간의 거래를 정의하는 노이즈 일정입니다. 노이즈가 앞부분에 집중되면 초기 큰 움직임을 유도할 수 있으며, 완만한 꼬리는 앵커 근처의 세부 사항을 보존할 수 있습니다. 프롬프트와 앵커에 만족한 후에만 조정하십시오.
VAEDecodeTiled (#219)#
타일 처리 방식을 사용하여 이미지로 비디오 잠재를 디코딩하여 더 큰 해상도를 메모리에 맞춥니다. 작은 타일은 VRAM을 줄이지만 타일 이음새 위험이 있으며, 큰 타일은 깨끗하지만 무겁습니다. GPU에 맞춰 해상도와 타일 크기를 균형 있게 유지하십시오.
LTXVAudioVAEDecode (#220)#
오디오 잠재에서 동기화된 오디오 트랙을 재구성합니다. 무음 클립을 내보내려면 CreateVideo (#218) 전에 서브 그래프 내에서 오디오 분기를 일시적으로 비활성화하십시오. 최종 사운드가 너무 복잡하게 느껴지면 프롬프트에서 동작 밀도를 줄여 오디오 모델이 더 간단한 비트를 따르도록 하십시오.
RandomNoise (#196)#
생성을 시드합니다. 재현 가능한 결과를 원하면 서브 그래프를 열고 고정 시드를 설정하여 무작위화를 방지하십시오. 동일한 앵커와 프롬프트에서 모션 옵션을 탐색할 때는 시드를 변경하여 다른 궤적을 샘플링하십시오.
선택적 추가 사항#
- 가장 깨끗한 전환을 위해 첫 번째 및 마지막 프레임을 비율, 수평선 및 주제 스케일에 맞추십시오; 불일치는 모델이 기하학을 왜곡하도록 강요합니다.
- 모션을 명확하게 설명하십시오: "왼쪽을 향해 시작하고, 카메라를 향해 돌고, 손을 열고, 파란색 크리스탈이 손바닥 위로 올라갑니다"는 스타일 전용 프롬프트보다 더 잘 읽힙니다.
- 지속 시간과 FPS는 상호 작용합니다; 둘 다 증가하면 메모리와 렌더링 시간이 증가합니다. 한 번에 하나씩 확장하고 확장하기 전에 미리보기하십시오.
- 가장자리가 깜박거리는 경우, 프롬프트에서 세밀한 질감 형용사를 줄이거나 시간적 안정성을 선호하여 가이드를 약간 낮추십시오.
- 반복 속도를 높이려면 더 작은 해상도로 테스트하고 모션과 프레이밍이 고정되면 너비와 높이를 높이십시오.
- 브랜드 완벽한 종료 프레임이 필요할 때는 프롬프트에서 강조하고 마지막 프레임을 깨끗하고 높은 대비로 유지하여 LTX 2.5 첫 마지막 프레임에서 비디오로가 신뢰할 수 있도록 고정할 수 있게 하십시오.
감사의 글#
이 워크플로우는 다음 작업과 리소스를 구현하고 발전시킵니다. 우리는 소스 워크플로우 템플릿을 제공한 Comfy.org, LTX-2.5 모델 가중치를 제공한 Lightricks, 그리고 그들의 기여와 유지보수에 대해 Lightricks의 LTX-2.5 Diffusers 프로젝트에 감사를 표합니다. 권위 있는 세부 사항에 대해서는 아래에 링크된 원본 문서 및 저장소를 참조하십시오.
리소스#
- Comfy.org/Source 워크플로우 템플릿
- 문서 / 릴리스 노트: Source 워크플로우 템플릿
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/Hugging Face 조직
- Hugging Face: Lightricks
참고: 참조된 모델, 데이터셋 및 코드의 사용은 저자와 유지보수자가 제공한 라이센스 및 조건에 따릅니다.

