ComfyUI>워크플로우>LTX 2.3 말하기 및 노래하기 립싱크 비디오 제작자

LTX 2.3 말하기 및 노래하기 립싱크 비디오 제작자

Workflow Name: RunComfy/LTX-2.3-Talking-Sync
Workflow ID: 0000...1461
이 워크플로우를 통해 초상화 이미지를 자연스러운 입 동기화로 말하거나 노래하는 비디오로 변환할 수 있습니다. 디자이너와 창작자는 정적인 캐릭터를 스토리텔링, 뮤직 비디오 또는 인터랙티브 콘텐츠로 생동감 있게 만들 수 있습니다. 고급 오디오 분리를 중심으로 구축되어 명확한 보컬과 정확한 입 움직임을 보장합니다. 얼굴 표정과 말의 리듬을 일치시켜 영화 품질의 결과를 손쉽게 생성할 수 있습니다. 디지털 휴먼 애니메이션, 가상 가수 및 성능 테스트에 이상적입니다.

ComfyUI LTX 2.3 Talking and Singing Lip Sync Workflow

LTX 2.3 Talking and Singing Lip Sync in ComfyUI | Portrait2Video Sync
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Talking and Singing Lip Sync Examples

LTX 2.3 말하기 및 노래하기 립싱크: 초상화-퍼포먼스 ComfyUI 워크플로우#

LTX 2.3 말하기 및 노래하기 립싱크는 정면 초상화와 목소리 또는 노래를 표현력 있고 동기화된 입 움직임이 있는 영화적 디지털 휴먼 비디오로 변환합니다. RunComfy를 위해 제작되었으며, LTX 2.3 비디오 생성 및 LTXV ComfyUI 노드와 Mel-Band RoFormer 오디오 분리를 사용하여 얼굴을 읽기 쉽게 유지하면서 말이나 가사를 일치시킵니다.

이 ComfyUI 워크플로우는 AI 뮤직 비디오, 가상 가수, 캐릭터 퍼포먼스 테스트 및 창작자 데모에 적합하며, 화면에 나타나는 퍼포머와 최종 오디오가 모두 사용 가능해야 합니다. 초상화 이미지와 오디오 트랙을 제공하고, 프레임 속도와 지속 시간을 선택하면 파이프라인이 립싱크가 트랙에 맞춰진 mp4를 렌더링합니다.

참고: 특히 인상적인 결과를 위해 Ace Step Model로 노래를 생성한 다음 Seedream 5.0 Pro로 명확한 영화적 초상화를 생성하는 것을 강력히 권장합니다. 이 워크플로우에 오디오 및 초상화 입력으로 이 두 자산을 사용하여 보다 세련된 노래하는 디지털 휴먼 퍼포먼스를 얻으세요.

Comfyui LTX 2.3 말하기 및 노래하기 립싱크 워크플로우의 주요 모델#

  • Lightricks의 LTX-2.3 비디오 생성 모델. 오디오 기능과 시각적 움직임을 결합하여 말하기 및 노래하기에 적합한 시간적으로 일관된 프레임을 생성하는 변환기 기반 오디오-비디오 생성기입니다. Model cardofficial repository.
  • LTX-2.3 Video VAE 및 Audio VAE. 비디오와 오디오를 LTX-2.3에서 사용하는 AV 잠재 공간에 패킹하여 효율적인 샘플링과 깨끗한 재구성을 보장하는 잠재 인코더/디코더입니다. LTX ComfyUI 통합에 구현되었습니다. ComfyUI-LTXVideo.
  • MelBandRoFormer. 여기서 사용되는 현대적인 음악 소스 분리 모델로, 최종 렌더링을 위해 원래 믹스를 유지하면서 더 깨끗한 립 컨디셔닝을 위해 보컬을 선택적으로 추출합니다. WeightsComfyUI node.

Comfyui LTX 2.3 말하기 및 노래하기 립싱크 워크플로우 사용 방법#

워크플로우는 입력, LTX 2.3 생성, 내보내기의 세 단계로 실행됩니다. 그룹은 초상화와 오디오를 동기화된 퍼포먼스로 변환하기 위해 끝에서 끝까지 함께 작동합니다.

입력#

Character Image (front view + 9:16, recommended) (#444)을 사용하여 정면 초상화를 로드하세요. 이미지는 모델을 위해 크기가 조정되고 신원 및 입 영역 세부 사항을 보존하기 위해 가볍게 전처리됩니다. Upload Song or Voice (#1755)를 사용하여 노래나 목소리를 업로드한 다음, 도입부 막대나 침묵을 건너뛰고 싶다면 Start lip-sync from which second? e.g. 10.0 (seconds) (#1776)를 설정하세요. Duration in seconds (best under 35s; enter 0 for full audio) (#1583)로 지속 시간을 선택하고 렌더링을 위한 Frame Rate (#1586)를 설정하세요. 표현과 카메라 행동을 안내하기 위해 Prompt (#1624)에 의도를 작성하세요. 워크플로우는 또한 자막, 워터마크 및 정적 프레임을 피하기 위한 유용한 부정적 큐를 주입합니다.

LTX2.3 디지털 휴먼 말하기/노래 립싱크#

LTXV Preprocess (#446) 및 LTXVImgToVideoInplaceKJ (#1762)에 의해 초상화가 시작 잠재 클립으로 변환됩니다. IMG STRENGTH. Set 0 for T2I mode (#1722)를 사용하여 초상화가 얼마나 강하게 적용될지 제어하세요: 높은 값은 사진에 고정되며, 낮은 값은 더 많은 생성적 움직임을 허용합니다. 오디오 경로는 업로드 트림, 선택적으로 Mel-Band RoFormer Sampler (#1599)로 보컬을 분리하고 LTXV Audio VAE Encode (#1605)를 통해 선택한 트랙을 인코딩합니다. 오디오 및 비디오 잠재는 LTXV Concat AV Latent (#350)에 의해 융합되고, CLIP Text Encode 노드의 텍스트 조건은 LTXVConditioning (#164)를 통해 전체 장면 의도와 청결함을 구동합니다. LTX-2.3 모델은 LTX2 NAG (#508)를 사용하여 립 정밀도를 위해 패치되고 가이드된 다음, 선택한 스케줄러 및 샘플러에서 SamplerCustomAdvanced (#161)로 샘플링됩니다.

내보내기 및 저장#

샘플링 후, 비디오 잠재는 VAE Decode (#1318)에 의해 프레임으로 디코딩됩니다. Video Combine 🎥🅥🅗🅢 (#1747)는 이러한 프레임을 잘린 원래 오디오와 함께 결합하여 선택한 프레임 속도로 mp4를 생성합니다. 컨디셔닝을 위해 보컬 전용을 활성화한 경우, 최종 내보내기는 여전히 전체 믹스를 사용하여 결과를 공유할 준비가 되도록 합니다. 출력은 쉬운 버전 관리를 위해 명확한 접두사로 저장됩니다.

Comfyui LTX 2.3 말하기 및 노래하기 립싱크 워크플로우의 주요 노드#

LTXVImgToVideoInplaceKJ (#1762)#

참조 초상화를 초기 잠재 비디오로 변환합니다. IMG STRENGTH. Set 0 for T2I mode (#1722)을 조정하여 신원 고정과 움직임의 자유 사이를 균형 있게 조정하세요. 강한 유사성과 안정적인 머리 자세를 위해 강도를 높게 유지하고, 더 많은 퍼포먼스 움직임을 위해 줄이세요. 0으로 설정하면 워크플로우를 텍스트-비디오처럼 취급하고 프롬프트와 오디오에 더 많이 의존하세요.

Mel-Band RoFormer Sampler (#1599)#

노래에서 보컬을 분리하여 모델에 더 깨끗한 말하기 기능을 제공합니다. 악기가 지배적이거나 자음이 사라질 때 USE VOCALS ONLY (#1616)를 사용하세요. 전체 믹스가 표현력을 좌우하도록 하려면 꺼 두세요. 최종 렌더링은 트림된 원래 오디오를 사용하여 의도한 사운드트랙을 보존합니다. ComfyUI 확장 및 위에 링크된 가중치에서 모델 세부 정보를 확인하세요.

LTXV Audio VAE Encode (#1605)#

선택한 오디오를 LTX 오디오 잠재 공간으로 인코딩하여 입 모양과 미세 표정을 구동합니다. 인코딩 전에 명백한 침묵을 트림하여 더 빠른 정렬을 위해 준비하세요. 가사가 0초에 시작되지 않는 경우 시작 시간 오프셋과 함께 사용하세요.

LTX2 NAG (#508)#

LTX 2.3에 맞춰 오디오-립 결합을 강화하기 위해 노이즈-증강된 가이던스를 적용합니다. 입이 덜 애니메이트된 것 같으면 가이던스를 약간 높이고, 치아나 입 모양이 과도하게 표현된 것 같으면 효과를 낮추세요. 이 컨트롤은 프롬프트 강도 및 샘플러 설정과 상호작용하기 때문에 작은 점진적 변화가 가장 잘 작동합니다. 참조 구현은 LTX 저장소에 있습니다.

SamplerCustomAdvanced (#161)#

선택한 KSamplerSelect (#154), CFG Guider (#153), 스케줄러를 사용하여 디노이징 프로세스를 실행합니다. 낮은 분류기-자유 가이던스는 일반적으로 자연스러운 움직임과 신원 보존을 선호하고, 높은 값은 프롬프트 지배력을 증가시키지만 입을 경직시킬 수 있습니다. 샘플러를 전환하는 경우 공정한 A/B 비교를 위해 나머지 설정을 그대로 유지하세요.

Video Combine 🎥🅥🅗🅢 (#1747)#

프레임과 트림된 오디오를 결합하여 최종 mp4를 작성합니다. 광범위한 호환성을 위해 기본값을 그대로 두거나 나중에 색상 등급을 계획하는 경우 품질을 높이세요. frame_rate가 창작 의도와 일치하고 이전에 설정한 것과 일치하는지 확인하세요.

선택적 추가 기능#

  • 가장 설득력 있는 LTX 2.3 말하기 및 노래하기 립싱크 결과를 위해 깨끗하고 정면을 향한 초상화와 중립 조명 및 9:16 크롭을 사용하세요.
  • 악기가 자음을 가릴 경우, USE VOCALS ONLY (#1616)를 활성화하여 모델이 더 깨끗한 보컬 스템으로 조건화하도록 하세요. 내보내기는 전체 믹스를 유지합니다.
  • 빠른 반복을 위해 클립을 35초 이하로 유지하고, 긴 뮤직 비디오를 제작하는 경우 외부에서 테이크를 연결하세요.
  • 움직임이 너무 정적일 때는 IMG STRENGTH를 낮추고, 신원이 흐려질 때는 높이고 프롬프트를 단순화하세요.
  • 리드인 침묵을 잘라내고 시작 시간 오프셋 컨트롤을 사용하여 입 모양이 첫 단어에 정확히 시작하도록 가사를 맞추세요.
  • 테이크를 복제하려면 고정 Start Seed를 설정한 다음, 대체 시드를 다양하게 사용하세요.
  • 공공 프로젝트에서 LTX 2.3 말하기 및 노래하기 립싱크 워크플로우를 사용할 때 유사성과 음악 권리를 존중하세요.

공식 리소스 링크

감사의 글#

이 워크플로우는 다음 작품과 리소스를 구현하고 기반으로 합니다. 우리는 Lightricks의 LTX-Video (LTX 2.3 모델 및 ComfyUI-LTXVideo 노드 포함), Kijai의 MelBandRoFormer (ComfyUI 노드 및 모델 가중치), 및 RunningHub의 워크플로우 소스 기사에 대한 기여와 유지보수에 대해 감사드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서 및 저장소를 참조하세요.

리소스#

참고: 참조된 모델, 데이터셋 및 코드의 사용은 해당 저자 및 유지보수자가 제공한 라이선스 및 조건을 따릅니다.

RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.