ComfyUI>워크플로우>MiniMax 뮤직 비디오 | MiniMax H3 및 Music 3을 사용한 전체 뮤직 비디오 파이프라인

MiniMax 뮤직 비디오 | MiniMax H3 및 Music 3을 사용한 전체 뮤직 비디오 파이프라인

Workflow Name: RunComfy/MiniMax-music-video
Workflow ID: 0000...1502
전체 노래를 연결된 AI 비주얼 시퀀스로 변환하십시오. MiniMax H3 및 MiniMax Music 3을 사용하여 장면을 리듬, 보컬 및 분위기에 맞춥니다. 프롬프트, 이미지, 오디오 또는 비디오 참조로 샷을 안내합니다. 캐릭터와 스타일 일관성을 유지하십시오. 성과 또는 내러티브 클립을 더 빠르게 구축합니다. 일관된 영화적 결과를 내보내십시오.

ComfyUI MiniMax music video Workflow

MiniMax Music Video in ComfyUI | Build full pipeline with MiniMax H3 and Music 3
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax music video Examples

MiniMax 뮤직 비디오: ComfyUI에서 노래‑장면 생성#

이 워크플로는 MiniMax H3를 사용하여 전체 노래를 리듬 인식 비디오 샷 시퀀스로 변환하며, 선택적으로 MiniMax Music 3에 의해 구동되는 음악 생성이 가능합니다. 텍스트 프롬프트, 참조 이미지 및 마스터 오디오 트랙을 혼합하여 보컬, 비트 및 분위기를 추적하는 영화적 클립을 생성합니다. 그 결과는 일관된 캐릭터 정체성과 자연스러운 샷 전환을 갖춘 일관된 MiniMax 뮤직 비디오입니다.

아티스트, 편집자 및 제작자를 위해 설계된 이 워크플로는 공연 컷, 가사 기반 비주얼 및 내러티브 삽입을 지원합니다. 자신의 트랙을 가져오거나 먼저 생성한 다음 노래의 구조와 함께 진화하는 동안 비주얼 연속성을 유지하는 MiniMax 뮤직 비디오를 조립할 수 있습니다.

Comfyui MiniMax 뮤직 비디오 워크플로의 주요 모델#

  • MiniMax H3 확산 모델. 오디오에 맞춘 샷 시퀀스를 합성하기 위해 참조 및 프롬프트 컨디셔닝을 사용하는 핵심 비디오 생성기입니다. 모델 자산은 Hugging Face의 Comfy‑Org 네임스페이스에 게시되며, 비디오 VAE 및 텍스트 인코더를 포함합니다. Comfy‑Org/MiniMax‑H3
  • MiniMax H3 비디오 VAE. 미리보기 및 내보내기를 위해 잠재 프레임을 이미지로 디코딩합니다. minimax_h3_video_vae_fp16.safetensors
  • MiniMax H3 오디오 VAE. 필요한 경우 모델의 보조 오디오 잠재를 디코딩합니다. minimax_h3_audio_vae_fp32.safetensors
  • MiniMax H3 텍스트 인코더 (Qwen3VL 32B 변형, H3용으로 패키징됨). 참조‑비디오 생성에 대한 멀티모달 프롬프트 이해를 제공합니다. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
  • MiniMax Music 3 확산 모델. 캡션 및 가사 계획에서 완전한 노래를 생성하는 텍스트‑음악 생성기; ComfyUI 내에서 트랙을 작성하려는 경우 사용됩니다. Comfy‑Org/MiniMax‑Music‑3
  • MiniMax Music 3 텍스트 인코더. 음악 생성에 대한 컨디셔닝으로 캡션 및 가사를 인코딩합니다. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
  • MiniMax Music 3 DAV VAE. 오디오 잠재를 최종 파형으로 디코딩합니다. minimax_music3_dav.safetensors

Comfyui MiniMax 뮤직 비디오 워크플로 사용 방법#

전반적인 흐름. 그래프는 두 개의 협력 부분으로 구성됩니다: 1) 마스터 트랙을 생성하는 선택적 음악 생성 및 2) 노래에 맞춰 시각적으로 일관된 샷을 구축하는 참조‑비디오 합성. 이들을 함께 실행하거나 자신의 오디오를 연결하고 음악 생성을 건너뛸 수 있습니다. 최종 단계는 프레임과 오디오를 렌더링된 MiniMax 뮤직 비디오로 조립합니다.

1) 음악 생성 (선택 사항)#

이 그룹은 MiniMax Music 3으로 트랙을 계획하고 합성합니다. M3SongPlanner (#6171)로 구조화된 캡션 및 가사를 초안을 작성하십시오; 둘 다 인코딩 전에 캔버스 텍스트 뷰어에서 편집 가능합니다. MiniMaxMusic3TextEncode (#6157)은 해당 계획을 컨디셔닝으로 변환하고 목표 지속 시간을 제공합니다. 잠재 오디오 컨테이너가 생성되며, MiniMax Music 3 UNet (UNETLoader (#6156))과 함께 KSampler (#6162)에 의해 샘플링된 다음, VRAM에 따라 표준 또는 타일 디코드를 사용하여 DAV VAE를 통해 디코딩됩니다. 생성된 오디오는 저장되고 비디오의 소스 트랙으로 설정됩니다.

2) 사용자 입력#

마스터 곡을 제공하거나 생성하십시오. VHS_LoadAudioUpload (#6170)로 외부 트랙을 업로드하거나 1단계에서 생성된 곡을 사용하십시오. LoadImage (#6110) 또는 경로 로더를 사용하여 외모 및 정체성을 위해 하나 이상의 참조 이미지를 추가하십시오; 이미지는 안정적인 컨디셔닝을 위해 ImageResizeKJv2 (#6090, #6091)에 의해 정규화됩니다. (input:prompt) Text Prompt (#138)에서 창의적 브리핑을 설정하십시오 — 이 프롬프트는 주제 정의, 샷 노트 및 타이밍 힌트를 지원합니다. Resolution Selector (Size) (#115) 및 (input:duration) Duration (#132)를 통해 비율 및 대략적인 지속 시간을 선택하십시오.

3) 패치#

PathchSageAttentionKJ (#142)는 일부 GPU에서 처리량과 메모리 동작을 개선할 수 있는 최적화된 주의 구현을 활성화합니다. 이 패치는 샘플링 전에 로드된 MiniMax H3 모델에서 작동합니다. 장치 별 문제를 겪지 않는 한 활성화 상태를 유지하십시오.

4) 모델#

UNETLoader (#127)는 참조‑비디오를 위한 MiniMax H3 백본을 로드하며, 빠르고 강력한 결과를 위해 LoraLoaderModelOnly (#5959)로 선택적 Turbo LoRA가 적용됩니다. 비디오 및 오디오 VAE (VAELoader (#119), VAELoader (#120))는 디코딩을 위해 준비됩니다. 이러한 자산은 품질 범위를 정의하며 샷 전반에 걸쳐 일관된 모습을 유지해야 합니다.

5) 컨디셔닝#

MiniMaxH3ReferenceToVideo (#136)는 텍스트 프롬프트, 참조 이미지, 목표 크기 및 길이를 컨디셔닝 및 초기 잠재로 융합합니다. 이는 창의적 브리핑과 샘플러가 렌더링할 내용을 연결하는 다리입니다. 이 템플릿에서 두 개의 참조 이미지를 제공하여 의상, 정체성 및 팔레트를 안내할 수 있습니다. 그룹은 요청된 지속 시간에서 샷 길이를 계산하여 프레임이 음악적으로 정렬되도록 합니다.

6) 샘플링#

샘플링 스택은 BasicScheduler (#124), BasicGuider (#126), SamplerCustomAdvanced (#125) 및 RandomNoise (#129)를 결합합니다. MiniMaxH3SigmaShift (#5960)는 더 선명한 비디오 모션과 안정적인 오디오 정렬을 위해 시그마 범위를 바이어스하기 위해 상류에 위치합니다. 함께 이들은 잠재를 참조 및 비트에 따라 이미지를 향해 반복합니다. 재현성을 위해 프롬프트 및 참조에서 반복하는 동안 씨드를 고정 상태로 유지하십시오.

7) 디코딩 및 비디오 생성#

VAEDecode (#122)는 샘플링된 잠재를 프레임으로 변환하고 Set_video_1 (#5651)는 내보내기를 위해 준비합니다. 최종 조립은 VHS_VideoCombine (#5645)를 사용하여 프레임을 선택한 소스 오디오에 연결하고 저장된 src_fps 값에서 대상 프레임 속도를 적용합니다. 출력은 트랙과 동기화된 공유 가능한 MiniMax 뮤직 비디오 클립입니다.

8) 참조 2 비디오#

이 그룹은 마스터 곡에 맞서 샷 시퀀스를 구축하기 위한 파이프라인의 창의적 핵심입니다. 준비된 H3 모델, 참조 및 계산된 샷 길이를 수신한 다음 클립당 한 번의 샘플링 패스를 실행합니다. 동일한 주제를 중심으로 여러 연결된 컷을 반복하여 정체성, 의상 및 팔레트를 일관되게 유지하십시오. 노래의 각 부분에 대해 반복하여 인트로, 구절, 후렴 및 다리에서 매칭 비주얼로 덮습니다.

Comfyui MiniMax 뮤직 비디오 워크플로의 주요 노드#

MiniMaxH3ReferenceToVideo (#136)#

프롬프트, 참조 및 목표 지오메트리를 샘플링을 위한 잠재와 연결하는 컨디셔닝을 생성합니다. 소수의 고품질 이미지와 명확한 샷 노트를 사용하여 정체성과 아트 방향을 조정하십시오. 얼굴이나 의상에 대한 강한 준수를 필요로 하는 샷의 경우, 참조를 스타일적으로 유사하게 유지하고 극단적인 크롭을 피하십시오. 샘플링 설정을 변경하기 전에 프롬프트 구문을 조정하십시오. 이 노드는 화면에 나타나는 사람과 사물을 가장 강하게 좌우합니다.

MiniMaxH3SigmaShift (#5960)#

MiniMax H3 스택에서 시그마 스케줄을 오프셋하여 시간적 변화와 오디오 정렬을 균형 있게 합니다. 더 많은 모션과 시각적 진화를 원하는 경우 비디오 시프트를 증가시키고, 타이트한 리듬과 립 느낌을 선호하려면 오디오 시프트를 증가시키십시오. 겸손한 변화를 사용하고 짧은 클립에서 테스트한 후 전체 장면을 커밋하십시오.

SamplerCustomAdvanced (#125)#

선택된 스케줄러 및 가이더와 함께 디노이징 루프를 실행합니다. 여기에서 시간과 품질 및 질감을 교환합니다. 빠른 아이디어화의 경우, 스텝을 줄이고 씨드를 고정 상태로 유지하십시오; 최종본의 경우, 더 많은 스텝을 주고 가이드를 조정하여 정체성을 잃지 않으면서 세부 사항을 정제하십시오. 결과가 브리핑을 초과할 경우, 먼저 프롬프트를 단순화하거나 충돌하는 참조를 줄이십시오.

VHS_VideoCombine (#5645)#

선택한 오디오와 함께 디코딩된 프레임을 단일 비디오 파일로 조립합니다. 함께 편집하려는 모든 클립에서 프레임 속도를 일정하게 유지하십시오. 비주얼이 비트와 어긋나는 경우, 샷 길이와 fps가 소스 트랙과 일치하는지 확인하십시오. 워크플로 내에서 템포와 가사 큐와 일치하도록 렌더링된 후에만 NLE에서 트림하십시오.

MiniMaxMusic3TextEncode (#6157)#

MiniMax Music 3을 위해 구조, 배열 및 보컬 캐릭터를 정의하는 캡션 및 가사를 인코딩합니다. 모델이 의도를 이해하도록 글로벌 메타데이터, 보컬 세부 사항 및 배열을 포함하는 섹션으로 캡션을 작성하십시오. 생성기가 따를 수 있는 전환을 표시하기 위해 [Intro], [Verse], [Chorus]와 같은 가사 섹션 태그를 사용하십시오. 프롬프트 도움말은 공식 저장소의 가이드와 도구를 참조하십시오. MiniMax‑AI/MiniMax‑Music3

ComfyMathExpression (#131)#

목표 지속 시간에서 내부 프레임 수를 계산하고 선택된 fps에서 H3 시간적 스택이 선호하는 리듬으로 스냅합니다. 미세한 비동기화 및 스터터를 피합니다. fps 또는 지속 시간을 변경하면 이 노드가 길이를 다시 계산하여 샘플링이 비트에 맞게 착륙하도록 하십시오.

선택적 추가 기능#

  • 안정적인 구조로 프롬프트 작성: 주제 정의, 한 문장 요약, 그런 다음 시간 큐가 있는 1–3 샷 단락. 시제와 음성을 일관되게 유지하십시오.
  • 주제당 1–2개의 깨끗한 참조 이미지를 사용하십시오. 정체성 보존을 향상시키기 위해 중립 조명과 헤어 및 의상 세부 사항을 포함하는 중간 크롭을 선호하십시오.
  • 먼저 노래에 장면을 매핑하십시오. 각 섹션(인트로, 구절, 후렴)당 짧은 클립을 렌더링하고 연결하십시오; 이는 MiniMax 뮤직 비디오가 일관성을 유지하면서도 로컬 변화를 허용합니다.
  • 함께 편집할 계획인 모든 클립에서 해상도와 프레임 속도를 일관되게 유지하십시오. 프로젝트 중간에 변경하면 연속성이 더 어려워집니다.
  • VRAM이 낮은 기기에서는 긴 노래의 경우 타일 오디오 디코드를 활성화하십시오; VRAM이 높은 기기에서는 표준 디코드가 일반적으로 더 깔끔합니다.
  • 신뢰할 수 있는 재렌더링을 위해, 비디오 샘플러와 음악 샘플러 모두에서 씨드를 잠그고 최종본을 내보내기 전에 잠그십시오.

감사의 말#

이 워크플로는 다음 작업 및 리소스를 구현하고 구축합니다. 우리는 MiniMax Music VideoWorkflow Source에 대한 그들의 기여와 유지 관리를 위해 Innovate Futures @ Benji에 감사드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서와 저장소를 참조하십시오.

리소스#

참고: 참조된 모델, 데이터 세트 및 코드의 사용은 작성자 및 유지 관리자가 제공하는 해당 라이선스 및 조건에 따릅니다.

RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.