MiniMax 뮤직 비디오: ComfyUI에서 노래‑장면 생성#
이 워크플로는 MiniMax H3를 사용하여 전체 노래를 리듬 인식 비디오 샷 시퀀스로 변환하며, 선택적으로 MiniMax Music 3에 의해 구동되는 음악 생성이 가능합니다. 텍스트 프롬프트, 참조 이미지 및 마스터 오디오 트랙을 혼합하여 보컬, 비트 및 분위기를 추적하는 영화적 클립을 생성합니다. 그 결과는 일관된 캐릭터 정체성과 자연스러운 샷 전환을 갖춘 일관된 MiniMax 뮤직 비디오입니다.
아티스트, 편집자 및 제작자를 위해 설계된 이 워크플로는 공연 컷, 가사 기반 비주얼 및 내러티브 삽입을 지원합니다. 자신의 트랙을 가져오거나 먼저 생성한 다음 노래의 구조와 함께 진화하는 동안 비주얼 연속성을 유지하는 MiniMax 뮤직 비디오를 조립할 수 있습니다.
Comfyui MiniMax 뮤직 비디오 워크플로의 주요 모델#
- MiniMax H3 확산 모델. 오디오에 맞춘 샷 시퀀스를 합성하기 위해 참조 및 프롬프트 컨디셔닝을 사용하는 핵심 비디오 생성기입니다. 모델 자산은 Hugging Face의 Comfy‑Org 네임스페이스에 게시되며, 비디오 VAE 및 텍스트 인코더를 포함합니다. Comfy‑Org/MiniMax‑H3
- MiniMax H3 비디오 VAE. 미리보기 및 내보내기를 위해 잠재 프레임을 이미지로 디코딩합니다. minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 오디오 VAE. 필요한 경우 모델의 보조 오디오 잠재를 디코딩합니다. minimax_h3_audio_vae_fp32.safetensors
- MiniMax H3 텍스트 인코더 (Qwen3VL 32B 변형, H3용으로 패키징됨). 참조‑비디오 생성에 대한 멀티모달 프롬프트 이해를 제공합니다. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
- MiniMax Music 3 확산 모델. 캡션 및 가사 계획에서 완전한 노래를 생성하는 텍스트‑음악 생성기; ComfyUI 내에서 트랙을 작성하려는 경우 사용됩니다. Comfy‑Org/MiniMax‑Music‑3
- MiniMax Music 3 텍스트 인코더. 음악 생성에 대한 컨디셔닝으로 캡션 및 가사를 인코딩합니다. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
- MiniMax Music 3 DAV VAE. 오디오 잠재를 최종 파형으로 디코딩합니다. minimax_music3_dav.safetensors
Comfyui MiniMax 뮤직 비디오 워크플로 사용 방법#
전반적인 흐름. 그래프는 두 개의 협력 부분으로 구성됩니다: 1) 마스터 트랙을 생성하는 선택적 음악 생성 및 2) 노래에 맞춰 시각적으로 일관된 샷을 구축하는 참조‑비디오 합성. 이들을 함께 실행하거나 자신의 오디오를 연결하고 음악 생성을 건너뛸 수 있습니다. 최종 단계는 프레임과 오디오를 렌더링된 MiniMax 뮤직 비디오로 조립합니다.
1) 음악 생성 (선택 사항)#
이 그룹은 MiniMax Music 3으로 트랙을 계획하고 합성합니다. M3SongPlanner (#6171)로 구조화된 캡션 및 가사를 초안을 작성하십시오; 둘 다 인코딩 전에 캔버스 텍스트 뷰어에서 편집 가능합니다. MiniMaxMusic3TextEncode (#6157)은 해당 계획을 컨디셔닝으로 변환하고 목표 지속 시간을 제공합니다. 잠재 오디오 컨테이너가 생성되며, MiniMax Music 3 UNet (UNETLoader (#6156))과 함께 KSampler (#6162)에 의해 샘플링된 다음, VRAM에 따라 표준 또는 타일 디코드를 사용하여 DAV VAE를 통해 디코딩됩니다. 생성된 오디오는 저장되고 비디오의 소스 트랙으로 설정됩니다.
2) 사용자 입력#
마스터 곡을 제공하거나 생성하십시오. VHS_LoadAudioUpload (#6170)로 외부 트랙을 업로드하거나 1단계에서 생성된 곡을 사용하십시오. LoadImage (#6110) 또는 경로 로더를 사용하여 외모 및 정체성을 위해 하나 이상의 참조 이미지를 추가하십시오; 이미지는 안정적인 컨디셔닝을 위해 ImageResizeKJv2 (#6090, #6091)에 의해 정규화됩니다. (input:prompt) Text Prompt (#138)에서 창의적 브리핑을 설정하십시오 — 이 프롬프트는 주제 정의, 샷 노트 및 타이밍 힌트를 지원합니다. Resolution Selector (Size) (#115) 및 (input:duration) Duration (#132)를 통해 비율 및 대략적인 지속 시간을 선택하십시오.
3) 패치#
PathchSageAttentionKJ (#142)는 일부 GPU에서 처리량과 메모리 동작을 개선할 수 있는 최적화된 주의 구현을 활성화합니다. 이 패치는 샘플링 전에 로드된 MiniMax H3 모델에서 작동합니다. 장치 별 문제를 겪지 않는 한 활성화 상태를 유지하십시오.
4) 모델#
UNETLoader (#127)는 참조‑비디오를 위한 MiniMax H3 백본을 로드하며, 빠르고 강력한 결과를 위해 LoraLoaderModelOnly (#5959)로 선택적 Turbo LoRA가 적용됩니다. 비디오 및 오디오 VAE (VAELoader (#119), VAELoader (#120))는 디코딩을 위해 준비됩니다. 이러한 자산은 품질 범위를 정의하며 샷 전반에 걸쳐 일관된 모습을 유지해야 합니다.
5) 컨디셔닝#
MiniMaxH3ReferenceToVideo (#136)는 텍스트 프롬프트, 참조 이미지, 목표 크기 및 길이를 컨디셔닝 및 초기 잠재로 융합합니다. 이는 창의적 브리핑과 샘플러가 렌더링할 내용을 연결하는 다리입니다. 이 템플릿에서 두 개의 참조 이미지를 제공하여 의상, 정체성 및 팔레트를 안내할 수 있습니다. 그룹은 요청된 지속 시간에서 샷 길이를 계산하여 프레임이 음악적으로 정렬되도록 합니다.
6) 샘플링#
샘플링 스택은 BasicScheduler (#124), BasicGuider (#126), SamplerCustomAdvanced (#125) 및 RandomNoise (#129)를 결합합니다. MiniMaxH3SigmaShift (#5960)는 더 선명한 비디오 모션과 안정적인 오디오 정렬을 위해 시그마 범위를 바이어스하기 위해 상류에 위치합니다. 함께 이들은 잠재를 참조 및 비트에 따라 이미지를 향해 반복합니다. 재현성을 위해 프롬프트 및 참조에서 반복하는 동안 씨드를 고정 상태로 유지하십시오.
7) 디코딩 및 비디오 생성#
VAEDecode (#122)는 샘플링된 잠재를 프레임으로 변환하고 Set_video_1 (#5651)는 내보내기를 위해 준비합니다. 최종 조립은 VHS_VideoCombine (#5645)를 사용하여 프레임을 선택한 소스 오디오에 연결하고 저장된 src_fps 값에서 대상 프레임 속도를 적용합니다. 출력은 트랙과 동기화된 공유 가능한 MiniMax 뮤직 비디오 클립입니다.
8) 참조 2 비디오#
이 그룹은 마스터 곡에 맞서 샷 시퀀스를 구축하기 위한 파이프라인의 창의적 핵심입니다. 준비된 H3 모델, 참조 및 계산된 샷 길이를 수신한 다음 클립당 한 번의 샘플링 패스를 실행합니다. 동일한 주제를 중심으로 여러 연결된 컷을 반복하여 정체성, 의상 및 팔레트를 일관되게 유지하십시오. 노래의 각 부분에 대해 반복하여 인트로, 구절, 후렴 및 다리에서 매칭 비주얼로 덮습니다.
Comfyui MiniMax 뮤직 비디오 워크플로의 주요 노드#
MiniMaxH3ReferenceToVideo (#136)#
프롬프트, 참조 및 목표 지오메트리를 샘플링을 위한 잠재와 연결하는 컨디셔닝을 생성합니다. 소수의 고품질 이미지와 명확한 샷 노트를 사용하여 정체성과 아트 방향을 조정하십시오. 얼굴이나 의상에 대한 강한 준수를 필요로 하는 샷의 경우, 참조를 스타일적으로 유사하게 유지하고 극단적인 크롭을 피하십시오. 샘플링 설정을 변경하기 전에 프롬프트 구문을 조정하십시오. 이 노드는 화면에 나타나는 사람과 사물을 가장 강하게 좌우합니다.
MiniMaxH3SigmaShift (#5960)#
MiniMax H3 스택에서 시그마 스케줄을 오프셋하여 시간적 변화와 오디오 정렬을 균형 있게 합니다. 더 많은 모션과 시각적 진화를 원하는 경우 비디오 시프트를 증가시키고, 타이트한 리듬과 립 느낌을 선호하려면 오디오 시프트를 증가시키십시오. 겸손한 변화를 사용하고 짧은 클립에서 테스트한 후 전체 장면을 커밋하십시오.
SamplerCustomAdvanced (#125)#
선택된 스케줄러 및 가이더와 함께 디노이징 루프를 실행합니다. 여기에서 시간과 품질 및 질감을 교환합니다. 빠른 아이디어화의 경우, 스텝을 줄이고 씨드를 고정 상태로 유지하십시오; 최종본의 경우, 더 많은 스텝을 주고 가이드를 조정하여 정체성을 잃지 않으면서 세부 사항을 정제하십시오. 결과가 브리핑을 초과할 경우, 먼저 프롬프트를 단순화하거나 충돌하는 참조를 줄이십시오.
VHS_VideoCombine (#5645)#
선택한 오디오와 함께 디코딩된 프레임을 단일 비디오 파일로 조립합니다. 함께 편집하려는 모든 클립에서 프레임 속도를 일정하게 유지하십시오. 비주얼이 비트와 어긋나는 경우, 샷 길이와 fps가 소스 트랙과 일치하는지 확인하십시오. 워크플로 내에서 템포와 가사 큐와 일치하도록 렌더링된 후에만 NLE에서 트림하십시오.
MiniMaxMusic3TextEncode (#6157)#
MiniMax Music 3을 위해 구조, 배열 및 보컬 캐릭터를 정의하는 캡션 및 가사를 인코딩합니다. 모델이 의도를 이해하도록 글로벌 메타데이터, 보컬 세부 사항 및 배열을 포함하는 섹션으로 캡션을 작성하십시오. 생성기가 따를 수 있는 전환을 표시하기 위해 [Intro], [Verse], [Chorus]와 같은 가사 섹션 태그를 사용하십시오. 프롬프트 도움말은 공식 저장소의 가이드와 도구를 참조하십시오. MiniMax‑AI/MiniMax‑Music3
ComfyMathExpression (#131)#
목표 지속 시간에서 내부 프레임 수를 계산하고 선택된 fps에서 H3 시간적 스택이 선호하는 리듬으로 스냅합니다. 미세한 비동기화 및 스터터를 피합니다. fps 또는 지속 시간을 변경하면 이 노드가 길이를 다시 계산하여 샘플링이 비트에 맞게 착륙하도록 하십시오.
선택적 추가 기능#
- 안정적인 구조로 프롬프트 작성: 주제 정의, 한 문장 요약, 그런 다음 시간 큐가 있는 1–3 샷 단락. 시제와 음성을 일관되게 유지하십시오.
- 주제당 1–2개의 깨끗한 참조 이미지를 사용하십시오. 정체성 보존을 향상시키기 위해 중립 조명과 헤어 및 의상 세부 사항을 포함하는 중간 크롭을 선호하십시오.
- 먼저 노래에 장면을 매핑하십시오. 각 섹션(인트로, 구절, 후렴)당 짧은 클립을 렌더링하고 연결하십시오; 이는 MiniMax 뮤직 비디오가 일관성을 유지하면서도 로컬 변화를 허용합니다.
- 함께 편집할 계획인 모든 클립에서 해상도와 프레임 속도를 일관되게 유지하십시오. 프로젝트 중간에 변경하면 연속성이 더 어려워집니다.
- VRAM이 낮은 기기에서는 긴 노래의 경우 타일 오디오 디코드를 활성화하십시오; VRAM이 높은 기기에서는 표준 디코드가 일반적으로 더 깔끔합니다.
- 신뢰할 수 있는 재렌더링을 위해, 비디오 샘플러와 음악 샘플러 모두에서 씨드를 잠그고 최종본을 내보내기 전에 잠그십시오.
감사의 말#
이 워크플로는 다음 작업 및 리소스를 구현하고 구축합니다. 우리는 MiniMax Music VideoWorkflow Source에 대한 그들의 기여와 유지 관리를 위해 Innovate Futures @ Benji에 감사드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서와 저장소를 참조하십시오.
리소스#
- Innovate Futures @ Benji/MiniMax Music VideoWorkflow Source
- 문서 / 릴리스 노트: MiniMax Music VideoWorkflow Source
참고: 참조된 모델, 데이터 세트 및 코드의 사용은 작성자 및 유지 관리자가 제공하는 해당 라이선스 및 조건에 따릅니다.

