MiniMax Music 3 ComfyUI 텍스트‑음악 워크플로우로 구조화된 노래 만들기#
MiniMax Music 3 ComfyUI는 RunComfy의 ComfyUI 내에서 세부적인 캡션과 섹션 태그가 있는 가사를 완전한 노래로 변환합니다. 그래프는 기본적으로 60초 트랙을 생성하도록 설정되어 있으며, 기본 모델은 약 5분 길이의 노래를 지원합니다. 장르, 분위기, 보컬, 악기 구성, 템포, 키, 구조를 텍스트로 안내하며, 모델은 이를 창의적 방향으로 처리합니다.
이 MiniMax Music 3 ComfyUI 워크플로우는 텍스트로부터 오리지널 보컬 트랙이나 구조화된 노래 개념을 초안하려는 프로듀서, 사운드 디자이너, 창작자에게 이상적입니다. 깨끗한 텍스트‑음악 생성에 중점을 두며, 참조 오디오, 커버, 연속, 오디오 편집 모드를 포함하지 않습니다.
MiniMax Music 3 ComfyUI 워크플로우의 주요 모델#
- MiniMax Music 3 Diffusion Transformer (DiT). 텍스트 조건에서 잠재 오디오 공간에서 노래를 합성하는 핵심 생성기입니다. 최고의 품질을 위해 FP16 가중치를 사용하거나 VRAM이 적은 경우 INT8 ConvRot 변형을 사용하세요. FP16 weights 및 INT8 weights.
- MiniMax Music 3 Text Encoder. 캡션과 가사를 생성기가 이해할 수 있는 조건으로 변환하고, 목표 지속 시간에서 파생된 타이밍 신호를 포함합니다. Text encoder.
- MiniMax Music 3 DAV (Decoding Audio VAE). 샘플링 종료 시 잠재 오디오를 전체 대역파형으로 디코딩합니다. VAE.
- 프로젝트 리소스 및 프롬프트 예시는 여기에서 저자에 의해 유지됩니다: MiniMax‑Music3 on GitHub.
MiniMax Music 3 ComfyUI 워크플로우 사용 방법#
전반적으로, 워크플로우는 캡션과 가사를 인코딩하고, 요청된 지속 시간의 잠재 오디오 타임라인을 생성하고, 노래를 샘플링하고, 파형으로 디코딩한 다음 결과를 저장합니다. 주요 제어는 Text to Music (MiniMax Music 3) (#37) 노드에 있습니다.
캡션 및 가사 작성#
캡션을 세 개의 짧은 섹션으로 작성하세요: 글로벌 메타데이터, 보컬 세부사항, 편곡. 장르, 분위기, 템포, 키, 악기, 믹스 캐릭터, 보컬 스타일을 간단한 언어로 설명하세요. 가사에서 [Intro], [Verse], [Chorus], [Bridge], [Outro]와 같은 섹션 태그를 사용하여 구조를 정의하세요; 태그는 형식을 구동하며, 단어는 주로 분위기와 발음을 알립니다. 스타일을 유도하기 위해 캡션을 간결하고 구체적으로 유지하고 창의력을 과도하게 제한하지 마세요. 기악 트랙의 경우, 캡션에 보컬이 필요 없다고 명시하세요.
MiniMaxMusic3TextEncode (#13)#
이 노드는 캡션과 태그가 있는 가사를 수집하여 스타일, 편곡 의도 및 보컬 존재감을 포착하는 조건을 생성합니다. 또한 그래프가 잠재 오디오 타임라인의 크기를 조정하는 데 사용하는 시간 값을 방출하므로 max_duration 설정이 노래 길이를 직접 형성합니다. 재현 가능한 테이크를 원하면 시드를 설정하세요; 같은 편곡을 반복하여 텍스트를 다듬으면서 고정하세요. 인코더는 그래프의 다른 부분에 로드된 MiniMax CLIP 계열 텍스트 모델과 짝을 이루므로 인코더를 전환할 필요는 거의 없습니다.
EmptyMiniMaxMusic3LatentAudio (#15)#
인코더의 지속 시간 신호에 일치하는 빈 잠재 오디오 캔버스를 생성합니다. 생성기가 텍스트에 따라 드럼, 베이스, 하모니, 멜로디, 보컬을 채울 멀티트랙 타임라인으로 생각하세요. 더 긴 지속 시간은 VRAM 필요와 렌더링 시간을 증가시킵니다. 짧은 아이디어와 전체 길이의 노래 사이를 이동할 때 파이프라인의 다른 부분을 변경하지 않고 사용하세요.
UNETLoader (#6) 및 KSampler (#9)#
UNETLoader는 MiniMax Music 3 DiT 가중치를 선택합니다. KSampler는 텍스트의 긍정적 조건과 ConditioningZeroOut (#10)이 제공하는 빈 부정적 조건을 사용하여 확산 프로세스를 적용합니다. 단계와 샘플러 선택은 디테일과 리듬 감을 영향을 미치며, 가이드 스케일은 텍스트에 대한 준수를 창의적 자유와 균형 있게 합니다. 캡션을 공정하게 비교하려면 시드를 일정하게 유지하고, 새로운 멜로디와 구조적 대안을 탐색하려면 변경하세요.
디코딩 및 VRAM 제어: VAEDecodeAudio (#12), VAEDecodeAudioTiled (#42), ComfySwitchNode (#43)#
샘플링 후, DAV가 잠재 오디오를 파형으로 디코딩합니다. 긴 노래나 낮은 VRAM 시나리오에서는 tiled_decode 스위치를 메인 노드에서 활성화하여 VAEDecodeAudioTiled를 통해 타일을 중첩하여 메모리 사용을 줄입니다. 타일 디코딩은 약간 느리고 에지 케이스에서 미묘한 경계 아티팩트를 도입할 수 있으므로 리소스가 허용하는 한 표준 디코딩을 선호하세요. ComfySwitchNode는 토글에 따라 자동으로 적절한 경로를 선택합니다.
출력: SaveAudioAdvanced (#35)#
최종 오디오는 선택한 형식(MP3 또는 WAV)으로 디스크에 저장됩니다. 이 노드를 사용하여 초안 또는 공유에 적합한 파일 이름 규칙 및 품질 설정을 지정하세요. 생산용으로는 후속 믹싱 및 마스터링을 위해 무손실 파일로 내보내는 것을 고려하세요.
MiniMax Music 3 ComfyUI 워크플로우의 주요 노드#
MiniMaxMusic3TextEncode (#13)#
스타일과 구조에 중심적입니다. max_duration을 조정하여 목표 길이를 설정하고, seed를 설정하여 재현성을 확보하세요. 결과가 프롬프트와 맞지 않으면, 캡션의 글로벌 메타데이터를 먼저 수정한 다음 보컬 세부사항과 편곡을 조정하여 악기 구성과 믹스 캐릭터를 재조정하세요.
KSampler (#9)#
디테일, 타이밍 감각, 노래가 텍스트를 따르는 정도를 관리합니다. 빠르기 손해를 감수하고 더 풍부한 텍스처를 위해 단계를 늘리고, 다른 그루브와 트랜지언트를 위해 대체 샘플러를 시도하고, 창의성을 위해 정밀도를 조정하세요. 캡션을 A/B 테스트할 때는 같은 시드를 유지하여 프롬프트 변경을 고립시키세요.
VAEDecodeAudioTiled (#42)#
긴 트랙을 생성하거나 제한된 GPU에서 작업할 때 사용합니다. 겹치는 타일로 파형을 디코딩하여 메모리 피크를 낮춥니다. 필요할 때만 활성화하여 작은 이음새 위험과 추가 렌더 시간을 피하세요.
UNETLoader (#6)#
FP16 및 INT8 DiT 가중치 간에 전환하여 VRAM을 조정하세요. FP16은 최고의 충실도를 위해 권장되며, INT8 ConvRot 변형은 작은 카드에서 더 긴 노래를 수용하는 데 도움이 됩니다.
SaveAudioAdvanced (#35)#
내보내기 형식 및 품질을 제어합니다. 빠른 공유를 위해 MP3를 선택하거나 무손실 스템 및 후속 처리용으로 WAV를 선택하세요. 여러 테이크를 정리하기 위해 명확한 파일 이름 접두사를 설정하세요.
선택적 추가 기능#
- 간결하고 구체적인 캡션을 사용하세요. 장르, BPM 느낌, 키, 믹스 형용사, 제작 시대가 포함된 강력한 글로벌 메타데이터 문단이 긴 산문보다 더 중요할 수 있습니다.
- 가사의 섹션 태그는 구조를 구동합니다. 태그를 간단히 유지하고 중첩을 피하며, 태그 사이에 단어를 생략하여 기악 섹션이 숨 쉴 수 있도록 하세요.
- 보컬을 앞으로 밀어내려면 캡션에서 보컬 음색과 배치를 강조하세요. 기악 출력을 위해서는 보컬이 필요 없다고 명시적으로 말하세요.
- 더 많은 변화를 위해 시드를 변경하세요. 집중된 개선을 위해 시드를 고정하고 텍스트를 반복하세요.
- 모델은 템포, 키, 악기 구성을 안내로 취급합니다. 창의적 편차를 기대하고 목표를 향해 반복하세요.
- 이 MiniMax Music 3 ComfyUI 워크플로우는 참조 오디오, 커버, 연속, 오디오 편집 모드를 포함하지 않습니다. 고급 프롬프트 기술 및 예시는 공식 프로젝트 리소스를 참조하세요: MiniMax‑Music3 on GitHub 및 모델 파일 Hugging Face.
감사#
이 워크플로우는 다음 작업 및 리소스를 구현하고 구축합니다. 우리는 MiniMax Music 3: Text to Music 워크플로우 템플릿에 대해 ComfyUI, MiniMax Music 3 공식 프로젝트에 대해 MiniMax-AI, MiniMax Music 3 모델 가중치에 대해 Comfy-Org에 그들의 기여와 유지 관리를 감사드립니다. 권위 있는 세부 정보는 아래 링크된 원본 문서 및 저장소를 참조하십시오.
리소스#
- Comfy.org/Source 워크플로우 템플릿
- 문서 / 릴리스 노트: MiniMax Music 3: Text to Music — ComfyUI Workflow
- MiniMax-AI/MiniMax Music 3 공식 프로젝트
- GitHub: MiniMax-AI/MiniMax-Music3
- Hugging Face: MiniMaxAI/MiniMax-Music3
- Comfy-Org/MiniMax Music 3 모델 가중치
- Hugging Face: Comfy-Org/MiniMax-Music-3
참고: 참조된 모델, 데이터셋 및 코드의 사용은 작성자 및 유지 관리자가 제공한 해당 라이선스 및 조건에 따릅니다.

