올인원 MiniMax H3 ComfyUI 다중 참조 가속화: 다중 참조 Ref2VA 비디오와 동기화된 스테레오 오디오#
이 올인원 MiniMax H3 ComfyUI 다중 참조 가속화 작업 흐름은 최대 아홉 개의 시각 참조와 선택적인 비디오 및 오디오 신호를 짧은 영화 같은 클립으로 변환하여 네이티브 스테레오 사운드트랙을 제공합니다. 이는 여러 정체성, 소품 또는 위치를 통합하면서 캐릭터를 일관되게 유지하고 <Picture 1>과 같은 프롬프트 태그를 올바른 참조와 정렬하려는 창작자를 위해 설계되었습니다.
오픈 Comfy-Org MiniMax-H3 Ref2VA 스택을 중심으로 구축된 이 그래프는 SageAttention 가속화를 통해 지원되는 GPU에서 더 빠른 샘플링을 가능하게 하고 int8-프루닝 모델을 사용하여 VRAM을 절약하면서도 일관성을 유지합니다. 그 결과 MiniMax H3를 위한 단일 RunComfy 준비 캔버스가 제공되며 여기에서 다중 참조 안내, 타이밍, 해상도 및 내보내기가 처음부터 끝까지 연결됩니다.
Comfyui 올인원 MiniMax H3 ComfyUI 다중 참조 가속화 작업 흐름의 주요 모델#
- MiniMax-H3 Ref2VA 확산 모델 (프루닝된 int8 convrot). 당신의 참조와 프롬프트를 결합하여 공동 비디오 및 오디오 잠재 공간으로 융합하는 핵심 생성기입니다. 가중치: Comfy-Org/MiniMax-H3.
- Qwen3-VL 32B 텍스트-이미지-언어 인코더 (AWQ, MiniMax-H3 릴리스와 함께 패키지됨). <Picture 1>과 같은 태그를 포함하여 당신의 프롬프트를 해석하고 생성기를 조건화합니다. 가중치는 Comfy-Org/MiniMax-H3에 포함되어 있습니다.
- MiniMax H3 비디오 VAE (FP16). 비디오 잠재 공간을 고충실도의 프레임으로 디코딩합니다. 가중치: Comfy-Org/MiniMax-H3.
- MiniMax H3 오디오 VAE (FP32). 오디오 잠재 공간을 깨끗한 스테레오 파형으로 디코딩하여 믹싱 준비가 됩니다. 가중치: Comfy-Org/MiniMax-H3.
Comfyui 올인원 MiniMax H3 ComfyUI 다중 참조 가속화 작업 흐름 사용 방법#
고급 수준에서, 당신은 모델을 로드하고, 참조와 프롬프트를 제공하며, 이 작업 흐름은 MiniMax-H3 조건을 구축하고, 가속화된 샘플러를 실행한 다음 생성된 스테레오 오디오와 함께 비디오 프레임을 디코딩하고 결합합니다. 그룹은 순서대로 작동합니다: 사용자 입력은 조건에 공급되고, 이는 샘플링을 구동합니다; 디코딩된 결과는 내보내기로 이동합니다.
사용자 입력#
LoadImage 노드를 사용하여 최대 아홉 개의 참조를 연결하십시오. 프롬프트 태그인 <Picture 1>, <Picture 2>, 등과 같은 순서가 일치하도록 일관된 순서를 유지하십시오. 당신의 장면과 대사를 Input Text (Prompt) 필드에 작성하고, 프롬프트 상단의 번호 태그에 정체성이나 자산을 명시적으로 매핑하십시오. Resolution Selector (Size)에서 비율과 크기를 선택하십시오; 안정성을 위해 32픽셀 배수로 너비와 높이를 출력합니다. 초 단위로 클립 지속 시간을 설정하십시오; 내부 표현식이 이를 거의 24fps에 해당하는 프레임 수로 변환하고 샘플러와 모델에 친화적인 배수로 정렬합니다.
모델#
이 그룹은 MiniMax-H3 UNet, Qwen3-VL 32B 텍스트 인코더 및 두 VAE를 로드합니다. int8-프루닝된 Ref2VA 모델은 메모리를 줄이면서도 모션과 입술 싱크 품질을 유지합니다. 텍스트 인코더는 MiniMax-H3에 대해 초기화되어 시각적 태그가 올바른 참조와 결합됩니다. 비디오와 오디오를 위한 별도의 VAE는 디코딩을 정확하고 효율적으로 유지합니다. 이 모델들은 공식 Ref2VA 템플릿에서 사용하는 동일한 계열이며, 여기서는 다중 참조 제어와 공동 오디오를 위해 조정되었습니다. 참조: MiniMax-H3 R2V template.
조건#
MiniMaxH3ReferenceToVideo는 실제 H3 조건과 시작 잠재 클립을 구축합니다. CLIP, VAE, 모든 연결된 참조 이미지, 프롬프트, 선택한 너비, 높이 및 길이를 수용합니다. 노드는 자리 표시자 태그를 존중하여 정체성, 위치 및 소품이 올바른 참조에 부착된 상태로 유지됩니다. 참조 크기 모드를 사용하여 출력과 상대적으로 구성이 조정되도록 유지합니다. 노드는 샘플러를 구동하는 긍정적 조건 스트림과 잠재 클립을 함께 방출합니다.
샘플링#
샘플링 전에 그래프는 PathchSageAttentionKJ로 모델을 감싸 SageAttention 가속화를 가능하게 하고, 그런 다음 VRAM 관리자를 통해 라우팅하여 큰 클립을 더 편안하게 맞출 수 있습니다. BasicGuider, BasicScheduler, 및 KSamplerSelect는 안내 전략, 단계 일정 및 샘플러 알고리즘을 정의합니다. RandomNoise는 프로세스를 시작하고 SamplerCustomAdvanced는 모델과 조건에 대해 디노이징 패스를 수행하여 정제된 비디오 및 오디오 잠재 공간을 생성합니다. 레이아웃은 MiniMax-H3에 대한 속도와 품질의 균형을 유지하면서 설정을 쉽게 접근할 수 있도록 합니다.
내보내기#
VAEDecode 및 VAEDecodeAudio는 최종 잠재 공간을 프레임과 스테레오 파형으로 변환합니다. 그런 다음 VHS_VideoCombine이 프레임과 오디오를 선택한 프레임 속도로 단일 MP4로 믹싱하고, 품질 제어를 위해 CRF 및 조직을 위한 간단한 파일 이름 접두사를 설정합니다. 결과를 즉시 미리 보고 출력 폴더에 저장할 수 있습니다. 나중에 외부 참조 오디오를 공급하면, 내보내기는 그 트랙 길이에 맞춰 자를 수 있습니다. 내보내기는 ComfyUI에서 널리 사용되는 Video Helper Suite에서 가져왔습니다: ComfyUI-VideoHelperSuite.
Comfyui 올인원 MiniMax H3 ComfyUI 다중 참조 가속화 작업 흐름의 주요 노드#
MiniMaxH3ReferenceToVideo (#136) 이것은 참조, 프롬프트, 크기, 길이가 MiniMax-H3 조건과 잠재 클립으로 융합되는 작업 흐름의 핵심입니다. <Picture 1> = character A와 같은 명시적 태그 매핑으로 prompt 텍스트를 조정하여 정체성을 고정하세요. width, height, 및 length를 조정하여 구성과 실행 시간을 설정하세요; 업스트림 선택기와 지속 시간 제어가 안전한 배수를 관리합니다. 참조 크기 모드를 사용하여 출력 프레임에 대한 주제의 규모를 조정하세요. 이 노드는 공식 Ref2VA 경로를 뒷받침하며 여기서는 다중 참조 제어를 위해 조정되었습니다.
PathchSageAttentionKJ (#144) 모델을 SageAttention으로 감싸 주의 레이어를 가속화하고 지원되는 GPU에서 메모리 압력을 줄입니다. 대부분의 카드에서 가속화 모드를 auto로 두세요; 환경에 이점이 있다면 모델 컴파일을 활성화하세요. 불안정성이 관찰되면 모드를 끄고 성능을 비교하세요. 출처: ComfyUI-KJNodes.
BasicScheduler (#124) 디노이징 중 사용되는 시그마 일정과 총 단계를 정의합니다. 단계 수를 늘리면 세부 사항이 추가될 수 있지만 렌더링 시간이 증가합니다; 여기에 대한 변경 사항은 호환 가능한 샘플러 유형과 쌍을 이루세요. denoise를 거의 전체로 유지하여 순수 생성을 위한 것이며, 강도 제한된 정제 시에만 낮추는 것을 고려하세요.
SamplerCustomAdvanced (#125) 선택한 샘플러, 일정 및 가이더와 함께 확산 루프를 실행합니다. 기본 샘플러는 MiniMax-H3에 대한 시간적 안정성과 모션 부드러움의 균형을 맞춥니다. 일정 관리자 계열을 변경하는 경우, 인공물을 피하기 위해 이에 맞게 설계된 샘플러를 선택하세요.
Resolution Selector (Size) (#115) GPU 친화적인 모양을 위해 32픽셀 배수로 스냅된 너비와 높이를 출력합니다. 빠른 품질 대 속도 절충을 위해 megapixels를 설정하고, 16:9와 같은 비율을 선택하여 와이드스크린 샷을 찍으세요. 초안 미리보기에는 적당한 크기를 사용하고, 타이밍과 프레이밍이 잠기면 확대하세요.
ComfyMathExpression (#131) 요청된 초를 거의 24fps에 해당하는 프레임 수로 변환하고 샘플러와 모델과 협력하는 배수로 정렬합니다. 이는 시간적 떨림과 오차를 방지합니다. 거의 손댈 필요가 없습니다; 초 입력에서 타이밍을 제어하세요.
VHS_VideoCombine (#143) 프레임과 생성된 스테레오 오디오를 최종 전달 가능 형태로 믹싱합니다. frame_rate를 목표 타임라인에 맞추고 crf를 조정하여 품질을 설정하세요. 외부 트랙을 공급하고 완벽한 길이로 자르려면 trim_to_audio를 사용하세요.
선택적 추가 기능#
- 빠르게 렌더링되고 깔끔하게 보이는 빠른 16:9 크기: 1056×608 (0.6 MP), 1216×672 (0.8 MP), 1344×768 (0.98 MP), 1664×928 (1.5 MP), 1920×1088 (2.0 MP).
- 프롬프트를 명시적으로 유지하세요:
<Picture 1..9>를 정체성, 의상, 소품 또는 위치에 바인딩하는 매핑 블록으로 시작한 후 장면을 설명하세요. - 일관된 얼굴을 위해서는 선명하고 정면을 향한 이미지를 사용하고 참조 간에 조명이나 각도만 약간 다르게 하세요.
- 대화와 효과음은 짧고 자연스러운 문장으로 작성하면 잘 작동합니다; 오디오 VAE는 Ref2VA 잠재 공간에서 깨끗한 스테레오 트랙을 합성할 것입니다.
- VRAM이 부족한 경우 먼저 짧은 클립을 렌더링하거나 메가픽셀을 줄인 다음 모션과 프레이밍에 만족하면 확대하거나 확장하세요.
- 이 레이아웃은 다중 참조 제어와 가속화를 위해 조정된 공식 Ref2VA 템플릿 계열을 따릅니다. 컨텍스트를 위해 기본 템플릿을 참조하세요: MiniMax-H3 R2V template.
감사의 말씀#
이 작업 흐름은 다음 작업과 리소스를 구현하고 구축합니다. 우리는 MiniMax H3, Comfy-Org의 MiniMax-H3 모델 가중치 및 MiniMax H3 R2V 작업 흐름 템플릿, 그리고 Comfy.org의 MiniMax H3 튜토리얼에 대한 기여와 유지보수에 대해 MiniMax에 감사드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서 및 리포지토리를 참조하십시오.
리소스#
- MiniMax H3 공식 발표
- 문서 / 릴리즈 노트: MiniMax H3 announcement
- Comfy-Org MiniMax-H3 모델 가중치
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org MiniMax H3 튜토리얼
- 문서 / 릴리즈 노트: Comfy.org tutorial
- Comfy.org MiniMax H3 R2V 템플릿
- GitHub: Comfy-Org/workflow_templates
참고: 참조된 모델, 데이터 세트 및 코드의 사용은 해당 저자와 유지보수자가 제공하는 라이선스 및 조건에 따릅니다.


