MiniMax H3 퍼포먼스 캡처 for ComfyUI#
MiniMax H3 퍼포먼스 캡처는 당신의 연기를 새로운 캐릭터로 변환하면서 원본 오디오를 유지합니다. 이 워크플로우는 얼굴 표정, 입 모양, 눈 방향 및 머리 움직임을 소스 클립에서 타겟 생물체 또는 전신 캐릭터로 전이한 후 결과를 원본에 합성합니다. MiniMax-H3 참조-조건 비디오를 기반으로 구축된 자동 얼굴 마스킹 및 선택적 포즈 가이드를 포함하며, 늑대, 로봇, 외계인과 같은 창의적인 스왑에 대해 장면과 사운드트랙을 보존하면서 테스트되었습니다. Mickmumpitz의 워크플로우입니다.
이 ComfyUI MiniMax H3 퍼포먼스 캡처 워크플로우는 간단한 "렌더" 에디션입니다: 기본적으로 하나의 카메라, 선택적인 헤드캠 및 수동 마스크, 선택적 포즈 제어, 그리고 두 개의 저장된 비디오(오디오가 포함된 최종 렌더, 비교 컷 포함).
Comfyui MiniMax H3 퍼포먼스 캡처 워크플로우의 주요 모델#
- MiniMax-H3 Reference-to-Video diffusion UNet (minimax_h3_ref2va_pruned_int8_convrot). 참조, 프롬프트 및 오디오를 비디오 잠재 변수로 융합하는 핵심 생성기입니다. Model files
- Qwen3‑VL 32B MiniMax‑H3 text encoder (qwen3vl_32b_minimax_h3_nvfp4_awq). 프롬프트를 인코딩하여 정체성과 연기 스타일을 조정합니다. Model file
- MiniMax‑H3 Video VAE FP16 and Audio VAE FP32. 비디오 VAE는 이미지 잠재 변수를 디코딩하며; 오디오 VAE는 립싱크와 퍼포먼스 타이밍을 조절합니다. VAEs
- MiniMax‑H3 Turbo 8‑step 768p LoRA. 빠르고 고품질의 렌더를 위한 H3 샘플링을 가속화합니다. Model card
- MiniMax‑H3 Character Swap LoRA. 스타일화되거나 생물체 모양을 위한 견고한 머리 및 몸체 스왑을 강화합니다. Model card
- FUN ControlNet Union 2.0 model patch for H3. 스켈레톤에서 선택적 몸 포즈 가이드를 추가합니다. Model file
- Segment Anything Model 3.1 Multiplex. 재생성할 영역에 대한 자동 마스크를 생성합니다. Checkpoint
- DWPose (via ControlNet Aux). 포즈 가이드와 머리 자르기 논리를 위한 몸과 손 스켈레톤을 감지합니다. Repository
Comfyui MiniMax H3 퍼포먼스 캡처 워크플로우 사용 방법#
워크플로우는 여덟 개의 레이블이 붙은 그룹을 통해 왼쪽에서 오른쪽으로 실행됩니다. 퍼포먼스 클립을 로드하고 선택적으로 수동 마스크, 헤드캠 클로즈업 및 캐릭터 시트를 로드하여 시작합니다. 파이프라인은 플레이트와 마스크를 준비하고, 얼굴로부터 연기 참조를 생성하며, 선택적으로 몸 포즈를 가이드하고, MiniMax H3로 렌더링하며, 비교 컷을 저장합니다.
1 모델 로드#
이 그룹은 MiniMax-H3 UNet, 텍스트 인코더 및 VAE를 로드한 다음, Turbo 및 Character-Swap LoRAs를 적용합니다. UNETLoader (#1001) 및 CLIPLoader (#1006)는 핵심 생성기와 프롬프트 인코더를 제공합니다. LoraLoaderModelOnly (#1003, #1004)는 속도 및 스왑 어댑터를 연결합니다. BlockSparseAttention (#1009) 및 MiniMaxH3SigmaShift (#1002)는 샘플링을 가속화하고 오디오-비디오 가이드를 균형 있게 유지합니다.
2 당신의 샷#
BODY CLIP (your performance + voice) (#1012)를 사용하여 임베디드 모노 또는 스테레오 오디오와 함께 메인 테이크를 로드합니다. 여러 샷에서 외모를 고정하려면 LoadImage (#1016)를 통해 CREATURE SHEET를 추가하고 PROMPT (the swap, the creature, its acting) (#1018)에서 프롬프트를 설정할 수 있습니다. 선택적 입력으로는 넓은 샷에서 작은 얼굴을 위한 HEAD-CAM 클로즈업 VHS_LoadVideo (#1013)와 자동 마스킹을 무시하려는 경우의 MANUAL MASK 비디오 VHS_LoadVideo (#1014)가 있습니다. 빠른 제어는 여기에서 가능합니다: WHAT GETS REPLACED (head / person) (#1017), SEED (#1019), GROW MASK px (#1020), FACE CROP (#1021) 및 PERSON (#1022). 토글 노드 (NO HEAD-CAM #1227, NO MANUAL MASK #1228, NO CHARACTER SHEET #1229, NO POSE CONTROL #1230)는 일반적인 설정을 한 번의 클릭으로 만듭니다.
3 준비#
WORKING SIZE (draft: 896x512) (#1028)는 입력을 안정적인 해상도로 정규화하고, length: next 17k+5 up (#1030)는 실행을 짧고 간결한 미리보기 길이로 제한합니다. PREPARE (plate + regenerated area) (#1231)는 깨끗한 플레이트를 구축하고 WHAT GETS REPLACED의 텍스트를 사용하여 SAM 3로 대체할 것을 추적하며, 존재한다면 수동 마스크를 수집합니다. 결과는 제어된 재생성을 위한 비디오 플레이트와 하나 또는 두 개의 마스크입니다.
4 재생성된 영역#
REGENERATED AREA (grow, blocks, hold) (#1233)는 MiniMax H3가 그릴 수 있는 마스크 논리입니다. 귀나 뿔과 같은 특징이 공간을 가질 수 있도록 마스크를 확장하고, 움직임을 안정시키기 위해 시간 블록으로 변환하며, 세부 사항이 깜빡이지 않도록 몇 프레임 동안 변경 사항을 유지합니다. 수동 마스크를 제공한 경우, [MANUAL MASK] 합성 (#1074 to #1105)은 그려진 대로 통과시킵니다.
5 연기 참조#
ACTING REFERENCE (your face on grey | head-cam) (#1232)는 선택된 사람을 찾고 DWPose로 얼굴 영역을 잘라내며, 당신의 표정, 눈선 및 머리 회전을 전달하는 참조 비디오를 생성합니다. 헤드캠이 활성화되면, 넓은 카메라를 따라가는 머리 방향과 헤드캠을 따라가는 세밀한 얼굴 움직임을 위해 분할 화면을 구축합니다. 미리보기 PREVIEW: acting reference (<Video 1>) (#1130)을 통해 렌더링 전에 추적을 확인할 수 있습니다.
6 포즈 제어 (선택 사항)#
전신 생물체 스왑을 위해 [POSE] DWPose skeleton (#1131)은 플레이트에서 몸과 손의 키포인트를 추출합니다. MiniMaxH3FunControlNetApply (#1132)은 그 움직임을 H3에 패치로 공급하여 팔다리와 몸통이 연기를 따르도록 하면서 얼굴은 참조 기반으로 유지합니다. 팔과 다리가 프레임 간에 일관되게 유지되어야 할 때 사용하세요; 머리만 스왑하거나 네 발 동물의 경우에는 꺼두십시오.
7 렌더#
H3 references + prompt MiniMaxH3ReferenceToVideo (#1134)는 프롬프트, 캐릭터 시트, 연기 참조, 오디오 및 작업 크기를 결합하여 H3 조건과 시작 잠재 변수를 생성합니다. H3 RENDER (#1234)는 플레이트 잠재 변수를 주입하고, 재생성 마스크를 적용하여 선택된 영역만 변경되도록 한 다음 Turbo 일정으로 샘플링합니다. 출력은 깨끗한 렌더와 "재생성 표시된" 미리보기를 포함합니다; SAVE: H3 render 1344x768 + voice (#1150)는 원본 오디오와 함께 MP4를 작성합니다.
8 비교 비디오#
COMPARISON VIDEO (#1235)는 플레이트, 렌더, 연기 참조 및 (사용된 경우) 생물체 시트를 검토를 위해 한 프레임에 쌓습니다. SAVE: comparison video + voice (#1158)는 동일한 사운드트랙과 함께 MP4를 내보내어 결과를 연기와 비교할 수 있습니다.
Comfyui MiniMax H3 퍼포먼스 캡처 워크플로우의 주요 노드#
BODY CLIP (your performance + voice) (#1012)#
연기와 오디오를 로드하여 립싱크와 타이밍을 구동합니다. 최고의 구성요소를 위해 가로 프레이밍을 유지하고 파일에 오디오가 포함되었는지 확인하십시오. 프레임에서 얼굴이 작다면, 표현 추적을 더욱 선명하게 하기 위해 헤드캠 입력을 추가하세요.
WHAT GETS REPLACED (head / person) (#1017)#
이 짧은 텍스트는 SAM 3.1이 H3가 재생성할 영역을 안내합니다. 머리 스왑을 위해서는 head를 사용하거나 전신 대체를 위해서는 person을 사용하세요. 헬멧이나 머리에 장착된 장비가 사라져야 한다면, head, helmet 또는 camera rig와 같은 단어를 포함시키세요; 배경에서 유사한 객체를 제거하려는 것이 아니라면 screen, monitor 또는 cable과 같은 일반적인 단어는 피하세요.
REGENERATED AREA (grow, blocks, hold) (#1233)#
H3가 이미지를 다시 그릴 수 있는 정도와 그 영역이 시간이 지남에 따라 어떻게 발전하는지를 정의합니다. 귀, 뿔 또는 털에 공간을 주기 위해 성장을 증가시키고, 배경으로 확장되지 않도록 넓은 샷에서는 낮추세요. 블록 및 홀드 단계는 움직임을 안정시켜 세부 사항이 프레임 간에 깜빡이지 않도록 합니다.
ACTING REFERENCE (your face on grey | head-cam) (#1232)#
MiniMax H3가 모방할 연기 트랙을 생성합니다. FACE CROP은 분석할 머리와 목의 범위를 제어하고, PERSON은 여러 사람이 보일 때 배우를 선택합니다. 넓은 샷에서 얼굴이 매우 작을 때만 헤드캠을 활성화하세요; 한 카메라가 보통 머리 회전을 가장 잘 따릅니다.
MiniMaxH3ReferenceToVideo (#1134)#
프롬프트, 참조 및 오디오를 결합하여 조건과 초기 잠재 변수를 생성하는 허브입니다. 너비와 높이를 작업 크기에 맞추고, 미리보기를 위해 워크플로우가 길이를 자동으로 제한하도록 하세요. 프롬프트는 이미 H3가 연기 참조를 어떻게 사용할지를 설명하는 문장을 포함하고 있습니다.
MiniMaxH3FunControlNetApply (#1132)#
DWPose에서 선택적인 몸 포즈 가이드를 추가합니다. 전신 생물체의 경우, 몸통과 팔다리가 설득력 있게 따라가도록 하면서 얼굴은 연기 참조를 따릅니다. 머리만 스왑하거나 인간 스켈레톤과 맞지 않는 네 발 동물의 경우에는 꺼두십시오.
H3 RENDER (#1234)#
선택된 영역만 변경되도록 마스크를 적용한 후, Turbo 일정으로 비디오를 샘플링하고 타일드 VAE로 디코딩하여 VRAM 효율성을 높입니다. SEED를 사용하여 외모와 미세 움직임을 조정하세요; 캐릭터의 외모가 시트나 설명에서 벗어날 때 변경하세요.
선택적 추가 사항#
- MiniMax H3 퍼포먼스 캡처를 위한 촬영 팁: 가로로 촬영하고, 노출을 안정적으로 유지하며, 깨끗한 제작 오디오를 포함하세요; iPhone에서 HDR로 촬영한 경우, 실행 전에 SDR로 변환하세요.
- 캐릭터 시트 가이드: 앞면 및 측면 뷰와 몇 가지 작은 표정 머리를 포함하세요; 텍스트만으로는 보다 나은 정체성을 고정합니다.
- 다중 인물 장면:
PERSON을 올바른 인덱스로 설정하고 SAM 텍스트에서 주제를 설명한 후 렌더링 전에 마스크 미리보기를 확인하세요. - 수동 마스크: 바디 클립 타이밍과 일치하는 흑백 비디오를 제공하세요; 의도된 생물체보다 약간 크게 페인트하여 H3가 원래 얼굴로 돌아가지 않도록 하세요.
- 포즈 제어를 활성화할 시기: 팔과 다리가 있는 전신 인간형 생물체나 생물체에 사용하세요; 머리만 스왑하고 사족 동물의 경우에는 꺼두십시오.
- 성능 노트: 스파스 어텐션은 렌더링 속도를 높이고 메모리를 줄이기 위해 활성화되어 있습니다; VRAM이 부족할 경우,
CLIPLoader에서 텍스트 인코더를 CPU에서 실행하세요. 사용된 커스텀 노드에는 ComfyUI-VideoHelperSuite, ComfyUI-KJNodes, comfyui_controlnet_aux, ComfyUI-H3-FaceRefine 및 ComfyUI-Mickmumpitz-Nodes가 포함됩니다.
감사의 말#
이 워크플로우는 다음 작품 및 리소스를 구현하고 구축합니다. 우리는 Mickmumpitz에게 ComfyUI 퍼포먼스 캡처 워크플로우와 Comfy-Org에게 MiniMax H3 모델에 대한 기여와 유지보수에 대해 감사드립니다. 권위 있는 세부 사항에 대해서는 아래에 링크된 원본 문서 및 저장소를 참조하십시오.
리소스#
- Mickmumpitz의 워크플로우
- MiniMax H3 모델
- Hugging Face: Comfy-Org/MiniMax-H3
참고: 참조된 모델, 데이터셋 및 코드의 사용은 해당 저자와 유지 관리자가 제공한 라이선스 및 조건json
에 따릅니다.


