ComfyUI>워크플로우>MiniMax H3 Fun Control | 정확한 이미지에서 비디오로

MiniMax H3 Fun Control | 정확한 이미지에서 비디오로

Workflow Name: RunComfy/MiniMax-H3-Control
Workflow ID: 0000...1506
참조 이미지를 제어된 비디오로 변환하세요. 주제의 신원, 의상, 장면을 일관되게 유지합니다. H3 Fun ControlNet으로 움직임을 안내하세요. 단일 제어 또는 깊이-포즈 분기를 선택하세요. 더 빠른 실행을 위해 선택적으로 SolAttn을 사용하세요. 깔끔한 걷기, 회전, 손짓, 전신 움직임을 만드세요.

ComfyUI MiniMax H3 Fun Control Workflow

MiniMax H3 Fun Control in ComfyUI | Depth and Pose Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Fun Control Examples

MiniMax H3 Fun Control: ComfyUI에서 제어 가능한 참조 이미지-비디오 생성#

이 RunComfy 준비 캔버스는 MiniMax H3 Fun Control을 ComfyUI에 도입하여 정확하고 프롬프트 가능한 이미지-비디오를 제공합니다. 이는 구조 패스(깊이, 캐니, 포즈, HED, 또는 MLSD)를 따르면서 첫 프레임 참조 또는 전체 캐릭터/스타일 참조를 존중합니다. 기본 레이아웃은 세 가지 실행 가능한 분기를 제공하여 간단히 시작하고 필요에 따라 제어를 확장할 수 있습니다.

그래프 1은 단일 제어 스트림을 실행하며 기본적으로 활성화되어 있습니다. 그래프 2는 캐릭터/스타일 참조 및 진정한 부정적 프롬프트와 함께 연결된 깊이-포즈 설정을 추가합니다. 그래프 3은 그래프 2를 반영하지만 선택적 SolAttn 속도 향상 패치를 포함합니다. 워크플로우를 로드한 후 준비된 분기를 활성화하거나 우회할 수 있습니다.

Comfyui MiniMax H3 Fun Control 워크플로우의 주요 모델#

  • MiniMax H3 기본 UNet (fl2va) 및 참조-비디오 UNet (ref2va). 이러한 비디오 백본은 프롬프트와 첫 프레임(fl2va) 또는 지속적인 이미지 참조(ref2va)에서 모션을 합성합니다. ComfyUI를 위한 커뮤니티 패키지 가중치는 Hugging Face의 MiniMax H3 실험 세트에서 사용할 수 있습니다: MiniMax-H3-experimental.
  • MiniMax H3 Video VAE 및 Audio VAE. 이는 H3에서 사용되는 잠재 비디오 및 오디오 스트림을 인코딩하고 디코딩하여 파이프라인이 효율적으로 샘플링한 후 결과를 픽셀과 사운드로 변환할 수 있습니다. 동일한 모델 팩을 참조하세요: MiniMax-H3-experimental.
  • Qwen-VL 패밀리 텍스트 인코더. 워크플로우는 H3에 텍스트 조건을 피드하기 위해 Qwen-VL 시리즈의 MiniMax 튜닝 변형을 사용합니다. 이 모델 패밀리에 대한 배경 정보는 공식 리포지토리를 참조하세요: Qwen2-VL.
  • MiniMax H3 Fun ControlNet Union (곡선 형식). 이 단일 ControlNet은 여러 제어 패스(깊이, 캐니, HED, 포즈, MLSD)를 지원하고 장면 구조를 프레임 간에 조정할 수 있습니다. 공식 릴리스에서 곡선 형식 체크포인트를 사용하세요: MiniMax-H3-Fun-Controlnet-Union.

Comfyui MiniMax H3 Fun Control 워크플로우 사용 방법#

캔버스는 세 개의 준비된 분기를 포함합니다. 그래프 1(단일 제어)이 활성화되어 있으며, 그래프 2(깊이+포즈 참조) 및 그래프 3(SolAttn 속도 향상)은 우회되었습니다. 준비가 되면 분기를 켜세요; 활성화된 분기만 실행됩니다.

01 · 단일 제어 · 기본 활성화됨#

01 · 모델 이 그룹은 MiniMax H3 기본 UNet, Qwen-VL 텍스트 인코더, 비디오 및 오디오용 H3 VAE를 로드합니다. 또한 단일 제어 스트림이 구조를 안내할 수 있도록 곡선 형식 MiniMax H3 Fun ControlNet Union을 로드합니다. 다른 체크포인트 세트에서 가중치를 교체하지 않는 한 여기서는 변경할 필요가 없습니다.

01 · 제어: 이것은 노드입니다 의도한 출력 너비, 높이, 프레임 수에 맞는 하나의 제어 비디오를 로드하세요; 노드는 일치하지 않으면 두 숫자를 올립니다. 당신의 움직임과 실루엣을 가장 잘 포착하는 지원되는 패스(깊이, 캐니, 포즈, HED, MLSD) 중에서 선택하세요. 강도는 준수 예산처럼 작동합니다; 단일 제어의 경우 1.0이 적절한 시작점이며, 더 높게 밀면 세부 사항이 포화되는 경향이 있습니다. 제어 일정 창은 샘플링 중 제어가 활성화되는 시간을 정의합니다; 창을 0.6 근처에서 끝내면 구조를 조기에 고정하면서 늦은 단계가 세부 질감을 추가할 수 있습니다. 곡선 형식 ControlNet 체크포인트를 사용하세요; 전체 너비 변형은 이 노드에서 로드되지 않습니다.

01 · 조건화 프롬프트를 작성하고 선택적으로 첫 프레임을 제공하세요. 첫 프레임이 있으면 모델이 해당 이미지에서 초기화되며 구성을 보존하는 경향이 있습니다; 그렇지 않으면 프롬프트만으로 외형을 결정합니다. 여기서 너비, 높이, 길이를 설정하세요; MiniMax H3는 24fps에서 17n + 5 그리드에 길이를 맞추므로, 이러한 수치를 기반으로 편집을 계획하세요. 첫 번째와 마지막 프레임을 설정하지 않으면 모델의 자연스러운 시작과 끝을 사용합니다; 이 분기에서는 마지막 프레임을 추가할 필요가 없습니다.

01 · 샘플링 샘플러는 CFG 없고 부정적 입력이 없는 기본 가이더와 함께 실행되므로 여기서 텍스트 내 부정적 요소는 무시됩니다; 부정적 요소가 필요하다면 그래프 2를 사용하거나 CFG 가이더로 전환하세요. 시그마 시프트는 비디오와 오디오 확산 일정을 조정하여 나중에 안정적인 디코딩을 위한 균형을 맞춥니다. 이 분기의 일정 및 샘플러 선택은 합리적인 품질 대 속도 절충안으로 조정되어 있습니다; 기본값을 얻은 후에는 실험을 자유롭게 하세요.

01 · 출력 샘플링된 잠재 요소는 H3 Video VAE와, 있는 경우 Audio VAE로 디코딩됩니다. 프레임과 오디오는 비디오로 결합되어 출력에 저장됩니다. 저장된 결과를 스타일 확인으로 사용하고 필요한 경우 제어 강도, 일정 창, 또는 프롬프트로 돌아가세요.

02 · 깊이 + 포즈 참조 · 기본 우회됨#

02 · 모델 이 분기는 모든 프레임에서 신원과 스타일을 유지하도록 설계된 H3 참조-비디오 UNet을 로드합니다. Qwen-VL 텍스트 인코더와 H3 VAE를 공유합니다. 구조를 유도하기 위해 곡선 형식 MiniMax H3 Fun ControlNet Union이 여기서 재사용됩니다.

02 · 제어: 체인형, 강도는 약 1.0에 합쳐짐 두 개의 적용 노드가 체인으로 연결되어 각 제어 스트림이 자신의 기여를 추가합니다, 먼저 깊이, 그 다음 포즈. 강도를 예산으로 취급하세요: 두 강도가 합쳐져야 하며, 총합이 1.0을 크게 초과하면 세부 사항이 흐려지고 주제가 번지게 됩니다. 깊이는 거친 기하학 및 카메라 배치를 위해 훌륭합니다; 포즈는 사지와 관절을 고정합니다. 한 강도를 0으로 설정하고 다른 강도를 들어본 후, 총합을 1.0에 가깝게 유지하세요.

02 · 조건화 및 참조 실제 참조 이미지를 프롬프트와 함께 MiniMaxH3ReferenceToVideo를 사용하여 모든 프레임에서 신원과 스타일이 지속되도록 하세요. ref_image_sizemax는 더 큰 참조 토큰(컴퓨팅 비용 증가)으로 가장 강한 신원을 제공합니다; match는 빠르고 느슨한 스타일 제어에 종종 충분합니다. 동일한 참조와 부정적 텍스트로 부정적 분기를 추가하여 CFG 가이더가 원하지 않는 것을 제거할 수 있습니다. 길이, 크기, 프레임 수는 그래프 1과 동일한 규칙을 따릅니다.

02 · 샘플링 부정적 조건이 실제로 적용되도록 CFGGuider로 전환합니다; 가이던스는 모델이 각 단계에서 긍정적 및 부정적을 평가하기 때문에 비용을 증가시킵니다. 체인형 제어 및 참조가 해결될 수 있도록 여기서는 단계가 더 높게 설정됩니다; 외형이 마음에 들면 속도를 위해 단계를 줄일 수 있습니다. 시드 컨트롤은 재현성을 제공합니다; 깊이와 포즈 예산을 조정하면서 고정 상태를 유지하세요.

02 · 출력 디코딩 및 비디오 조립은 그래프 1을 반영합니다. 출력이 구조와 일치하지만 과도하게 부드러워 보이면 제어 창 끝을 0.6으로 줄이거나 총 제어 강도를 약간 낮추세요. 신원이 흐려지면 ref_image_size를 올리거나 두 번째 참조 이미지를 추가하세요.

03 · 선택적 Sol-Attn 속도 향상 · 기본 우회됨#

03 · 모델 이 분기는 그래프 2의 모델과 제어를 반영하지만 희소-어텐션 가속 패치를 추가합니다. SolAttn Triton 확장이 필요합니다. Triton이나 노드 팩이 설치되어 있지 않으면 이 분기를 우회 상태로 두세요.

03 · 제어: 체인형, 강도는 약 1.0에 합쳐짐 동일한 깊이-포즈 체인이 적용됩니다; 총합을 1.0에 가깝게 유지하여 선명한 결과를 얻으세요. 그래프 2와 동일한 튜닝 접근법을 사용하여 장면과 주제 크기에 가장 적합한 분할을 찾으세요.

03 · 조건화 및 참조 그래프 2와 동일합니다. 긍정적 및 부정적 분기에서 참조를 일관되게 유지하여 CFG가 올바른 기능을 제거하도록 하세요. 최대 신원을 원한다면 ref_image_size: max를 약간 더 높은 단계 수와 결합하세요.

03 · 선택적: 희소 어텐션 SolAttnPatch는 품질을 유지할 중요한 부분에서 희소-어텐션 블록을 가속화합니다. 비디오 토큰을 Z-order로 재정렬하여 ControlNet이 행별 오프셋을 적용하는 위치를 잘못 맞추고 제어를 효과적으로 제거하므로 morton을 끄세요. 속도를 높이고 싶을 때 초기 및 마지막 변환기 블록을 정확하게 유지하는 것이 안전한 기본값입니다. Triton이 커널을 컴파일한 후 더 빠른 실행을 기대하세요; 첫 번째 패스는 주로 컴파일 시간을 측정합니다.

03 · 샘플링 및 출력 샘플링, 디코딩 및 저장은 그래프 2를 따릅니다. SolAttn을 켜고 끄는 것을 고정된 시드로 비교하여 콘텐츠의 품질과 준수를 판단하세요. SolAttn으로 제어가 약해 보이면 morton이 비활성화되어 있는지 두 번 확인한 후 강도를 조정하세요.

Comfyui MiniMax H3 Fun Control 워크플로우의 주요 노드#

Apply H3 Fun ControlNet (#23) 현재 모델에 하나의 제어 스트림을 추가하고 제어 비디오에서 추출한 제어 프레임 배치를 가져옵니다. strength를 준수 예산으로 사용하세요: 단일 제어의 경우 1.0에서 시작하세요; 제어를 체인으로 연결할 때 세부 사항이 흐려지지 않도록 합계를 1.0에 가깝게 유지하세요. 일정 창(start_percent, end_percent)은 제어가 활성화되는 시간을 결정합니다; 0.6 근처에서 끝내면 제어가 설명할 수 없는 질감을 보존하는 경우가 많습니다.

Prompt + first frame -> conditioning (#31) 모델이 초기 구성을 존중할 수 있도록 텍스트 프롬프트와 선택적 첫 프레임에서 조건을 구축합니다. 첫 프레임을 생략하면 프롬프트만으로 콘텐츠를 조종합니다. 너비, 높이, 길이는 여기서 설정됩니다; H3는 24fps에서 17n + 5 그리드의 길이를 수용하므로, 이러한 기간에 맞춰 편집을 계획하세요.

Positive: references + prompt (#1031) 모든 프레임에 걸쳐 신원과 스타일을 지속시키기 위해 지속적인 이미지 참조와 프롬프트 텍스트를 H3에 공급합니다. ref_image_sizemax는 더 큰 토큰을 사용하여 더 강한 신원을 제공합니다; match는 빠르고 더 가벼운 신원 압력을 제공합니다. 강한 배제를 원하면 부정적 분기와 CFGGuider와 함께 사용하세요.

CFGGuider: the negative only works here (#1040) 부정적 조건이 효과를 발휘하도록 분류자-프리 가이던스를 활성화합니다. 더 높은 가이던스는 프롬프트와 참조 준수를 강화하지만 각 단계에서 긍정적 및 부정적을 모두 실행하기 때문에 계산량이 증가합니다. 길고 특정한 스타일 브리프의 경우, 중간 정도의 cfg가 준수를 크게 향상시킬 수 있습니다; 고정된 시드와 나란히 테스트하세요.

Sigma shift (video 12 / audio 3) (#24) 비디오 경로와 오디오 경로가 샘플링 전에 적절한 시그마 프로필을 갖도록 확산 일정을 조정합니다. 오디오를 디코딩할 계획이라면 오디오 VAE가 호환 가능한 잠재 분포를 받을 수 있도록 이 체인을 유지하세요.

Sol-Attn (선택적, SolAttn 노드 팩 + Triton 필요) (#2060) 그래프를 변경하지 않고 H3를 가속화하기 위해 희소-어텐션 커널을 적용합니다. morton을 비활성화 상태로 유지하세요; 활성화하면 토큰이 재정렬되고 ControlNet의 기여가 의도된 행을 놓치게 되어 제어를 무시하는 완벽한 출력처럼 보입니다. 보수적인 속도 향상을 위해 초기 및 마지막 변환기 블록을 정확하게 유지하고 Triton 컴파일 후 프로파일링하세요.

BasicScheduler (#42) 샘플링을 위한 시그마 일정과 단계 수를 제공합니다. 엄격하게 제어된 샷의 경우, 몇 가지 추가 단계가 제어가 사라지기 전에 구조를 안정화하는 데 도움이 될 수 있습니다; 빠른 스타일 패스의 경우, 시간을 절약하기 위해 단계를 줄이세요. 제어 창과 결합하여 준수와 질감의 균형을 맞추세요.

선택적 추가 기능#

  • 제어 비디오는 생성 너비, 높이, 프레임 수와 정확히 일치해야 합니다; 노드는 다르면 두 숫자를 올립니다.
  • 곡선 형식 ControlNet 체크포인트를 사용하세요; 원래의 전체 너비 릴리스는 H3FunControlLoader에서 로드되지 않습니다.
  • 제어 패스에 큰 무특징 영역이 있는 경우, 제어 창 끝을 0.6 근처에서 종료하여 늦은 단계가 프롬프트에서 질감을 추가할 수 있도록 하세요.
  • 신원에 중요한 클립의 경우, MiniMaxH3ReferenceToVideo와 함께 그래프 2 또는 그래프 3을 선호하고 ref_image_size: max를 고려하세요.
  • 그래프 1에서 부정 요소가 필요합니까? CFGGuider를 교체하거나 부정적 분기가 이미 연결된 그래프 2/3으로 이동하세요.
  • 프로젝트 리소스: 사용자 지정 노드 ComfyUI-H3-FunControl, 곡선 형식 ControlNet MiniMax-H3-Fun-Controlnet-Union, 커뮤니티 H3 가중치 MiniMax-H3-experimental, 선택적 속도 향상 [ComfyUI-Sjson

olAttn_triton](https://github.com/kijai/ComfyUI-SolAttn_triton).

감사#

이 워크플로우는 다음 작업 및 리소스를 구현하고 발전시킵니다. ComfyUI-H3-FunControl 사용자 지정 노드에 대해 wyzborrero에게, MiniMax H3 Fun ControlNet Union 모델에 대해 alibaba-pai에게, MiniMax H3 실험 모델 파일에 대해 Kijai에게, 선택적 속도 향상 노드에 대해 kijai에게, 그리고 Cloud Save 워크플로우에 대해 RunComfy에게 그들의 기여와 유지보수에 감사를 표합니다. 권위 있는 세부사항은 아래에 링크된 원본 문서 및 리포지토리를 참조하십시오.

리소스#

참고: 참조된 모델, 데이터셋, 코드의 사용은 해당 저자 및 유지보수자가 제공한 라이선스 및 조건에 따릅니다.

RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.