ComfyUI>워크플로우>MiniMax H3 Reference to Video ComfyUI | Stereo

MiniMax H3 Reference to Video ComfyUI | Stereo

Workflow Name: RunComfy/MiniMax-H3-Ref2Video
Workflow ID: 0000...1473
두 개의 참조를 시네마틱 클립으로 변환하세요. 캐릭터의 일관성을 유지하세요. 비디오와 함께 네이티브 스테레오 오디오를 생성하세요. 정확한 이미지 태그를 사용하여 프롬프트 제어를 하세요. 스타일화된 장면을 빠르게 테스트하세요. MiniMax H3 Ref2VA 그래프를 사용하여 다듬어진 오디오-비디오 컨셉을 만드세요.

MiniMax H3 Reference to Video ComfyUI Workflow

MiniMax H3 Ref to Video in ComfyUI | Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 Reference to Video ComfyUI Examples

MiniMax H3 Reference to Video ComfyUI: 네이티브 스테레오 오디오 Ref2VA 워크플로우#

이 RunComfy-준비된 MiniMax H3 Reference to Video ComfyUI 워크플로우는 연결된 참조 이미지를 짧은 시네마틱 비디오로 변환하며, 네이티브 스테레오 오디오를 함께 생성합니다. Comfy.org Reference-to-Video 템플릿에서 제작되었고, 오픈 Comfy-Org MiniMax-H3 가중치에 대해 검증되었습니다. 캐릭터 일관성이 있는 참조 기반 샷, 스타일화된 장면 테스트, 그리고 프롬프트 워딩과 <Picture 1> 및 <Picture 2> 같은 태그가 중요한 컨셉 클립에 이상적입니다.

기본적으로 이 그래프는 두 개의 이미지 참조와 자유형 프롬프트를 연결하여 한 번의 패스로 동기화된 사운드가 있는 비디오를 생성합니다. 코어 노드는 더 많은 참조 이미지, 오디오가 있는 참조 비디오, 그리고 독립적인 오디오 참조에 대한 선택적 입력을 노출하여 필요에 따라 조건 강도를 조정할 수 있습니다. 원래 디자인에 맞춘 시작점을 원하시면 GitHub의 Comfy.org 템플릿 파일을 참조하세요 video_minimax_h3_r2v.json.

MiniMax H3 Reference to Video ComfyUI 워크플로우의 주요 모델들#

  • Comfy-Org/MiniMax-H3 확산 가중치 (Ref2VA): UNETLoader를 통해 사용되는 참조-비디오-오디오에 특화된 생성 코어입니다. 텍스트 및 시각/오디오 참조로부터 학습하여 비디오와 스테레오 오디오를 모두 포함하는 단일 잠재 변수를 생성합니다. 모델 카드 및 파일
  • MiniMax H3 Video VAE (FP16): 합동 잠재 변수의 비디오 부분을 고화질 프레임으로 디코딩합니다. minimax_h3_video_vae_fp16.safetensors
  • MiniMax H3 Audio VAE (FP32): 합동 잠재 변수의 오디오 부분을 네이티브 스테레오 파형으로 디코딩합니다. minimax_h3_audio_vae_fp32.safetensors
  • Qwen3-VL 32B MiniMax-H3 텍스트-이미지 인코더 (AWQ): 프롬프트와 참조 태그 및 시각 토큰을 인코딩하여 조건을 설정합니다. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

MiniMax H3 Reference to Video ComfyUI 워크플로우 사용 방법#

이 워크플로우는 참조와 프롬프트를 MiniMax H3의 Ref2VA 코어에 라우팅하여 비디오와 오디오를 포함한 단일 잠재 변수를 샘플링한 후, 결과를 MP4로 디코딩 및 믹싱하여 동기화된 사운드를 제공합니다. 아래 그룹은 그래프에 매핑되어 무엇을 변경해야 하는지와 그 이유를 보여줍니다.

사용자 입력#

LoadImage (#137) 및 LoadImage (#139)를 사용하여 두 개의 시각 참조를 제공합니다. 프롬프트는 Input Text (Prompt) (#138)에 입력하고, 연결된 순서대로 각 입력을 태그로 참조하여 예를 들어 <Picture 1> 및 <Picture 2>로 장면, 동작, 사운드를 설명합니다. Resolution Selector (Size) (#115)에서 목표 비율 및 픽셀 수를 설정합니다. Float (Duration) (#132)를 사용하여 비디오 지속 시간을 초 단위로 선택하면 ComfyMathExpression (#131)가 자동으로 유효한 프레임 길이로 변환하여 오디오와 비디오가 정렬 상태를 유지합니다.

모델#

UNETLoader (#127)는 생성의 핵심이 되는 MiniMax H3 Ref2VA 확산 가중치를 로드합니다. CLIPLoader (#128)는 Qwen3-VL 32B 인코더를 로드하여 텍스트와 참조 태그를 토큰화합니다. 두 개의 VAELoader 노드 (#119 비디오, #120 오디오)는 나중에 합동 잠재 변수를 프레임과 스테레오 오디오로 풀어낼 페어링된 디코더를 제공합니다. 이러한 모델은 동일한 작업군 내에서 다른 MiniMax H3 변형으로 마이그레이션할 때 교체해야 할 유일한 자산입니다.

조건#

MiniMaxH3ReferenceToVideo (#136)는 파이프라인의 핵심입니다. 텍스트 프롬프트, 너비, 높이 및 계산된 length(프레임), 연결된 ref_images, ref_videos, 선택적 오디오 참조를 수락합니다. 이 노드는 안내를 위한 긍정적 조건 스트림과 참조 및 태그에 따라 정체성, 구성, 동작 및 사운드 디자인을 고정하는 초기화된 잠재 변수를 방출합니다. 이미지를 통한 정체성 충실도를 위해 잘 조명된 모델 참조를 연결하고 프롬프트에서 정확히 참조하십시오. 동작이나 페이싱을 위해서는 오디오가 있는지 없는지에 상관없이 비디오 참조를 추가할 수 있습니다.

샘플링#

RandomNoise (#129)는 프로세스를 시드하고, KSamplerSelect (#123)는 샘플러 변형을 선택하며, BasicScheduler (#124)는 단계 일정을 설정합니다. BasicGuider (#126)는 MiniMax H3 노드에 의해 생성된 조건을 적용하고, SamplerCustomAdvanced (#125)는 공동 오디오+비디오 잠재 변수를 발전시키기 위한 실제 디노이징 단계를 수행합니다. 여기서의 선택은 주로 속도와 충실도 및 참조 준수를 교환합니다. 시작할 때는 기본값을 유지하고, 일단 기본적인 외관과 소리를 얻으면 실험을 통해 비교하십시오.

디코딩 및 비디오 생성#

샘플러의 공동 잠재 변수는 VAEDecode (#122)로 프레임을, VAEDecodeAudio (#121)로 스테레오 사운드를 처리합니다. CreateVideo (#130)는 디코딩된 이미지와 오디오를 재생 가능한 스트림으로 믹싱하고, SaveVideo (#92)는 최종 파일을 출력 폴더에 저장합니다. 비디오와 오디오가 함께 생성되었기 때문에 타이밍은 포스트 정렬이나 외부 TTS 없이 일관됩니다.

MiniMax H3 Reference to Video ComfyUI 워크플로우의 주요 노드#

MiniMaxH3ReferenceToVideo (#136) 이 노드는 텍스트, 시각, 선택적 오디오 참조를 MiniMax H3의 Ref2VA 조건과 이미 정체성, 스타일, 동작, 사운드를 “알고 있는” 초기 잠재 변수로 조합합니다. 연결 순서와 일치하는 정확한 참조 태그를 프롬프트에 사용하고, 목표에 따라 ref_image_size를 선택하세요: 생성 해상도에 맞춰 빠른 반복을 원할 때, 더 큰 참조 토큰을 유지하여 강한 정체성을 원할 때. 더 긴 샷의 경우, 모델이 연속성을 유지할 수 있도록 명확한 장면 및 동작 설명을 선호합니다.

Resolution Selector (Size) (#115) 전체 그래프가 준수할 목표 비율 및 픽셀 수를 제어합니다. 클립을 어떻게 보여줄지에 맞는 형태를 선택하고, 참조에서 세부 사항을 더 잘 유지할 수 있도록 세부 사항과 처리량을 균형 있게 조정하여 빠르게 반복할 수 있도록 합니다. 더 높은 해상도는 VRAM과 시간을 증가시키지만, 참조의 세밀한 특징을 더 잘 보존합니다.

ComfyMathExpression (#131) 사용자에게 노출된 초 단위 지속 시간을 샘플러와 디코더가 좋아하는 프레임 수로 변환합니다. 표현식은 합리적인 최소값으로 클램프되고 내부 친화적인 단계에 맞춰져 비디오와 오디오가 잠금 상태를 유지합니다. 초 입력만 조정하세요; 노드가 수학을 처리합니다.

KSamplerSelect (#123) 및 BasicScheduler (#124) 함께 디노이징 경로를 결정합니다. 강력한 참조 준수를 위해 제공된 샘플러와 일정을 시작하세요. 샷이 이동하거나 덜 자세하게 느껴진다면, 대체 일정이나 약간 다른 샘플러 패밀리를 테스트하고 결과를 나란히 비교하세요.

선택적 추가 사항#

  • 프롬프트를 구체적이고 참조 우선으로 유지하세요: <Picture 1> 및 <Picture 2>와 같은 태그로 시작한 후 샷 유형, 동작, 조명 및 예상되는 사운드를 설명하세요.
  • 이미지에서 더 강한 정체성을 위해 참조 충실도를 증가시키려면 더 큰 참조 크기 모드를 사용하세요. 더 빠른 룩-데브를 위해 맞춤 크기 모드를 사용하세요.
  • 오디오 참조를 연결하지 않으면, MiniMax H3는 프롬프트만으로 네이티브 스테레오 오디오를 합성합니다; 분위기, 효과음 및 음성 톤을 설명하여 이를 안내하세요.
  • 모션 리듬이나 카메라 동작에 가장 신경 쓸 때는 짧은 참조 비디오를 추가하세요; 그 소닉 캐릭터를 생성에 반영하고 싶을 때는 페어링된 오디오를 추가하세요.
  • 먼저 적당한 해상도와 지속 시간으로 반복하고, 타이밍, 정체성 및 구성이 유지되면 확장하세요.

참조#

감사의 말#

이 워크플로우는 다음 작품 및 리소스를 구현하고 구축합니다. MiniMax H3 R2V ComfyUI 워크플로우 템플릿과 MiniMax H3 튜토리얼을 제공한 Comfy-Org, MiniMax H3 모델과 공식 발표를 제공한 MiniMax, MiniMax-H3 모델 가중치를 제공한 Comfy-Org에 대한 기여와 유지보수에 대해 감사드립니다. 권위 있는 세부 사항은 아래 링크된 원본 문서 및 저장소를 참조하세요.

리소스#

참고: 언급된 모델, 데이터셋 및 코드의 사용은 해당 저자 및 유지보수자가 제공한 라이선스 및 조건에 따릅니다.

RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.