ComfyUI>워크플로우>MiniMax H3 고품질 듀얼 샘플링 R2V

MiniMax H3 고품질 듀얼 샘플링 R2V

Workflow Name: RunComfy/MiniMax-H3-Dual
Workflow ID: 0000...1503
여러 참조 이미지를 짧은 시네마틱 비디오로 변환하세요. 캐릭터와 제품을 샷 전반에 걸쳐 일관되게 유지합니다. 듀얼 샘플링은 세부 사항과 부드러운 움직임을 균형 있게 조정합니다. 네이티브 오디오는 동기화 상태를 유지합니다. 4단계 터보 LoRA는 생성 속도를 높입니다. 준비된 MiniMax H3 그래프는 설정 시간을 절약합니다.

ComfyUI MiniMax H3 High Quality Dual-Sampling workflow 워크플로우

MiniMax H3 Dual-Sampling Workflow | Ref2VA + Turbo LoRA
이 워크플로우를 실행하고 싶으신가요?
  • 완전히 작동 가능한 워크플로우
  • 누락된 노드 또는 모델 없음
  • 수동 설정 불필요
  • 멋진 시각 효과 제공

ComfyUI MiniMax H3 High Quality Dual-Sampling workflow 예제

MiniMax H3 고품질 듀얼 샘플링 워크플로우: 동기화된 네이티브 오디오를 갖춘 다중 참조 비디오#

MiniMax H3 고품질 듀얼 샘플링 워크플로우는 여러 이미지 참조와 선택적 비디오 또는 오디오 큐를 짧은 시네마틱 클립으로 변환하는 RunComfy 준비 완료 참조-비디오 그래프입니다. 듀얼 샘플링 일정, 메모리 효율적인 H3 어텐션, 전용 비디오 및 오디오 VAE, 터보 4단계 LoRA 경로를 결합하여 정체성 유지, 안정적인 움직임, 선명한 디테일을 균형 있게 조정합니다.

제품이나 캐릭터 전반에 걸쳐 연속성이 필요한 제작자를 위해 설계된 이 MiniMax H3 고품질 듀얼 샘플링 워크플로우는 하나의 프롬프트에서 주제, 장면, 사운드를 정의한 후 그래프를 재구성하지 않고도 세련된 H3 비디오 출력을 생성합니다. 스틸 세트를 제공하고 오디오 스타일 참조를 추가하여 공유 준비가 된 MP4를 내보내십시오.

Comfyui MiniMax H3 고품질 듀얼 샘플링 워크플로우의 주요 모델#

  • MiniMax H3 Reference-to-Video 확산 모델 (Ref2VA). 참조와 텍스트를 오디오비주얼 잠재로 변환하는 핵심 생성기로, 프레임과 네이티브 오디오 모두를 지원합니다. 공식 저장소에서 모델 패키지와 가중치를 확인하세요: MiniMaxAI/MiniMax-H3Comfy-Org/MiniMax-H3.
  • MiniMax H3에 맞춰 조정된 Qwen3-VL 32B 텍스트 인코더. 주제, 샷 및 사운드를 설명하는 구조화된 프롬프트를 해석한 다음 Comfy-Org 모델 팩에 포함된 CLIP 스타일 임베딩을 통해 H3 UNet을 조절합니다: Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. 효율적인 고품질 프레임 생성을 위해 비디오 잠재를 압축하고 디코딩하며 Comfy-Org 릴리스에 포함되어 있습니다: Comfy-Org/MiniMax-H3.
  • MiniMax H3 Audio VAE. 네이티브 오디오 잠재를 인코딩하고 디코딩하여 동일한 파이프라인 내에서 음성 및 분위기가 생성되고 동기화되도록 합니다: Comfy-Org/MiniMax-H3.
  • MiniMax H3 Turbo 4-step LoRA. 디테일과 시간적 안정성을 개선하면서 런타임을 빠르게 유지하는 경량 정제 경로입니다. 이 워크플로우의 기본 H3 Ref2VA 모델 위에 쌓입니다.

Comfyui MiniMax H3 고품질 듀얼 샘플링 워크플로우 사용 방법#

이 그래프는 참조 및 프롬프트에서 H3 샘플링, 디코딩 및 MP4 내보내기까지 작업을 전달하는 명확한 그룹으로 구성되어 있습니다. 듀얼 샘플링은 먼저 움직임과 구조를 설정한 다음 정체성을 유지하면서 세부 사항과 오디오를 정제합니다.

참조 영역#

사람, 물체 또는 환경에 대해 최대 9개의 스틸 참조를 로드합니다. 이러한 참조는 H3 ref-to-video 노드에 피드되어 모델이 정체성, 의상 및 장면 요소에 잠금할 수 있도록 합니다. 원할 경우 시각적 참조로 짧은 클립을 라우팅할 수도 있습니다. 최상의 보존을 위해 이미 목표 관점이나 조명과 일치하는 참조를 사용하세요. 배치나 스프라이트 시트를 가져오는 경우, GetImageRangeFromBatch (#40)는 하류에서 사용하려는 프레임을 추출할 수 있습니다.

비디오 참조 영역#

참조 비디오에서 시작하려면 비디오 로더를 사용하여 프레임을 가져오고 선택적으로 지속 시간을 제한하세요. GetImageRangeFromBatch (#40)는 연속적인 슬라이스를 선택하여 워크플로우가 가벼운 상태를 유지합니다. 이러한 프레임은 첫 번째 H3 패스에 대한 구조적 또는 움직임 지침으로 작용합니다. 비디오와 스틸 이미지를 혼합할 수 있습니다. H3 인코더가 샘플링 전에 이를 융합합니다.

오디오 참조 영역#

음성 음색, 리듬 또는 분위기를 안내하기 위해 1~3개의 짧은 오디오 스니펫을 로드합니다. 이러한 스니펫은 문자 그대로 복사되지 않으며, 대신 오디오 잠재를 형성하여 최종 음성이나 사운드스케이프가 동일한 스타일을 따르도록 합니다. 음성 대사의 경우 배경이 거의 없는 짧고 깨끗한 음성 클립이 가장 잘 작동합니다. 오디오를 생략하면 워크플로우는 여전히 프롬프트에서 그럴듯한 분위기를 생성합니다.

모델#

이 그룹은 H3 UNet, Qwen 기반 텍스트 인코더, 두 VAE를 연결한 다음 메모리 효율적인 어텐션 패치를 적용합니다. Lora Loader Stack (rgthree) (#118)은 터보 4단계 LoRA를 추가하여 긴 스케줄 없이 더 높은 디테일을 제공합니다. 어텐션 패치 노드는 VRAM 압력을 줄이며, 이는 더 큰 해상도에서 유용합니다. 함께 샘플러가 사용할 조건 스택을 준비합니다.

샘플링#

MiniMaxH3ReferenceToVideo (#56)는 프롬프트, 참조 및 해상도를 결합하여 조건 및 초기 오디오비주얼 잠재를 생성하는 곳입니다. 노드는 주제_정의, 요약, 보존_분석, 자세한_설명, 전체_사운드스케이프, 비다이제틱_음악과 같은 구조화된 프롬프트 섹션을 읽습니다. 기본 가이드 및 샘플러 선택은 구성을 간단하게 유지하면서도 강력한 제어를 가능하게 합니다. 이를 듀얼 샘플링 정제기가 인계받기 전의 준비 단계로 생각하십시오.

시그마#

짧은 스케줄러가 시그마 스케줄을 생성한 다음 이를 분할하여 듀얼 샘플링 구조를 구동합니다. 한 가지 분기는 안정성과 거친 움직임을 강조하고, 다른 하나는 고주파 디테일과 선명도를 강조합니다. 작은 불리언 스위치로 어려운 샷에서 더 많은 정리가 필요할 때 중간 영역을 확장하거나 우회할 수 있습니다. 여기서 숫자를 조정할 필요는 없으며 얼굴이나 로고에 추가 충실도가 필요할 때 확장 범위를 활성화할지 선택하기만 하면 됩니다.

SamplerCustomAdvanced#

첫 번째 SamplerCustomAdvanced (#108) 패스는 레이아웃, 정체성 및 움직임 리듬을 설정하기 위해 낮은 시그마 범위에서 실행됩니다. 잠재는 비디오 및 오디오로 분리되며, 비디오 잠재는 잠재 공간에서 약간 업스케일되어 디테일을 위한 여유 공간을 추가할 수 있습니다. 두 번째 SamplerCustomAdvanced (#103) 패스는 첫 번째 패스의 가이더를 존중하면서 가장자리와 텍스처를 선명하게 하기 위해 더 높은 시그마 슬라이스를 사용합니다. 동반 패스 SamplerCustomAdvanced (#106)는 선택적으로 노이즈를 줄이거나 영역을 보존할 수 있으며, 스위치 노드는 디코딩 전 최상의 최종 잠재를 결정합니다. 이 두 패스 댄스는 MiniMax H3 고품질 듀얼 샘플링 워크플로우에 안정성과 선명한 디테일의 신뢰할 수 있는 조합을 제공합니다.

가속 노드#

VRAM이 부족한 GPU의 경우 UniBlockSwap은 일시적으로 UNet 블록을 시스템 메모리로 교체하여 도움을 주고, VRAMReserver는 디코딩 및 최종 멀티플렉싱을 위한 충분한 여유 공간을 유지합니다. 이러한 속도 및 메모리 도우미는 품질에 미치는 영향이 거의 없으며 메모리 부족 경고가 표시될 때 켜둘 수 있습니다. 그래프에 연결된 UNet 경로 근처에 유지하세요.

비디오 저장#

최종 잠재는 전용 비디오 및 오디오 VAE에 의해 디코딩된 후 PixaromaSaveMp4 (#115)가 프레임과 오디오를 MP4로 멀티플렉싱합니다. 여기에서 대상 프레임 속도를 설정하고 비디오를 생성된 오디오 길이에 맞출지 선택하세요. 파일 이름 접두사와 하위 폴더는 테이크를 샷 또는 주제별로 쉽게 정리할 수 있도록 합니다. 새로운 시드나 참조로 다시 실행할 때 출력은 동일한 폴더에 쌓입니다.

Comfyui MiniMax H3 고품질 듀얼 샘플링 워크플로우의 주요 노드#

MiniMaxH3ReferenceToVideo (#56)#

텍스트, 이미지 및 선택적 비디오 또는 오디오 참조를 H3를 위한 조건 및 초기 오디오비주얼 잠재로 융합합니다. 프롬프트를 조정하여 주제, 장면 연속성, 샷 타이밍 및 사운드 디자인을 정의하고, , 높이길이를 설정하여 대상 비율 및 지속 시간을 설정합니다. 연속성이 중요할 때 여러 참조 이미지를 사용하여 정체성과 의상을 고정하세요.

Lora Loader Stack (rgthree) (#118)#

기본 모델 위에 MiniMax H3 터보 4단계 LoRA를 적용하여 짧은 스케줄에서 디테일을 개선합니다. 가장자리가 너무 날카로워지거나 기본 모델 스타일이 덮어씌워질 경우 LoRA 강도를 조정하세요. 참조가 이미 강한 텍스처를 가지고 있을 때는 LoRA 레이어링을 최소화하세요.

MiniMaxH3MemoryEfficientSageAttentionPatch (#70)#

H3 UNet의 메모리 효율적인 어텐션을 활성화하여 보통의 GPU에서도 더 높은 해상도나 더 긴 클립을 실행할 수 있도록 합니다. 8~12GB 카드나 VRAM 스파이크가 보일 때 켜두세요. 고메모리 GPU에서 원시 처리량을 벤치마크할 때만 비활성화하세요.

SplitSigmas (#99)#

스케줄러를 보완적인 시그마 밴드로 나누어 두 샘플러 패스를 피드합니다. 장면이 안정적이지만 물기가 부족한 경우 고시그마 분기로 더 많은 가중치를 이동하십시오. 움직임이 떨리거나 정체성이 흐려지면 저시그마 분기를 선호하고 확장된 중간 스위치를 끄십시오.

SamplerCustomAdvanced (#108)#

첫 번째 패스 샘플러로 구조, 움직임 및 정체성을 설정합니다. 프롬프트 및 참조와 일관된 가이더를 유지하여 두 번째 패스가 깨끗한 기반을 갖도록 하세요. 이 패스를 사용하여 시드와 프레이밍을 빠르게 테스트한 후 정제에 전념하세요.

SamplerCustomAdvanced (#103)#

세부 사항을 강화하고 가장자리를 고정하기 위해 더 높은 시그마 슬라이스를 사용하는 정제 샘플러입니다. 견고한 첫 번째 패스 후에 가장 잘 작동하며, 얼굴이나 로고가 과도하게 선명해지기 시작할 때 과도하게 사용하지 마세요. 추가 텍스처 헤드룸이 필요할 때만 잠재 업스케일링과 함께 사용하세요.

ComfySwitchNode (#107)#

듀얼 샘플링 후 대체 잠재 정제를 선택합니다. 보조 노이즈 감소 분기와 직접 정제 분기에서 결과를 비교할 때 이를 전환하세요. 주제 세트에 대해 어느 경로가 정체성을 더 잘 유지하는지 기록해 두세요.

PixaromaSaveMp4 (#115)#

디코딩된 프레임과 오디오를 MP4로 멀티플렉싱합니다. fps를 설정하여 움직임의 느낌과 일치시키고 trim_to_audio를 사용하여 타이트한 오디오비주얼 동기화를 구현하세요. filename_prefix를 업데이트하여 테이크를 샷 또는 주제별로 정리하세요.

선택적 추가 사항#

  • 공식 H3 R2V 템플릿에서 시작하여 이 그래프를 사용자 지정하기 전에 핵심 패턴을 학습하세요: Comfy-Org workflow template.
  • ResolutionSelector (#73)를 사용하여 GPU가 처리할 수 있는 비율 및 메가픽셀 목표를 선택한 다음 프레이밍이 올바르게 보이면 점차적으로 증가시킵니다.
  • 모델이 이해하는 구조화된 섹션으로 프롬프트하세요: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music. 이 스타일은 H3에 더 명확한 제약을 제공합니다.
  • 정체성이 중요한 샷의 경우 동일한 주제에 대해 일치하는 조명과 각도로 3~5개의 고품질 스틸을 제공합니다. 참조에 무거운 필터를 피하세요.
  • 캐릭터 전반에 걸쳐 일관된 음조를 위해 깨끗한 1~5초 음성 스타일 클립을 오디오 참조로 제공하세요. 소음과 음악을 낮게 유지하세요.
  • VRAM 한계에 도달하면 어텐션 패치와 가속 노드 그룹을 활성화하세요. 해상도를 먼저 낮춘 다음 길이를 줄이세요.
  • 움직임이 맞지만 텍스처가 부드러운 경우 첫 번째 패스를 그대로 유지하고 전체 스텝을 확장하기보다는 두 번째 샘플러 분기에 대한 의존도를 높이세요.
  • 자주 버전을 저장하세요. 작은 프롬프트 편집은 비디오와 오디오를 모두 조건화하기 때문에 MiniMax H3 고품질 듀얼 샘플링 워크플로우에 큰 영향을 미칩니다.

감사의 글#

이 워크플로우는 다음 작품과 리소스를 구현하고 기반으로 합니다. 우리는 MiniMaxAI의 MiniMax-H3 모델, Comfy-Org/Comfy.org의 ComfyUI 템플릿, 가중치, MiniMax H3 튜토리얼 및 RunningHub.ai의 워크플로우 참조에 대한 기여와 유지 보수에 대해 감사의 뜻을 표합니다. 공식 문서 및 저장소에 대한 권위 있는 세부 사항은 아래에서 참조하십시오.

리소스#

주의: 참조된 모델, 데이터 세트 및 코드의 사용은 각 저자 및 유지 관리자가 제공한 해당 라이선스 및 조건에 따릅니다.

RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.