MiniMax H3 8단계 가속화: 네이티브 오디오와 함께하는 All-in-One 멀티모달 비디오 생성#
MiniMax H3 8단계 가속화는 네이티브 오디오와 동기화된 시네마틱 비디오를 생성하기 위한 All-in-One ComfyUI 워크플로우입니다. 통합된 MiniMaxH3Unified 노드를 통해 이미지 참조, 비디오 참조, 오디오가 포함된 비디오, 독립형 오디오 참조를 하나의 간소화된 워크플로우에서 지원합니다.
실행 준비가 된 예시는 단일 이미지와 모션 지향 텍스트 프롬프트를 사용하지만, 참조-비디오 방식은 워크플로우를 사용하는 한 가지 방법일 뿐입니다. 통합된 멀티모달 디자인은 각 입력 유형에 대해 별도의 워크플로우 그래프가 필요 없이 다양한 시각 및 오디오 가이던스 조합을 지원합니다.
워크플로우는 MiniMax H3 FL2VA 백본과 LightX2V Turbo LoRA 및 컴팩트한 8단계, 2패스 샘플링 일정을 결합합니다. 시네마틱 캐릭터 샷, 대화 장면, 분위기 있는 마이크로 스토리 및 빠른 반복과 동기화된 네이티브 오디오가 필요한 기타 멀티모달 비디오 작업에 적합하게 설계되었습니다.
ComfyUI MiniMax H3 8단계 가속화 워크플로우의 주요 모델#
- MiniMax-H3 공식 가중치. 프롬프트와 멀티모달 참조에서 비디오와 네이티브 오디오를 생성하는 오디오비주얼 확산 백본. MiniMaxAI/MiniMax-H3
- MiniMax H3 Video VAE와 Audio VAE. 픽셀 공간, 오디오 웨이브폼 및 H3 잠재 공간 간 이동에 사용되는 쌍을 이루는 인코더 및 디코더. Comfy-Org 배포에 포함됨. Comfy-Org/MiniMax-H3
- Qwen3-VL 32B 텍스트 인코더 (AWQ, MiniMax 조정됨). MiniMax H3를 구동할 때 프롬프트 및 참조에 대한 언어 및 시각적 기반을 제공합니다. Comfy-Org MiniMax H3 패키지와 함께 배포됩니다. Comfy-Org/MiniMax-H3
- LightX2V MiniMax H3 Turbo LoRA. 8단계 일정에서 H3가 효과적으로 수렴할 수 있도록 경로를 조이는 속도 지향 LoRA. lightx2v/Minimax-h3-Turbo
- MiniMax H3 Latent Upscaler 3D. 오디오 정렬을 깨지 않으면서 공간 세부 사항을 증가시키기 위해 패스 간 사용되는 H3-네이티브 잠재 업스케일러.
ComfyUI MiniMax H3 8단계 가속화 워크플로우 사용법#
높은 수준에서, 워크플로우는 하나의 통합 입력 노드를 통해 프롬프트와 멀티모달 참조를 수집하고, 컴팩트한 8단계 일정을 구성하며, 모션과 장면 구조를 설정하기 위해 빠른 높은 시그마 패스를 실행합니다. 그런 다음 비디오 잠재를 3D로 업스케일한 후 낮은 시그마 정제 패스를 실행하여 동기화된 오디오와 비디오를 디코딩하고 결과를 MP4로 내보낼 수 있습니다.
입력 및 크기 조정#
Resolution Selector (Size) (#115)를 사용하여 대상 너비와 높이를 선택하세요. Input Text (Prompt) (#217)에 장면 설명을 입력하세요; 생성된 클립에 대사가 포함되기를 원한다면 인용된 대화를 포함할 수 있습니다.
All-in-One MiniMaxH3Unified 노드 (#212)는 워크플로우의 멀티모달 참조 허브 역할을 합니다. 이미지 참조, 비디오 참조, 오디오가 포함된 비디오 및 독립형 오디오 참조를 지원하며 프롬프트, 크기 조정 및 지속 시간 컨트롤을 하나의 노드에 결합합니다.
포함된 예시는 즉시 사용하기 위해 하나의 참조 이미지와 모션 프롬프트로 구성되어 있습니다. 샘플링, 업스케일링, 디코딩 또는 내보내기 단계를 재구성하지 않고 동일한 통합 노드 내에서 그 이미지를 교체하거나 다른 지원 참조 유형을 구성할 수 있습니다.
외부 오디오 참조를 사용할 때 타이밍을 안내하기 위해 MiniMaxH3Unified에서 duration을 설정하거나 auto_length_from_audio를 토글할 수 있습니다.
모델 설정 및 가속 패치#
UNETLoader (#127)는 MiniMax H3 FL2VA 체크포인트를 가져옵니다. MiniMaxH3MemoryEfficientSageAttentionPatch (#160)와 ModelAttentionBackend (#168)는 VRAM 친화적인 주의 백엔드를 활성화합니다.
MiniMaxH3SigmaShift (#207)는 짧은 일정에 대해 비디오와 오디오의 디노이징 지평선을 정렬합니다. LoraLoaderModelOnly (#167)는 MiniMax H3 8단계 가속화를 별도의 가속 그래프 없이 가능하게 하는 LightX2V Turbo LoRA를 적용합니다.
8단계 일정 빌더#
BasicScheduler (#163)는 컴팩트한 경로를 구축하며, ExtendIntermediateSigmas (#220)와 H3SigmaRefiner (#209)는 H3의 오디오비주얼 역학을 위해 미세 조정합니다.
SplitSigmas (#197)는 구조를 위한 높은 시그마 블록과 세부 사항을 위한 낮은 시그마 블록으로 일정을 나눕니다. 두 패스를 돕기 위해 단일 RandomNoise (#129) 시드가 사용되어 모션과 오디오의 일관성을 유지합니다.
첫 번째 패스 샘플러: 높은 시그마#
높은 시그마 블록은 SamplerCustomAdvanced (#125)로 흐르고, BasicGuider (#126)의 긍정적 조건화와 함께 MiniMaxH3Unified (#212)에서 안내받습니다.
이 패스는 구성, 모션 리듬 및 통합 오디오비주얼 잠재 내에서 거친 오디오 베드를 설정합니다. 디노이즈된 출력은 중간 파이프라인 향상을 위해 준비됩니다.
잠재 공간 업스케일#
LTXVSeparateAVLatent (#199)는 오디오비주얼 잠재를 분리하여 MinimaxH3LatentUpscaler3D (#226)에서 비디오 채널만 업스케일되도록 합니다. 오디오 잠재는 동기화를 유지하기 위해 손대지 않습니다.
LTXVConcatAVLatent (#198)는 향상된 비디오 잠재를 원래의 오디오 잠재와 결합하여 정제를 위한 더 선명하지만 여전히 동기화된 오디오비주얼 잠재를 만듭니다.
두 번째 패스 샘플러: 낮은 시그마#
재결합된 잠재는 SamplerCustomAdvanced (#177)에서 낮은 시그마 블록과 BasicGuider (#178)를 사용하여 정제됩니다.
이 패스는 표면 세부 사항을 추가하고, 얼굴 특징을 정리하며, 첫 번째 패스 동안 설정된 모션과 타이밍을 유지하면서 오디오 질감을 다듬습니다.
디코드 및 내보내기#
VAEDecode (#186)는 비디오 잠재를 프레임으로 변환하고, VAEDecodeAudio (#185)는 네이티브 오디오 트랙을 복원합니다.
VHS_VideoCombine (#189)는 선택된 프레임 속도—기본값으로 24 fps—에서 결과를 MP4로 결합하여 공유할 준비가 된 오디오비주얼 클립을 생성합니다.
ComfyUI MiniMax H3 8단계 가속화 워크플로우의 주요 노드#
MiniMaxH3Unified(#212). MiniMax H3를 위한 중앙 All-in-One 멀티모달 참조 허브. 이미지, 비디오, 비디오-오디오, 독립형 오디오, 프롬프트, 크기 조정 및 지속 시간 컨트롤을 하나의 노드에 결합하여 다양한 H3 참조 작업이 동일한 가속 생성 파이프라인을 사용할 수 있도록 합니다.H3SigmaRefiner(#209). H3가 가장 많은 이점을 얻는 경로의 부분을 선호하도록 일정을 조정합니다. 동일한 속도로 더 선명한 세부 사항이 필요하면 약간의 정제를 추가하세요; 최대 처리량을 우선시하는 경우에는 간결하게 유지하세요.SplitSigmas(#197). 컴팩트한 일정을 두 패스 계획으로 나눕니다. 8단계 일정에서 중간점 분할은 속도와 품질을 균형 있게 맞춥니다; 분할을 이동하면 구조 또는 세부 사항에 더 많은 단계를 할당할 수 있습니다.MiniMaxH3SigmaShift(#207). 짧은 일정에서 비디오와 오디오가 깔끔하게 수렴하도록 시그마 범위를 오프셋합니다. 제공된 시프트를 변경하지 마세요, 동기화 및 안정성에 미치는 영향을 이해하지 않는 한.LoraLoaderModelOnly(#167). LightX2V Turbo LoRA를 적용합니다. 낮은 강도는 Turbo 효과를 부드러운 모션으로 완화합니다; 높은 강도는 스냅을 증가시킬 수 있지만 질감을 과도하게 강조할 수 있습니다.MinimaxH3LatentUpscaler3D(#226). 패스 간 공간 세부 사항을 증가시키면서 오디오 잠재를 그대로 유지합니다. VRAM이 허용하는 경우 720p 유형 출력에 적당한mode.scale을 사용하거나 1080p에 더 큰 배율을 사용하세요.VHS_VideoCombine(#189). 최종 결합 및 내보내기를 처리합니다.frame_rate를 조정하고 파일 이름 접두사를 설정하며, 미리보기를 위한 트리밍 또는 핑퐁 루핑을 선택적으로 사용할 수 있습니다.
선택적 추가 기능#
- 멀티모달 참조. 통합된 H3 노드를 사용하여 이미지 참조, 비디오 참조, 오디오가 포함된 비디오 또는 독립형 오디오 참조를 별도의 생성 그래프로 전환하지 않고 작업할 수 있습니다.
- 빠른 시작 프롬프트. MiniMax H3는 시네마틱 동사와 카메라 언어에 잘 반응합니다. "느린 줌인," "핸드헬드 스웨이," 또는 인용된 대사의 짧고 구체적인 단서는 보통 더 강한 모션과 더 깨끗한 연설을 생성합니다.
- 해상도 단축키. 0.4 MP에 1.6x 잠재 업스케일은 720p에 가까운 결과를 제공합니다. 0.5 MP 첫 번째 패스에 2x 업스케일링은 1080p에 가까운 결과를 제공합니다. VRAM 한계에 도달하면 스텝 일정을 변경하기 전에 메가픽셀을 줄이세요.
- 안정성 팁. 반복 가능한 테이크를 위해 동일한 시드를 유지하세요. 시드만 변경하여 나머지 타이밍 및 장면 방향을 유지하면서 빠른 변화를 얻을 수 있습니다.
- 업스케일러를 우회할 때. 속도 또는 메모리를 우선시하는 경우, 업스케일러의 배율을 1로 설정하여 효과적으로 향상 단계를 건너뛰세요.
- 적합한 시나리오. 이 MiniMax H3 8단계 가속화 워크플로우는 중간 클로즈 캐릭터 샷, 주변 소리가 있는 대화, 오디오비주얼 장면 참조, 짧은 분위기 비트 및 빠른 반복이 중요한 멀티모달 비디오 작업에 적합합니다.
감사#
이 워크플로우는 다음 작업과 리소스를 구현하고 이를 기반으로 구축합니다. 우리는 워크플로우 참조를 제공한 RunningHub, MiniMaxAI의 MiniMax-H3 공식 모델, Comfy-Org의 MiniMax-H3 모델 가중치 및 lightx2v의 MiniMax H3 Turbo LoRA에 감사드립니다.
권위 있는 세부 정보, 라이선스 정보 및 모델 사용 조건에 대해서는 아래 링크된 원본 문서 및 저장소를 참조하세요.
리소스#
- RunningHub 워크플로우 소스 및 참조
- 문서 / 릴리스 노트: Workflow source and reference
- MiniMaxAI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
- lightx2v/Minimax-h3-Turbo
- Hugging Face: lightx2v/Minimax-h3-Turbo
참고: 참조된 모델, 데이터셋 및 코드의 사용은 저자 및 유지 관리자가 제공한 각 라이선스 및 조건에 따릅니다.

