MiniMax H3 ComfyUI 참조에서 비디오로 4단계 Turbo#
MiniMax H3 ComfyUI 참조에서 비디오로 4단계 Turbo는 정지 이미지에서 하나 이상의 캐릭터 정체성을 고정하고 단일 가속 패스에서 네이티브 스테레오 오디오가 포함된 짧은 클립을 생성하는 RunComfy 준비 참조-비디오 워크플로우입니다. 이는 장면 내에서 일관된 얼굴, 의상 및 연출이 필요한 창작자를 위해 설계되었으며 카메라 움직임, 대화 및 립 싱크를 일관되게 유지합니다.
이 그래프는 MiniMax H3의 ref2va 파이프라인과 Turbo LoRA를 사용하여 여러 주제의 정체성, 움직임 및 대화가 더 긴 기본 일정 없이 통합되도록 합니다. 프롬프트 내에 <Picture N>으로 스틸 사진을 태그하고, 선택적으로 참조 비디오 및 오디오를 가져와 ComfyUI에서 직접 깨끗한 클립을 렌더링하십시오.
Comfyui MiniMax H3 ComfyUI 참조에서 비디오로 4단계 Turbo 워크플로우의 주요 모델#
- MiniMax-H3 참조-비디오 확산 모델 (ref2va). 스틸, 선택적 비디오 및 텍스트를 기반으로 일관된 샷을 합성하기 위한 핵심 생성 백본을 제공합니다. 가중치는 Hugging Face의 MiniMax-H3의 Comfy-Org 패키지에서 사용할 수 있습니다. Comfy-Org/MiniMax-H3
- MiniMax-H3 비디오 VAE. 샘플러가 작동하는 비디오 잠재 변수를 인코딩하고 디코딩하여 시간적 부드러움과 세부 사항을 보존합니다. 동일한 패키지로 배포됩니다. Comfy-Org/MiniMax-H3
- MiniMax-H3 오디오 VAE. 비디오와 함께 네이티브 스테레오 오디오 트랙을 처리하여 샷과 함께 연설 및 분위기를 저작합니다. 비디오 구성 요소와 함께 포함됩니다. Comfy-Org/MiniMax-H3
- MiniMax-H3에 맞춰 조정된 Qwen-VL 32B 텍스트 인코더. 프롬프트, <Picture N> 마커 및 연출 지시를 H3가 사용하는 조건 신호로 번역합니다. Comfy-Org 릴리스에 포함되어 있습니다. Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4단계 LoRA. 스케줄을 압축하여 빠른 패스로 샷을 생성하면서 정체성과 움직임의 일관성을 유지하는 가속 LoRA. larryvrh/MiniMax-H3-Turbo-Lora
Comfyui MiniMax H3 ComfyUI 참조에서 비디오로 4단계 Turbo 워크플로우 사용 방법#
워크플로우는 참조 및 타이밍에서 모델 설정, 조건부, 샘플링 및 최종 멀티플렉싱으로 이동합니다. 스틸만으로 실행하거나 선택적 참조 비디오 및 오디오와 결합할 수 있습니다.
단계 1 — 참조, 프롬프트 및 타이밍#
LoadImage 노드를 통해 하나 이상의 스틸을 로드하고 프롬프트에서 <Picture 1>, <Picture 2> 등으로 참조할 계획을 세우십시오. 가이드 클립이 있는 경우 VHS_LoadVideo 노드를 통해 피드하십시오. 그들의 오디오는 리듬과 에너지를 안내하기 위해 전달될 수도 있습니다. 맞춤형 대화 또는 분위기를 제공하려면 참조 비디오 오디오 대신 또는 추가로 LoadAudio 노드를 사용하십시오. 모든 캐릭터 잠금, 카메라 이동 및 대화가 포함된 전체 샷 설명을 Input Text (Prompt)에 입력하십시오. 워크플로우는 원하는 지속 시간을 안정적인 프레임 수로 자동 변환하여 MiniMax H3의 내부 스트라이드에 타임라인을 맞춥니다.
단계 2 — 모델 설정 및 터보 가속#
핵심 H3 ref2va UNet, 텍스트 인코더 및 비디오와 오디오 VAE는 "Core Workspace"에 로드됩니다. 메모리 효율적인 주의 패치로 인해 일반 GPU에서 더 큰 샷이나 더 높은 해상도를 사용할 수 있습니다. Turbo 4단계 LoRA는 LoraLoaderModelOnly (#164)에 의해 적용되어 단계 수를 낮게 유지하면서 정체성 잠금 및 움직임을 보존할 수 있습니다. 수동 배선이 필요하지 않습니다. 그래프는 RunComfy에 미리 연결되어 있습니다. 일부 입력을 사용하지 않는 경우 Ctrl+B를 사용하여 사용하지 않는 Load Image / Load Video / Load Audio 노드를 꺼서 실행을 간소화하십시오.
단계 3 — 조건부 및 잠재 어셈블리#
MiniMaxH3ReferenceToVideo (#136)은 프롬프트, 스틸 및 선택적 비디오 또는 오디오 참조를 수집하여 조건부 및 초기 잠재 타임라인을 빌드합니다. 각 사람이나 객체를 특정 스틸에 명확히 연결하려면 <Picture N> 태그를 사용하십시오. 순서는 채운 참조 슬롯을 따릅니다. 자연어로 카메라 동작, 립 싱크 및 분위기를 지시할 수 있습니다. 너비, 높이 및 지속 시간이 이 노드로 흐르므로 프레이밍과 타이밍이 의도에 맞습니다. 많은 스틸이 있는 경우 현재 비트에 실제로 필요한 정체성과 의상을 정의하는 것만 유지하십시오.
단계 4 — 샘플링#
그래프는 BasicGuider (#126)에 의해 안내되는 KSamplerSelect (#123)에 의해 선택된 최소 스케줄과 빠른 샘플러를 통해 잠재를 라우팅합니다. BasicScheduler (#124)는 Turbo LoRA가 기대하는 단계 패턴을 제공하여 속도와 충실도를 균형 있게 합니다. SamplerCustomAdvanced (#125)는 재현성을 위해 시드된 노이즈를 사용하여 한 번의 효율적인 패스로 타임라인을 해결합니다. 대부분의 경우 이러한 구성 요소를 구성된 상태로 두고 프롬프트, 참조 및 프레이밍에 집중할 수 있습니다.
단계 5 — 디코딩, 멀티플렉싱 및 저장#
샘플링 후 VAEDecode는 비디오 프레임을 복원하고 VAEDecodeAudio는 스테레오 트랙을 복원합니다. CreateVideo (#130)는 선택한 비율과 비트 깊이로 이미지와 오디오를 재생 가능한 파일로 멀티플렉싱합니다. 마지막으로 SaveVideo (#92)는 선택한 컨테이너와 코덱을 사용하여 결과를 디스크에 씁니다. 출력은 MiniMax H3 ComfyUI 참조에서 비디오로 4단계 Turbo에 의해 저작된 정체성 잠금 캐릭터, 카메라 움직임, 네이티브 스테레오 오디오가 포함된 짧은 클립입니다.
Comfyui MiniMax H3 ComfyUI 참조에서 비디오로 4단계 Turbo 워크플로우의 주요 노드#
MiniMaxH3ReferenceToVideo (#136)#
이 워크플로우의 핵심으로 프롬프트 텍스트, 스틸 참조 및 선택적 비디오/오디오를 조건부 및 초기화된 잠재로 융합합니다. prompt를 조정하여 <Picture N> 마커와 카메라, 대화 및 분위기에 대한 명확한 연출 지시를 포함하십시오. width, height, length를 조정하여 샷의 프레이밍과 지속 시간을 설정합니다. 스틸에 대한 세부 사항과 속도의 균형을 맞춰야 하는 경우 ref_image_size를 렌더 크기와 일치시키는 모드와 가벼운 실행을 위한 크기 조정 모드 사이에서 전환하십시오. 장면에 실제로 필요한 정체성에 집중할 수 있도록 참조 세트를 유지하십시오.
LoraLoaderModelOnly (#164)#
MiniMax-H3 Turbo 4단계 LoRA를 ref2va 모델에 적용하여 스케줄을 압축하여 빠른 추론을 위한 것입니다. strength는 LoRA가 백본에 얼마나 강하게 영향을 미치는지를 제어합니다. 강한 값은 속도와 터보 외관을 선호하며, 낮은 값은 기본 H3로 다시 혼합합니다. 극단적인 가속에서 세부 사항이 손실되는 것을 발견하면 LoRA 강도를 약간 줄이거나 스케줄러에서 일정을 늘려 충실도를 회복하십시오. LoRA 모델 카드에서 버전 노트 및 의도된 사용법을 참조하십시오. MiniMax-H3 Turbo LoRA
MiniMaxH3MemoryEfficientSageAttentionPatch (#163)#
MiniMax H3와 호환되는 메모리 효율적인 주의 구현을 가능하게 하여 제한된 VRAM에서 더 높은 해상도나 더 긴 샷을 실행할 수 있습니다. 이 그래프에서는 매개변수가 없으며 최적의 용량을 위해 활성화된 상태로 유지하십시오. 이 노드는 ComfyUI용 KJNodes의 일부입니다. kijai/ComfyUI-KJNodes
BasicScheduler (#124)#
샘플링 중 사용되는 확산 스케줄을 정의합니다. Turbo LoRA가 활성화된 상태에서는 속도를 위해 단계 수를 간결하게 유지하고, 추가 선명도나 안정성이 필요할 때만 단계를 조정하십시오. denoise를 사용하여 프롬프트가 더 큰 변경을 요구할 경우 참조의 강력한 재해석을 추진할 수 있습니다. 여기서의 변경 사항은 LoRA 강도 및 선택된 샘플러와 상호 작용하므로 작은 증분으로 조정하십시오.
KSamplerSelect (#123)#
패스를 위한 샘플링 알고리즘을 선택합니다. 간단하고 안정적인 샘플러는 터보 스케줄과 잘 어울리며 프레임 간 일관성을 유지하는 데 도움이 됩니다. 스타일화나 매우 빠른 카메라 움직임을 강조하는 경우 약간의 가변성을 대가로 모션 텍스처를 추가할 수 있는 대체 샘플러를 시도해보십시오.
CreateVideo (#130) 및 SaveVideo (#92)#
CreateVideo는 디코딩된 프레임과 오디오를 최종 스트림으로 조립하며, fps 및 bit_depth를 설정하여 전달 요구 사항에 맞춥니다. SaveVideo는 내보내기 위한 컨테이너와 코덱을 선택합니다. 일반 공유를 위해 널리 지원되는 조합을 사용하거나 후작업을 위한 고품질 변형을 사용하십시오. 빠르게 반복하는 경우 설정을 가볍게 유지한 다음 최종 렌더링을 위해 프로덕션 설정으로 전환하십시오.
선택적 추가 기능#
- 여러 캐릭터의 경우 가장 명확한 얼굴 정면 스틸을 먼저 배치하고 <Picture 1>, <Picture 2> 등으로 참조하십시오. 각 주제에 대해 각도나 의상 범위를 위해 하나 또는 두 개의 추가 스틸을 사용하십시오.
- 참조 비디오를 가져오는 경우 프롬프트에 원하는 카메라 동작에 대한 간단한 설명을 포함하여 H3가 무엇을 보존하고 재해석해야 하는지 알 수 있도록 하십시오.
CreateVideo에서 대상 프레임 속도를 변경하는 경우 프롬프트의 타이밍 노트를 다시 확인하십시오. H3에 안전한 프레임 수에 내부적으로 맞춥니다.- 비디오 및 오디오 도우미 노드는 Video Helper Suite에서 제공되며 ComfyUI 내에서 강력한 미디어 I/O를 제공합니다. Kosinkadink/ComfyUI-VideoHelperSuite
- ComfyUI에서 MiniMax H3 참조-비디오에 대한 기본 비교 워크플로우를 찾고 계신가요? 공식 템플릿을 검토하고 필요한 경우 아이디어를 조정하십시오. Comfy-Org 워크플로우 템플릿
감사의 말#
이 워크플로우는 다음의 작업과 리소스를 구현하고 구축합니다. MiniMax Research의 MiniMax H3 모델, Comfy.org의 MiniMax H3 ComfyUI 워크플로우 예제, Comfy-Org의 MiniMax-H3 모델 가중치, 그리고 larryvrh의 MiniMax-H3 Turbo LoRA에 대한 기여와 유지보수에 대해 감사드립니다. 권위 있는 세부 사항은 아래에 연결된 원본 문서와 리포지토리를 참조하십시오.
리소스#
- MiniMax Research/MiniMax H3 공식 발표
- 문서 / 릴리스 노트: MiniMax H3 공식 발표
- Comfy.org/MiniMax H3 튜토리얼
- GitHub: comfy-org/docs
- 문서 / 릴리스 노트: MiniMax H3: ComfyUI 워크플로우 예제
- Comfy-Org/MiniMax-H3 모델 가중치
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
참고: 참조된 모델, 데이터 세트 및 코드의 사용은 저자 및 유지보수자가 제공하는 해당 라이센스 및 조건에 따릅니다.


