MiniMax H3 ComfyUI 이미지에서 비디오로의 4단계 Turbo#
MiniMax H3 ComfyUI 이미지에서 비디오로의 4단계 Turbo는 RunComfy에 바로 사용할 수 있는 워크플로우로, 하나의 정지 이미지를 ComfyUI에서 네이티브 스테레오 오디오가 포함된 짧은 비디오로 변환합니다. MiniMax H3 (Hailuo) 이미지에서 비디오로의 파이프라인을 실행하며, Turbo LoRA를 적용하여 기본 일정보다 훨씬 적은 샘플링 단계로 동작과 대화를 미리 볼 수 있습니다.
이 그래프는 ComfyUI 캔버스를 떠나지 않고 빠른 I2V 초안을 원하는 제작자를 위해 만들어졌습니다: 대화하는 캐릭터, 빠른 제품 회전, 또는 동기화된 사운드가 포함된 환경 장면 등. 시작 프레임과 동작/대화 프롬프트를 제공하면, 워크플로우는 비디오 프레임과 스테레오 오디오를 함께 생성하고, 이를 다운로드할 수 있는 완성된 클립으로 결합합니다.
Comfyui MiniMax H3 ComfyUI 이미지에서 비디오로의 4단계 Turbo 워크플로우의 주요 모델#
- MiniMaxAI/MiniMax-H3 멀티모달 비디오 모델. 공식 H3 모델은 동기화된 스테레오 오디오와 함께 비디오를 생성하며, 첫 프레임 I2V를 지원합니다; 이 워크플로우는 Comfy-Org 리팩을 ComfyUI에서 사용합니다. MiniMaxAI/MiniMax-H3 및 Comfy-Org/MiniMax-H3
- MiniMax H3 Video VAE. H3의 확산 백본에서 사용되는 비디오 잠재 변수를 인코딩/디코딩합니다. Comfy-Org 리팩에 포함되어 있습니다. Comfy-Org/MiniMax-H3
- MiniMax H3 Audio VAE. 모델의 오디오 잠재 변수를 네이티브 스테레오 웨이브폼으로 디코딩하여 프레임에 정렬합니다. Comfy-Org 리팩에 포함되어 있습니다. Comfy-Org/MiniMax-H3
- Qwen3‑VL 32B 텍스트 인코더 (MiniMax H3 변형). 동작 및 대화 프롬프트를 H3에 대한 조건으로 해석합니다. Comfy-Org 릴리스에서 text_encoders로 패키징되어 있습니다. Comfy-Org/MiniMax-H3
- MiniMax‑H3 Turbo LoRA (4‑단계). H3 샘플링을 가속화하여 매우 낮은 단계 수로 선명한 미리보기가 가능하게 하는 LoRA입니다. larryvrh/MiniMax-H3-Turbo-Lora 및 LoRA 개념 논문 LoRA: Low‑Rank Adaptation
Comfyui MiniMax H3 ComfyUI 이미지에서 비디오로의 4단계 Turbo 워크플로우 사용 방법#
전체 흐름. 그래프는 업로드된 이미지를 스케일링하고, 지속 시간을 유효한 H3 프레임 수로 변환한 다음, 시작 프레임과 프롬프트를 Turbo LoRA가 적용된 H3에 공급합니다. 샘플러는 공동 비디오 및 오디오 잠재 변수를 생성하고, 이를 디코딩하여 다운로드 가능한 클립으로 결합합니다.
이미지 업로드. 애니메이션으로 만들고 싶은 첫 프레임을 제공하려면 LoadImage (#114)를 사용하세요. 이미지는 LayerUtility: ImageScaleByAspectRatio V2 (#167)에 의해 비율을 유지하면서 대상 긴 측면으로 자동 스케일링됩니다; 파생된 width/height는 핵심 H3 노드에 공급됩니다. 왜곡을 피하기 위해 필요할 때 레터박싱이 사용됩니다. 이는 H3의 선호하는 그리드에 맞추면서 구성을 유지합니다.
매개변수 및 프롬프트. 클립 길이는 Duration 제어 (레이블 “Duration (sec)”)를 사용하여 설정되며, 이는 작은 수학 노드 ComfyMathExpression (#134)로 공급되어 초를 영화 속도에서 프레임으로 변환하고 H3의 유효한 그리드에 맞춥니다. 녹색 easy positive 프롬프트 노드 (#152)에 동작과 대화를 입력하세요; 자연스러운 문장과 인용된 대사를 작성할 수 있습니다. 프롬프트는 CLIPLoader (#130)를 통해 Qwen3‑VL 텍스트 인코더에 의해 인코딩되어 모델에 대한 조건을 준비합니다.
핵심 생성. UNETLoader (#129)는 MiniMax H3 확산 백본을 로드하고 VAELoader (#121, #122)는 비디오 및 오디오 VAE를 로드합니다. Turbo LoRA는 LoraLoaderModelOnly (#171)에 의해 런타임에 병합되며, 메모리 효율적인 주의 패치 (MiniMaxH3MemoryEfficientSageAttentionPatch (#170))는 VRAM을 줄이는 데 도움이 됩니다. 메인 노드 MiniMaxH3ImageToVideo (#133)는 시작 프레임, 프롬프트, 계산된 너비/높이/길이를 받아 동기화된 비디오 및 오디오 잠재 변수를 생성합니다.
샘플링 및 디코딩. 컴팩트한 샘플러 스택 (KSamplerSelect (#125), BasicScheduler (#126), BasicGuider (#128), SamplerCustomAdvanced (#127), RandomNoise (#131))은 Turbo LoRA 덕분에 매우 적은 반복 횟수로 디노이징을 수행합니다. VAEDecode (#124)는 비디오 잠재 변수를 프레임으로 변환하고, VAEDecodeAudio (#123)는 프레임에 맞춰진 스테레오 오디오를 생성합니다. 디코딩 설정을 조정할 필요는 없습니다; 미리보기가 깔끔하게 보이도록 연결되어 있습니다.
출력. CreateVideo (#132)는 프레임과 오디오를 하나의 클립으로 결합하고, SaveVideo (#92)는 구성된 파일 이름 접두사로 이를 저장하여 RunComfy에서 즉시 다운로드할 수 있습니다. 결과는 시작 프레임, 동작 프롬프트, 대화를 반영하는 짧고 동기화된 비디오입니다.
Comfyui MiniMax H3 ComfyUI 이미지에서 비디오로의 4단계 Turbo 워크플로우의 주요 노드#
MiniMaxH3ImageToVideo (#133). 그래프의 핵심: 시작 프레임, 인코딩된 프롬프트, 목표 크기/길이를 받아 공동 비디오 및 오디오 잠재 변수를 생성합니다. 이 워크플로우에서 노출된 몇 가지 입력만 조정하세요: 강력하고 설명적인 프롬프트를 제공하고 (인용된 대사 포함) 현실적인 지속 시간을 설정하세요; 노드는 Comfy-Org 리팩의 H3 모델 및 VAE를 사용하여 나머지를 처리합니다. Comfy-Org/MiniMax-H3
LoraLoaderModelOnly (#171). MiniMax‑H3 Turbo LoRA를 주입하여 샘플러가 매우 적은 단계 수로 높은 선명도에 도달할 수 있도록 합니다. 속도를 위해 아티팩트를 교환해야 한다면 LoRA 강도를 약간 낮추세요; 모션 스미어가 보이면 약간 올려보세요. LoRA는 일반적인 H3 기본 변형, 포함된 리팩에서도 작동하도록 설계되었습니다. larryvrh/MiniMax-H3-Turbo-Lora
BasicScheduler (#126) 및 SamplerCustomAdvanced (#127). 함께 디노이징 일정 및 스텝 동작을 제어합니다. Turbo LoRA가 적용되어 있어 매우 낮은 단계 수로 빠른 미리보기가 가능합니다; 시간이 허락된다면 단계를 늘리면 안정성이 약간 향상됩니다. 특정한 외형을 염두에 두지 않는 한 스케줄러 및 샘플러 선택을 일반적으로 유지하세요.
LayerUtility: ImageScaleByAspectRatio V2 (#167). 업로드된 정지 이미지가 비율을 보존하면서 깔끔하고 모델 친화적인 해상도로 리사이즈되도록 합니다. 소스 이미지를 변경할 때 예상치 못한 자르기나 왜곡을 피하기 위해 사용하세요; 노드는 핵심 H3 노드가 소비하는 정확한 width/height를 출력합니다. ComfyUI_LayerStyle
ComfyMathExpression (#134). 초를 프레임으로 변환하고 H3의 유효한 프레임 그리드에 맞춰 오디오가 비디오에 위상 고정되도록 합니다. H3가 지원하지 않는 프레임 수를 피하는 “안전 장치”로 생각할 수 있으며, 결합 단계에서 미묘한 비동기를 방지합니다. 입력은 캔버스 상단에서 설정한 평문 영어 지속 시간입니다.
MiniMaxH3MemoryEfficientSageAttentionPatch (#170). H3 샘플링 중 VRAM 피크를 낮추는 실험적 주의 최적화를 적용합니다. 더 큰 크기나 메모리가 제한된 GPU에서 작업할 때 켜세요; 창의적 의도를 유지하면서 적합성을 개선합니다. ComfyUI‑KJNodes
선택적 추가 항목#
- 립싱크를 위한 프롬프트: 실제 대사를 따옴표로 작성하고 (예: “Dinner’s up — try this carbonara.”) 분위기와 카메라 움직임을 평문으로 설명하세요.
- 구성 우선: 피사체를 의도한 거리에서 이미 프레임에 맞춘 시작 프레임을 선택하세요; 애니메이션은 그 구성을 존중할 것입니다.
- 속도 대 마무리: MiniMax H3 ComfyUI 이미지에서 비디오로의 4단계 Turbo 설정은 빠른 미리보기에 맞춰져 있습니다; 중요한 샷일 경우 몇 단계를 추가하거나 LoRA 강도를 약간 낮추어 과도하게 선명한 그레인을 억제하세요.
- 런타임 여유: VRAM 제한에 도달했다면 최대 이미지 측 길이를 줄이거나 지속 시간을 줄이거나 메모리 효율적인 주의 패치를 활성화하세요.
- 베이스 탐색: 워크플로우는 Comfy‑Org H3 리팩 변형 (bf16, int8 convrot, pruned)과 호환됩니다. 베이스를 변경할 경우, 모델 로더와 샘플러 사이에 Turbo LoRA를 연결하여 동일한 가속 효과를 유지하세요. Comfy-Org/MiniMax-H3
감사의 글#
이 워크플로우는 다음 작업 및 리소스를 구현하고 기반으로 합니다. MiniMax H3 모델에 대해 MiniMax에, MiniMax H3 ComfyUI 워크플로우 튜토리얼에 대해 Comfy.org에, MiniMax-H3 모델 가중치에 대해 Comfy-Org에, MiniMax-H3 Turbo LoRA에 대해 larryvrh에 감사드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서 및 리포지토리를 참조하십시오.
리소스#
- MiniMax/MiniMax H3 공식 발표
- 문서 / 릴리스 노트: MiniMax H3 공식 발표
- Comfy.org/MiniMax H3 튜토리얼
- GitHub: Comfy-Org/docs
- 문서 / 릴리스 노트: MiniMax H3 튜토리얼
- Comfy-Org/MiniMax-H3 모델 가중치
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
참고: 참조된 모델, 데이터세트 및 코드의 사용은 해당 저자 및 유지 관리자가 제공하는 해당 라이선스 및 조건에 따릅니다.

