MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보: 한 번의 패스로 네이티브 오디오와 함께 프롬프트를 클립으로 변환#
이 워크플로우는 MiniMax H3를 사용하여 하나의 시네마틱 프롬프트를 스테레오 오디오와 함께 짧은 비디오로 변환합니다. Turbo 4단계 가속 LoRA를 적용하여 대화, 노래 및 환경 장면을 신속하게 반복할 수 있으며 모션과 사운드를 긴밀하게 결합합니다.
프롬프트만으로 초안을 원하는 제작자를 위해 설계된 MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보 워크플로우는 수동 오디오 조립 없이 깨끗한 음성 또는 보컬, 일관된 환경 사운드, 일관된 시네마토그래피를 제공합니다. 그래프는 길이 정렬, 잠재 샘플링, 디코딩 및 멀티플렉싱을 자동으로 처리하여 스토리텔링과 퍼포먼스 큐에 집중할 수 있게 합니다.
Comfyui MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보 워크플로우의 주요 모델#
- MiniMax H3 확산 모델 (FL2VA UNet). 사진과 사운드를 위한 공유 잠재를 학습하여 동일한 샘플링 패스에서 동기화된 모션과 오디오를 가능하게 하는 핵심 오디오비주얼 생성기입니다. 가중치: Comfy-Org/MiniMax-H3.
- H3용 Qwen3-VL 32B 텍스트 인코더 (AWQ/NVFP4 변형). 풍부한 다중 문장 프롬프트를 장면 레이아웃, 퍼포먼스 및 오디오 이벤트를 구동하는 조건으로 인코딩합니다. Comfy-Org/MiniMax-H3에 패키지되어 있습니다.
- MiniMax H3 비디오 VAE. 샘플링된 비디오 잠재를 필름 톤과 디테일이 있는 프레임으로 디코딩합니다. 파일: minimax_h3_video_vae_fp16.safetensors.
- MiniMax H3 오디오 VAE. 공유 잠재를 시간 정렬된 스테레오 오디오로 디코딩하여 음성, 노래 및 환경음을 제공합니다. 파일: minimax_h3_audio_vae_fp32.safetensors.
- MiniMax H3 터보 4단계 LoRA. 매우 빠른 샘플링을 가능하게 하면서 장면의 충실도를 유지하는 가속 레시피를 적용합니다. 파일: minimax_h3_turbo_4step_pruned_comfyui.safetensors.
Comfyui MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보 워크플로우 사용 방법#
고수준에서, 프롬프트는 인코딩되고, 터보로 보강된 H3 모델이 단일 오디오비주얼 잠재를 샘플링하며, 비디오와 오디오 VAE가 해당 잠재를 디코딩한 후 클립이 재생 가능한 파일로 멀티플렉싱됩니다.
1) 시네마틱 프롬프트 작성 및 지속 시간 설정#
easy positive (#147) 텍스트 필드를 사용하여 외관, 동작 및 퍼포먼스를 설명합니다. 음성이나 음악을 안내하려면 "오디오: 중년 남성 목소리가 대사를 전달합니다... 빗소리 배경... 저음의 스릴러 언더스코어."와 같은 명확한 큐를 포함하십시오. Float (duration) 컨트롤러 (#133)는 클립 길이를 초 단위로 설정합니다. 수학 노드는 지속 시간을 프레임으로 변환하고 조용히 H3의 필요한 속도에 맞춰 프레임 수를 정렬하므로 프레임 수학을 관리할 필요가 없습니다.
2) H3, 텍스트 인코더, VAE 및 터보 LoRA 로드#
UNETLoader (#127)는 MiniMax H3 확산 모델을 로드하고, CLIPLoader (#128)는 H3에 맞춘 Qwen3-VL 텍스트 인코더를 로드합니다. 두 개의 VAELoader 노드는 비디오 VAE (#119)와 오디오 VAE (#120)를 가져옵니다. LoraLoaderModelOnly (#153)는 MiniMax H3 터보 4단계 LoRA를 모델에 적용하여 스케줄러와 샘플러가 시청각 일관성을 잃지 않고 빠른 모드로 작동할 수 있게 합니다.
3) 조건 설정 및 초기 오디오비주얼 잠재 생성#
MiniMaxH3ImageToVideo (#131)는 프롬프트를 긍정적 조건으로 변환하고 선택한 너비, 높이 및 프레임 수에 맞춰 초기 잠재를 준비합니다. 그래프를 나중에 확장하려는 경우 시작 또는 종료 이미지를 고정하기 위한 선택적 first_frame 및 last_frame 입력이 존재합니다. 노드는 다운스트림 샘플링이 개선할 조건과 잠재를 출력합니다.
4) 터보로 샘플링#
BasicGuider (#126)는 모델을 조건과 페어링하고, KSamplerSelect (#123)는 샘플링 알고리즘을 선택하며, BasicScheduler (#124)는 터보 LoRA와 함께 작동하는 단계 스케줄을 설정합니다. RandomNoise (#129)는 재현성을 위해 생성을 시드합니다. SamplerCustomAdvanced (#125)는 비디오와 오디오를 모두 인코딩하는 최종 공유 잠재를 생성하기 위해 디노이징 패스를 수행합니다.
5) 최종 클립 디코딩 및 내보내기#
VAEDecode (#122)는 잠재로부터 이미지 프레임을 재구성하고, VAEDecodeAudio (#121)는 동기화된 스테레오 오디오를 재구성합니다. CreateVideo (#130)는 프레임과 오디오를 단일 스트림으로 멀티플렉싱한 다음, SaveVideo (#92)는 설정한 파일 이름 접두사를 사용하여 디스크에 파일을 저장합니다.
Comfyui MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보 워크플로우의 주요 노드#
MiniMaxH3ImageToVideo (#131)#
프롬프트, 해상도 및 길이에서 긍정적 조건을 생성하고 오디오비주얼 잠재를 초기화합니다. width, height 또는 length를 조정하면 모션 스케일과 화면에 맞출 수 있는 액션 양이 모두 변경됩니다. 나중에 그래프를 확장하면, first_frame 및 last_frame을 사용하여 샷 간의 연속성을 잠글 수 있습니다.
LoraLoaderModelOnly (#153)#
로드된 H3 모델에 터보 4단계 LoRA를 적용합니다. 터보의 이점을 얻기 위해 스케줄러를 저단계 모드에 유지하십시오; 단계를 크게 올리면 의도된 빠른 반복 동작에서 벗어납니다. 이 LoRA는 MiniMax H3에 특화되어 있으며 H3 저장소의 주요 가중치와 함께 유지됩니다.
BasicScheduler (#124)#
샘플러가 따르는 디노이징 스케줄을 제어합니다. 속도와 충실도 균형을 맞추면서 터보 LoRA와 호환되도록 사용하십시오. 샘플러 알고리즘을 변경하면, 안정적인 모션과 깨끗한 오디오를 유지하기 위해 스케줄 선택을 다시 검토하십시오.
SamplerCustomAdvanced (#125)#
노이즈, 가이더, 샘플러, 시그마 및 초기 잠재를 주어진 디노이징을 실행합니다. 텍스처, 타이밍 및 오디오비주얼 선명도의 최종 중재자입니다. 프롬프트 수정 시 동일한 시드를 사용하여 노이즈가 아닌 텍스트 변경에 따른 차이를 확인할 수 있습니다.
PathchSageAttentionKJ (#150)#
LoRA 주입 전에 주의를 최적화하여 대형 해상도에서 처리량을 개선합니다. KJNodes에서 제공하는 성능 도우미로, ComfyUI를 위한 성능 도우미를 제공합니다. 저장소: ComfyUI-KJNodes.
CreateVideo (#130)#
디코딩된 프레임을 디코딩된 오디오와 결합하여 동기화된 클립을 만듭니다. 전달 사양에 맞추어 프레임 속도나 비트 깊이를 변경할 수 있습니다. 노드는 공유 잠재로부터 유도된 오디오-비디오 동기화를 유지합니다.
SaveVideo (#92)#
선택한 파일 이름 접두사, 컨테이너 및 코덱을 사용하여 렌더링된 클립을 디스크에 씁니다. 동일한 장면과 시드에 대한 반복을 추적하기 위해 일관된 명명을 사용하십시오.
선택적 추가 기능#
- 음성 프롬프트: "오디오:" 뒤에 정확한 대사를 넣고 목소리의 나이, 성별, 톤 및 속도를 설명하십시오. 노래의 경우 스타일과 템포를 지정하십시오. 환경의 경우 소스, 강도 및 언더스코어만 원하는지 여부를 나열하십시오.
- 해상도 및 지속 시간 절충: 픽셀 수가 많고 클립이 길수록 샘플링 시간이 더 많이 소요됩니다. 많은 테이크가 필요한 경우, 더 작게 시작한 후 타이밍과 전달이 적절하다고 느껴지면 업스케일하거나 길이를 늘리십시오.
- 재현성: 텍스트만 수정할 때 동일한 시드를 유지하여 작은 프롬프트 편집을 A/B 테스트할 수 있습니다.
- 길이 정렬은 자동입니다: 그래프는 초를 프레임으로 변환하고 H3의 내부 속도에 맞춰 프레임 수를 정렬하여 안정적인 오디오비주얼 합성을 제공합니다.
- 연속성 옵션: 모델 노드는 선택적
first_frame및last_frame을 노출합니다. 나중에 워크플로우를 확장하면, 이미지를 그곳에 연결하여 편집 간의 샷 시작 또는 종료를 일치시킬 수 있습니다. - 안전성: 저작권이 있는 캐릭터, 동의 없는 실제 인물의 유사성, 화면에 로고 또는 자막을 넣지 마십시오.
감사의 글#
이 워크플로우는 다음 작업과 리소스를 구현하고 구축합니다. MiniMax의 MiniMax H3 멀티모달 생성 모델 및 발표, Comfy.org의 ComfyUI MiniMax H3 워크플로우 튜토리얼, MiniMax-H3 모델 가중치를 제공하고 유지 관리하는 Comfy-Org에 감사드립니다. 권위 있는 세부 사항은 아래 링크된 원본 문서 및 저장소를 참조하십시오.
리소스#
- MiniMax/MiniMax H3: 작업과 모달리티 간의 경계를 허무는 오픈 모델
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- 문서 / 릴리스 노트: MiniMax H3 공식 발표
- Comfy.org/MiniMax H3: ComfyUI 워크플로우 예제
- GitHub: Comfy-Org/docs
- 문서 / 릴리스 노트: Comfy.org MiniMax H3 튜토리얼
- Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
참고: 참조된 모델, 데이터셋 및 코드의 사용은 해당 저자 및 유지 관리자가 제공한 라이센스 및 조건에 따릅니다.


