MiniMax H3 T2V ComfyUI: 네이티브 스테레오 오디오와 함께하는 프롬프트-비디오#
MiniMax H3 T2V ComfyUI는 하나의 프롬프트를 짧은 영화 같은 비디오로 변환하며 동기화된 스테레오 오디오를 제공합니다. 공식 Comfy.org 템플릿과 공개된 Comfy-Org MiniMax-H3 가중치로부터 제작되었으며, FL2VA 경로를 따라 모션과 사운드가 함께 생성되며, 사후에 연결되지 않습니다. 이는 프롬프트 전용 장면, 대화 또는 노래 클립, 시각과 사운드가 한 번에 필요한 컨셉 샷의 빠른 탐색에 이상적입니다.
하나의 블록에서 샷, 카메라, 퍼포먼스, 오디오 큐를 설명하고 크기와 지속 시간을 선택한 후 그래프를 대기열에 넣으세요. 워크플로우는 올바른 MiniMax-H3 구성 요소를 로드하고, 결합된 오디오-비주얼 잠재 공간을 샘플링하며, 이를 프레임과 스테레오 오디오로 디코딩하고, 결과를 멀티플렉싱하여 완성된 비디오 파일로 저장합니다.
Comfyui MiniMax H3 T2V ComfyUI 워크플로우의 주요 모델#
- MiniMax-H3 FL2VA 확산 모델. 모션과 사운드가 위상 정렬 상태로 유지되도록 결합된 오디오-비디오 노이즈 제거를 수행하는 핵심 UNet입니다. Comfy-Org에서 제공하는 가중치가 diffusion_models에 있습니다. Model files
- MiniMax-H3 Video VAE. 시각적 잠재 공간을 RGB 프레임으로 인코딩하고 디코딩하여 영화 같은 디테일과 모션 연속성을 유지합니다. minimax_h3_video_vae_fp16.safetensors
- MiniMax-H3 Audio VAE. 각 클립에 대해 시간 정렬된 스테레오 웨이브폼으로 오디오 잠재 공간을 인코딩하고 디코딩합니다. minimax_h3_audio_vae_fp32.safetensors
- Qwen3-VL 32B 텍스트 인코더 (AWQ for MiniMax-H3). 장면의 의미, 타이밍, 오디오 의도를 포괄하는 조건으로 프롬프트를 해석합니다. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
원본 템플릿과 이 그래프가 어떻게 비교되는지 보고 싶다면 Comfy.org 참조를 확인하세요. Template JSON
Comfyui MiniMax H3 T2V ComfyUI 워크플로우 사용법#
고수준에서, 목표 해상도와 지속 시간을 설정하고, 시각적 요소와 오디오가 모두 포함된 단일 프롬프트를 작성하며, 선택적으로 첫 번째와 마지막 프레임을 추가한 후 실행합니다. 서브그래프 내에서 MiniMax-H3는 동기화된 비디오 및 오디오 잠재 공간을 생성하며, 이는 디코딩되고 24fps 영화로 결합되어 저장됩니다.
ResolutionSelector (#115)#
width와 height를 설정하기 위해 비율과 스케일을 선택하세요. 선택기는 32의 효율적인 배수로 반올림하여 MiniMax-H3 서브그래프에 값을 전달하므로 직접 계산할 필요가 없습니다. 더 빠른 반복을 위해 적당한 크기로 시작한 후 프롬프트가 올바르게 읽힐 때 크기를 늘리세요. 비율 변경은 트레일러, 세로 클립 및 정사각형 미리보기의 강력한 창의적 도구입니다.
Image to Video (MiniMax H3) (#105)#
이 서브그래프는 MiniMax H3 T2V ComfyUI 파이프라인을 조정합니다. 샷, 편집 및 사운드트랙을 함께 설명하는 일관된 프롬프트를 붙여넣고, 선택적으로 first_frame 및 last_frame 이미지를 제공하여 입구와 출구를 고정합니다. 사용자 친화적인 duration을 설정하고 그래프가 유효한 프레임 수로 변환합니다. 서브그래프는 디코딩 및 멀티플렉싱으로 진행되는 동기화된 오디오-비주얼 잠재 공간을 반환합니다.
모델 그룹#
모델 그룹은 이 워크플로우를 위한 정확한 MiniMax-H3 구성 요소를 로드합니다. UNETLoader (#6)는 FL2VA 확산 모델을 가져오고, CLIPLoader (#13)는 Qwen3-VL 인코더를 로드하며, 두 개의 VAELoader 노드 (#11 비디오, #24 오디오)는 디코더를 준비합니다. 이는 Comfy-Org MiniMax-H3 파일을 가리키므로 수동 연결 없이 실행할 수 있습니다. 모델을 중앙 집중화하면 미래의 교체나 업그레이드가 간단해집니다.
조건 그룹#
MiniMaxH3ImageToVideo (#104)는 프롬프트, 선택적 first_frame 및 last_frame, 선택한 width, height, length를 MiniMax-H3 조건과 초기 잠재 공간으로 변환합니다. 모델이 장면 내용과 오디오 의도를 동시에 읽도록 하여 더 타이트한 동기화를 이끌어내는 것이 아이디어입니다. 참조 프레임을 제공하면 입구와 출구가 연속성을 위해 안내되며, 비워두면 생성이 차갑게 시작됩니다.
샘플링 그룹#
샘플링은 RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16), 그리고 주요 SamplerCustomAdvanced (#14)에 의해 처리됩니다. 이들은 결합된 잠재 공간의 노이즈를 제거하여 그림 모션과 사운드 이벤트가 동기화되도록 합니다. 동일한 창의적 방향을 유지하면서 새로운 시드를 사용하여 다른 테이크를 탐색할 수 있습니다. 샘플러 선택이나 스케줄을 실험하면 모션 에너지와 사운드 텍스처를 약간 변경할 수 있습니다.
디코딩 및 비디오 생성 그룹#
VAEDecode (#10)은 비디오 잠재 공간에서 프레임 시퀀스를 재구성하고, VAEDecodeAudio (#23)는 오디오 잠재 공간에서 스테레오 웨이브폼을 재구성합니다. CreateVideo (#91)는 프레임과 오디오를 24fps에서 완성된 클립으로 결합합니다. 이는 프롬프트에서 지정된 깨끗한 컷과 비트가 타임라인에서 결합되는 곳입니다. 출력은 저장으로 진행됩니다.
SaveVideo (#92)#
최종 비디오를 ComfyUI 출력의 video/MiniMax_H3 하위에 씁니다. 노드는 자동 명명법을 사용하여 빠르게 반복할 수 있으며, 경로를 변경하여 다른 프로젝트를 분리할 수 있습니다. 출력에는 생성된 그림과 스테레오 오디오가 모두 포함됩니다.
Comfyui MiniMax H3 T2V ComfyUI 워크플로우의 주요 노드#
MiniMaxH3ImageToVideo (#104)#
MiniMax-H3의 핵심 조건 노드로, prompt, 선택적 first_frame 및 last_frame, width, height, length를 수용합니다. 프롬프트를 간결하지만 영화적으로 유지하고, 같은 텍스트 블록에서 배경음, SFX, 대화, 음악적 히트와 같은 오디오 큐를 포함하세요. 특정 입구나 출구가 필요할 때 참조 프레임을 사용하세요; 자유로운 배치를 위해서는 생략하세요.
ComfyMathExpression (#107)#
초 단위로 읽기 쉬운 duration을 모델이 기대하는 정수 length로 매핑하여 깨끗한 타이밍을 위한 모델의 프레임 그리드에 맞춥니다. 의도한 클립 길이에 float를 설정하고 노드가 변환을 처리하도록 하세요. 약간 짧은 클립은 높은 해상도에서 선명한 모션과 사운드 동기화를 유지하는 경향이 있습니다.
SamplerCustomAdvanced (#14)#
선택된 샘플러와 스케줄에 기반하여 노이즈 제거 프로세스를 진행합니다. 비교를 위해 테이크를 고정하려면 고정 noise_seed를 사용하고, 새 변형을 탐색하려면 시드만 변경하세요. 모션이 너무 혼란스럽거나 너무 뻣뻣하게 느껴지면 KSamplerSelect (#17)에서 다른 샘플러를 시도하거나 BasicScheduler (#9)에서 스케줄을 조정하세요.
CreateVideo (#91)#
디코딩된 프레임과 스테레오 오디오를 선택한 프레임 속도로 단일 비디오 스트림으로 결합합니다. 리듬 기반 편집을 위해 프롬프트에서 설명한 리듬에 맞추어 fps를 설정하세요. 느리거나 더 빠른 느낌을 원할 경우 fps를 변경할 수 있는 곳이기도 합니다.
ResolutionSelector (#115)#
비율과 전체 픽셀 수를 위한 하나의 컨트롤로, 모델 친화적인 크기로 자동 반올림합니다. 먼저 비율을 선택한 후 스케일을 조정하여 속도와 충실도를 균형 있게 유지하세요. 더 큰 캔버스는 신중한 프롬프트와 짧은 지속 시간에 보답합니다.
SaveVideo (#92)#
디스크에 클립을 마무리합니다. 프로젝트 하위 폴더를 가리켜 실험을 정리하고, 중요한 순간을 찾으면 현명하게 이름을 변경하세요.
선택적 추가 기능#
- 시간 큐와 명시적인 오디오 비트를 가진 미니 스토리보드로 프롬프트를 작성하여 안정적인 동기화를 얻으세요.
- 바람, 발걸음, 군중, 리버브 또는 특정 악기와 같은 오디오 의도 단어를 포함하여 사운드트랙을 조정하세요.
- 프롬프트에 대화 또는 노래의 줄을 직접 추가하고 화자의 톤을 기재하세요.
- 프롬프트 조정 시 비교를 위해
noise_seed를 고정하고, 다른 테이크를 탐색할 때 시드만 변경하세요. - 컷 간의 연속성이나 정확한 최종 자세가 필요할 때
first_frame및last_frame을 사용하여 모션을 브래킷하세요.
감사의 말#
이 워크플로우는 다음 작업 및 리소스를 구현하고 이에 기반합니다. MiniMax H3 T2V 워크플로우 템플릿 및 MiniMax-H3 모델 가중치에 대해 Comfy-Org에 감사드리며, MiniMax H3 튜토리얼에 대해 Comfy.org에 감사드리며, MiniMax H3 공식 발표에 대해 MiniMax에 감사드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서 및 저장소를 참조하세요.
리소스#
- Comfy-Org/MiniMax H3 T2V 워크플로우 템플릿
- GitHub: video_minimax_h3_t2v.json
- Comfy.org/MiniMax H3 튜토리얼
- 문서 / 릴리스 노트: MiniMax H3 튜토리얼
- MiniMax/MiniMax H3 공식 발표
- 문서 / 릴리스 노트: MiniMax H3 공식 발표
- Comfy-Org/MiniMax-H3 모델 가중치
- Hugging Face: Comfy-Org/MiniMax-H3
참고: 참조된 모델, 데이터셋 및 코드의 사용은 해당 저자 및 유지관리자가 제공한 라이선스 및 조건에 따릅니다.

