ComfyUI>워크플로우>MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보

MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1483
하나의 시네마틱 프롬프트를 짧은 비디오로 변환하세요. 같은 과정에서 네이티브 스테레오 사운드를 얻을 수 있습니다. 명확한 대화, 노래 및 환경 장면을 만드세요. Hailuo H3 터보는 더 빠른 초안을 위해 4단계 샘플링을 사용합니다. 아이디어를 빠르게 테스트할 수 있습니다. 모션과 오디오를 함께 내보내세요.

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Workflow

MiniMax H3 ComfyUI Text-to-Video | 4-Step Turbo
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Examples

MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보: 한 번의 패스로 네이티브 오디오와 함께 프롬프트를 클립으로 변환#

이 워크플로우는 MiniMax H3를 사용하여 하나의 시네마틱 프롬프트를 스테레오 오디오와 함께 짧은 비디오로 변환합니다. Turbo 4단계 가속 LoRA를 적용하여 대화, 노래 및 환경 장면을 신속하게 반복할 수 있으며 모션과 사운드를 긴밀하게 결합합니다.

프롬프트만으로 초안을 원하는 제작자를 위해 설계된 MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보 워크플로우는 수동 오디오 조립 없이 깨끗한 음성 또는 보컬, 일관된 환경 사운드, 일관된 시네마토그래피를 제공합니다. 그래프는 길이 정렬, 잠재 샘플링, 디코딩 및 멀티플렉싱을 자동으로 처리하여 스토리텔링과 퍼포먼스 큐에 집중할 수 있게 합니다.

Comfyui MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보 워크플로우의 주요 모델#

  • MiniMax H3 확산 모델 (FL2VA UNet). 사진과 사운드를 위한 공유 잠재를 학습하여 동일한 샘플링 패스에서 동기화된 모션과 오디오를 가능하게 하는 핵심 오디오비주얼 생성기입니다. 가중치: Comfy-Org/MiniMax-H3.
  • H3용 Qwen3-VL 32B 텍스트 인코더 (AWQ/NVFP4 변형). 풍부한 다중 문장 프롬프트를 장면 레이아웃, 퍼포먼스 및 오디오 이벤트를 구동하는 조건으로 인코딩합니다. Comfy-Org/MiniMax-H3에 패키지되어 있습니다.
  • MiniMax H3 비디오 VAE. 샘플링된 비디오 잠재를 필름 톤과 디테일이 있는 프레임으로 디코딩합니다. 파일: minimax_h3_video_vae_fp16.safetensors.
  • MiniMax H3 오디오 VAE. 공유 잠재를 시간 정렬된 스테레오 오디오로 디코딩하여 음성, 노래 및 환경음을 제공합니다. 파일: minimax_h3_audio_vae_fp32.safetensors.
  • MiniMax H3 터보 4단계 LoRA. 매우 빠른 샘플링을 가능하게 하면서 장면의 충실도를 유지하는 가속 레시피를 적용합니다. 파일: minimax_h3_turbo_4step_pruned_comfyui.safetensors.

Comfyui MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보 워크플로우 사용 방법#

고수준에서, 프롬프트는 인코딩되고, 터보로 보강된 H3 모델이 단일 오디오비주얼 잠재를 샘플링하며, 비디오와 오디오 VAE가 해당 잠재를 디코딩한 후 클립이 재생 가능한 파일로 멀티플렉싱됩니다.

1) 시네마틱 프롬프트 작성 및 지속 시간 설정#

easy positive (#147) 텍스트 필드를 사용하여 외관, 동작 및 퍼포먼스를 설명합니다. 음성이나 음악을 안내하려면 "오디오: 중년 남성 목소리가 대사를 전달합니다... 빗소리 배경... 저음의 스릴러 언더스코어."와 같은 명확한 큐를 포함하십시오. Float (duration) 컨트롤러 (#133)는 클립 길이를 초 단위로 설정합니다. 수학 노드는 지속 시간을 프레임으로 변환하고 조용히 H3의 필요한 속도에 맞춰 프레임 수를 정렬하므로 프레임 수학을 관리할 필요가 없습니다.

2) H3, 텍스트 인코더, VAE 및 터보 LoRA 로드#

UNETLoader (#127)는 MiniMax H3 확산 모델을 로드하고, CLIPLoader (#128)는 H3에 맞춘 Qwen3-VL 텍스트 인코더를 로드합니다. 두 개의 VAELoader 노드는 비디오 VAE (#119)와 오디오 VAE (#120)를 가져옵니다. LoraLoaderModelOnly (#153)는 MiniMax H3 터보 4단계 LoRA를 모델에 적용하여 스케줄러와 샘플러가 시청각 일관성을 잃지 않고 빠른 모드로 작동할 수 있게 합니다.

3) 조건 설정 및 초기 오디오비주얼 잠재 생성#

MiniMaxH3ImageToVideo (#131)는 프롬프트를 긍정적 조건으로 변환하고 선택한 너비, 높이 및 프레임 수에 맞춰 초기 잠재를 준비합니다. 그래프를 나중에 확장하려는 경우 시작 또는 종료 이미지를 고정하기 위한 선택적 first_framelast_frame 입력이 존재합니다. 노드는 다운스트림 샘플링이 개선할 조건과 잠재를 출력합니다.

4) 터보로 샘플링#

BasicGuider (#126)는 모델을 조건과 페어링하고, KSamplerSelect (#123)는 샘플링 알고리즘을 선택하며, BasicScheduler (#124)는 터보 LoRA와 함께 작동하는 단계 스케줄을 설정합니다. RandomNoise (#129)는 재현성을 위해 생성을 시드합니다. SamplerCustomAdvanced (#125)는 비디오와 오디오를 모두 인코딩하는 최종 공유 잠재를 생성하기 위해 디노이징 패스를 수행합니다.

5) 최종 클립 디코딩 및 내보내기#

VAEDecode (#122)는 잠재로부터 이미지 프레임을 재구성하고, VAEDecodeAudio (#121)는 동기화된 스테레오 오디오를 재구성합니다. CreateVideo (#130)는 프레임과 오디오를 단일 스트림으로 멀티플렉싱한 다음, SaveVideo (#92)는 설정한 파일 이름 접두사를 사용하여 디스크에 파일을 저장합니다.

Comfyui MiniMax H3 ComfyUI 텍스트-비디오 4단계 터보 워크플로우의 주요 노드#

MiniMaxH3ImageToVideo (#131)#

프롬프트, 해상도 및 길이에서 긍정적 조건을 생성하고 오디오비주얼 잠재를 초기화합니다. width, height 또는 length를 조정하면 모션 스케일과 화면에 맞출 수 있는 액션 양이 모두 변경됩니다. 나중에 그래프를 확장하면, first_framelast_frame을 사용하여 샷 간의 연속성을 잠글 수 있습니다.

LoraLoaderModelOnly (#153)#

로드된 H3 모델에 터보 4단계 LoRA를 적용합니다. 터보의 이점을 얻기 위해 스케줄러를 저단계 모드에 유지하십시오; 단계를 크게 올리면 의도된 빠른 반복 동작에서 벗어납니다. 이 LoRA는 MiniMax H3에 특화되어 있으며 H3 저장소의 주요 가중치와 함께 유지됩니다.

BasicScheduler (#124)#

샘플러가 따르는 디노이징 스케줄을 제어합니다. 속도와 충실도 균형을 맞추면서 터보 LoRA와 호환되도록 사용하십시오. 샘플러 알고리즘을 변경하면, 안정적인 모션과 깨끗한 오디오를 유지하기 위해 스케줄 선택을 다시 검토하십시오.

SamplerCustomAdvanced (#125)#

노이즈, 가이더, 샘플러, 시그마 및 초기 잠재를 주어진 디노이징을 실행합니다. 텍스처, 타이밍 및 오디오비주얼 선명도의 최종 중재자입니다. 프롬프트 수정 시 동일한 시드를 사용하여 노이즈가 아닌 텍스트 변경에 따른 차이를 확인할 수 있습니다.

PathchSageAttentionKJ (#150)#

LoRA 주입 전에 주의를 최적화하여 대형 해상도에서 처리량을 개선합니다. KJNodes에서 제공하는 성능 도우미로, ComfyUI를 위한 성능 도우미를 제공합니다. 저장소: ComfyUI-KJNodes.

CreateVideo (#130)#

디코딩된 프레임을 디코딩된 오디오와 결합하여 동기화된 클립을 만듭니다. 전달 사양에 맞추어 프레임 속도나 비트 깊이를 변경할 수 있습니다. 노드는 공유 잠재로부터 유도된 오디오-비디오 동기화를 유지합니다.

SaveVideo (#92)#

선택한 파일 이름 접두사, 컨테이너 및 코덱을 사용하여 렌더링된 클립을 디스크에 씁니다. 동일한 장면과 시드에 대한 반복을 추적하기 위해 일관된 명명을 사용하십시오.

선택적 추가 기능#

  • 음성 프롬프트: "오디오:" 뒤에 정확한 대사를 넣고 목소리의 나이, 성별, 톤 및 속도를 설명하십시오. 노래의 경우 스타일과 템포를 지정하십시오. 환경의 경우 소스, 강도 및 언더스코어만 원하는지 여부를 나열하십시오.
  • 해상도 및 지속 시간 절충: 픽셀 수가 많고 클립이 길수록 샘플링 시간이 더 많이 소요됩니다. 많은 테이크가 필요한 경우, 더 작게 시작한 후 타이밍과 전달이 적절하다고 느껴지면 업스케일하거나 길이를 늘리십시오.
  • 재현성: 텍스트만 수정할 때 동일한 시드를 유지하여 작은 프롬프트 편집을 A/B 테스트할 수 있습니다.
  • 길이 정렬은 자동입니다: 그래프는 초를 프레임으로 변환하고 H3의 내부 속도에 맞춰 프레임 수를 정렬하여 안정적인 오디오비주얼 합성을 제공합니다.
  • 연속성 옵션: 모델 노드는 선택적 first_framelast_frame을 노출합니다. 나중에 워크플로우를 확장하면, 이미지를 그곳에 연결하여 편집 간의 샷 시작 또는 종료를 일치시킬 수 있습니다.
  • 안전성: 저작권이 있는 캐릭터, 동의 없는 실제 인물의 유사성, 화면에 로고 또는 자막을 넣지 마십시오.

감사의 글#

이 워크플로우는 다음 작업과 리소스를 구현하고 구축합니다. MiniMax의 MiniMax H3 멀티모달 생성 모델 및 발표, Comfy.org의 ComfyUI MiniMax H3 워크플로우 튜토리얼, MiniMax-H3 모델 가중치를 제공하고 유지 관리하는 Comfy-Org에 감사드립니다. 권위 있는 세부 사항은 아래 링크된 원본 문서 및 저장소를 참조하십시오.

리소스#

참고: 참조된 모델, 데이터셋 및 코드의 사용은 해당 저자 및 유지 관리자가 제공한 라이센스 및 조건에 따릅니다.

RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.