MiniMax H3 Latent Upscaler: BUNNY 두 단계 비디오 생성 워크플로우#
이 ComfyUI 워크플로우는 텍스트 프롬프트와 선택적 참조 이미지를 짧고 시네마틱한 비디오로 변환하여 동기화된 오디오를 제공합니다. BUNNY 두 단계 설계를 사용합니다: 1단계에서는 기본 해상도에서 동작과 구성을 설정한 후, MiniMax H3 Latent Upscaler가 3D 비디오-오디오 잠재적을 확대하고, 2단계에서는 고주파 디테일을 재구성하고 최종 프레임과 사운드를 디코딩합니다. MiniMax H3 Latent Upscaler는 생성에 통합되어 있으며, 기존 비디오를 위한 일반적인 향상 도구가 아닙니다; 추가적인 명료성을 원하면서 동작 의도를 잃지 않으려는 광고 컷과 스타일화된 시네마틱 장면을 위해 설계되었습니다.
결과는 프롬프트, 참조 및 소수의 LoRAs에 의해 결정되는 외형을 가진 고해상도 클립이며, 두 단계 업샘플-그런 후 재구성 파이프라인에 의해 모션 안정성이 보호됩니다. 2단계는 필수이며 항상 잠재적이 업스케일된 후 실제 디테일 재구성을 수행합니다.
Comfyui MiniMax H3 Latent Upscaler 워크플로우의 주요 모델#
- MiniMax H3 비디오-오디오 모델과 T8 커스텀 노드. 파이프라인 전반에 걸쳐 사용되는 핵심 생성기, 조건 설정, 두 단계 계획 및 디코드 유틸리티를 제공합니다. 모델별 동작 및 인터페이스에 대한 정보는 T8 저장소의 노드 스위트를 참조하십시오. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Video VAE. 2단계가 결국 프레임으로 변환하는 비디오 잠재적을 인코딩하고 디코딩합니다. 위의 T8 노드에 포함되어 사용됩니다. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Audio VAE. 시각적 모션 계획과 일치하도록 환경음을 유지하기 위해 오디오 잠재적을 인코딩하고 디코딩합니다. GitHub: comfyui-minimax-h3-audio-T8
- MiniMax H3 Latent Upscaler 3D. 후처리 보간보다 시간 구조를 더 잘 보존하면서 디테일 재구성 전에 폭과 높이를 확대하는 학습된 3D 잠재적 업스케일러. 공식 3D fp16 체크포인트를 사용하십시오. Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- SageAttention 메모리 효율적인 H3용 패치. 이 워크플로우의 유일한 주의 패치로 안정적이고 메모리 친화적인 추론을 제공합니다. GitHub: ComfyUI-h3_sage_amd
Comfyui MiniMax H3 Latent Upscaler 워크플로우 사용 방법#
워크플로우에는 최종 클립을 생성하기 위해 협력하는 7개의 레이블 그룹이 있습니다. 1단계는 기본 해상도에서 동작을 계획하고, MiniMax H3 Latent Upscaler가 잠재적을 확대하며, 2단계는 디코딩 전에 더 큰 크기로 디테일을 재구성합니다.
01 · 입력, 업스케일 및 참조#
BUNNY 프롬프트 상자를 사용하여 장면, 동작, 분위기 및 음향을 설명하십시오. 선택적으로 최대 4개의 참조 이미지를 추가하여 정체성, 팔레트 또는 샷 디자인을 조정할 수 있으며, 텍스트 전용 생성을 위해 연결을 끊습니다. 목표 지속 시간을 설정하십시오; 프레임 수는 모델의 샘플링 그리드에 맞게 자동으로 계산됩니다. 하드웨어에 적합한 1단계 기본 해상도를 선택한 다음, MiniMax H3 Latent Upscaler가 잠재 공간에서 폭과 높이를 얼마나 확장할지를 결정하기 위해 Upscale Scale을 조정하십시오. 픽셀 영역은 스케일 팩터의 제곱에 비례하여 확장되므로, VRAM과 렌더링 시간이 업스케일 증가와 함께 증가합니다.
02 · 모델 베이스 · Sage 전용#
이 그룹은 MiniMax H3 기본 모델을 로드하고, 속도를 위한 Turbo LoRA를 적용하며, 유일한 주의 수정으로 SageAttention 패치를 활성화합니다. 일관된 조건 설정 및 디코딩을 보장하기 위해 MiniMax H3 비디오 및 오디오 VAE와 H3 텍스트 인코더가 로드됩니다. 호환 가능한 모델 파일을 교체할 특별한 이유가 없는 한 이 섹션을 그대로 두십시오; 주의 백엔드를 혼합하는 것은 권장되지 않습니다.
03 · BUNNY 1단계 및 2단계 LoRAs#
1단계의 LoRAs는 동작 논리, 구성 및 상호작용 패턴에 영향을 미치고, 2단계의 LoRAs는 확대된 구조와 세부 사항을 재구성하는 데 중점을 둡니다. 주제에 맞는 LoRA 파일로 교체하고, 가중치를 절약하여 조정할 수 있습니다. 2단계가 동작 의도를 변경하기 시작하면 2단계 LoRA 강도를 조정하기 전에 1단계를 만지십시오. 절대로 2단계 LoRAs를 1단계로 다시 라우팅하거나 2단계를 우회하지 마십시오.
04 · 1단계 동작#
1단계 조건 설정 · AUTO (#7)는 프롬프트와 참조를 분석하고, 적절한 생성 모드를 선택하며, 공동 비디오-오디오 잠재적 캔버스를 조합합니다. 1단계 듀얼 클록 (#8)은 동기화된 비디오 및 오디오 일정으로 별도의 샘플링 클록을 구동하여 동작 및 사운드가 일관되게 발전하도록 합니다. 두 단계 계획 노드는 1단계에 동작 구조를 위한 작은 예산을 할당하고, 2단계 디테일에 더 많은 예산을 예약합니다. 1단계 · 동작 구조는 구성을 설정하고 타이밍을 설정하는 조밀한 디노이징을 수행하며, 출력은 정제된 잠재적이며 최종 프레임이 아닙니다.
05 · H3 3D 잠재적 업스케일#
H3 3D 학습된 잠재적 업스케일 (#13)은 1단계 잠재적에 MiniMax H3 Latent Upscaler를 적용하여 3D 잠재적 공간에서 폭과 높이를 직접 확대합니다. 디테일 재구성 전에 업스케일링이 이루어지기 때문에 시간적 일관성이 프레임 공간 업스케일러보다 잘 보존됩니다. 공식 3D fp16 체크포인트만 사용하고, 최종 해상도가 다르게 원하는 경우 여기서 스케일을 조정합니다. 노드는 새로운 차원을 자동으로 2단계에 전달합니다.
06 · 2단계 HQ 재구성 (필수)#
2단계 조건 설정 · AUTO (#14)는 프롬프트, 참조 및 업스케일된 차원을 재사용하여 더 큰 캔버스와의 지침을 맞춥니다. 2단계 화해 · 크기 및 오디오 (#15)는 비디오와 사운드가 동기화 상태를 유지하도록 차원과 오디오 정책을 잠급니다. 2단계 디테일 믹서 · 고정 5단계 (#16)는 Stage 1 동작을 존중하면서도 선명한 텍스처를 추가하는 결정적인 재구성 패스를 수행합니다. 2단계 · 5단계 HQ 재구성은 시드된 노이즈에서 최종 잠재적으로 디노이즈하고, 2단계 AV 디코드 (#20)는 이를 프레임과 생성된 오디오로 변환하여 출력합니다.
07 · 최종 출력#
CreateVideo는 디코딩된 프레임과 오디오를 선택한 프레임 속도로 비디오 스트림으로 패키징합니다. 생성 후 VRAM 정리는 렌더링 간 메모리를 해제합니다. BUNNY HQ · 최종 비디오 저장은 파일 이름 접두사, 형식 및 코덱으로 최종 파일을 작성합니다. 항상 2단계 디코드에서 저장하십시오; 1단계 미리보기는 최종이 아닙니다.
Comfyui MiniMax H3 Latent Upscaler 워크플로우의 주요 노드#
1단계 조건 설정 · AUTO(#7). 텍스트, 참조 및 모드 라우팅의 중앙 입력. 프롬프트를 조정하고, 필요할 때 참조 사용을 지배하는 모드를 조정하십시오. 명확한 이유가 없는 한 AUTO에 두고, 참조가 설명하는 이야기와 일치하는지 확인하십시오.1단계 듀얼 클록 · 비디오 12 / 오디오 3(#8). 동작 비트와 소닉 이벤트를 정렬하기 위해 비디오와 오디오에 별도의 샘플링 클록을 조직합니다. 타이밍을 조정해야 한다면 부드럽게 하며 두 클록이 목표 페이싱과 일관되도록 하십시오.H3 3D 학습된 잠재적 업스케일(#13). 공식 3D fp16 체크포인트를 사용하여 MiniMax H3 Latent Upscaler를 적용합니다. 대부분의 사용자가 조정해야 할 유일한 매개변수는 스케일 팩터입니다; 이를 증가시키면 잠재 공간에서 폭과 높이가 증가하고, 총 픽셀은 그 팩터의 제곱에 비례하여 증가합니다. 모델 카드의 검증된 체크포인트를 사용하여 손상된 잠재적을 피하십시오. Hugging Face2단계 화해 · 크기 및 오디오(#15). 재구성 전에 2단계 잠재적이 업스케일된 크기와 선택된 오디오 정책을 유지하도록 보장합니다. 오디오 설정을 실험할 때, 조정이 활성화되어 타이밍과 차원이 일관되도록 하십시오.2단계 디테일 믹서 · 고정 5단계(#16). 모션 논리를 다시 쓰지 않고 디테일을 추가하는 고해상도 재구성의 중심입니다. 결과가 과도하게 선명하거나 애니메이션에서 벗어날 경우, 먼저 2단계 LoRA 강도를 줄이고, 필요할 경우 믹서 균형을 미세 조정하십시오.2단계 AV 디코드(#20). 재구성된 잠재적을 프레임과 동기화된 오디오로 디코딩합니다. 항상 이 노드에서CreateVideo와Save Final Video로 출력을 라우팅하여 색 공간과 오디오가 올바르게 처리되도록 하십시오.
선택적 추가 기능#
- 텍스트 전용 생성을 위해 모든 참조 이미지 입력의 연결을 끊어 AUTO가 순수한 텍스트-비디오 경로를 선택하도록 합니다.
- 업스케일 변경 시, 렌더링 비용은 팩터의 제곱에 비례하여 확장되므로, MiniMax H3 Latent Upscaler 스케일이 설정된 후에만 1단계 기본 해상도를 올리는 것을 선호하십시오.
- 일관성을 개선하려면,
Seeded Noise에서 시드를 고정하고 대안을 탐색할 때 의도적으로 변경하십시오. - 2단계가 모션 비트를 변경하면, 샘플러나 믹서 설정을 만지기 전에 2단계 LoRA 가중치를 줄이십시오.
- SageAttention을 유일한 주의 패치로 유지하십시오; 안정성을 위해 추가 주의 백엔드를 쌓는 것을 피하십시오. GitHub
- 공식 MiniMax H3 Latent Upscaler 체크포인트를 사용하여 잘못된 텐서와 불일치 키를 방지하십시오. Hugging Face
감사의 말#
이 워크플로우는 다음 작업 및 리소스를 구현하고 기반으로 합니다. 워크플로우 소스에 대해 RunningHub.ai, Minimax H3 Latent Upscaler 모델에 대해 LBH-123-AI, MiniMax H3 커스텀 노드에 대해 T8mars의 기여와 유지보수에 대해 감사의 말씀을 드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서 및 저장소를 참조하십시오.
리소스#
- RunningHub.ai/Workflow source
- Docs / Release Notes: runninghub.ai post
- LBH-123-AI/Minimax_h3_latent_Upscaler
- GitHub: LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler
- Hugging Face: LBH-123-AI/Minimax_h3_latent_Upscaler
- T8mars/comfyui-minimax-h3-audio-T8
Note: 사용된 모델, 데이터셋 및 코드는 해당 작성자 및 유지보수자가 제공한 각 라이센스 및 조건에 따릅니다.


