VDN H3 MiniMax ComfyUI Text To Video#
VDN H3 ComfyUI Text To Video는 자연어 프롬프트를 짧고 시네마틱한 비디오로 변환하며, 오디오와 동기화됩니다. 이는 MiniMax H3 계열과 Video DeltaNet 하이브리드 어텐션, 8단계 샘플링을 결합하여 하나의 프롬프트에서 비디오와 오디오를 생성합니다. 스토리보드, 제품 클립, 시네마틱 판타지, 랠리 드라이빙, 갑옷 검술과 같은 스타일화된 장면에 적합합니다.
그래프에는 독립적으로 선택 가능한 두 개의 브랜치가 포함되어 있습니다. VDN-H3 브랜치는 Video DeltaNet 패치를 적용하며, 포함된 예제를 생성하는 데 사용되었습니다. FastVideo 브랜치는 출력 및 생성 시간을 VDN 경로와 비교할 수 있도록 제공됩니다. 두 브랜치 모두 선택한 프레임 속도로 오디오가 포함된 MP4를 렌더링합니다.
오픈 컴포넌트로 구축: MiniMax H3 GitHub 및 Hugging Face용 VDN, Saganaki22의 VDN-H3 ComfyUI 노드 GitHub, 및 기본 MiniMax H3 가중치와 VAE Hugging Face.
Comfyui VDN H3 ComfyUI Text To Video 워크플로우의 주요 모델#
- MiniMax-H3 확산 모델 (UNet). 노이즈를 일관된 시공간 비디오 및 오디오 잠재로 변환하는 디노이징 프로세스를 구동합니다. 가중치는 Hugging Face의 MiniMax H3 번들에 제공됩니다.
- Qwen3-VL 32B MiniMax-H3 텍스트 인코더. 프롬프트를 비디오 및 오디오 생성의 조건으로 변환하며, H3 계열에 맞게 튜닝되었습니다. Hugging Face의 MiniMax H3 릴리스에 포함되어 있습니다.
- MiniMax-H3 비디오 VAE. 비디오 잠재를 RGB 프레임으로 디코딩합니다. Hugging Face의 VAE 섹션에서 사용할 수 있습니다.
- MiniMax-H3 오디오 VAE. 오디오 잠재에서 파형 오디오를 재구성합니다. 또한 Hugging Face에서 제공됩니다.
- VDN-H3 패치 가중치. Video DeltaNet은 MiniMax H3에 하이브리드 어텐션을 적용합니다. 체크포인트는 Hugging Face에서 가져올 수 있습니다.
- FastVideo UNet 변형. 비교 브랜치는 Kijai/MiniMax-H3-experimental의
minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensors를 사용합니다.
Comfyui VDN H3 MiniMax ComfyUI Text To Video 워크플로우 사용 방법#
프롬프트, 해상도, 지속 시간 및 프레임 속도를 설정하여 시작하세요. 개별 실행을 위해 VDN-H3 브랜치 또는 FastVideo 브랜치를 선택하세요. Queue All은 활성화된 두 브랜치를 모두 실행하고 두 개의 MP4를 생성할 수 있습니다. 별도의 그래프 브랜치는 GPU의 동시 실행을 보장하지 않습니다. 두 브랜치는 모두 8단계 샘플링에 설정되어 있습니다.
사용자 입력#
(input:prompt) Text Prompt 패널을 사용하여 시각적 및 청각적 요소를 일반 언어로 설명하세요. 오디오의 경우, 특정 효과음이나 분위기를 요청하기 위해 마지막 줄에 Audio:로 시작하는 줄을 추가하세요. 예를 들어, "Audio: rhythmic hoofbeats, wind, distant roar." (input:Resolution) Megapixels를 사용하여 시각적 크기를 제어하고, ResolutionSelector에 공급하여 계산에 적합한 폭과 높이를 생성합니다. (input:Duration) Seconds 및 (input:FPS)를 설정하여 클립의 지속 시간과 부드러움을 정의하세요. 워크플로우는 지속 시간과 FPS를 유효한 프레임 수로 변환하고, H3의 내부와 잘 맞는 시퀀스 길이로 조용히 스냅합니다.
모델#
CLIPLoader는 조건 설정에 사용되는 MiniMax 튜닝 텍스트 인코더를 제공합니다. 두 개의 VAELoader 노드는 MiniMax-H3 비디오 VAE와 오디오 VAE를 가져와서 디코딩된 프레임과 사운드가 모델의 잠재 공간과 일치하도록 합니다. 이 로더들은 두 브랜치에서 공유되어 A/B 결과를 보장합니다.
조건 설정#
MiniMaxH3ImageToVideo (#219)는 프롬프트와 크기, 길이를 초기 비디오 및 오디오 잠재와 긍정적 조건과 함께 변환합니다. 특정 입장 또는 퇴장 포즈가 필요할 때 첫 번째 또는 마지막 프레임을 잠그기 위해 선택적 이미지 입력을 사용할 수 있습니다. 이 단계는 카메라 움직임, 주제 행동, 조명, Audio: 라인과 같은 내러티브 결정이 가장 중요하게 작용하는 곳입니다.
VDN-H3 패치#
VDN 브랜치는 ApplyVDNH3Advanced (#6126)를 사용하여 Video DeltaNet 업그레이드를 적용합니다. 선택한 하이브리드 어텐션 패치를 적용합니다. MiniMaxChunkFeedForward 및 ModelPatchTorchSettings는 메모리 및 실행 설정을 구성합니다. MiniMaxH3SigmaShift는 샘플링이 시작되기 전에 비디오 및 오디오에 대한 노이즈 일정을 조정합니다.
샘플링 (VDN-H3)#
VDN 샘플링은 RandomNoise (#6141)에서 시작하여 BasicGuider (#6134)와 함께 안내를 병합하고, KSamplerSelect (#6137)에서 솔버를 선택하고, BasicScheduler (#6136)에서 확산 단계를 압축된 수로 일정합니다. SamplerCustomAdvanced (#6135) 는 정련된 비디오 및 오디오 잠재를 생성하기 위해 전체 시퀀스에 걸쳐 디노이징을 수행합니다. 동일한 프롬프트로 새 변형을 탐색하려면 고정된 시드를 유지하거나 변경하세요.
디코딩 및 비디오 생성 (VDN-H3)#
VAEDecode (#6146)는 프레임을 재구성하고 VAEDecodeAudio (#6145)는 사운드트랙을 재구성합니다. VHS_VideoCombine (#6170)은 설정한 프레임 속도를 존중하고 미리보기 가능한 파일을 저장하여 프레임과 오디오를 MP4로 결합합니다. VDN 출력은 FastVideo 결과와 비교하기 쉽게 고유한 파일 이름 접두사로 저장됩니다.
FastVideo 비교 브랜치#
FastVideo 경로는 속도 조정된 MiniMax H3 UNet을 로드하고 샘플링 전에 가벼운 어텐션 패치를 적용합니다. 프롬프트, 크기, 프레임 수를 재사용하여 시간을 직접 비교할 수 있습니다. 샘플링은 VDN 브랜치의 구조를 반영하며 8단계로 설정되어 있습니다. 프레임과 오디오는 VHS_VideoCombine (#6104)을 사용하여 디코딩되고 결합되어 두 번째 MP4를 생성합니다. 이러한 출력물을 나란히 사용하여 어느 브랜치가 장면에 가장 적합한지 결정하세요.
Comfyui VDN H3 ComfyUI Text To Video 워크플로우의 주요 노드#
ApplyVDNH3Advanced(#6126). 선택한 VDN-H3 릴리스의 체크포인트를 사용하여 MiniMax H3에 Video DeltaNet을 활성화합니다. 일반적인 사용을 위해 하이브리드 어텐션 기본값을 유지하세요; VDN 체크포인트를 변경하거나 어텐션 백엔드를 변경하려면 조정하세요. 참조 구현: Saganaki22/ComfyUI-VDN-H3.MiniMaxH3ImageToVideo(#219). 텍스트 프롬프트, 계산된 폭과 높이, 도출된 프레임 수를 수용하는 스토리 및 타이밍의 중앙 제어 지점입니다. 오디오의 경우, 프롬프트에 단일Audio:라인을 추가하여 효과음 및 분위기를 유도하고, 명시적으로 요청하지 않는 한 음성을 피하세요.MiniMaxH3SigmaShift(#6131, #6007). 비디오 및 오디오 스트림의 시그마 일정을 재조정하며, 이는 저단계에서 떨림을 줄이고 디테일을 보존하는 데 도움을 줄 수 있습니다. 모델 변형을 변경하거나 움직임 불안정을 발견하면 소규모 조정을 고려하세요.VHS_VideoCombine(#6170, #6104). 설정한 프레임 속도 및 파일 이름 접두사로 디코딩된 프레임과 오디오를 MP4로 결합합니다. 유용한 옵션으로는 오디오 길이에 맞게 잘라내기와 원하는 H.264 픽셀 포맷 선택이 있습니다. 프로젝트 페이지: ComfyUI-VideoHelperSuite.
선택적 추가 기능#
- 프롬프트 팁: 주제, 행동, 카메라 움직임을 설정하는 단일 문장으로 시작한 다음, 외관 및 느낌을 추가하고 효과음을 위한 하나의
Audio:라인을 추가하세요. - 더 긴 클립의 경우, 메모리 사용을 유지하고 움직임을 안정화하기 위해 높은 해상도보다 적당한 메가픽셀을 선호하세요.
RandomNoise에서 시드를 고정하여 일관된 반복을 원할 때; 변형을 탐색하려면 변경하세요.- 출력 품질과 생성 시간을 평가하기 위해 자신의 장면에서 두 브랜치를 비교하세요.
- 메모리 한계에 도달하면 먼저 메가픽셀 또는 지속 시간을 줄이세요; 청크 피드 포워드는 이미 더 긴 시퀀스를 처리하는 데 도움이 됩니다.
감사의 말#
이 워크플로우는 다음 작품 및 리소스를 구현하고 확장합니다. 우리는 vdn-minimax-h3 모델, 가중치 및 리포지토리에 대해 OpenVDN, ComfyUI-VDN-H3 노드에 대해 Saganaki22, VDN-H3 워크플로우에 대해 Benji (AI Future Tech)의 기여와 유지보수에 감사드립니다. 권위 있는 세부 사항은 아래 링크된 원본 문서 및 리포지토리를 참조하세요.
리소스#
- OpenVDN/vdn-minimax-h3
- GitHub: OpenVDN/vdn-minimax-h3
- Hugging Face: OpenVDN/vdn-minimax-h3
- Saganaki22/ComfyUI-VDN-H3
- GitHub: Saganaki22/ComfyUI-VDN-H3
- Benji (AI Future Tech)/VDN-H3 Workflow
- Docs / Release Notes: AI Future Tech Patreon post
참고: 언급된 모델, 데이터 세트 및 코드의 사용은 각각의 저자 및 유지보수자가 제공하는 라이선스 및 조건에 따릅니다.

