MiniMax H3 ComfyUI Talking and Singing Dual Character 4단계 가속#
이 RunComfy-ready 워크플로우는 두 개의 초상화 스틸과 짧은 연설 또는 노래 트랙을 단일 립싱크 비디오로 변환하여 두 캐릭터가 장면을 공유합니다. 공식 Turbo LoRA와 함께 MiniMax H3 참조-to-비디오에 기반하여, 몇 단계의 생성으로 두 개의 정체성을 안정적으로 유지하고 입 모션을 소스 오디오에 고정합니다.
MiniMax H3 ComfyUI Talking and Singing Dual Character 4단계 가속은 듀엣, 두 인물의 대화 장면, 예고편, 또는 빠른 공연 미리보기에 이상적입니다. 두 개의 이미지를 가져오고 하나의 오디오 파일을 추가한 다음 짧은 프롬프트를 추가하고 크기를 선택하면 그래프가 원본 사운드 트랙을 유지한 mp4를 렌더링합니다.
Comfyui MiniMax H3 ComfyUI Talking and Singing Dual Character 4단계 가속 워크플로우의 주요 모델들#
- Comfy-Org의 MiniMax-H3 참조-to-비디오 백본 — 참조와 텍스트를 오디오-비주얼 잠재 변수로 매핑하여 비디오 합성을 위한 생성 모델. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — 비디오 잠재 변수를 인코딩하고 디코딩하여 프레임을 효율적으로 노이즈 제거하고 충실하게 재구성합니다. 모델 팩에 포함됨. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — 트랙에서 입 모션과 타이밍을 학습할 수 있도록 운전 오디오를 잠재 공간에 표현합니다. 모델 팩에 포함됨. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B 텍스트 인코더 (H3용 AWQ/NVFP 변형) — 두 캐릭터 구성의 장면, 스타일, 촬영 의도를 설정하기 위해 프롬프트를 해석합니다. 모델 팩에 포함됨. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4단계 LoRA — 샘플링을 가속화하여 신원과 립싱크를 보존하면서 최소한의 노이즈 제거 단계로 렌더링할 수 있습니다. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Comfyui MiniMax H3 ComfyUI Talking and Singing Dual Character 4단계 가속 사용 방법#
이 그래프는 왼쪽에서 오른쪽으로 흐릅니다: 두 캐릭터 스틸과 하나의 오디오 클립을 로드하고, 프롬프트와 크기를 설정한 다음, 핵심 H3 경로가 참조와 오디오를 AV 잠재 변수로 융합합니다. 짧은 오디오 잠금 단계가 원본 사운드 트랙을 보존하면서 입 모션을 구동하고, Turbo LoRA가 활성화된 샘플러가 최종 비디오 조립 전에 몇 단계의 노이즈 제거를 수행합니다.
- 이미지 업로드 (캐릭터 A)
LoadImage(#227)에 캐릭터 A의 명확하고 정면을 향한 스틸을 드롭하세요. 캐릭터 B와 유사한 머리 크기와 조명을 선호하여 안정적인 공동 존재를 유지합니다. 배경은 단순할 수 있으며, 신원과 포즈가 우선입니다. 노드는 H3 참조 스택에 공급되어 모델이 공유 장면에서 첫 번째 화자가 누구인지 학습할 수 있도록 합니다.
- 이미지 업로드 (캐릭터 B)
LoadImage(#137)에 캐릭터 B를 제공하세요. 프레이밍, 방향, 표현을 캐릭터 A와 대략적으로 비교하여 샷 간의 이동을 줄입니다. 이 두 번째 참조는 H3가 두 사람이 서로 대화하거나 노래하는 동안 일관성을 유지하는 두 샷을 합성할 수 있게 합니다.
- 오디오 업로드
LoadAudio(#171)에 대화나 보컬을 추가하세요.AudioCrop(#177)을 사용하여 시작 및 종료 시간을 설정하여 클립 길이가 원하는 세그먼트와 일치하도록 합니다. 깨끗하고 중심 잡힌 오디오는 입의 발음을 개선하고 타이밍 지터를 줄입니다.
- 프롬프트
Input Text (Prompt)(#138)에서 샷을 설명하세요. 짧고 영화적인 문구가 잘 작동하며, 예를 들어 두 캐릭터의 카메라 거리, 배경, 분위기를 설명합니다. 프롬프트는 스틸과 트랙의 타이밍에서 신원 지침을 대체하지 않고 레이아웃과 스타일을 조정합니다.
- 해상도 선택기 (크기)
Resolution Selector (Size)(#115)에서 비율과 대상 크기를 선택하세요. 선택기는 디테일과 속도를 균형 있게 유지하기 위해 모델 친화적인 배수로 정렬된 너비와 높이를 출력합니다. 내장된 크기 노트는 GPU 예산에 맞는 메가픽셀 계층을 선택할 수 있도록 16:9 프리셋을 제공합니다.
- 결과
- 프레임이 디코딩되고 원본 오디오와
VHS_VideoCombine(#142)에서 혼합되어 mp4를 생성합니다. 렌더링이 약간 길거나 짧게 실행되면 이 단계에서 제공된 토글을 사용하여 오디오 길이에 맞춰 자를 수 있습니다. 파일 이름과 형식은 빠른 반복을 위해 사전 구성되어 있습니다.
- 프레임이 디코딩되고 원본 오디오와
- 핵심 (수정하지 마세요)
- 이 보호된 영역 내에서
MiniMaxH3ReferenceToVideo(#136)는 두 참조 이미지, 프롬프트, 잘린 오디오를 공동 AV 잠재 변수와 긍정적 조건화로 융합합니다.VRGDG_MiniMaxH3AudioDrive(#172)는 소스 오디오를 고정하여 립싱크가 트랙을 따르도록 하고 사운드트랙은 변경되지 않은 채로 전달됩니다. UNet은 메모리 효율성을 위해 패치되었으며,LoraLoaderModelOnly(#234)는 Turbo 4단계 LoRA를 적용한 후 샘플러가 노이즈 제거하고VAEDecode가 프레임을 재구성합니다. 이 내부는 안정성과 속도를 위해 조정되어 있어 일반적으로 조정할 필요가 없습니다.
- 이 보호된 영역 내에서
Comfyui MiniMax H3 ComfyUI Talking and Singing Dual Character 4단계 가속 워크플로우의 주요 노드들#
MiniMaxH3ReferenceToVideo(#136)- 그래프의 중심으로, 두 캐릭터 스틸, 프롬프트, 너비, 높이, 자동 계산된 클립 길이를 수용합니다. 잘린 오디오도 참조로 받아들여져 음소 타이밍과 비세임 모양이 사운드트랙에 맞춰 정렬됩니다. 더 엄격한 제어가 필요한 경우,
prompt,width,height를 직접 조정하거나 특별한 타이밍을 위해length를 재정의할 수 있습니다.
- 그래프의 중심으로, 두 캐릭터 스틸, 프롬프트, 너비, 높이, 자동 계산된 클립 길이를 수용합니다. 잘린 오디오도 참조로 받아들여져 음소 타이밍과 비세임 모양이 사운드트랙에 맞춰 정렬됩니다. 더 엄격한 제어가 필요한 경우,
VRGDG_MiniMaxH3AudioDrive(#172)- 제공된 소스 오디오에 입 모션을 잠금하여 최종 비디오가 같은 오디오 트랙을 사용하도록 합니다. 정확한 가사나 대화 타이밍을 원할 때 사용하세요. 깨끗한 보컬이나 대화를 피드하세요.
LoraLoaderModelOnly(#234)- MiniMax-H3 Turbo 4단계 LoRA를 로드하여 샘플러가 매우 적은 단계로 수렴할 수 있도록 합니다. 더 느리지만 보수적인 노이즈 제거를 선호하는 경우, LoRA의 영향을 줄일 수 있습니다. 최대 속도를 위해 기본 강도를 유지하세요. 모델 참조: MiniMax-H3 Turbo LoRA.
SamplerCustomAdvanced(#125)- 업스트림에서 선택된 스케줄러 및 샘플러를 사용하여 실제 노이즈 제거를 수행합니다. Turbo LoRA가 활성화되면 최소 단계로 빠르게 렌더링할 수 있으며, 모션 불안정성을 볼 때만 단계를 늘리세요.
RandomNoise(#129)에서 시드 제어가 이루어져 재현 가능한 테이크를 제공합니다.
- 업스트림에서 선택된 스케줄러 및 샘플러를 사용하여 실제 노이즈 제거를 수행합니다. Turbo LoRA가 활성화되면 최소 단계로 빠르게 렌더링할 수 있으며, 모션 불안정성을 볼 때만 단계를 늘리세요.
Resolution Selector (Size)(#115)- 모델 정렬된 너비와 높이를 출력하여 배수나 비율 수학을 조정할 필요가 없습니다. 프리뷰, 중간, 최종 크기 간에 점프하여 구성을 일관되게 유지하세요. 더 큰 크기는 정체성 세부 사항을 증가시키지만 더 많은 VRAM과 시간이 필요합니다.
AudioCrop(#177)- 애니메이션하려는 정확한 세그먼트로 입력 오디오를 자릅니다. 이를 사용하여 침묵을 잘라내거나 구절이나 대화 비트를 분리하세요. 깨끗한 시작 및 종료 지점은 입의 열림/닫힘 타이밍에 도움이 됩니다.
VHS_VideoCombine(#142)- 디코딩된 프레임과 패스스루 오디오를 공유 가능한 mp4로 조립합니다. 내장된 옵션을 사용하여 사운드트랙에 맞춰 지속 시간을 정렬하고 파일 이름 규칙을 설정하세요. 이는 MiniMax H3 ComfyUI Talking and Singing Dual Character 4단계 가속 출력의 최종 전달 단계입니다.
선택적 추가 기능#
- 두 이미지에서 주제 크기 및 얼굴 각도를 맞춰 신원 이동을 최소화하세요.
- 프롬프트는 간결하고 시각적으로 유지하세요: 카메라 거리, 설정, 분위기, 조명 큐.
- 반복 시 잡음 시드를 사용하여 테이크 간의 변경 사항을 신뢰성 있게 A/B 테스트하세요.
- 클립이 약간 초과하는 경우, 결합 단계에서 자르기를 활성화하여 프레임 정확한 동기화를 제공합니다.
- 중간 수준 해상도에서 시작한 후 차단 및 타이밍이 올바른지 확인하면 크기를 늘리세요.
감사의 글#
이 워크플로우는 다음 작품과 리소스를 구현하고 확장합니다. MiniMax H3, Comfy.org의 ComfyUI MiniMax H3 튜토리얼, MiniMax-H3 모델 가중치와 MiniMax-H3 Turbo LoRA에 대한 기여 및 유지 관리에 대해 MiniMax Research, Comfy-Org 및 larryvrh에 감사드립니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서 및 저장소를 참조하십시오.
리소스#
- MiniMax Research/MiniMax H3 공식 발표
- Docs / Release Notes: MiniMax H3 공식 발표
- Comfy.org/MiniMax H3 튜토리얼
- GitHub: Comfy-Org/docs
- Docs / Release Notes: Comfy.org MiniMax H3 튜토리얼
- Comfy-Org/MiniMax-H3 모델 가중치
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
참고: 참조된 모델, 데이터세트 및 코드는 각 저자 및 유지 관리자가 제공하는 해당 라이선스 및 조건에 따라 사용해야 합니다.

