MiniMax H3 액션 장면: 네이티브 오디오가 포함된 참조 안내 액션 비디오 생성기#
MiniMax H3 액션 장면은 동기화된 네이티브 오디오가 포함된 밀도 높은 참조 안내 액션 비디오를 생성하기 위한 ComfyUI 워크플로우입니다. 두 개의 캐릭터 이미지, 하나의 장면 참조, 구조화된 프롬프트를 제공합니다. 워크플로우는 MiniMax H3 Turbo로 동작을 설정한 후, LMS 및 Combat LoRAs로 구성과 전투 가독성을 정제하면서 원본 오디오를 보존합니다. 출력물에는 빠른 첫 번째 "기본" 비디오와 높은 품질의 "정제된" 비디오가 포함됩니다.
이 Comfyui MiniMax H3 액션 장면 워크플로우는 사전 시각화, 스턴트 및 전투 디자인, 게임 및 VFX 시네마틱, 짧은 소셜 클립을 위해 설계되었습니다. 테스트된 예시에는 성 검 연습, 복싱 체육관 미트 작업, 우주선 곤봉 훈련이 포함됩니다. 프롬프트에서 캐릭터 신원과 안무를 명확히 하고, 빠른 손이나 무기 접촉을 검토하여 가능한 아티팩트를 확인하세요.
Comfyui MiniMax H3 액션 장면 워크플로우의 주요 모델#
- Comfy‑Org MiniMax H3 핵심 제품군. 텍스트 인코더와 오디오-비디오 잠재를 구축, 분리 및 디코딩하는 데 사용된 비디오 및 오디오 VAE를 제공합니다. 공식 컬렉션에서 모델 및 LoRAs를 참조하세요. MiniMax‑H3 models
- Minimax‑h3 Singularity (UNet). 참조와 프롬프트를 오디오-비디오 잠재로 융합하여 액션 장면을 생성하는 기본 참조-비디오 생성기로 사용됩니다. Minimax‑h3_Singularity
- MiniMax‑H3 Turbo LoRA. 첫 번째 패스를 가속화하여 동작 비트를 빠르게 반복할 수 있도록 합니다. 공식 MiniMax H3 컬렉션에 포함되어 있습니다. MiniMax‑H3 LoRAs
- MiniMax‑H3 LMS LoRA. 실사 스타일 출력에 적합한 레이아웃, 재료, 구조적 선명도를 추가합니다; 두 번째 패스에서 사용됩니다. LMS LoRA r64
- H3 Combat LoRA. 액션 시나리오에서 전투 실루엣, 칼 접촉 및 지상 발놀림의 명확성을 향상시킵니다. MiniMax H3 컬렉션에 포함되어 있습니다. MiniMax‑H3 models
- H3 Latent Upscaler LMS. 패스 간에 비디오 잠재를 확대하면서 동작 연속성을 유지하는 시간적 3D 업스케일러입니다. Comfyui Minimax H3 Latent Upscaler
Comfyui MiniMax H3 액션 장면 워크플로우 사용 방법#
파이프라인은 두 개의 협조된 패스로 실행됩니다. 패스 1은 속도를 위해 Turbo로 동작과 타이밍을 설정합니다. 그런 다음 비디오 잠재는 LMS 및 Combat LoRAs로 정제되기 전에 업스케일됩니다. 네이티브 오디오는 유지됩니다. 빠른 "기본" 미리보기와 세련된 "정제된" 내보내기를 받습니다.
설정#
설정 그룹을 사용하여 종횡비, 작업 해상도, 클립 지속 시간 및 프레임 속도를 선택합니다. 지속 시간 제어는 샘플러의 청크와 일치하는 프레임 수로 초를 변환하여 안정성을 높입니다. 빠른 미리보기를 위해 낮은 값을 시작한 후 프레임과 비트가 적절해 보이면 스케일을 올리세요. 높은 해상도와 긴 클립은 VRAM과 렌더링 시간을 증가시킵니다.
참조#
세 개의 참조를 로드하세요: 캐릭터당 하나의 이미지와 환경을 정의하는 하나의 이미지. 캐릭터 이미지는 배경이 아닌 신원 및 의상 가이드로 작용하므로 읽기 쉬운 얼굴과 주요 의상 요소가 포함된 깨끗한 초상화를 선택하세요. 장면 참조는 조명, 팔레트, 건축을 설정합니다; 의도한 카메라 높이에 일치하는 뷰를 선택하세요. 다양한 매치업 및 위치를 탐색하려면 참조를 자유롭게 교환할 수 있습니다.
조건#
MiniMaxH3ReferenceToVideo (#56) 노드는 구조화된 프롬프트와 참조 및 MiniMax H3 인코더를 융합하여 공동 오디오-비디오 잠재와 긍정적 조건부를 생성합니다. 프롬프트는 subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music와 같은 레이블이 있는 섹션으로 나누어 최상의 결과를 얻습니다. 전투자 수, 무기, 카메라 이동 및 깨끗한 접촉의 정확한 수에 대해 명확히 하세요. 추가 캐릭터, 순간 이동, 초인적 움직임 또는 효과는 피하세요.
LoRAs#
LoRAs는 두 단계로 적용됩니다. 첫 번째 패스에서 Turbo가 주입되어 신원 보존을 희생하지 않고 동작 탐색을 가속화합니다. LMS LoRA는 AdaLN 호환성 수정을 통해 흐르고, Combat이 적용되어 정교한 실루엣과 스트라이크-막기 교환을 강조합니다. LoRA 강도를 조정하여 장르에 맞는 사실성과 스타일화를 균형 있게 유지할 수 있습니다.
패치#
이 그룹은 성능 및 스케줄 형성을 구성합니다. PathchSageAttentionKJ (#199)는 메모리 및 속도를 최적화하여 고동작 장면이 반응성을 유지하도록 합니다. MiniMaxH3SigmaShift (#297)는 비디오 및 오디오 시그마 스케줄을 조정하여 동작에 비례한 입술 및 폴리 타이밍을 개선합니다. 타이밍 드리프트 또는 작은 신원 불안정성을 볼 때 사용하세요.
1차 샘플링#
첫 번째 패스는 잡음을 초기화하고, 간결한 스케줄을 설정하며, 긍정적 조건에 의해 안내된 SamplerCustomAdvanced (#238)로 샘플링합니다. 출력은 기본 잠재로 저장되며 빠른 검토를 위한 네이티브 오디오와 함께 빠른 미리보기 비디오로 디코딩될 수 있습니다. 이 패스에서는 블로킹, 카메라 이동, 타격의 리듬을 판단합니다. 비트 맵이 잘못되었으면 이 단계에서 프롬프트와 참조를 수정하세요.
2차 샘플링 + 정제기#
정제 전에 오디오와 비디오는 첫 번째 패스에서 분리되고, 비디오 잠재는 MinimaxH3LatentUpscaler3D (#124)로 확대되고, 오디오 잠재는 그대로 유지됩니다. 정제기는 LMS 및 Combat LoRAs를 사용하여 낮은 잡음 시그마로 샘플링하여 재료 세부, 가장자리 충실도 및 전투 가독성을 추가합니다. 마지막으로 이미지와 보존된 오디오가 디코딩되어 정제된 내보내기로 결합됩니다. 기본 패스와 비교하여 더 선명한 가장자리, 더 깨끗한 손과 칼날, 더 안정된 신원을 기대하세요.
Comfyui MiniMax H3 액션 장면 워크플로우의 주요 노드#
MiniMaxH3ReferenceToVideo (#56)#
구조화된 프롬프트와 참조 이미지를 사용하여 MiniMax H3 텍스트 인코더와 VAE를 통해 동기화된 오디오-비디오 잠재를 구축합니다. prompt, width, height, length를 조정하여 콘텐츠, 프레이밍 및 지속 시간을 제어하세요. 최상의 결과를 위해 주제 정의 및 장면 제약을 명확히 유지하세요. 참조: Comfy‑Org MiniMax‑H3.
MinimaxH3LatentUpscaler3D (#124)#
정제 전 패스 간에 비디오 잠재를 확대하는 시간적으로 일관된 3D 잠재 업스케일러입니다. mode.scale을 적절히 증가시켜 동작을 불안정하게 하지 않고 세부사항을 얻으세요. 패스-1 타이밍이 마음에 들지만 더 선명한 가장자리와 텍스처를 원할 때 유용합니다. 참조: Comfyui Minimax H3 Latent Upscaler.
MiniMaxH3SigmaShift (#297)#
MiniMax H3에서 사용되는 오디오 및 비디오 시그마 스케줄을 조정하여 동작, 입술 신호 및 폴리가 정렬되도록 합니다. shift_video 및 shift_audio를 조정하여 대화 또는 충격의 타이밍 드리프트를 줄일 수 있습니다. 컷-인 또는 컷-아웃에서 비동기화가 발생하면 작은 오프셋을 유지하세요. 참조: MiniMax‑H3 collection.
VHS_VideoCombine (#264)#
디코딩된 프레임과 오디오를 최종 MP4로 결합하여 선택한 프레임 속도 및 품질 설정을 사용합니다. 메타데이터 저장을 활성화하여 내보내기에서 출처 및 워크플로우 세부 정보를 유지합니다. 정제된 비디오가 보존된 오디오를 초과할 때 trim_to_audio를 사용하세요. 참조: ComfyUI‑VideoHelperSuite.
PathchSageAttentionKJ (#199)#
고세부 장면 및 더 큰 해상도를 위한 처리량 및 안정성을 개선할 수 있는 주의 최적화입니다. 더 긴 촬영 또는 복잡한 환경을 위해 활성화 상태를 유지하세요. 작은 클립에서 성능 퇴보가 발생하면 자동 모드를 시도하세요. 참조: ComfyUI‑KJNodes.
선택적 추가 기능#
- 프롬프트 패턴. 제공된 섹션 형식을 사용하고 액션을 위한 비트 맵을 작성하세요. 전투자 및 무기의 정확한 수, 카메라 이동, 읽기 가능한 접촉의 수 및 타이밍을 지정하세요.
- 참조 큐레이션. 명확한 얼굴과 의상이 있는 신원 사진을 선택하고, 의도한 관점과 조명에 맞는 위치 이미지를 선택하세요. 캐릭터 참조에서 바쁜 배경을 피하여 충돌을 줄이세요.
- 검토 패스. 기본 비디오를 보고 블로킹과 타이밍을 검증한 후 정제하세요. 접촉이 흐릿해 보이면 프롬프트에서 명확성을 높이고 손이나 칼날의 속도를 줄이세요.
- 일반적인 문제 및 수정. 빠른 손이나 무기 접촉은 작은 왜곡을 일으킬 수 있습니다; 충돌 주위의 안무를 단순화하고, 교환을 단축하거나, 카메라에서 거리를 늘려 모델이 순간을 깨끗하게 렌더링할 수 있도록 하세요.
- 전달물. 워크플로우는 빠른 기본 미리보기와 정제된 내보내기를 작성하여 동작과 최종 모양을 비교할 수 있습니다. 신원, 환경, 비트가 목표를 충족하면 정제된 클립을 공유에 사용하세요.
MiniMax H3 액션 장면을 사용하면 두 개의 캐릭터 이미지, 장면 참조, 정밀한 브리핑을 통해 편집, 예비 시각화 또는 출판을 위한 네이티브 오디오가 동기화된 근거 있는 참조 충실한 액션 클립을 만들 수 있습니다.
감사의 말#
이 워크플로우는 다음 작품 및 리소스를 구현하고 구축합니다. 우리는 AI Video MiniMax H3 ComfyUI 워크플로우 지침을 제공한 Innovate Futures @ Benji, Minimax-h3_Singularity를 제공한 WarmBloodAban, MiniMax-H3 기본 모델 및 LMS LoRA를 제공한 Comfy-Org 및 RunningHubAI의 기여 및 유지보수에 감사를 표합니다. 권위 있는 세부 사항은 아래에 링크된 원본 문서 및 리포지토리를 참조하세요.
리소스#
- Innovate Futures @ Benji/AI Video MiniMax H3 (워크플로우 소스)
- Docs / Release Notes: AI Video Minimax H3 Action Scenes Update — New Sampling Settings in ComfyUI
- WarmBloodAban/Minimax-h3_Singularity
- Hugging Face: WarmBloodAban/Minimax-h3_Singularity
- Comfy-Org/MiniMax-H3
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- RunningHubAI/rh-minimax-h3-lms-v1.0-r64-lora
- Hugging Face: RunningHubAI/rh-minimax-h3-lms-v1.0-r64-lora
Note: Use of the referenced models, datasets, and code is subject to the respective licenses and terms provided by their authors and maintainers.

