ComfyUI>워크플로우>ComfyUI MiniMax H3 | 현실감 있는 말하는 아바타

ComfyUI MiniMax H3 | 현실감 있는 말하는 아바타

Workflow Name: RunComfy/ComfyUI-MiniMax-H3
Workflow ID: 0000...1481
정면 초상화를 말하는 아바타로 변환하세요. 짧은 음성 샘플을 추가하여 음성을 복제하세요. 동기화된 입술과 공동 생성된 오디오를 얻습니다. 아이덴티티와 배경은 안정적으로 유지됩니다. QwenVL이 이미지를 제어합니다. 데모, 발표자, 디지털 대변인을 더 빠르게 만드세요.

ComfyUI MiniMax H3 Talking Digital Human Workflow

ComfyUI MiniMax H3 | Voice-Cloned Talking Avatars
이 워크플로우를 실행하고 싶으신가요?
  • 완전히 작동 가능한 워크플로우
  • 누락된 노드 또는 모델 없음
  • 수동 설정 불필요
  • 멋진 시각 효과 제공

ComfyUI MiniMax H3 Talking Digital Human Examples

ComfyUI MiniMax H3 말하는 디지털 인간: 초상화와 음성을 립 싱크 아바타 비디오로#

이 워크플로우는 단일 정면 초상화와 짧은 음성 참조를 사용하여 RunComfy에서 고품질 말하는 머리 클립을 생성합니다. MiniMax H3 참조-비디오-오디오와 QwenVL 이미지 그라운딩을 기반으로 구축되어 아이덴티티와 배경을 유지하면서 샘플에서 말하는 음성을 생성합니다. ComfyUI MiniMax H3 말하는 디지털 인간은 제품 설명자, 발표자 아바타, 소셜 게시물, 짧은 대변인 비디오에 이상적입니다. 별도의 TTS나 립 싱크 스택 없이도 가능합니다.

이미지 하나와 음성 클립 하나를 제공합니다. 워크플로우는 얼굴과 장면에 대한 간결한 설명을 추론하고, MiniMax H3를 그 가이드로 조정하여 비디오 프레임과 일치하는 오디오를 공동으로 생성합니다. 결과는 다운로드 및 공유할 수 있는 단일 비디오 파일로 렌더링됩니다.

Comfyui ComfyUI MiniMax H3 말하는 디지털 인간 워크플로우의 주요 모델#

  • MiniMax H3 참조-비디오-오디오 확산 모델. 초상화와 선택적 오디오를 참조로 사용하여 동기화된 말하는 머리를 생성하는 핵심 생성기입니다. Comfy-Org에 의해 호스팅되어 ComfyUI에서 쉽게 사용할 수 있습니다. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax H3 비디오 VAE. MiniMax H3가 사용하는 공유 잠재 공간의 비디오 부분을 인코딩하고 디코딩하여 아이덴티티와 배경을 안정적으로 유지합니다. 동일한 모델 패키지로 배포됩니다. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax H3 오디오 VAE. 말하는 음성을 입술 움직임과 동기화하여 생성하기 위해 공유 잠재 공간의 오디오 부분을 인코딩하고 디코딩합니다. 모델 패키지에서도 제공됩니다. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 4B Instruct. 업로드된 초상화의 시각적 세부사항에 프롬프트를 기반으로 하는 비전-언어 모델로, 아이덴티티 유지 및 장면 일관성을 개선합니다. Hugging Face: Qwen/Qwen3-VL-4B-Instruct

Comfyui ComfyUI MiniMax H3 말하는 디지털 인간 워크플로우 사용 방법#

이 워크플로우는 네 가지 영역으로 구성되어 있습니다: 업로드 및 편집 섹션, 지속 시간 도우미, MiniMax H3 생성 코어, 출력 단계. 왼쪽에서 오른쪽으로 작업하여 미디어 입력을 시작하고, 그런 다음 프롬프트 가이드를 추가하고, 생성 실행 및 비디오 저장을 수행합니다.

업로드 / 편집 영역: 보통 여기서만 변경하십시오; 나머지는 기본값으로 두십시오#

LoadImage (#137)를 사용하여 단일 정면 캐릭터 초상화를 업로드하십시오. 자연스러운 립 모션을 위해 눈과 입이 보이는 정면 또는 거의 정면 프레이밍이 가장 좋습니다. LoadAudio (#141)를 사용하여 모방하고자 하는 음색의 깨끗한 음성 샘플을 업로드하십시오; 배경 소음이 거의 없는 몇 초간의 대화일 수 있습니다. 필요한 경우 AudioCrop (#142)를 사용하여 말하는 세그먼트의 시작과 끝을 설정하여 음성 샘플을 자르십시오. Prompt (#138)에 스타일 또는 콘텐츠 가이드를 추가하십시오; 워크플로우는 더 나은 일관성을 위해 자동 이미지 그라운딩 세부사항을 추가할 것입니다.

비디오 지속 시간 (초):#

지속 시간 그룹 상단의 숫자 제어를 사용하여 목표 지속 시간을 설정하십시오. 도우미 ComfyMathExpression (#131)가 모델에 유효한 프레임 수로 초를 변환하고 샘플러 요구사항에 맞게 정렬합니다. 이는 타이밍을 안정적으로 유지하고 중간 음소가 잘리지 않도록 합니다. 나중에 지속 시간을 변경하면 최종 음성과 립 모션이 일치하도록 오디오 트림을 업데이트하십시오.

MiniMax-H3 오픈 소스 - 이미지 말하는 디지털 인간#

이것은 MiniMaxH3ReferenceToVideo (#136)를 중심으로 구축된 핵심 생성 경로입니다. 노드는 참조 이미지로서 당신의 초상화와 참조 오디오로서 당신의 자른 음성 클립을 받으며, 선택기에서 너비, 높이, 길이를 받습니다. QwenVL 기반 초상화 설명이 당신의 작성 프롬프트와 결합되어 모델이 시각적 그라운딩과 지시 사항을 모두 받습니다. 모델은 비디오와 오디오를 포함한 단일 잠재를 방출하며, 이는 샘플러 스택에 의해 사용되는 조건도 포함되어 있어 별도의 립 싱크 단계 없이도 립 싱크가 강력합니다.

QwenVL로 프롬프트 그라운딩#

AILab_QwenVL (#152)는 업로드된 초상화를 분석하고 간결하고 사실적인 설명을 반환합니다. 워크플로우는 그 설명을 JoinStrings (#150, #148, #144)를 통해 당신의 지시 텍스트와 연결하여 모델에게 배경을 변경하지 않고 당신의 오디오를 말하는 음성으로 사용할 것을 지시하는 최종 프롬프트를 생성합니다. 이 자동 그라운딩은 아이덴티티와 배경 안정성을 눈에 띄게 강화합니다. 당신의 작성 프롬프트를 짧게 유지하고 그라운딩이 정확한 얼굴 및 장면 세부사항을 채우도록 하십시오.

해상도 / 비디오 화면 비율#

ResolutionSelector (#115)를 사용하여 화면 비율과 목표 해상도를 선택하십시오. 이를 통해 모델 및 GPU에 친화적인 너비와 높이를 출력하며, 핵심 노드에서 직접 사용합니다. 초상화 아바타의 경우, 높은 화면 비율은 주제를 더 많이 유지하면서 자연스러운 머리 움직임을 위한 공간을 남깁니다. 테스트 후 화면 비율을 조정하면 입력 초상화의 동일한 프레이밍을 유지하여 일관된 결과를 얻으십시오.

생성된 비디오 출력#

샘플러 경로는 공동 잠재를 디노이즈하고, VAEDecode (#122)는 이를 프레임으로 변환하며, VAEDecodeAudio (#121)는 이를 파형으로 변환합니다. CreateVideo (#130)는 프레임과 오디오를 선택한 프레임 속도로 단일 클립으로 병합하며, SaveVideo (#92)는 파일을 작성합니다. 저장된 결과는 동일한 생성 실행에서 나온 그림과 동기화된 음성을 포함합니다. 다운로드하고 검토하십시오; 타이밍이 맞지 않으면 오디오 트림이나 지속 시간을 조정하고 다시 실행하십시오.

Comfyui ComfyUI MiniMax H3 말하는 디지털 인간 워크플로우의 주요 노드#

MiniMaxH3ReferenceToVideo (#136)#

참조 초상화와 음성 샘플을 수용하여 비디오와 오디오를 공동 생성하는 파이프라인의 핵심입니다. 주요 제어는 콘텐츠 및 스타일에 대한 prompt, 프레이밍을 위한 widthheight, 프레임 단위의 지속 시간을 위한 length입니다. 첫 번째 참조 이미지로 단일 선명한 초상화를 사용하고 ref_image_size를 일치시켜 얼굴 비율이 올바르게 전송되도록 하십시오. 드리프트나 배경 변경이 보이면 배경을 명시적으로 유지하도록 지시 텍스트를 강화하십시오.

ResolutionSelector (#115)#

화면 비율과 전체 픽셀 수를 설정한 다음 모델에 친화적인 배수에 맞춰 너비와 높이를 방출합니다. 리샘플링 아티팩트를 줄이기 위해 초상화 자르기와 일치하는 화면 비율을 선택하십시오. 총 해상도를 증가시키면 세부사항이 향상될 수 있지만 VRAM과 시간도 증가합니다; 더 작은 설정에서 테스트한 후에 확장하십시오. 일관된 아이덴티티를 위해 실행 간 프레이밍을 일관되게 유지하십시오.

AudioCrop (#142)#

업로드된 참조 음성을 아바타가 말하고자 하는 세그먼트로 자릅니다. 시작과 끝을 말하는 부분에 설정하고, 자연스러운 시작과 끝을 위해 끝에 약간의 침묵 여백을 남겨두십시오. 다듬어진 오디오 길이를 목표 비디오 지속 시간에 맞추면 생성기가 음소를 입 모양에 맞출 수 있도록 도와줍니다. 파열음이나 치찰음이 잘못 보이면 더 깨끗한 녹음이나 다듬어진 범위를 줄여보십시오.

AILab_QwenVL (#152)#

이미지에 기반한 설명을 생성하여 자동으로 프롬프트에 추가합니다. 이는 얼굴, 머리카락, 의복 및 배경에 대한 구체적인 세부사항을 추가하여 모델이 아이덴티티와 장면을 보존하는 데 도움이 됩니다. 그라운딩 설명이 스타일을 과도하게 제한하면, 당신의 작성 프롬프트를 최소화하고 중립적으로 유지하여 그라운딩이 자신의 역할을 할 수 있도록 하십시오. 다중 캐릭터 이미지의 경우, 설명이 단일 주제에 집중하도록 더 좁은 자르기를 업로드하십시오.

CreateVideo (#130)#

디코딩된 프레임과 오디오를 단일 재생 가능한 파일로 결합합니다. 다운스트림 타임라인에 맞추려면 fps를 변경할 수 있지만, 이전의 지속 시간-프레임 변환과 일관되게 유지하십시오. 특정 플랫폼에서 버벅임이 보이면 해당 플랫폼에 맞는 일반적인 프레임 속도로 재출력하십시오. bit_depth 제어는 웹 전송을 위해 기본값으로 유지할 수 있습니다.

ComfyMathExpression (#131)#

초 단위의 지속 시간을 생성기용 유효한 프레임 수로 변환하고 샘플러의 스트라이드에 맞춥니다. 이는 타이밍 드리프트를 일으킬 수 있는 부분 단계를 방지합니다. 프레임 속도를 다운스트림에서 변경하면, 지속 시간을 다시 방문하여 입 모양이 음절에 맞도록 유지하십시오. 이 노드를 전체 실행의 타이밍 소스로 간주하십시오.

선택적 추가 항목#

  • 가장 자연스러운 발음을 위해 눈과 입이 가려지지 않고 균일하게 조명된 깨끗한 초상화를 사용하십시오.
  • 조용한 방에서 5~10초의 명확한 음성을 녹음하십시오; 참조 클립에서 음악이나 심한 압축을 피하십시오.
  • 재현 가능한 결과를 위해, RandomNoise (#129)에서 RandomNoise 시드를 고정하고 실행 간 무작위화를 피하십시오.
  • 캡션이 필요하면, 모델이 얼굴과 음성에 집중할 수 있도록 프롬프트에 굽지 않고 사후에 추가하십시오.
  • 실제 사람을 위한 ComfyUI MiniMax H3 말하는 디지털 인간을 만들 때 초상 및 음성 권리를 존중하십시오.

감사 인사#

이 워크플로우는 다음 작품과 자원을 구현하고 구축합니다. 우리는 MiniMax의 MiniMax H3 모델, Comfy-Org의 MiniMax-H3 모델 가중치, 그리고 Comfy.org의 MiniMax H3 튜토리얼의 기여와 유지보수에 감사드립니다. 권위 있는 세부사항은 아래 링크된 원본 문서 및 저장소를 참조하십시오.

자원#

참고: 참조된 모델, 데이터셋 및 코드의 사용은 저자 및 유지 관리자가 제공한 해당 라이선스 및 조건에 따릅니다.

RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.