logo
RunComfy
  • ComfyUI
  • 트레이너신규
  • 모델
  • API
  • 가격
discord logo
모델
탐색
모든 모델
라이브러리
생성 기록
모델 API
API 문서
API 키
계정
사용량

MiniMax H3: 스테레오 오디오 지원 2K Text-to-Video | RunComfy

minimax/minimax-h3/text-to-video

MiniMax H3 Text-to-Video는 글로 작성한 프롬프트를 네이티브 스테레오 오디오가 포함된 5~15초 길이의 2K 영상으로 만듭니다. 이미지, 영상, 오디오 레퍼런스에는 별도의 H3 워크플로를 사용하세요.

생성되는 영상의 화면비입니다.
생성되는 영상의 해상도입니다.
생성되는 영상의 길이(초)입니다.
Idle
MiniMax H3 generates 2K video. The rate is $0.13 per second.

MiniMax H3 영상 제작 소개

MiniMax H3는 MiniMax의 범용 멀티모달 모델 제품군입니다. 이 Text-to-Video 페이지는 글로 작성한 프롬프트를 24 FPS, 5~15초 길이의 2K 영상으로 만들며 화면과 함께 스테레오 오디오도 생성합니다. 전체 모델 제품군에는 이미지, 영상, 오디오를 레퍼런스로 사용해 정체성, 움직임, 카메라, 음성, 사운드, 편집을 제어하는 별도의 H3 워크플로가 있지만 이 페이지에서는 해당 미디어를 입력할 수 없습니다. MiniMax는 이 모델을 광고, 브랜딩, 이커머스, 제품 디자인, UI/UX, 게임, 짧은 시청각 콘셉트 제작에 적합한 모델로 소개합니다. 개발자는 RunComfy의 브라우저와 HTTP API에서 MiniMax H3를 사용할 수 있으므로 모델을 직접 호스팅하거나 확장할 필요가 없습니다.
적합한 용도: 2K 광고 및 제품 영상 | 프롬프트 기반 브랜드 스토리텔링 | 짧은 시청각 콘셉트

MiniMax H3를 선택하는 이유#


MiniMax H3는 자연어 지시로 이미지, 영상, 오디오를 생성하고 편집하는 MiniMax의 멀티모달 모델 제품군입니다. 이 페이지에서는 MiniMax H3 Text-to-Video를 제공합니다. 하나의 글로 작성한 프롬프트를 네이티브 스테레오 오디오가 화면과 함께 생성되는 24 FPS, 5–15초 길이의 2K 영상으로 만듭니다. 이 페이지에서는 텍스트만 입력할 수 있습니다. 이미지, 영상 또는 오디오 레퍼런스가 필요하다면 링크된 H3 워크플로를 사용하세요.


MiniMax H3의 장점사용자에게 유용한 점
2K 영상과 네이티브 스테레오 오디오 통합 생성정교한 화면, 대사, 효과음, 주변음, 음악을 한 번에 생성해 별도의 업스케일링, 사운드 디자인, 동기화 단계를 줄입니다.
언어로 지시하는 Omni-ReferenceMiniMax H3의 여러 워크플로에서 이미지, 영상, 오디오에 정체성, 제품 외형, 움직임, 카메라 스타일, 음성, 음악과 같은 서로 다른 역할을 지정해 여러 소스가 하나의 일관된 결과를 이끌도록 할 수 있습니다.
V2V 전이 및 대상 중심 편집MiniMax H3는 움직임이나 카메라 표현을 이어받고 나머지는 보존하면서 선택한 시각 또는 오디오 요소를 수정할 수 있어, 제작팀이 장면을 처음부터 다시 생성하지 않고도 다음 단계로 나아갈 수 있습니다.
제작물에 바로 적용할 수 있는 길이와 구도6개 화면비로 24 FPS, 5–15초 영상을 생성하므로 훅, 제품 공개, 여러 전개가 있는 장면을 영화, 웹, 피드, 인물형, 세로형 게시 위치에 맞추면서 재편집과 재크롭을 줄일 수 있습니다.

추천 활용 사례#


  • 광고 및 제품 출시: 카메라 연출과 사운드를 함께 설계해야 하는 히어로 숏, 제품 공개, 캠페인 콘셉트, 짧은 광고에 MiniMax H3를 활용하세요.
  • 소셜 미디어 콘텐츠: MiniMax H3로 분명한 오프닝 훅과 플랫폼에 맞는 구도를 갖춘 9:16 Shorts, Reels, Stories 또는 1:1 피드 콘텐츠를 제작하세요.
  • 영화 및 광고 프리비주얼라이제이션: 실제 제작에 들어가기 전에 MiniMax H3로 카메라 움직임, 조명 계획, 주요 동작, 장면 전환, 임시 사운드트랙을 테스트하세요.
  • 브랜드 및 스타일 스토리텔링: 글로 작성한 아이디어에 완성도 높은 시청각 표현이 필요할 때 MiniMax H3로 타이틀 시퀀스, 애니메이션 포스터, 캐릭터 장면, 그래픽 룩을 탐색하세요.

작동 방식#


  1. 장면 작성: MiniMax H3에 화면에 무엇이 나타나는지, 시간이 지나며 무엇이 바뀌는지, 카메라가 어떻게 움직이는지, 장면이 어떻게 보여야 하는지, 어떤 소리가 들려야 하는지 설명합니다.
  2. 제작물 형식 선택: 화면비와 5–15초 길이를 선택합니다. MiniMax H3는 해상도가 2K로 고정되어 있어 품질 등급을 별도로 설정할 필요가 없습니다.
  3. 생성 및 수정: 모델이 영상과 스테레오 오디오를 함께 생성합니다. 움직임, 텍스트, 얼굴, 립싱크, 사운드 타이밍을 확인한 뒤 지시를 한 번에 하나씩 바꿉니다.

파라미터#


첫 번째 표는 이 페이지의 MiniMax H3 Text-to-Video 도구에서 제공하는 설정을 보여 줍니다.


파라미터필수유형기본값범위 / 옵션선택 방법
prompt*예 (*)String프롬프트 예시1–4,000자MiniMax H3에 피사체, 하나의 주요 동작, 카메라, 배경과 조명, 시각 스타일, 오디오, 의도한 마지막 장면을 포함한 구조화된 지시를 제공합니다. 전체 한도를 채우는 것보다 명확한 구조가 더 중요합니다.
aspect_ratio아니요String16:921:9, 16:9, 4:3, 1:1, 3:4, 9:16MiniMax H3 출력을 게시 위치에 맞춥니다. 21:9는 울트라와이드 시네마틱 숏, 16:9는 일반 영상과 광고, 4:3은 에디토리얼 또는 레트로 구도, 1:1은 피드, 3:4는 세로형 제품 콘텐츠, 9:16은 세로형 소셜 영상에 적합합니다.
resolution아니요String2k2k이 도구에서는 고정되며 아래의 1440p 등급에 연결됩니다. 다른 품질 등급을 선택하지 않고 고해상도 디테일이 필요할 때 MiniMax H3를 선택하세요.
duration아니요Integer55–15초, 1초 단위MiniMax H3에서 하나의 동작이나 빠른 반복 작업에는 5–7초, 단순한 변화에는 8–10초, 프롬프트가 명확한 시작, 전개, 끝을 정의할 때만 11–15초를 사용하세요.

\* 필수 항목입니다.


다음 표는 더 넓은 MiniMax H3 모델 제품군의 사양을 요약합니다. 첫/마지막 프레임과 Omni-Reference 모드에 설명된 입력은 별도의 워크플로에서 사용할 수 있으며, 이 Text-to-Video 페이지의 설정 항목은 아닙니다.


핵심 항목MiniMax H3
모델MiniMax-H3
출력 길이MiniMax H3는 5–15초 길이로 출력합니다.
출력 화면비첫/마지막 프레임 모드: 입력 이미지의 원래 화면비를 따릅니다.<br>Text-to-Video 모드: 사용자가 선택한 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 화면비를 따릅니다.<br>Omni-Reference 모드: 이 6개 화면비 중 하나 또는 MiniMax H3가 출력 화면비를 선택하도록 하는 Auto를 사용합니다.
해상도MiniMax H3는 문서에 명시된 2개 등급을 지원합니다. 768p 모드(추후 제공): 16:9부터 9:16까지의 화면비에서는 짧은 변이 768픽셀입니다. 더 넓은 출력의 전체 해상도는 약 1 MP이며, 예를 들어 21:9는 1536×672입니다. 768p 결과는 1440p로 업그레이드할 수 있습니다.<br>1440p / 2K 모드: 16:9부터 9:16까지의 화면비에서는 짧은 변이 1440픽셀입니다. 더 넓은 출력의 전체 해상도는 약 3.7 MP이며, 예를 들어 21:9는 2976×1248입니다.
출력 프레임 속도MiniMax H3는 24 FPS로 출력합니다.
출력 오디오모든 MiniMax H3 결과에 네이티브 스테레오 오디오가 포함됩니다.
첫/마지막 프레임 입력이미지: 0장, 1장 또는 2장. 너비와 높이는 각각 256–5760픽셀, 화면비는 5:2부터 2:5(0.4–2.5)입니다. 이미지를 입력하지 않으면 MiniMax H3는 이 페이지에서 제공하는 도구인 Text-to-Video 모드로 실행됩니다.
Omni-Reference 입력이미지: 최대 9장, 너비와 높이는 각각 256–5760픽셀.<br>영상: 최대 3개, 각각 2–15초, 영상 합계 길이는 최대 15초, 너비와 높이는 각각 256–5760픽셀, 화면비는 5:2부터 2:5(0.4–2.5).<br>오디오: 최대 3개 클립, 각각 2–15초, 오디오 합계 길이는 최대 15초. 오디오는 이미지 또는 영상과 함께 사용해야 하며 단독 레퍼런스로 사용할 수 없습니다.<br>혼합 입력: 총 12개 파일까지. 이미지, 영상, 오디오 입력이 없으면 워크플로는 Text-to-Video가 됩니다.
지원 입력 형식MiniMax H3가 지원하는 영상: H.264/AVC 또는 H.265/HEVC, 내장 오디오: AAC 또는 MP3.<br>이미지: JPG, JPEG, PNG, WEBP, HEIC 또는 HEIF.<br>오디오: WAV 또는 MP3.
입력 크기 제한영상당 50 MB, 이미지당 30 MB, 오디오 파일당 15 MB. 파일별 제한 외에 별도의 전체 미디어 합계 제한은 없지만 API 요청 본문은 64 MB로 제한되므로 URL 기반 미디어 입력을 권장합니다.
프롬프트 한도MiniMax H3 제품 가이드에서는 최대 7,000자를 허용합니다. 현재 Text-to-Video 배포는 위 페이지 설정 표에 표시된 대로 1–4,000자를 받습니다.

가격#


이 페이지에서 MiniMax H3의 2K 생성 비용은 생성된 영상 1초당 $0.13 USD입니다.


길이영상당 가격
5초$0.65
10초$1.30
15초$1.95

1–4개 결과를 일괄 생성할 때 총비용은 duration × $0.13 × output count로 계산합니다.


프롬프트 작성 팁 및 예시#


다음 MiniMax H3 프롬프트 구조를 반복해서 활용할 수 있습니다.


[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]


  • 움직임 분리: 피사체의 움직임과 카메라 움직임을 따로 설명합니다.
  • 순서 제시: 클립에 둘 이상의 전개가 있다면 “~로 시작해”, “그다음”, “~로 끝난다” 같은 표현을 사용합니다.
  • 사운드 출처 명시: MiniMax H3에 누가 말하는지, 각 소리를 무엇이 내는지, 주변음은 무엇인지, 음악이 중심이 되어야 하는지 은은하게 유지되어야 하는지 알려 줍니다.
  • 서로 경쟁하는 아이디어 제한: 하나의 주요 피사체, 하나의 핵심 동작, 하나의 일관된 스타일로 구성하면 MiniMax H3가 지시를 더 쉽게 따를 수 있습니다.

약한 프롬프트


> 고급 시계 광고, 시네마틱하고 역동적으로, 음악과 함께.


개선된 MiniMax H3 프롬프트


> 브러시드 스틸 자동 시계가 검은 화산석 위에 놓여 있다. 가느다란 스튜디오 조명이 사파이어 크리스털을 가로지르고, 초침이 움직이며 케이스에는 물방울이 맺힌다. 익스트림 매크로로 시작해 천천히 30도 회전하고 시계 문자판에서 끝낸다. 강한 대비의 고급 광고, 짙은 검은색 배경. 오디오: 부드러운 기계식 초침 소리와 낮은 시네마틱 펄스 한 번. 대사 없음.


개선된 버전은 MiniMax H3에 식별 가능한 피사체, 시간에 따른 동작, 분리된 카메라 지시, 조명, 마감, 사운드 출처, 검토할 수 있는 마지막 프레임을 제공합니다.


MiniMax H3와 다른 모델 비교#


이 MiniMax H3 비교표는 모델 제품군을 선택할 때 참고할 수 있는 안내입니다. 최대 해상도와 최대 길이를 동시에 사용하지 못할 수 있으며, RunComfy 워크플로에 따라 입력, 해상도 등급, 오디오 제어가 다를 수 있습니다.


모델해상도최대 길이오디오차별점
MiniMax H3최대 2K15s네이티브 스테레오(음성, SFX, 음악)언어를 통해 텍스트, 이미지, 영상, 오디오 레퍼런스의 관계를 지정하여 V2V 모션 전이와 제작용 편집을 지원합니다. 공개 가중치는 출시가 예정되어 있지만 아직 공개되지 않았습니다.
Hailuo 021080p~10s없음높은 프롬프트 이행력과 물리 표현 중심의 움직임으로 체조, 춤, 제품 움직임 등 후반 제작에서 오디오를 추가할 무음 액션 장면에 적합합니다.
Kling 3.0최대 4K15s립싱크 지원 네이티브 오디오멀티숏 카메라 전환과 화자를 지정한 다국어 대사 및 립싱크를 조율하므로 대본이 있는 광고, 스토리보드, 캐릭터 중심 장면에 유용합니다.
Seedance 2.01080p15s오디오와 영상 통합 생성다수의 이미지, 영상, 오디오 레퍼런스를 시청각 통합 생성 및 정확한 립싱크와 결합해 정체성이 중요한 광고, 브랜드 스토리, 레퍼런스 중심 편집에 적합합니다.
Veo 3.14K8s네이티브 대사 및 효과음프롬프트로 지정한 대사와 효과음을 첫/마지막 프레임, 레퍼런스 이미지, 장면 연장 제어와 결합하므로 시네마틱 전환과 이어 붙인 시퀀스에 적합합니다.

Hailuo 02의 최대치는 모드에 따라 다릅니다. 1080p 출력은 6초로 제한되며, 10초 출력은 512p 또는 768p에서 사용할 수 있습니다.


MiniMax H3의 Omni-Reference와 V2V 기능은 관련 워크플로에 속합니다. 이 페이지의 Text-to-Video 도구는 프롬프트 전용입니다.


MiniMax H3의 차별점은 이러한 기능의 조합입니다. 텍스트, 이미지, 영상, 오디오의 관계를 지정하는 하나의 범용 모델 제품군이 네이티브 스테레오 사운드를 생성하고, 이 페이지에서는 생성된 영상 1초당 $0.13로 2K에 도달합니다. 텍스트 지시에서 시작해 관련 워크플로의 레퍼런스 기반 제작 또는 편집으로 확장할 수 있는 경로가 필요하다면 MiniMax H3를 선택하세요. 공개된 정보를 바탕으로 제작 파이프라인을 확정하기 전에 각 모델에서 동일한 지시를 실행해 보세요.


함께 사용해 볼 모델#


MiniMax H3가 프로젝트의 출발점으로 적합하지 않다면 RunComfy에서 다음의 특화 워크플로를 비교하세요.


  • MiniMax H3 Image-to-Video: 구도, 정체성, 제품 외형을 고정해야 할 때 이미지에서 시작하고 필요하면 마지막 프레임도 지정합니다.
  • MiniMax H3 Reference-to-Video: 움직임, 카메라 스타일, 음성, 음악 또는 기타 소스 특징을 유지해야 할 때 이미지에 선택 사항인 영상과 오디오를 결합합니다.
  • Hailuo 02 Image-to-Video: 이미지 애니메이션에 집중된 워크플로를 원한다면 MiniMax의 이전 세대 모델을 사용해 보세요.
  • Hailuo 2.3 Pro: 안정적인 물리 표현 기반 움직임, 섬세한 표정, 자연스러운 조명으로 정지 이미지를 1080p로 움직여 완성도 높은 제품, 인물, 캐릭터 장면에 적합합니다.
  • Kling 3.0: 시작 이미지에 선택 사항인 마지막 프레임, 요소 레퍼런스, 시간 지정 장면 프롬프트, 동기화 오디오를 더해 브랜드 및 캐릭터 시퀀스를 제어합니다.
  • Seedance 2.0 Pro: 최대 9장의 이미지, 3개의 영상, 3개의 오디오 클립을 혼합해 4–15초 클립 전체에서 정체성, 카메라 언어, 동기화된 음성, 효과음, 음악을 일치시킵니다.

공식 리소스#


  • MiniMax H3 출시 게시물
  • MiniMax 공식 웹사이트

관련 모델

sora-2/text-to-video

필수 텍스트 프롬프트로 오디오가 동기화된 동영상을 생성합니다. 출력 크기는 `1280x720` 또는 `720x1280`, 길이는 `4`, `8`, `12`초 중에서 선택할 수 있습니다.

kling-3.0/4k/text-to-video

동기화된 대사와 일관된 캐릭터를 갖춘 네이티브 4K 영화형 텍스트 영상을 생성합니다.

pixverse/v5.5/transition

필수 시작 이미지와 종료 이미지를 연결하는 전환 영상을 만들고 프롬프트, 화면 비율, 해상도, 길이, 스타일, 오디오, 프롬프트 최적화를 조정합니다.

gemini-omni-flash/text-to-video

텍스트 프롬프트로 동기화 오디오가 포함된 시네마틱 동영상을 생성합니다.

veo-3-1/fast/image-to-video

이미지로부터 영화 같은 영상을 빠르고 자연스럽게 제작하는 Veo 3.1 Fast.

pika-2-2/text-to-video

Pika 2.2로 텍스트 프롬프트에서 고품질 영상을 생성합니다.

자주 묻는 질문

MiniMax H3를 현재 RunComfy에서 사용할 수 있나요?

예. MiniMax H3 Text-to-Video는 브라우저와 RunComfy API에서 사용할 수 있으며, 계정 크레딧을 사용합니다.

MiniMax H3란 무엇인가요?

MiniMax H3는 MiniMax의 범용 멀티모달 생성 및 편집 모델 제품군입니다. 전체 작업 설계는 텍스트, 이미지, 영상, 오디오를 다루지만 각 워크플로에서 제공하는 입력은 서로 다릅니다. 이 페이지에서는 프롬프트만 입력하는 Text-to-Video 워크플로를 제공합니다.

MiniMax H3는 어떤 용도로 사용할 수 있나요?

MiniMax는 H3의 활용 분야로 광고, 브랜딩, 이커머스, 영화, 타이틀 디자인, 애니메이션 포스터, 숏폼 스토리텔링, 제품 및 UI 콘셉트, 게임, 가상 캐릭터, 스타일 애니메이션을 제시합니다. 현재 Text-to-Video 워크플로는 글로 작성한 프롬프트만으로 연출할 수 있는 짧은 콘셉트 영상에 적합합니다.

MiniMax H3 Text-to-Video는 어떤 해상도와 영상 길이를 지원하나요?

이 페이지에서 MiniMax H3는 2K 영상만 생성합니다. 5~15초 사이에서 1초 단위로 길이를 선택할 수 있으며 기본값은 5초입니다. 이 워크플로에서는 768p를 선택할 수 없습니다.

MiniMax H3는 오디오도 생성하나요?

예. 이 Text-to-Video 워크플로는 영상과 함께 네이티브 스테레오 오디오를 생성합니다. 프롬프트에 대사, 주변음, 효과음, 음악을 설명할 수 있으며 별도의 오디오 켜기/끄기 옵션은 없습니다. 결과는 달라질 수 있으므로 립싱크와 오디오 타이밍을 확인하세요.

이 MiniMax H3 페이지에서 이미지, 영상 또는 오디오 레퍼런스를 사용할 수 있나요?

아니요. 이 페이지는 프롬프트만 입력하는 MiniMax H3 Text-to-Video 워크플로이며 API는 prompt, aspect_ratio, resolution, duration만 받습니다. 소스 미디어가 필요하다면 별도의 H3 Image-to-Video 또는 Reference-to-Video 워크플로를 사용하세요.

MiniMax H3 모델 제품군에서 멀티모달 컨텍스트란 무엇인가요?

레퍼런스를 지원하는 H3 워크플로에서는 자연어로 텍스트, 이미지, 영상, 오디오에 서로 다른 역할을 지정할 수 있습니다. 예를 들어 한 소스는 카메라 움직임을, 다른 소스는 캐릭터를, 또 다른 소스는 음성을 정의할 수 있습니다. 이는 모델 제품군의 기능이며 현재 페이지에서 미디어를 업로드할 수 있다는 의미는 아닙니다.

MiniMax H3를 직접 호스팅해야 하나요?

아니요. RunComfy는 MiniMax H3를 브라우저와 HTTP API로 제공하므로 모델을 직접 호스팅하거나 확장할 필요가 없습니다. MiniMax는 7월 31일 출시 게시물에서 조건부 모델 가중치 공개 계획을 언급했습니다. 자체 호스팅을 계획한다면 현재 공개 여부와 라이선스 조건을 확인하세요.

MiniMax H3 Text-to-Video의 가격은 얼마인가요?

MiniMax H3 Text-to-Video의 2K 생성 요금은 초당 $0.13입니다. 5초 영상은 $0.65, 10초 영상은 $1.30, 15초 영상은 $1.95입니다. 일괄 생성 비용은 길이에 따른 가격에 결과 수를 곱해 계산합니다.

MiniMax H3는 Hailuo 02와 어떻게 다른가요?

MiniMax는 Hailuo 02가 아키텍처, 데이터, 규모에 집중한 반면 MiniMax H3는 작업과 모달리티의 일반화에 집중한다고 설명합니다. H3는 Text-to-Video 워크플로에 네이티브 스테레오 오디오와 2K 출력도 추가했습니다.

브라우저에서 테스트한 MiniMax H3를 API에 연동하려면 어떻게 해야 하나요?

먼저 RunComfy에서 프롬프트, 화면비, 길이를 테스트합니다. 그런 다음 API에서 동일한 MiniMax H3 Text-to-Video 템플릿을 호출하고 prompt(필수), aspect_ratio, resolution(2k만 지원), duration(5~15)을 전달합니다. 이 워크플로에는 미디어 업로드 필드가 없습니다.

팔로우하기
  • 링크드인
  • 페이스북
  • Instagram
  • 트위터
지원
  • 디스코드
  • 이메일
  • 시스템 상태
  • 제휴사
비디오 모델
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • 모든 모델 보기 →
이미지 모델
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • 모든 모델 보기 →
법적 고지
  • 서비스 약관
  • 개인정보 보호정책
  • 쿠키 정책
RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.

MiniMax H3 예시

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...