필수 텍스트 프롬프트로 오디오가 동기화된 동영상을 생성합니다. 출력 크기는 `1280x720` 또는 `720x1280`, 길이는 `4`, `8`, `12`초 중에서 선택할 수 있습니다.
MiniMax H3는 자연어 지시로 이미지, 영상, 오디오를 생성하고 편집하는 MiniMax의 멀티모달 모델 제품군입니다. 이 페이지에서는 MiniMax H3 Text-to-Video를 제공합니다. 하나의 글로 작성한 프롬프트를 네이티브 스테레오 오디오가 화면과 함께 생성되는 24 FPS, 5–15초 길이의 2K 영상으로 만듭니다. 이 페이지에서는 텍스트만 입력할 수 있습니다. 이미지, 영상 또는 오디오 레퍼런스가 필요하다면 링크된 H3 워크플로를 사용하세요.
| MiniMax H3의 장점 | 사용자에게 유용한 점 |
|---|---|
| 2K 영상과 네이티브 스테레오 오디오 통합 생성 | 정교한 화면, 대사, 효과음, 주변음, 음악을 한 번에 생성해 별도의 업스케일링, 사운드 디자인, 동기화 단계를 줄입니다. |
| 언어로 지시하는 Omni-Reference | MiniMax H3의 여러 워크플로에서 이미지, 영상, 오디오에 정체성, 제품 외형, 움직임, 카메라 스타일, 음성, 음악과 같은 서로 다른 역할을 지정해 여러 소스가 하나의 일관된 결과를 이끌도록 할 수 있습니다. |
| V2V 전이 및 대상 중심 편집 | MiniMax H3는 움직임이나 카메라 표현을 이어받고 나머지는 보존하면서 선택한 시각 또는 오디오 요소를 수정할 수 있어, 제작팀이 장면을 처음부터 다시 생성하지 않고도 다음 단계로 나아갈 수 있습니다. |
| 제작물에 바로 적용할 수 있는 길이와 구도 | 6개 화면비로 24 FPS, 5–15초 영상을 생성하므로 훅, 제품 공개, 여러 전개가 있는 장면을 영화, 웹, 피드, 인물형, 세로형 게시 위치에 맞추면서 재편집과 재크롭을 줄일 수 있습니다. |
9:16 Shorts, Reels, Stories 또는 1:1 피드 콘텐츠를 제작하세요.첫 번째 표는 이 페이지의 MiniMax H3 Text-to-Video 도구에서 제공하는 설정을 보여 줍니다.
| 파라미터 | 필수 | 유형 | 기본값 | 범위 / 옵션 | 선택 방법 |
|---|---|---|---|---|---|
prompt* | 예 (*) | String | 프롬프트 예시 | 1–4,000자 | MiniMax H3에 피사체, 하나의 주요 동작, 카메라, 배경과 조명, 시각 스타일, 오디오, 의도한 마지막 장면을 포함한 구조화된 지시를 제공합니다. 전체 한도를 채우는 것보다 명확한 구조가 더 중요합니다. |
aspect_ratio | 아니요 | String | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | MiniMax H3 출력을 게시 위치에 맞춥니다. 21:9는 울트라와이드 시네마틱 숏, 16:9는 일반 영상과 광고, 4:3은 에디토리얼 또는 레트로 구도, 1:1은 피드, 3:4는 세로형 제품 콘텐츠, 9:16은 세로형 소셜 영상에 적합합니다. |
resolution | 아니요 | String | 2k | 2k | 이 도구에서는 고정되며 아래의 1440p 등급에 연결됩니다. 다른 품질 등급을 선택하지 않고 고해상도 디테일이 필요할 때 MiniMax H3를 선택하세요. |
duration | 아니요 | Integer | 5 | 5–15초, 1초 단위 | MiniMax H3에서 하나의 동작이나 빠른 반복 작업에는 5–7초, 단순한 변화에는 8–10초, 프롬프트가 명확한 시작, 전개, 끝을 정의할 때만 11–15초를 사용하세요. |
\* 필수 항목입니다.
다음 표는 더 넓은 MiniMax H3 모델 제품군의 사양을 요약합니다. 첫/마지막 프레임과 Omni-Reference 모드에 설명된 입력은 별도의 워크플로에서 사용할 수 있으며, 이 Text-to-Video 페이지의 설정 항목은 아닙니다.
| 핵심 항목 | MiniMax H3 |
|---|---|
| 모델 | MiniMax-H3 |
| 출력 길이 | MiniMax H3는 5–15초 길이로 출력합니다. |
| 출력 화면비 | 첫/마지막 프레임 모드: 입력 이미지의 원래 화면비를 따릅니다.<br>Text-to-Video 모드: 사용자가 선택한 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 화면비를 따릅니다.<br>Omni-Reference 모드: 이 6개 화면비 중 하나 또는 MiniMax H3가 출력 화면비를 선택하도록 하는 Auto를 사용합니다. |
| 해상도 | MiniMax H3는 문서에 명시된 2개 등급을 지원합니다. 768p 모드(추후 제공): 16:9부터 9:16까지의 화면비에서는 짧은 변이 768픽셀입니다. 더 넓은 출력의 전체 해상도는 약 1 MP이며, 예를 들어 21:9는 1536×672입니다. 768p 결과는 1440p로 업그레이드할 수 있습니다.<br>1440p / 2K 모드: 16:9부터 9:16까지의 화면비에서는 짧은 변이 1440픽셀입니다. 더 넓은 출력의 전체 해상도는 약 3.7 MP이며, 예를 들어 21:9는 2976×1248입니다. |
| 출력 프레임 속도 | MiniMax H3는 24 FPS로 출력합니다. |
| 출력 오디오 | 모든 MiniMax H3 결과에 네이티브 스테레오 오디오가 포함됩니다. |
| 첫/마지막 프레임 입력 | 이미지: 0장, 1장 또는 2장. 너비와 높이는 각각 256–5760픽셀, 화면비는 5:2부터 2:5(0.4–2.5)입니다. 이미지를 입력하지 않으면 MiniMax H3는 이 페이지에서 제공하는 도구인 Text-to-Video 모드로 실행됩니다. |
| Omni-Reference 입력 | 이미지: 최대 9장, 너비와 높이는 각각 256–5760픽셀.<br>영상: 최대 3개, 각각 2–15초, 영상 합계 길이는 최대 15초, 너비와 높이는 각각 256–5760픽셀, 화면비는 5:2부터 2:5(0.4–2.5).<br>오디오: 최대 3개 클립, 각각 2–15초, 오디오 합계 길이는 최대 15초. 오디오는 이미지 또는 영상과 함께 사용해야 하며 단독 레퍼런스로 사용할 수 없습니다.<br>혼합 입력: 총 12개 파일까지. 이미지, 영상, 오디오 입력이 없으면 워크플로는 Text-to-Video가 됩니다. |
| 지원 입력 형식 | MiniMax H3가 지원하는 영상: H.264/AVC 또는 H.265/HEVC, 내장 오디오: AAC 또는 MP3.<br>이미지: JPG, JPEG, PNG, WEBP, HEIC 또는 HEIF.<br>오디오: WAV 또는 MP3. |
| 입력 크기 제한 | 영상당 50 MB, 이미지당 30 MB, 오디오 파일당 15 MB. 파일별 제한 외에 별도의 전체 미디어 합계 제한은 없지만 API 요청 본문은 64 MB로 제한되므로 URL 기반 미디어 입력을 권장합니다. |
| 프롬프트 한도 | MiniMax H3 제품 가이드에서는 최대 7,000자를 허용합니다. 현재 Text-to-Video 배포는 위 페이지 설정 표에 표시된 대로 1–4,000자를 받습니다. |
이 페이지에서 MiniMax H3의 2K 생성 비용은 생성된 영상 1초당 $0.13 USD입니다.
| 길이 | 영상당 가격 |
|---|---|
| 5초 | $0.65 |
| 10초 | $1.30 |
| 15초 | $1.95 |
1–4개 결과를 일괄 생성할 때 총비용은 duration × $0.13 × output count로 계산합니다.
다음 MiniMax H3 프롬프트 구조를 반복해서 활용할 수 있습니다.
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
약한 프롬프트
> 고급 시계 광고, 시네마틱하고 역동적으로, 음악과 함께.
개선된 MiniMax H3 프롬프트
> 브러시드 스틸 자동 시계가 검은 화산석 위에 놓여 있다. 가느다란 스튜디오 조명이 사파이어 크리스털을 가로지르고, 초침이 움직이며 케이스에는 물방울이 맺힌다. 익스트림 매크로로 시작해 천천히 30도 회전하고 시계 문자판에서 끝낸다. 강한 대비의 고급 광고, 짙은 검은색 배경. 오디오: 부드러운 기계식 초침 소리와 낮은 시네마틱 펄스 한 번. 대사 없음.
개선된 버전은 MiniMax H3에 식별 가능한 피사체, 시간에 따른 동작, 분리된 카메라 지시, 조명, 마감, 사운드 출처, 검토할 수 있는 마지막 프레임을 제공합니다.
이 MiniMax H3 비교표는 모델 제품군을 선택할 때 참고할 수 있는 안내입니다. 최대 해상도와 최대 길이를 동시에 사용하지 못할 수 있으며, RunComfy 워크플로에 따라 입력, 해상도 등급, 오디오 제어가 다를 수 있습니다.
| 모델 | 해상도 | 최대 길이 | 오디오 | 차별점 |
|---|---|---|---|---|
| MiniMax H3 | 최대 2K | 15s | 네이티브 스테레오(음성, SFX, 음악) | 언어를 통해 텍스트, 이미지, 영상, 오디오 레퍼런스의 관계를 지정하여 V2V 모션 전이와 제작용 편집을 지원합니다. 공개 가중치는 출시가 예정되어 있지만 아직 공개되지 않았습니다. |
| Hailuo 02 | 1080p | ~10s | 없음 | 높은 프롬프트 이행력과 물리 표현 중심의 움직임으로 체조, 춤, 제품 움직임 등 후반 제작에서 오디오를 추가할 무음 액션 장면에 적합합니다. |
| Kling 3.0 | 최대 4K | 15s | 립싱크 지원 네이티브 오디오 | 멀티숏 카메라 전환과 화자를 지정한 다국어 대사 및 립싱크를 조율하므로 대본이 있는 광고, 스토리보드, 캐릭터 중심 장면에 유용합니다. |
| Seedance 2.0 | 1080p | 15s | 오디오와 영상 통합 생성 | 다수의 이미지, 영상, 오디오 레퍼런스를 시청각 통합 생성 및 정확한 립싱크와 결합해 정체성이 중요한 광고, 브랜드 스토리, 레퍼런스 중심 편집에 적합합니다. |
| Veo 3.1 | 4K | 8s | 네이티브 대사 및 효과음 | 프롬프트로 지정한 대사와 효과음을 첫/마지막 프레임, 레퍼런스 이미지, 장면 연장 제어와 결합하므로 시네마틱 전환과 이어 붙인 시퀀스에 적합합니다. |
Hailuo 02의 최대치는 모드에 따라 다릅니다. 1080p 출력은 6초로 제한되며, 10초 출력은 512p 또는 768p에서 사용할 수 있습니다.
MiniMax H3의 Omni-Reference와 V2V 기능은 관련 워크플로에 속합니다. 이 페이지의 Text-to-Video 도구는 프롬프트 전용입니다.
MiniMax H3의 차별점은 이러한 기능의 조합입니다. 텍스트, 이미지, 영상, 오디오의 관계를 지정하는 하나의 범용 모델 제품군이 네이티브 스테레오 사운드를 생성하고, 이 페이지에서는 생성된 영상 1초당 $0.13로 2K에 도달합니다. 텍스트 지시에서 시작해 관련 워크플로의 레퍼런스 기반 제작 또는 편집으로 확장할 수 있는 경로가 필요하다면 MiniMax H3를 선택하세요. 공개된 정보를 바탕으로 제작 파이프라인을 확정하기 전에 각 모델에서 동일한 지시를 실행해 보세요.
MiniMax H3가 프로젝트의 출발점으로 적합하지 않다면 RunComfy에서 다음의 특화 워크플로를 비교하세요.
필수 텍스트 프롬프트로 오디오가 동기화된 동영상을 생성합니다. 출력 크기는 `1280x720` 또는 `720x1280`, 길이는 `4`, `8`, `12`초 중에서 선택할 수 있습니다.
동기화된 대사와 일관된 캐릭터를 갖춘 네이티브 4K 영화형 텍스트 영상을 생성합니다.
필수 시작 이미지와 종료 이미지를 연결하는 전환 영상을 만들고 프롬프트, 화면 비율, 해상도, 길이, 스타일, 오디오, 프롬프트 최적화를 조정합니다.
텍스트 프롬프트로 동기화 오디오가 포함된 시네마틱 동영상을 생성합니다.
이미지로부터 영화 같은 영상을 빠르고 자연스럽게 제작하는 Veo 3.1 Fast.
Pika 2.2로 텍스트 프롬프트에서 고품질 영상을 생성합니다.
예. MiniMax H3 Text-to-Video는 브라우저와 RunComfy API에서 사용할 수 있으며, 계정 크레딧을 사용합니다.
MiniMax H3는 MiniMax의 범용 멀티모달 생성 및 편집 모델 제품군입니다. 전체 작업 설계는 텍스트, 이미지, 영상, 오디오를 다루지만 각 워크플로에서 제공하는 입력은 서로 다릅니다. 이 페이지에서는 프롬프트만 입력하는 Text-to-Video 워크플로를 제공합니다.
MiniMax는 H3의 활용 분야로 광고, 브랜딩, 이커머스, 영화, 타이틀 디자인, 애니메이션 포스터, 숏폼 스토리텔링, 제품 및 UI 콘셉트, 게임, 가상 캐릭터, 스타일 애니메이션을 제시합니다. 현재 Text-to-Video 워크플로는 글로 작성한 프롬프트만으로 연출할 수 있는 짧은 콘셉트 영상에 적합합니다.
이 페이지에서 MiniMax H3는 2K 영상만 생성합니다. 5~15초 사이에서 1초 단위로 길이를 선택할 수 있으며 기본값은 5초입니다. 이 워크플로에서는 768p를 선택할 수 없습니다.
예. 이 Text-to-Video 워크플로는 영상과 함께 네이티브 스테레오 오디오를 생성합니다. 프롬프트에 대사, 주변음, 효과음, 음악을 설명할 수 있으며 별도의 오디오 켜기/끄기 옵션은 없습니다. 결과는 달라질 수 있으므로 립싱크와 오디오 타이밍을 확인하세요.
아니요. 이 페이지는 프롬프트만 입력하는 MiniMax H3 Text-to-Video 워크플로이며 API는 prompt, aspect_ratio, resolution, duration만 받습니다. 소스 미디어가 필요하다면 별도의 H3 Image-to-Video 또는 Reference-to-Video 워크플로를 사용하세요.
레퍼런스를 지원하는 H3 워크플로에서는 자연어로 텍스트, 이미지, 영상, 오디오에 서로 다른 역할을 지정할 수 있습니다. 예를 들어 한 소스는 카메라 움직임을, 다른 소스는 캐릭터를, 또 다른 소스는 음성을 정의할 수 있습니다. 이는 모델 제품군의 기능이며 현재 페이지에서 미디어를 업로드할 수 있다는 의미는 아닙니다.
아니요. RunComfy는 MiniMax H3를 브라우저와 HTTP API로 제공하므로 모델을 직접 호스팅하거나 확장할 필요가 없습니다. MiniMax는 7월 31일 출시 게시물에서 조건부 모델 가중치 공개 계획을 언급했습니다. 자체 호스팅을 계획한다면 현재 공개 여부와 라이선스 조건을 확인하세요.
MiniMax H3 Text-to-Video의 2K 생성 요금은 초당 $0.13입니다. 5초 영상은 $0.65, 10초 영상은 $1.30, 15초 영상은 $1.95입니다. 일괄 생성 비용은 길이에 따른 가격에 결과 수를 곱해 계산합니다.
MiniMax는 Hailuo 02가 아키텍처, 데이터, 규모에 집중한 반면 MiniMax H3는 작업과 모달리티의 일반화에 집중한다고 설명합니다. H3는 Text-to-Video 워크플로에 네이티브 스테레오 오디오와 2K 출력도 추가했습니다.
먼저 RunComfy에서 프롬프트, 화면비, 길이를 테스트합니다. 그런 다음 API에서 동일한 MiniMax H3 Text-to-Video 템플릿을 호출하고 prompt(필수), aspect_ratio, resolution(2k만 지원), duration(5~15)을 전달합니다. 이 워크플로에는 미디어 업로드 필드가 없습니다.
RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.














