영상의 첫 프레임을 기준으로 일관된 스타일을 유지하는 AI 비디오 변환 도구
Minimax H3 Reference to Video generates a 768p or 2K clip from a text prompt and the reference media you attach. Supply at least one reference image or video, describe the scene you want, and the model works out how your references should behave on screen.
The split is simple. Images pin what things look like; videos pin how things move. Minimax H3 Reference to Video reads both against your prompt rather than treating either as a fixed template.
768p for cheaper drafts or 2k when detail needs to hold up in large placements.The live Minimax H3 Reference to Video fields on this page.
| Parameter | Required | Type | Default | Range / Options | Description |
|---|---|---|---|---|---|
| prompt * | Yes (*) | string | Sample brief | 1-4000 characters | Scene, motion, camera work, visual style. |
| reference_images * | Yes (*) | array (URLs) | Sample reference | Up to 9 | Images guiding subject, style, composition. |
| reference_videos | No | array (URLs) | None | Up to 3 | Clips guiding movement, pacing, or interaction. |
| reference_audios | No | array (URLs) | None | Up to 3 | Audio guidance; needs an image or video too. |
| aspect_ratio * | Yes (*) | string | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Output framing. |
| duration * | Yes (*) | integer | 5 | 4-15 | Clip length in whole seconds. |
| resolution * | Yes (*) | string | 768p | 768p, 2k | Output resolution tier. |
At least one reference image or video is required.
Minimax H3 Reference to Video bills by resolution on counted seconds: the finished clip plus the combined length of any reference videos attached. Reference images and audio are not billed by duration.
| Resolution | Price per counted second |
|---|---|
| 768p | $0.11 |
| 2K | $0.16 |
| Output | Reference video | Counted seconds | Cost at 768p | Cost at 2K |
|---|---|---|---|---|
| 5s | none | 5 | $0.55 | $0.80 |
| 10s | none | 10 | $1.10 | $1.60 |
| 15s | none | 15 | $1.65 | $2.40 |
| 10s | 5s | 15 | $1.65 | $2.40 |
Reference clips are measured after the job runs, so the figure shown before you submit is an estimate and the final charge reflects the real counted seconds.
1) Attach your references — Add images that define the subject and, if movement matters, clips that define it. Minimax H3 Reference to Video needs at least one of the two.
2) Write the brief — Describe the action, camera work, lighting, and mood.
3) Say how the references relate — Name which one supplies the subject and which supplies the motion. Minimax H3 Reference to Video follows an explicit relationship far better than an implied one.
4) Add reference audio (optional) — Only alongside an image or video reference in Minimax H3 Reference to Video.
5) Pick the aspect ratio — 16:9 widescreen, 9:16 vertical, 1:1 square, 21:9 wide cinematic.
6) Choose resolution and length — Start at 768p and a short duration while testing, then switch to 2k and extend toward 15 seconds once Minimax H3 Reference to Video is behaving.
7) Generate and refine — Change one reference or clause at a time so you can attribute the difference in the Minimax H3 Reference to Video output.
영상의 첫 프레임을 기준으로 일관된 스타일을 유지하는 AI 비디오 변환 도구
텍스트 프롬프트로 동기화 오디오가 포함된 시네마틱 동영상을 생성합니다.
이미지 1장으로 영화 같은 4K 영상을 생성하며 출력 1초당 $0.42입니다.
텍스트 지시에 따라 소스 동영상을 편집하면서 장면의 일관성을 유지합니다.
긍정적이고 부정적인 프롬프트와 조정 가능한 생성 설정을 사용하여 드라이빙 영상의 모션으로 참조 캐릭터 이미지를 애니메이션화합니다.
Veo 3.1로 이미지를 몇 초 만에 생동감 있는 영화 같은 영상으로 전환하세요.
Minimax H3 비디오 참조는 서면 프롬프트와 사용자가 제공하는 참조 미디어를 통해 768p 또는 2K 비디오를 생성합니다. 반복되는 캐릭터, 제품, 브랜드 룩 등 여러 장면에서 피사체를 알아볼 수 있어야 하는 작업을 위해 제작되었습니다. 하나 이상의 참조 이미지나 비디오를 첨부하고 장면을 설명하면 모델이 해당 참조가 화면에서 어떻게 작동해야 하는지 결정합니다.
최대 9개의 참조 이미지, 최대 3개의 참조 비디오, 최대 3개의 참조 오디오 파일을 첨부할 수 있습니다. Minimax H3 Reference to Video에서는 이미지가 정체성, 스타일, 구성을 안내하고, 비디오는 움직임, 속도, 카메라 동작을 안내합니다. 오디오만 제출할 수 없습니다. 이미지나 비디오 참조를 동반해야 합니다.
이미지-비디오는 클립의 문자 그대로 첫 번째 프레임을 고정하므로 시작 구성이 고정됩니다. 대신 Minimax H3 Reference to Video는 미디어를 가이드로 취급하여 피사체를 일관되게 유지하면서 프레이밍과 카메라 움직임을 더 자유롭게 유지합니다. 정확한 오프닝 프레임보다 누가, 무엇이 나타나는지에 관심이 있을 때 선택하세요.
출력 해상도는 '768p' 또는 '2k'로 선택 가능하며 지속 시간은 전체 초 단위로 4~15초 중에서 선택할 수 있습니다. Minimax H3 Reference to Video는 6가지 화면비(21:9, 16:9, 4:3, 1:1, 3:4, 9:16)를 지원하므로 와이드스크린, 정사각형 및 수직 결과물이 모두 동일한 모델에서 제공됩니다. 현재 노출된 값은 이 페이지의 매개변수 패널을 확인하세요.
프롬프트는 1~4000자를 허용하며 요청을 실행하려면 하나 이상의 참조 이미지 또는 비디오가 있어야 합니다. 참조 수는 이미지 9개, 비디오 3개, 오디오 파일 3개로 제한됩니다. 한도는 모드나 공급자 설정에 따라 다를 수 있으므로 한도를 구축하기 전에 라이브 패널을 확인하세요.
참조 사이의 관계를 명시적으로 기술하십시오. 어느 것이 주제이고 어느 것이 동작을 제공하는지입니다. Minimax H3 비디오 참조는 묵시적인 것보다 명명된 관계를 훨씬 더 잘 따르며, 충돌하는 참조는 서로 평균을 내는 경향이 있습니다. 추상적인 분위기 단어보다는 눈에 보이는 동작과 카메라 동작을 설명하세요.
예. 참조, 프롬프트, 해상도 및 지속 시간이 올 때까지 RunComfy AI 플레이그라운드 웹 UI에서 프로토타입을 만든 다음 동일한 매개변수를 사용하여 RunComfy API를 통해 동일한 모델을 호출합니다. 이를 통해 Minimax H3 Reference to Video는 파이프라인의 수동 탐색과 자동화된 작업 간에 동일하게 작동합니다.
세대는 768p의 경우 초당 $0.11, 2K의 경우 초당 $0.16의 RunComfy 잔액에서 USD 또는 크레딧을 소비합니다. 계산된 초는 완성된 클립에 첨부한 참조 비디오의 지속 시간을 더한 값입니다. 따라서 5초 참조 클립이 포함된 10초 768p 출력에는 15초 또는 1.65달러가 청구됩니다. 참조 클립은 실행 후 측정되므로 제출하기 전에 표시된 수치는 추정치입니다. 청구 관련 질문은 hi@runcomfy.com으로 문의하세요.
RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.





