Anime una imagen requerida del primer fotograma a partir de un prompt de texto, guiando opcionalmente el final con una imagen del último fotograma.
Minimax H3 Reference to Video generates a 768p or 2K clip from a text prompt and the reference media you attach. Supply at least one reference image or video, describe the scene you want, and the model works out how your references should behave on screen.
The split is simple. Images pin what things look like; videos pin how things move. Minimax H3 Reference to Video reads both against your prompt rather than treating either as a fixed template.
768p for cheaper drafts or 2k when detail needs to hold up in large placements.The live Minimax H3 Reference to Video fields on this page.
| Parameter | Required | Type | Default | Range / Options | Description |
|---|---|---|---|---|---|
| prompt * | Yes (*) | string | Sample brief | 1-4000 characters | Scene, motion, camera work, visual style. |
| reference_images * | Yes (*) | array (URLs) | Sample reference | Up to 9 | Images guiding subject, style, composition. |
| reference_videos | No | array (URLs) | None | Up to 3 | Clips guiding movement, pacing, or interaction. |
| reference_audios | No | array (URLs) | None | Up to 3 | Audio guidance; needs an image or video too. |
| aspect_ratio * | Yes (*) | string | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Output framing. |
| duration * | Yes (*) | integer | 5 | 4-15 | Clip length in whole seconds. |
| resolution * | Yes (*) | string | 768p | 768p, 2k | Output resolution tier. |
At least one reference image or video is required.
Minimax H3 Reference to Video bills by resolution on counted seconds: the finished clip plus the combined length of any reference videos attached. Reference images and audio are not billed by duration.
| Resolution | Price per counted second |
|---|---|
| 768p | $0.11 |
| 2K | $0.16 |
| Output | Reference video | Counted seconds | Cost at 768p | Cost at 2K |
|---|---|---|---|---|
| 5s | none | 5 | $0.55 | $0.80 |
| 10s | none | 10 | $1.10 | $1.60 |
| 15s | none | 15 | $1.65 | $2.40 |
| 10s | 5s | 15 | $1.65 | $2.40 |
Reference clips are measured after the job runs, so the figure shown before you submit is an estimate and the final charge reflects the real counted seconds.
1) Attach your references — Add images that define the subject and, if movement matters, clips that define it. Minimax H3 Reference to Video needs at least one of the two.
2) Write the brief — Describe the action, camera work, lighting, and mood.
3) Say how the references relate — Name which one supplies the subject and which supplies the motion. Minimax H3 Reference to Video follows an explicit relationship far better than an implied one.
4) Add reference audio (optional) — Only alongside an image or video reference in Minimax H3 Reference to Video.
5) Pick the aspect ratio — 16:9 widescreen, 9:16 vertical, 1:1 square, 21:9 wide cinematic.
6) Choose resolution and length — Start at 768p and a short duration while testing, then switch to 2k and extend toward 15 seconds once Minimax H3 Reference to Video is behaving.
7) Generate and refine — Change one reference or clause at a time so you can attribute the difference in the Minimax H3 Reference to Video output.
Anime una imagen requerida del primer fotograma a partir de un prompt de texto, guiando opcionalmente el final con una imagen del último fotograma.
Anime una imagen requerida con un prompt obligatorio usando Kling 2.1 Standard, con controles de duración, relación de aspecto, prompt negativo y intensidad del prompt.
Crea videos realistas con personajes y estilos coherentes fácilmente
Herramienta de conversión de movimiento impulsada por IA que permite la creación de animaciones precisas y estables
Crea escenas de vídeo realistas a partir de imágenes fijas con movimiento, sincronización de diálogos y control creativo flexible.
Convierte texto en videos creativos en segundos con IA avanzada.
Minimax H3 Reference to Video genera un video de 768p o 2K a partir de un mensaje escrito más los medios de referencia que usted proporciona. Está diseñado para trabajos en los que un sujeto debe seguir siendo reconocible en todas las tomas, como un personaje recurrente, un producto o la apariencia de una marca. Adjuntas al menos una imagen o vídeo de referencia, describe la escena y el modelo resuelve cómo deben comportarse esas referencias en la pantalla.
Puede adjuntar hasta 9 imágenes de referencia, hasta 3 videos de referencia y hasta 3 archivos de audio de referencia. Las imágenes guían la identidad, el estilo y la composición, mientras que los videos guían el movimiento, el ritmo y el comportamiento de la cámara en Minimax H3 Reference to Video. El audio no se puede enviar solo; tiene que acompañar una imagen o vídeo de referencia.
Imagen a vídeo fija el primer fotograma literal del clip, por lo que la composición de apertura queda fija. En cambio, Minimax H3 Reference to Video trata los medios como guía, lo que deja el encuadre y el movimiento de la cámara más libres y al mismo tiempo mantiene al sujeto constante. Elígelo cuando te importe más quién o qué aparece que el marco de apertura exacto.
La resolución de salida se puede seleccionar como 768p o 2k, con una duración seleccionable de 4 a 15 segundos en segundos completos. Minimax H3 Reference to Video admite seis relaciones de aspecto: 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16, por lo que los entregables de pantalla ancha, cuadrada y vertical provienen del mismo modelo. Consulte el panel de parámetros en esta página para conocer los valores actualmente expuestos.
El mensaje acepta de 1 a 4000 caracteres y al menos una imagen o video de referencia debe estar presente para que se ejecute la solicitud. El recuento de referencias tiene un límite de 9 imágenes, 3 vídeos y 3 archivos de audio. Los límites pueden variar según el modo o la configuración del proveedor, así que confírmelo en el panel en vivo antes de construir alrededor de ellos.
Indique explícitamente la relación entre sus referencias: cuál es el sujeto y cuál proporciona la moción. Minimax H3 Reference to Video sigue una relación nombrada mucho mejor que una implícita, y las referencias conflictivas tienden a promediarse entre sí. Describe la acción visible y el comportamiento de la cámara en lugar de palabras de humor abstractas.
Sí. Haga un prototipo en la interfaz de usuario web RunComfy AI Playground hasta que las referencias, el mensaje, la resolución y la duración sean correctos, luego llame al mismo modelo a través de la API RunComfy con parámetros idénticos. Esto mantiene a Minimax H3 Reference to Video comportándose igual entre la exploración manual y los trabajos automatizados en su propio proceso.
Las generaciones consumen dólares o créditos de su saldo RunComfy a $0,11 por segundo contado para 768p y $0,16 por segundo contado para 2K. Los segundos contados son el clip terminado más la duración combinada de los videos de referencia que adjunte, por lo que una salida de 10 segundos a 768p con un clip de referencia de 5 segundos cuesta 15 segundos, o $1,65. Debido a que los clips de referencia se miden después de la ejecución, la cifra que se muestra antes de enviarla es una estimación; Si tiene preguntas sobre facturación, comuníquese con hi@runcomfy.com.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.





