Procesa un vídeo existente con una pista de audio y añade, si lo necesitas, prompt y semilla.
Minimax H3 Image to Video is MiniMax's H3-series model for turning one picture into moving footage. You hand it the opening frame and describe what should happen; the model resolves motion, camera behavior, and scene development, then renders at 768p or 2K.
Because the first frame is pinned by your upload, subject identity, wardrobe, palette, and framing carry through the clip. Minimax H3 Image to Video therefore fits work where the look is settled and only movement is missing.
768p for cheaper drafts or 2k when faces, packaging text, and fine texture need to survive a full-screen crop.These are the live fields for Minimax H3 Image to Video on this page.
| Parameter | Required | Type | Default | Range / Options | Description |
|---|---|---|---|---|---|
| image * | Yes (*) | string (URL) | Sample first frame | 256-5760 px per side, aspect ratio 0.4-2.5 | Opening frame that anchors subject, composition, and style. |
| prompt * | Yes (*) | string | Sample motion brief | 1-4000 characters | What should move, how the camera behaves, how the scene develops. |
| last_image | No | string (URL) | None | Same image constraints as image | Closing frame used to steer where the clip ends. |
| duration * | Yes (*) | integer | 5 | 4-15 | Clip length in whole seconds. |
| resolution * | Yes (*) | string | 768p | 768p, 2k | Output resolution tier. |
Minimax H3 Image to Video bills on resolution and the length of the finished clip:
| Resolution | Price per second | 5s | 10s | 15s |
|---|---|---|---|---|
| 768p | $0.11 | $0.55 | $1.10 | $1.65 |
| 2K | $0.16 | $0.80 | $1.60 | $2.40 |
1) Upload the opening frame — Pick an image where the subject reads clearly and the composition matches the shot you want.
2) Write the motion brief — Say what moves, how fast, and what the camera does. Minimax H3 Image to Video answers to verbs and camera language, not adjective lists.
3) Add a closing frame (optional) — Supply a last image when the ending matters, and keep it compatible with the first frame.
4) Set the length — Start at 5 seconds while tuning wording, then extend toward 15 once the motion behaves.
5) Choose the resolution — Use 768p for drafts; switch to 2k for final deliveries that need more detail.
6) Generate — Submit and review the Minimax H3 Image to Video result at full size.
7) Iterate one variable at a time — Swap the prompt, image, duration, or resolution separately so you can tell what changed the take.
When Minimax H3 Image to Video is not the right fit, these are worth a pass:
Procesa un vídeo existente con una pista de audio y añade, si lo necesitas, prompt y semilla.
MiniMax H3: texto a vídeo 768p/2K con audio estéreo nativo
Seedance 2.5: anima una imagen fija a vídeo cinematográfico con IA
Texto a vídeo cinematográfico premium con la mayor fidelidad visual de la familia Kling V3.0.
Crea un vídeo corto con audio sincronizado a partir de imágenes de referencia y una instrucción.
Convierte imágenes de referencia en un video fluido en 720P o 1080P con un solo prompt.
Minimax H3 Image to Video toma una imagen fija más un resumen de movimiento escrito y devuelve un videoclip de 768p o 2K. Está diseñado para convertir obras de arte, fotografías de productos o un fotograma renderizado en una toma en movimiento sin reconstruir la escena en 3D o una herramienta de composición. La imagen cargada corrige el fotograma de apertura, por lo que el sujeto y el encuadre que ya aprobó se incluyen en el clip.
Además del primer fotograma requerido, Minimax H3 Image to Video acepta una última imagen opcional que guía cómo termina el clip. El modelo resuelve el movimiento entre los dos fotogramas en lugar de derivar hacia un estado final arbitrario. Mantenga las dos imágenes visualmente compatibles en iluminación, paleta y encuadre, o la transición parecerá forzada.
La resolución de salida se puede seleccionar como 768p o 2k, y la duración se puede seleccionar de 4 a 15 segundos en segundos completos. Los clips más cortos son la opción práctica mientras todavía estás probando la redacción de mensajes con Minimax H3 Image to Video, y los clips más largos brindan espacio para desarrollar la escena. Consulte el panel de parámetros en esta página para conocer los valores exactos actualmente expuestos.
La imagen de origen debe medir entre 256 y 5760 píxeles en cada lado con una relación de aspecto entre 0,4 y 2,5, y el mensaje acepta de 1 a 4000 caracteres. Minimax H3 Image to Video no recompone un sujeto mal recortado, así que proporcione una imagen que ya coincida con el encuadre deseado. Los límites pueden variar según el modo o la configuración del proveedor, así que confírmelo en el panel en vivo.
Describe primero qué se mueve físicamente, luego el comportamiento de la cámara, luego la iluminación y el estado de ánimo. Minimax H3 Image to Video responde mejor a verbos concretos y movimientos de cámara con nombre, como un empuje lento o una órbita, que a adjetivos apilados. Evite mezclar dos estilos visuales en competencia en un mensaje, ya que el resultado tiende a promediarlos.
La conversión de texto a vídeo decide el tema, la composición y el estilo desde cero, lo que dificulta conseguir un aspecto aprobado dos veces. Minimax H3 Image to Video elimina esa variable al bloquear el fotograma de apertura de su carga, lo que se adapta a tomas de productos, trabajo de personajes y material de campaña donde la dirección de arte ya está aprobada. Es una herramienta más limitada por diseño, con una lista de entrada corta y un ciclo de iteración rápido.
Sí. Realice un prototipo en la interfaz de usuario web RunComfy AI Playground para establecer su imagen, mensaje, resolución y duración, luego llame al mismo modelo a través de la API RunComfy con parámetros idénticos. Esto le permite mantener la configuración de Imagen a Video de Minimax H3 consistente entre la exploración manual y los trabajos por lotes o programados en su propia aplicación.
Las generaciones consumen dólares o créditos de su saldo RunComfy. La tarifa es de $0,11 por segundo a 768p y de $0,16 por segundo a 2K. Por lo tanto, un clip de 5 segundos cuesta 0,55 dólares a 768p o 0,80 dólares a 2K; 10 segundos cuestan $1,10 o $1,60; 15 segundos cuestan $1,65 o $2,40. Los nuevos usuarios normalmente reciben una cantidad de prueba gratuita para realizar pruebas; Si tiene preguntas sobre facturación, comuníquese con hi@runcomfy.com.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.





