Sincroniza una pista de audio con un vídeo existente mediante dos URL obligatorias.
MiniMax H3 es la familia de modelos multimodales de MiniMax para generar y editar imágenes, video y audio mediante instrucciones en lenguaje natural. Esta página ofrece MiniMax H3 Text-to-Video: convierte un único prompt escrito en un video 2K de 5–15 segundos a 24 FPS, con audio estéreo nativo generado junto con la imagen. Solo acepta texto; utiliza los flujos de trabajo H3 enlazados cuando necesites referencias de imagen, video o audio.
| Ventaja de MiniMax H3 | Qué aporta al usuario |
|---|---|
| Video 2K y audio estéreo nativo generados conjuntamente | Genera imágenes detalladas, diálogos, efectos, ambiente y música en un solo proceso, reduciendo etapas independientes de reescalado, diseño sonoro y sincronización. |
| Omni-Reference dirigido por lenguaje | En los flujos de trabajo de MiniMax H3, asigna funciones distintas a imágenes, video y audio —como identidad, apariencia del producto, movimiento, estilo de cámara, voz o música— para que varias fuentes guíen un resultado coherente. |
| Transferencia V2V y edición dirigida | MiniMax H3 puede conservar el movimiento o el lenguaje de cámara y modificar elementos visuales o sonoros concretos manteniendo el resto, lo que permite avanzar sin regenerar toda la toma desde cero. |
| Duración y encuadre listos para la entrega | Genera 5–15 segundos a 24 FPS en seis relaciones de aspecto, de modo que hooks, presentaciones de producto y escenas de varios momentos encajen en formatos cinematográficos, web, feed, retrato o verticales con menos recortes y reedición. |
9:16 o piezas para el feed en 1:1, con un hook inicial claro y un encuadre listo para la plataforma.La primera tabla recoge los controles disponibles en la herramienta MiniMax H3 Text-to-Video de esta página.
| Parámetro | Obligatorio | Tipo | Predeterminado | Rango / Opciones | Cómo elegir |
|---|---|---|---|---|---|
prompt* | Sí (*) | String | Prompt de ejemplo | 1–4,000 caracteres | Proporciona a MiniMax H3 un brief estructurado que incluya el sujeto, una acción principal, cámara, entorno e iluminación, estilo visual, audio y final previsto. Una estructura clara importa más que utilizar todo el límite. |
aspect_ratio | No | String | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Adapta la salida de MiniMax H3 al destino: 21:9 para tomas cinematográficas ultraanchas, 16:9 para video general y anuncios, 4:3 para encuadres editoriales o retro, 1:1 para feeds, 3:4 para productos en retrato y 9:16 para video social vertical. |
resolution | No | String | 2k | 2k | Valor fijo para esta herramienta y asociado al nivel 1440p descrito más abajo. Elige MiniMax H3 cuando necesites detalle de alta resolución sin seleccionar otro nivel de calidad. |
duration | No | Integer | 5 | 5–15 segundos, en incrementos de 1 segundo | Usa clips MiniMax H3 de 5–7 segundos para una acción o una iteración rápida, de 8–10 segundos para un cambio sencillo y de 11–15 segundos solo cuando el prompt defina un inicio, un desarrollo y un final claros. |
\* Campo obligatorio.
La siguiente tabla resume la familia de modelos MiniMax H3 en su conjunto. Las entradas descritas para los modos de primer/último fotograma y Omni-Reference están disponibles mediante flujos de trabajo independientes, no como controles de esta página Text-to-Video.
| Dimensión principal | MiniMax H3 |
|---|---|
| Modelo | MiniMax-H3 |
| Duración de salida | MiniMax H3 genera 5–15 segundos. |
| Relación de aspecto de salida | Modo de primer/último fotograma: conserva la relación de aspecto original de la imagen de entrada.<br>Modo Text-to-Video: utiliza la relación elegida por el usuario: 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.<br>Modo Omni-Reference: usa una de esas seis relaciones o Auto, que permite a MiniMax H3 elegir la relación de salida. |
| Resolución | MiniMax H3 admite dos niveles documentados. Modo 768p (disponible más adelante): para relaciones de aspecto desde 16:9 hasta 9:16, el lado corto mide 768 píxeles; en salidas más anchas, la resolución total es de unos 1 MP —por ejemplo, 21:9 equivale a 1536×672. Un resultado 768p puede ampliarse a 1440p.<br>Modo 1440p / 2K: para relaciones de aspecto desde 16:9 hasta 9:16, el lado corto mide 1440 píxeles; en salidas más anchas, la resolución total es de unos 3.7 MP —por ejemplo, 21:9 equivale a 2976×1248. |
| Frecuencia de fotogramas de salida | MiniMax H3 genera a 24 FPS. |
| Audio de salida | Todos los resultados de MiniMax H3 incluyen audio estéreo nativo. |
| Entrada de primer/último fotograma | Imágenes: 0, 1 o 2; anchura y altura de 256–5760 píxeles cada una; relación de aspecto de 5:2 a 2:5 (0.4–2.5). Sin una imagen de entrada, MiniMax H3 funciona en modo Text-to-Video, que es la herramienta disponible en esta página. |
| Entrada Omni-Reference | Imágenes: hasta 9; anchura y altura de 256–5760 píxeles cada una.<br>Videos: hasta 3; 2–15 segundos cada uno; duración combinada de video de hasta 15 segundos; anchura y altura de 256–5760 píxeles cada una; relación de aspecto de 5:2 a 2:5 (0.4–2.5).<br>Audio: hasta 3 clips; 2–15 segundos cada uno; duración combinada de audio de hasta 15 segundos. El audio debe acompañar una imagen o un video y no puede ser la única referencia.<br>Entrada mixta: hasta 12 archivos en total. Sin entradas de imagen, video o audio, el flujo de trabajo se convierte en Text-to-Video. |
| Formatos de entrada compatibles | MiniMax H3 acepta video: H.264/AVC o H.265/HEVC; audio integrado: AAC o MP3.<br>Imagen: JPG, JPEG, PNG, WEBP, HEIC o HEIF.<br>Audio: WAV o MP3. |
| Límites de tamaño de entrada | Cada video: 50 MB; cada imagen: 30 MB; cada archivo de audio: 15 MB. No existe un límite combinado de medios adicional a los límites por archivo, pero el cuerpo de la solicitud API está limitado a 64 MB; se recomienda introducir los medios mediante URL. |
| Límite del prompt | La guía de producto de MiniMax H3 permite hasta 7,000 caracteres. Esta implementación Text-to-Video acepta actualmente 1–4,000 caracteres, tal como muestra la tabla de controles de la página. |
MiniMax H3 cuesta $0.13 USD por segundo generado en 2K en esta página.
| Duración | Precio por video |
|---|---|
| 5 segundos | $0.65 |
| 10 segundos | $1.30 |
| 15 segundos | $1.95 |
Para lotes de 1–4 resultados, calcula el total como duration × $0.13 × output count.
Usa esta estructura reutilizable de prompts para MiniMax H3:
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
Prompt débil
> Un anuncio de un reloj de lujo, cinematográfico y dinámico, con música.
Prompt mejorado para MiniMax H3
> Un reloj automático de acero cepillado descansa sobre piedra volcánica negra. Una franja estrecha de luz de estudio recorre el cristal de zafiro mientras avanza el segundero y se forman gotas de condensación sobre la caja. Empieza con un macro extremo, realiza después un lento movimiento orbital de 30 grados y termina en la esfera. Anuncio de lujo con alto contraste y fondo negro profundo. Audio: suave tictac mecánico y un único pulso cinematográfico grave; sin diálogo.
La versión mejorada proporciona a MiniMax H3 un sujeto identificable, una acción temporizada, una dirección de cámara independiente, iluminación, acabado visual, fuentes de sonido y un fotograma final que se puede revisar.
Utiliza esta comparación de MiniMax H3 como guía de familias de modelos; puede que la resolución y la duración máximas no estén disponibles al mismo tiempo, y los flujos de trabajo de RunComfy pueden ofrecer entradas, niveles de resolución y controles de audio distintos.
| Modelo | Resolución | Duración máxima | Audio | Característica diferencial |
|---|---|---|---|---|
| MiniMax H3 | Hasta 2K | 15s | Estéreo nativo (voz, SFX, música) | Relaciona referencias de texto, imagen, video y audio mediante lenguaje para transferir movimiento V2V y realizar edición orientada a producción; los pesos públicos están previstos, pero todavía no se han publicado. |
| Hailuo 02 | 1080p | ~10s | Sin audio | La gran fidelidad al prompt y el movimiento centrado en la física resultan adecuados para gimnasia, danza, movimiento de productos y otras tomas de acción sin sonido que se sonorizarán posteriormente. |
| Kling 3.0 | Hasta 4K | 15s | Audio nativo con sincronización labial | Coordina cambios de cámara entre varias tomas con diálogos multilingües asignados a cada hablante y sincronización labial; resulta útil para anuncios guionizados, storyboards y escenas centradas en personajes. |
| Seedance 2.0 | 1080p | 15s | Audio y video conjuntos | Combina numerosas referencias de imagen, video y audio con generación audiovisual conjunta y sincronización labial precisa para anuncios sensibles a la identidad, historias de marca y ediciones con muchas referencias. |
| Veo 3.1 | 4K | 8s | Diálogos y efectos nativos | Combina diálogos y efectos indicados en el prompt con controles de primer/último fotograma, imagen de referencia y ampliación de escena; resulta adecuado para transiciones cinematográficas y secuencias ensambladas. |
En Hailuo 02, los máximos indicados dependen del modo: la salida 1080p está limitada a 6 segundos, mientras que la salida de 10 segundos está disponible en 512p o 768p.
En MiniMax H3, las funciones Omni-Reference y V2V pertenecen a flujos de trabajo relacionados; la herramienta Text-to-Video de esta página sigue admitiendo únicamente prompts.
Lo que diferencia a MiniMax H3 es la combinación: una familia de modelos de propósito general que relaciona texto, imagen, video y audio, genera sonido estéreo nativo y alcanza 2K a $0.13 por segundo generado en esta página. Elige MiniMax H3 cuando quieras comenzar con un brief escrito y mantener abierta la posibilidad de crear o editar mediante referencias en otros flujos de trabajo. Según la información disponible públicamente, prueba el mismo brief en cada modelo antes de adoptar una solución.
Si MiniMax H3 no es el punto de partida adecuado para un proyecto, compara estos flujos de trabajo especializados en RunComfy:
Sincroniza una pista de audio con un vídeo existente mediante dos URL obligatorias.
Convierte imágenes fijas en videos realistas y dinámicos en 2K.
Crea canciones mediante prompts, con salida WAV de 44,1 kHz y edición por secciones.
Convierte imágenes en videos realistas con audio y movimiento fluido
Cree un vídeo a partir de un prompt de texto con una relación de aspecto seleccionable y una duración de 5 o 10 segundos.
Convierte imágenes de referencia en un video fluido en 720P o 1080P con un solo prompt.
Sí. MiniMax H3 Text-to-Video está disponible en el navegador y mediante la RunComfy API utilizando los créditos de tu cuenta.
MiniMax H3 es la familia de modelos multimodales de propósito general de MiniMax para generación y edición. Su diseño de tareas más amplio abarca texto, imagen, video y audio, mientras que cada flujo de trabajo admite entradas diferentes. Esta página ofrece el flujo de trabajo Text-to-Video basado únicamente en un prompt.
MiniMax posiciona H3 para publicidad, branding, comercio electrónico, cine, diseño de títulos, pósteres animados, narrativa breve, conceptos de producto y UI, videojuegos, personajes virtuales y animación estilizada. El flujo de trabajo Text-to-Video actual es ideal para conceptos breves que se puedan dirigir mediante un prompt escrito.
En esta página, MiniMax H3 solo genera video en 2K. Elige cualquier duración en segundos enteros entre 5 y 15; el valor predeterminado es 5 segundos. Este flujo de trabajo no ofrece una opción 768p.
Sí. Este flujo de trabajo Text-to-Video genera audio estéreo nativo junto con el video. Describe el diálogo, el ambiente, los efectos sonoros o la música en el prompt; no hay un control de audio independiente. Los resultados pueden variar, así que revisa la sincronización labial y el ritmo del audio.
No. Esta página corresponde al flujo de trabajo MiniMax H3 Text-to-Video basado únicamente en un prompt, y su API solo acepta prompt, aspect_ratio, resolution y duration. Para usar contenido multimedia de origen, elige un flujo de trabajo independiente H3 Image-to-Video o Reference-to-Video.
En los flujos de trabajo de H3 que admiten referencias, el lenguaje natural puede asignar funciones diferentes al texto, las imágenes, el video y el audio. Por ejemplo, una fuente puede definir el movimiento de cámara, otra el personaje y otra la voz. Se trata de una capacidad de la familia de modelos, no de una función de carga de contenido multimedia en la página actual.
No. RunComfy ofrece MiniMax H3 en el navegador y mediante una API HTTP, por lo que no necesitas alojar ni escalar el modelo por tu cuenta. La publicación de lanzamiento de MiniMax del 31 de julio describía un plan condicionado para publicar los pesos del modelo; comprueba la disponibilidad y los términos de licencia actuales antes de planificar un alojamiento propio.
MiniMax H3 Text-to-Video cuesta $0.13 por segundo generado en 2K. Un video de 5 segundos cuesta $0.65, uno de 10 segundos cuesta $1.30 y uno de 15 segundos cuesta $1.95. La generación por lotes multiplica el coste basado en la duración por el número de resultados.
MiniMax describe Hailuo 02 como un modelo centrado en la arquitectura, los datos y la escala, mientras que MiniMax H3 se centra en generalizar tareas y modalidades. H3 también añade audio estéreo nativo y salida en 2K a su flujo de trabajo Text-to-Video.
Prueba el prompt, la relación de aspecto y la duración en RunComfy. Después, llama a la misma plantilla MiniMax H3 Text-to-Video mediante la API con prompt (obligatorio), aspect_ratio, resolution (solo 2k) y duration (5–15). Este flujo de trabajo no incluye campos para cargar contenido multimedia.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.














