logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

MiniMax H3: Text-to-Video en 2K con audio estéreo | RunComfy

minimax/minimax-h3/text-to-video

MiniMax H3 Text-to-Video convierte un prompt escrito en un video en 2K de 5–15 segundos con sonido estéreo nativo. Usa otro flujo de trabajo de H3 para referencias de imagen, video o audio.

La relación de aspecto del video generado.
La resolución del video generado.
La duración del video generado en segundos.
Idle
MiniMax H3 generates 2K video. The rate is $0.13 per second.

Introducción a la creación de video con MiniMax H3

MiniMax H3 es la familia de modelos multimodales de propósito general de MiniMax. Esta página de Text-to-Video convierte un prompt escrito en un video en 2K de 5–15 segundos a 24 FPS, con sonido estéreo generado junto con la imagen. En toda la familia, otros flujos de trabajo de H3 utilizan imágenes, video y audio como referencias para controlar la identidad, el movimiento, la cámara, la voz, el sonido o la edición; esas entradas multimedia no están disponibles en esta página. MiniMax posiciona el modelo para publicidad, branding, comercio electrónico, diseño de producto, UI/UX, videojuegos y conceptos audiovisuales breves. Para desarrolladores, MiniMax H3 en RunComfy está disponible tanto en el navegador como mediante una API HTTP, por lo que no necesitas alojar ni escalar el modelo por tu cuenta.
Ideal para: anuncios y videos de producto en 2K | narrativa de marca dirigida por prompts | conceptos audiovisuales breves

Por qué elegir MiniMax H3#


MiniMax H3 es la familia de modelos multimodales de MiniMax para generar y editar imágenes, video y audio mediante instrucciones en lenguaje natural. Esta página ofrece MiniMax H3 Text-to-Video: convierte un único prompt escrito en un video 2K de 5–15 segundos a 24 FPS, con audio estéreo nativo generado junto con la imagen. Solo acepta texto; utiliza los flujos de trabajo H3 enlazados cuando necesites referencias de imagen, video o audio.


Ventaja de MiniMax H3Qué aporta al usuario
Video 2K y audio estéreo nativo generados conjuntamenteGenera imágenes detalladas, diálogos, efectos, ambiente y música en un solo proceso, reduciendo etapas independientes de reescalado, diseño sonoro y sincronización.
Omni-Reference dirigido por lenguajeEn los flujos de trabajo de MiniMax H3, asigna funciones distintas a imágenes, video y audio —como identidad, apariencia del producto, movimiento, estilo de cámara, voz o música— para que varias fuentes guíen un resultado coherente.
Transferencia V2V y edición dirigidaMiniMax H3 puede conservar el movimiento o el lenguaje de cámara y modificar elementos visuales o sonoros concretos manteniendo el resto, lo que permite avanzar sin regenerar toda la toma desde cero.
Duración y encuadre listos para la entregaGenera 5–15 segundos a 24 FPS en seis relaciones de aspecto, de modo que hooks, presentaciones de producto y escenas de varios momentos encajen en formatos cinematográficos, web, feed, retrato o verticales con menos recortes y reedición.

Mejores casos de uso#


  • Publicidad y lanzamientos de producto: Usa MiniMax H3 para hero shots, presentaciones de producto, conceptos de campaña y anuncios breves en los que la dirección de cámara y el sonido deban diseñarse juntos.
  • Contenido para redes sociales: Usa MiniMax H3 para crear Shorts, Reels y Stories en 9:16 o piezas para el feed en 1:1, con un hook inicial claro y un encuadre listo para la plataforma.
  • Previsualización cinematográfica y publicitaria: Usa MiniMax H3 para probar un movimiento de cámara, un esquema de iluminación, una acción, una transición de escena o una banda sonora temporal antes de pasar a producción.
  • Storytelling de marca y estilizado: Usa MiniMax H3 para explorar secuencias de títulos, pósteres animados, momentos de personajes y estilos gráficos cuando una idea escrita necesita un tratamiento audiovisual pulido.

Cómo funciona#


  1. Describe la toma: Indica a MiniMax H3 qué aparece, qué cambia con el tiempo, cómo se mueve la cámara, qué aspecto debe tener la escena y qué debe oírse.
  2. Elige el formato de entrega: Selecciona una relación de aspecto y una duración de 5–15 segundos. MiniMax H3 mantiene la resolución fija en 2K, por lo que no hay que configurar un nivel de calidad.
  3. Genera y perfecciona: El modelo crea el video y el audio estéreo conjuntamente. Revisa movimiento, texto, rostros, sincronización labial y ritmo del sonido; después, cambia una instrucción cada vez.

Parámetros#


La primera tabla recoge los controles disponibles en la herramienta MiniMax H3 Text-to-Video de esta página.


ParámetroObligatorioTipoPredeterminadoRango / OpcionesCómo elegir
prompt*Sí (*)StringPrompt de ejemplo1–4,000 caracteresProporciona a MiniMax H3 un brief estructurado que incluya el sujeto, una acción principal, cámara, entorno e iluminación, estilo visual, audio y final previsto. Una estructura clara importa más que utilizar todo el límite.
aspect_ratioNoString16:921:9, 16:9, 4:3, 1:1, 3:4, 9:16Adapta la salida de MiniMax H3 al destino: 21:9 para tomas cinematográficas ultraanchas, 16:9 para video general y anuncios, 4:3 para encuadres editoriales o retro, 1:1 para feeds, 3:4 para productos en retrato y 9:16 para video social vertical.
resolutionNoString2k2kValor fijo para esta herramienta y asociado al nivel 1440p descrito más abajo. Elige MiniMax H3 cuando necesites detalle de alta resolución sin seleccionar otro nivel de calidad.
durationNoInteger55–15 segundos, en incrementos de 1 segundoUsa clips MiniMax H3 de 5–7 segundos para una acción o una iteración rápida, de 8–10 segundos para un cambio sencillo y de 11–15 segundos solo cuando el prompt defina un inicio, un desarrollo y un final claros.

\* Campo obligatorio.


La siguiente tabla resume la familia de modelos MiniMax H3 en su conjunto. Las entradas descritas para los modos de primer/último fotograma y Omni-Reference están disponibles mediante flujos de trabajo independientes, no como controles de esta página Text-to-Video.


Dimensión principalMiniMax H3
ModeloMiniMax-H3
Duración de salidaMiniMax H3 genera 5–15 segundos.
Relación de aspecto de salidaModo de primer/último fotograma: conserva la relación de aspecto original de la imagen de entrada.<br>Modo Text-to-Video: utiliza la relación elegida por el usuario: 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.<br>Modo Omni-Reference: usa una de esas seis relaciones o Auto, que permite a MiniMax H3 elegir la relación de salida.
ResoluciónMiniMax H3 admite dos niveles documentados. Modo 768p (disponible más adelante): para relaciones de aspecto desde 16:9 hasta 9:16, el lado corto mide 768 píxeles; en salidas más anchas, la resolución total es de unos 1 MP —por ejemplo, 21:9 equivale a 1536×672. Un resultado 768p puede ampliarse a 1440p.<br>Modo 1440p / 2K: para relaciones de aspecto desde 16:9 hasta 9:16, el lado corto mide 1440 píxeles; en salidas más anchas, la resolución total es de unos 3.7 MP —por ejemplo, 21:9 equivale a 2976×1248.
Frecuencia de fotogramas de salidaMiniMax H3 genera a 24 FPS.
Audio de salidaTodos los resultados de MiniMax H3 incluyen audio estéreo nativo.
Entrada de primer/último fotogramaImágenes: 0, 1 o 2; anchura y altura de 256–5760 píxeles cada una; relación de aspecto de 5:2 a 2:5 (0.4–2.5). Sin una imagen de entrada, MiniMax H3 funciona en modo Text-to-Video, que es la herramienta disponible en esta página.
Entrada Omni-ReferenceImágenes: hasta 9; anchura y altura de 256–5760 píxeles cada una.<br>Videos: hasta 3; 2–15 segundos cada uno; duración combinada de video de hasta 15 segundos; anchura y altura de 256–5760 píxeles cada una; relación de aspecto de 5:2 a 2:5 (0.4–2.5).<br>Audio: hasta 3 clips; 2–15 segundos cada uno; duración combinada de audio de hasta 15 segundos. El audio debe acompañar una imagen o un video y no puede ser la única referencia.<br>Entrada mixta: hasta 12 archivos en total. Sin entradas de imagen, video o audio, el flujo de trabajo se convierte en Text-to-Video.
Formatos de entrada compatiblesMiniMax H3 acepta video: H.264/AVC o H.265/HEVC; audio integrado: AAC o MP3.<br>Imagen: JPG, JPEG, PNG, WEBP, HEIC o HEIF.<br>Audio: WAV o MP3.
Límites de tamaño de entradaCada video: 50 MB; cada imagen: 30 MB; cada archivo de audio: 15 MB. No existe un límite combinado de medios adicional a los límites por archivo, pero el cuerpo de la solicitud API está limitado a 64 MB; se recomienda introducir los medios mediante URL.
Límite del promptLa guía de producto de MiniMax H3 permite hasta 7,000 caracteres. Esta implementación Text-to-Video acepta actualmente 1–4,000 caracteres, tal como muestra la tabla de controles de la página.

Precios#


MiniMax H3 cuesta $0.13 USD por segundo generado en 2K en esta página.


DuraciónPrecio por video
5 segundos$0.65
10 segundos$1.30
15 segundos$1.95

Para lotes de 1–4 resultados, calcula el total como duration × $0.13 × output count.


Consejos y ejemplos de prompts#


Usa esta estructura reutilizable de prompts para MiniMax H3:


[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]


  • Separa los movimientos: Describe de forma independiente el movimiento del sujeto y el movimiento de la cámara.
  • Muestra la secuencia: Usa «empieza con», «después» y «termina en» cuando el clip tenga más de un momento.
  • Nombra las fuentes de sonido: Indica a MiniMax H3 quién habla, qué produce cada sonido, cuál debe ser el ambiente y si la música debe dominar o mantenerse sutil.
  • Limita las ideas que compiten: Un sujeto principal, una acción primaria y un estilo coherente son más fáciles de seguir para MiniMax H3.

Prompt débil


> Un anuncio de un reloj de lujo, cinematográfico y dinámico, con música.


Prompt mejorado para MiniMax H3


> Un reloj automático de acero cepillado descansa sobre piedra volcánica negra. Una franja estrecha de luz de estudio recorre el cristal de zafiro mientras avanza el segundero y se forman gotas de condensación sobre la caja. Empieza con un macro extremo, realiza después un lento movimiento orbital de 30 grados y termina en la esfera. Anuncio de lujo con alto contraste y fondo negro profundo. Audio: suave tictac mecánico y un único pulso cinematográfico grave; sin diálogo.


La versión mejorada proporciona a MiniMax H3 un sujeto identificable, una acción temporizada, una dirección de cámara independiente, iluminación, acabado visual, fuentes de sonido y un fotograma final que se puede revisar.


Comparación de MiniMax H3#


Utiliza esta comparación de MiniMax H3 como guía de familias de modelos; puede que la resolución y la duración máximas no estén disponibles al mismo tiempo, y los flujos de trabajo de RunComfy pueden ofrecer entradas, niveles de resolución y controles de audio distintos.


ModeloResoluciónDuración máximaAudioCaracterística diferencial
MiniMax H3Hasta 2K15sEstéreo nativo (voz, SFX, música)Relaciona referencias de texto, imagen, video y audio mediante lenguaje para transferir movimiento V2V y realizar edición orientada a producción; los pesos públicos están previstos, pero todavía no se han publicado.
Hailuo 021080p~10sSin audioLa gran fidelidad al prompt y el movimiento centrado en la física resultan adecuados para gimnasia, danza, movimiento de productos y otras tomas de acción sin sonido que se sonorizarán posteriormente.
Kling 3.0Hasta 4K15sAudio nativo con sincronización labialCoordina cambios de cámara entre varias tomas con diálogos multilingües asignados a cada hablante y sincronización labial; resulta útil para anuncios guionizados, storyboards y escenas centradas en personajes.
Seedance 2.01080p15sAudio y video conjuntosCombina numerosas referencias de imagen, video y audio con generación audiovisual conjunta y sincronización labial precisa para anuncios sensibles a la identidad, historias de marca y ediciones con muchas referencias.
Veo 3.14K8sDiálogos y efectos nativosCombina diálogos y efectos indicados en el prompt con controles de primer/último fotograma, imagen de referencia y ampliación de escena; resulta adecuado para transiciones cinematográficas y secuencias ensambladas.

En Hailuo 02, los máximos indicados dependen del modo: la salida 1080p está limitada a 6 segundos, mientras que la salida de 10 segundos está disponible en 512p o 768p.


En MiniMax H3, las funciones Omni-Reference y V2V pertenecen a flujos de trabajo relacionados; la herramienta Text-to-Video de esta página sigue admitiendo únicamente prompts.


Lo que diferencia a MiniMax H3 es la combinación: una familia de modelos de propósito general que relaciona texto, imagen, video y audio, genera sonido estéreo nativo y alcanza 2K a $0.13 por segundo generado en esta página. Elige MiniMax H3 cuando quieras comenzar con un brief escrito y mantener abierta la posibilidad de crear o editar mediante referencias en otros flujos de trabajo. Según la información disponible públicamente, prueba el mismo brief en cada modelo antes de adoptar una solución.


Más modelos que puedes probar#


Si MiniMax H3 no es el punto de partida adecuado para un proyecto, compara estos flujos de trabajo especializados en RunComfy:


  • MiniMax H3 Image-to-Video: Empieza con una imagen y guía opcionalmente el fotograma final cuando la composición, la identidad o la apariencia del producto deban permanecer ancladas.
  • MiniMax H3 Reference-to-Video: Combina imágenes con video y audio opcionales cuando sea necesario conservar el movimiento, el estilo de cámara, la voz, la música u otros detalles de la fuente.
  • Hailuo 02 Image-to-Video: Prueba una generación anterior de MiniMax cuando quieras un flujo de trabajo específico para animar imágenes.
  • Hailuo 2.3 Pro: Anima una imagen fija en 1080p con movimiento estable y consciente de la física, expresiones faciales matizadas e iluminación natural; resulta ideal para tomas pulidas de productos, retratos y personajes.
  • Kling 3.0: Anima una imagen inicial con un fotograma final opcional, referencias de elementos, prompts de tomas temporizados y audio sincronizado para secuencias controladas de marcas y personajes.
  • Seedance 2.0 Pro: Combina hasta nueve imágenes, tres videos y tres clips de audio para mantener alineados la identidad, el lenguaje de cámara y el habla, los efectos y la música sincronizados a lo largo de clips de 4–15 segundos.

Recursos oficiales#


  • Publicación de lanzamiento de MiniMax H3
  • Sitio web oficial de MiniMax

Modelos relacionados

kling/lipsync/audio-to-video

Sincroniza una pista de audio con un vídeo existente mediante dos URL obligatorias.

dreamina-3-0/pro/image-to-video

Convierte imágenes fijas en videos realistas y dinámicos en 2K.

elevenlabs/music-generation

Crea canciones mediante prompts, con salida WAV de 44,1 kHz y edición por secciones.

wan-2-5/image-to-video

Convierte imágenes en videos realistas con audio y movimiento fluido

kling-video-o1/standard/text-to-video

Cree un vídeo a partir de un prompt de texto con una relación de aspecto seleccionable y una duración de 5 o 10 segundos.

happyhorse-1.1/reference-to-video

Convierte imágenes de referencia en un video fluido en 720P o 1080P con un solo prompt.

Preguntas Frecuentes

¿MiniMax H3 ya está disponible en RunComfy?

Sí. MiniMax H3 Text-to-Video está disponible en el navegador y mediante la RunComfy API utilizando los créditos de tu cuenta.

¿Qué es MiniMax H3?

MiniMax H3 es la familia de modelos multimodales de propósito general de MiniMax para generación y edición. Su diseño de tareas más amplio abarca texto, imagen, video y audio, mientras que cada flujo de trabajo admite entradas diferentes. Esta página ofrece el flujo de trabajo Text-to-Video basado únicamente en un prompt.

¿Para qué se puede utilizar MiniMax H3?

MiniMax posiciona H3 para publicidad, branding, comercio electrónico, cine, diseño de títulos, pósteres animados, narrativa breve, conceptos de producto y UI, videojuegos, personajes virtuales y animación estilizada. El flujo de trabajo Text-to-Video actual es ideal para conceptos breves que se puedan dirigir mediante un prompt escrito.

¿Qué resolución y duración de clip admite MiniMax H3 Text-to-Video?

En esta página, MiniMax H3 solo genera video en 2K. Elige cualquier duración en segundos enteros entre 5 y 15; el valor predeterminado es 5 segundos. Este flujo de trabajo no ofrece una opción 768p.

¿MiniMax H3 genera audio?

Sí. Este flujo de trabajo Text-to-Video genera audio estéreo nativo junto con el video. Describe el diálogo, el ambiente, los efectos sonoros o la música en el prompt; no hay un control de audio independiente. Los resultados pueden variar, así que revisa la sincronización labial y el ritmo del audio.

¿Puedo usar referencias de imagen, video o audio en esta página de MiniMax H3?

No. Esta página corresponde al flujo de trabajo MiniMax H3 Text-to-Video basado únicamente en un prompt, y su API solo acepta prompt, aspect_ratio, resolution y duration. Para usar contenido multimedia de origen, elige un flujo de trabajo independiente H3 Image-to-Video o Reference-to-Video.

¿Qué significa el contexto multimodal para la familia de modelos MiniMax H3?

En los flujos de trabajo de H3 que admiten referencias, el lenguaje natural puede asignar funciones diferentes al texto, las imágenes, el video y el audio. Por ejemplo, una fuente puede definir el movimiento de cámara, otra el personaje y otra la voz. Se trata de una capacidad de la familia de modelos, no de una función de carga de contenido multimedia en la página actual.

¿Tengo que alojar MiniMax H3 por mi cuenta?

No. RunComfy ofrece MiniMax H3 en el navegador y mediante una API HTTP, por lo que no necesitas alojar ni escalar el modelo por tu cuenta. La publicación de lanzamiento de MiniMax del 31 de julio describía un plan condicionado para publicar los pesos del modelo; comprueba la disponibilidad y los términos de licencia actuales antes de planificar un alojamiento propio.

¿Cuánto cuesta MiniMax H3 Text-to-Video?

MiniMax H3 Text-to-Video cuesta $0.13 por segundo generado en 2K. Un video de 5 segundos cuesta $0.65, uno de 10 segundos cuesta $1.30 y uno de 15 segundos cuesta $1.95. La generación por lotes multiplica el coste basado en la duración por el número de resultados.

¿En qué se diferencia MiniMax H3 de Hailuo 02?

MiniMax describe Hailuo 02 como un modelo centrado en la arquitectura, los datos y la escala, mientras que MiniMax H3 se centra en generalizar tareas y modalidades. H3 también añade audio estéreo nativo y salida en 2K a su flujo de trabajo Text-to-Video.

¿Cómo paso de probar MiniMax H3 en el navegador a integrarlo mediante la API?

Prueba el prompt, la relación de aspecto y la duración en RunComfy. Después, llama a la misma plantilla MiniMax H3 Text-to-Video mediante la API con prompt (obligatorio), aspect_ratio, resolution (solo 2k) y duration (5–15). Este flujo de trabajo no incluye campos para cargar contenido multimedia.

Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • Ver todos los modelos →
Modelos de Imagen
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.

Ejemplos de MiniMax H3

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...