Anime uma imagem inicial com texto e configure proporção, resolução, duração, estilo, áudio e vários clipes.
MiniMax H3 é a família de modelos multimodais da MiniMax para gerar e editar imagens, vídeos e áudio por meio de instruções em linguagem natural. Esta página oferece o MiniMax H3 Text-to-Video: transforme um único prompt escrito em um vídeo 2K de 5–15 segundos a 24 FPS, com áudio estéreo nativo gerado junto com a imagem. A ferramenta aceita apenas texto; use os workflows H3 indicados nos links quando precisar de referências de imagem, vídeo ou áudio.
| Vantagem do MiniMax H3 | O que isso significa para você |
|---|---|
| Vídeo 2K e áudio estéreo nativo gerados em conjunto | Gere imagens detalhadas, diálogos, efeitos, ambiência e música em uma única etapa, reduzindo processos separados de upscaling, design de som e sincronização. |
| Omni-Reference dirigido por linguagem | Em diferentes workflows do MiniMax H3, atribua funções distintas a imagens, vídeos e áudio — como identidade, aparência do produto, movimento, estilo de câmera, voz ou música — para que várias fontes orientem um único resultado coerente. |
| Transferência V2V e edição direcionada | O MiniMax H3 pode transferir o movimento ou a linguagem de câmera e revisar elementos visuais ou sonoros selecionados, preservando o restante e oferecendo às equipes de produção um caminho além de regenerar um plano do zero. |
| Duração e enquadramento prontos para publicação | Gere 5–15 segundos a 24 FPS em seis proporções para que aberturas, revelações de produtos e cenas com vários momentos se ajustem a formatos cinematográficos, web, feed, retrato ou vertical, com menos necessidade de recorte e reenquadramento. |
9:16 ou peças de feed em 1:1, com uma abertura clara e enquadramento pronto para a plataforma.A primeira tabela lista os controles disponibilizados pela ferramenta MiniMax H3 Text-to-Video nesta página.
| Parâmetro | Obrigatório | Tipo | Padrão | Intervalo / Opções | Como escolher |
|---|---|---|---|---|---|
prompt* | Sim (*) | String | Prompt de exemplo | 1–4,000 caracteres | Forneça ao MiniMax H3 um briefing estruturado que cubra o objeto, uma ação principal, a câmera, o ambiente e a iluminação, o estilo visual, o áudio e o final desejado. Uma estrutura clara é mais importante do que usar todo o limite. |
aspect_ratio | Não | String | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Adapte a saída do MiniMax H3 ao destino: 21:9 para planos cinematográficos ultrawide, 16:9 para vídeos em geral e anúncios, 4:3 para enquadramento editorial ou retrô, 1:1 para feeds, 3:4 para produtos em retrato e 9:16 para vídeos verticais em redes sociais. |
resolution | Não | String | 2k | 2k | Valor fixo para esta ferramenta e associado ao nível 1440p abaixo. Escolha o MiniMax H3 quando a saída precisar de detalhes em alta resolução sem selecionar outro nível de qualidade. |
duration | Não | Integer | 5 | 5–15 segundos, em incrementos de 1 segundo | Use clipes do MiniMax H3 de 5–7 segundos para uma ação ou iterações rápidas, de 8–10 segundos para uma mudança simples e de 11–15 segundos somente quando o prompt definir um início, um desenvolvimento e um final claros. |
\* Campo obrigatório.
A tabela a seguir resume a família mais ampla de modelos MiniMax H3. As entradas descritas para os modos de quadro inicial/final e Omni-Reference estão disponíveis em workflows separados, não como controles desta página Text-to-Video.
| Dimensão principal | MiniMax H3 |
|---|---|
| Modelo | MiniMax-H3 |
| Duração da saída | O MiniMax H3 gera vídeos de 5–15 segundos. |
| Proporção da saída | Modo de quadro inicial/final: segue a proporção original da imagem de entrada.<br>Modo Text-to-Video: segue a proporção 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16 selecionada pelo usuário.<br>Modo Omni-Reference: usa uma dessas seis proporções ou Auto, que permite ao MiniMax H3 escolher a proporção da saída. |
| Resolução | O MiniMax H3 oferece dois níveis documentados. Modo 768p (disponível posteriormente): para proporções de 16:9 a 9:16, o lado menor tem 768 pixels; para saídas mais largas, a resolução total é de cerca de 1 MP — por exemplo, 21:9 corresponde a 1536×672. Um resultado em 768p pode receber upgrade para 1440p.<br>Modo 1440p / 2K: para proporções de 16:9 a 9:16, o lado menor tem 1440 pixels; para saídas mais largas, a resolução total é de cerca de 3.7 MP — por exemplo, 21:9 corresponde a 2976×1248. |
| Taxa de quadros da saída | O MiniMax H3 gera a 24 FPS. |
| Áudio da saída | Todo resultado do MiniMax H3 inclui áudio estéreo nativo. |
| Entrada de quadro inicial/final | Imagens: 0, 1 ou 2; largura e altura de 256–5760 pixels cada; proporção de 5:2 a 2:5 (0.4–2.5). Sem entrada de imagem, o MiniMax H3 funciona no modo Text-to-Video — a ferramenta oferecida nesta página. |
| Entrada Omni-Reference | Imagens: até 9; largura e altura de 256–5760 pixels cada.<br>Vídeos: até 3; cada um com 2–15 segundos; duração combinada dos vídeos de até 15 segundos; largura e altura de 256–5760 pixels cada; proporção de 5:2 a 2:5 (0.4–2.5).<br>Áudio: até 3 clipes; cada um com 2–15 segundos; duração combinada do áudio de até 15 segundos. O áudio deve acompanhar uma imagem ou um vídeo e não pode ser a única referência.<br>Entrada mista: até 12 arquivos no total. Sem entrada de imagem, vídeo ou áudio, o workflow se torna Text-to-Video. |
| Formatos de entrada compatíveis | O MiniMax H3 aceita vídeo: H.264/AVC ou H.265/HEVC; áudio incorporado: AAC ou MP3.<br>Imagem: JPG, JPEG, PNG, WEBP, HEIC ou HEIF.<br>Áudio: WAV ou MP3. |
| Limites de tamanho da entrada | Cada vídeo: 50 MB; cada imagem: 30 MB; cada arquivo de áudio: 15 MB. Não há um limite separado para a combinação das mídias além dos limites por arquivo, mas o corpo da solicitação da API é limitado a 64 MB; recomenda-se usar entrada de mídia baseada em URL. |
| Limite do prompt | O guia do produto MiniMax H3 permite até 7,000 caracteres. Esta implementação Text-to-Video aceita atualmente 1–4,000 caracteres, como mostra a tabela de controles da página acima. |
O MiniMax H3 custa $0.13 USD por segundo gerado em 2K nesta página.
| Duração | Preço por vídeo |
|---|---|
| 5 segundos | $0.65 |
| 10 segundos | $1.30 |
| 15 segundos | $1.95 |
Para lotes com 1–4 saídas, calcule o total como duration × $0.13 × output count.
Use esta estrutura reutilizável de prompt para o MiniMax H3:
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
Prompt fraco
> Um anúncio de relógio de luxo, cinematográfico e dinâmico, com música.
Prompt melhorado para o MiniMax H3
> Um relógio automático de aço escovado repousa sobre uma pedra vulcânica preta. Uma faixa estreita de luz de estúdio percorre o cristal de safira enquanto o ponteiro dos segundos se move e gotas de condensação se formam na caixa. Comece com um macro extremo, depois faça uma órbita lenta de 30 graus e termine no mostrador do relógio. Comercial de luxo com alto contraste e fundo preto profundo. Áudio: tique-taque mecânico suave e um único pulso cinematográfico grave; sem diálogo.
A versão melhorada oferece ao MiniMax H3 um objeto identificável, uma ação temporizada, direção de câmera separada, iluminação, acabamento visual, fontes sonoras e um plano final que pode ser revisado.
Use esta comparação do MiniMax H3 como um guia da família de modelos; a resolução e a duração máximas podem não estar disponíveis simultaneamente, e os workflows da RunComfy podem oferecer diferentes entradas, níveis de resolução e controles de áudio.
| Modelo | Resolução | Duração máxima | Áudio | Destaque |
|---|---|---|---|---|
| MiniMax H3 | Até 2K | 15s | Estéreo nativo (voz, SFX, música) | Relaciona referências de texto, imagem, vídeo e áudio por meio da linguagem para transferência de movimento V2V e edição de produção; os pesos públicos estão planejados, mas ainda não foram lançados. |
| Hailuo 02 | 1080p | ~10s | Nenhum | A forte aderência ao prompt e o movimento centrado na física são adequados para ginástica, dança, movimento de produtos e outros planos de ação sem som que receberão áudio posteriormente na produção. |
| Kling 3.0 | Até 4K | 15s | Áudio nativo com sincronização labial | Coordena mudanças de câmera em vários planos com diálogos multilíngues atribuídos a falantes e sincronização labial — útil para anúncios roteirizados, storyboards e cenas conduzidas por personagens. |
| Seedance 2.0 | 1080p | 15s | Áudio e vídeo conjuntos | Combina muitas referências de imagem, vídeo e áudio com geração audiovisual conjunta e sincronização labial precisa para anúncios sensíveis à identidade, histórias de marca e edições com muitas referências. |
| Veo 3.1 | 4K | 8s | Diálogo e efeitos nativos | Combina diálogos e efeitos orientados por prompt com controles de quadro inicial/final, imagem de referência e extensão de cena — adequado para transições cinematográficas e sequências montadas. |
Para o Hailuo 02, os valores máximos indicados variam conforme o modo: a saída em 1080p é limitada a 6 segundos, enquanto a saída de 10 segundos está disponível em 512p ou 768p.
No MiniMax H3, os recursos Omni-Reference e V2V pertencem a workflows relacionados; a ferramenta Text-to-Video desta página continua aceitando apenas prompts.
O que diferencia o MiniMax H3 é a combinação: uma família de modelos de uso geral que relaciona texto, imagem, vídeo e áudio, gera som estéreo nativo e alcança 2K por $0.13 por segundo gerado nesta página. Escolha o MiniMax H3 quando quiser começar com um briefing em texto e manter um caminho para criação ou edição guiada por referências em workflows relacionados. Com base nas informações disponíveis publicamente, execute o mesmo briefing em cada modelo antes de definir um pipeline.
Se o MiniMax H3 não for o ponto de partida certo para um projeto, compare estes workflows especializados na RunComfy:
Anime uma imagem inicial com texto e configure proporção, resolução, duração, estilo, áudio e vários clipes.
Gere um vídeo a partir de imagens de referência e elementos obrigatórios. Use tokens @Image e @Element na ordem dos arrays e defina com precisão a duração e a proporção.
Transforme imagens em vídeos cinematográficos com Veo 3.1 Fast e crie conteúdos criativos em instantes.
Crie um vídeo de avatar a partir de um arquivo de imagem e áudio obrigatório, com um prompt de texto opcional para orientação de geração.
Anime uma imagem de referência com o Sora 2 Pro usando um prompt e escolha o tamanho e a duração.
Geração de vídeo com qualidade cinematográfica no nível do Seedance 2.0, alta fidelidade visual e movimento natural
Sim. O MiniMax H3 Text-to-Video está disponível no navegador e pela RunComfy API usando os créditos da sua conta.
O MiniMax H3 é a família de modelos de geração e edição multimodal de uso geral da MiniMax. Seu projeto mais amplo abrange texto, imagem, vídeo e áudio, enquanto cada workflow disponibiliza entradas diferentes. Esta página oferece o workflow Text-to-Video baseado apenas em prompt.
A MiniMax posiciona o H3 para publicidade, branding, e-commerce, cinema, criação de títulos, pôsteres animados, storytelling em formato curto, conceitos de produtos e UI, games, personagens virtuais e animação estilizada. O workflow Text-to-Video atual é ideal para conceitos curtos que podem ser dirigidos a partir de um prompt escrito.
Nesta página, o MiniMax H3 gera somente vídeo 2K. Escolha qualquer duração em segundos inteiros de 5 a 15; o padrão é 5 segundos. Este workflow não oferece uma opção 768p.
Sim. Este workflow Text-to-Video gera áudio estéreo nativo junto com o vídeo. Descreva diálogos, ambiência, efeitos sonoros ou música no prompt; não há um controle separado para áudio. Os resultados podem variar, então revise a sincronização labial e o tempo do áudio.
Não. Esta página é o workflow MiniMax H3 Text-to-Video baseado apenas em prompt, e sua API aceita somente prompt, aspect_ratio, resolution e duration. Para usar mídias de origem, escolha um workflow H3 Image-to-Video ou Reference-to-Video separado.
Nos workflows H3 compatíveis com referências, a linguagem natural pode atribuir funções diferentes a texto, imagens, vídeo e áudio. Por exemplo, uma fonte pode definir o movimento da câmera, outra o personagem e outra a voz. Esse é um recurso da família de modelos, não uma função de upload de mídia na página atual.
Não. A RunComfy fornece o MiniMax H3 pelo navegador e por uma API HTTP, então você não precisa hospedar nem escalar o modelo por conta própria. A publicação de lançamento da MiniMax em 31 de julho descreveu um plano condicionado para liberar os pesos do modelo; verifique a disponibilidade atual e os termos da licença antes de planejar uma hospedagem própria.
O MiniMax H3 Text-to-Video custa $0.13 por segundo gerado em 2K. Um vídeo de 5 segundos custa $0.65, um de 10 segundos custa $1.30 e um de 15 segundos custa $1.95. A geração em lote multiplica o custo baseado na duração pelo número de saídas.
A MiniMax descreve o Hailuo 02 como focado em arquitetura, dados e escala, enquanto o MiniMax H3 se concentra na generalização de tarefas e modalidades. O H3 também adiciona áudio estéreo nativo e saída 2K ao seu workflow Text-to-Video.
Teste o prompt, a proporção e a duração na RunComfy. Depois, chame o mesmo template MiniMax H3 Text-to-Video pela API com prompt (obrigatório), aspect_ratio, resolution (somente 2k) e duration (5–15). Este workflow não tem campos para upload de mídia.
RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.














