logo
RunComfy
  • ComfyUI
  • TreinadorNovo
  • Modelos
  • API
  • Preços
discord logo
MODELOS
Explorar
Todos os modelos
BIBLIOTECA
Gerações
APIS DE MODELOS
Documentação da API
Chaves API
CONTA
Uso

MiniMax H3: Text-to-Video 2K com áudio estéreo | RunComfy

minimax/minimax-h3/text-to-video

O MiniMax H3 Text-to-Video transforma um prompt escrito em um vídeo 2K de 5–15 segundos com áudio estéreo nativo. Para referências de imagem, vídeo ou áudio, use um workflow H3 separado.

A proporção do vídeo gerado.
A resolução do vídeo gerado.
A duração do vídeo gerado em segundos.
Idle
MiniMax H3 generates 2K video. The rate is $0.13 per second.

Introdução à criação de vídeos com o MiniMax H3

O MiniMax H3 é a família de modelos multimodais de uso geral da MiniMax. Esta página Text-to-Video transforma um prompt escrito em um vídeo 2K de 5–15 segundos a 24 FPS, com som estéreo gerado junto com a imagem. Em toda a família, workflows H3 separados usam imagens, vídeo e áudio como referências para identidade, movimento, câmera, voz, som ou edição; essas entradas de mídia não estão disponíveis nesta página. A MiniMax posiciona o modelo para publicidade, branding, e-commerce, design de produto, UI/UX, games e conceitos audiovisuais curtos. Para desenvolvedores, o MiniMax H3 na RunComfy está disponível tanto no navegador quanto por uma API HTTP, então você não precisa hospedar nem escalar o modelo por conta própria.
Ideal para: comerciais e vídeos de produto em 2K | storytelling de marca orientado por prompt | conceitos audiovisuais curtos

Por que escolher o MiniMax H3#


MiniMax H3 é a família de modelos multimodais da MiniMax para gerar e editar imagens, vídeos e áudio por meio de instruções em linguagem natural. Esta página oferece o MiniMax H3 Text-to-Video: transforme um único prompt escrito em um vídeo 2K de 5–15 segundos a 24 FPS, com áudio estéreo nativo gerado junto com a imagem. A ferramenta aceita apenas texto; use os workflows H3 indicados nos links quando precisar de referências de imagem, vídeo ou áudio.


Vantagem do MiniMax H3O que isso significa para você
Vídeo 2K e áudio estéreo nativo gerados em conjuntoGere imagens detalhadas, diálogos, efeitos, ambiência e música em uma única etapa, reduzindo processos separados de upscaling, design de som e sincronização.
Omni-Reference dirigido por linguagemEm diferentes workflows do MiniMax H3, atribua funções distintas a imagens, vídeos e áudio — como identidade, aparência do produto, movimento, estilo de câmera, voz ou música — para que várias fontes orientem um único resultado coerente.
Transferência V2V e edição direcionadaO MiniMax H3 pode transferir o movimento ou a linguagem de câmera e revisar elementos visuais ou sonoros selecionados, preservando o restante e oferecendo às equipes de produção um caminho além de regenerar um plano do zero.
Duração e enquadramento prontos para publicaçãoGere 5–15 segundos a 24 FPS em seis proporções para que aberturas, revelações de produtos e cenas com vários momentos se ajustem a formatos cinematográficos, web, feed, retrato ou vertical, com menos necessidade de recorte e reenquadramento.

Melhores casos de uso#


  • Publicidade e lançamentos de produtos: Use o MiniMax H3 para planos de destaque, revelações de produtos, conceitos de campanha e comerciais curtos em que a direção de câmera e o som precisam ser projetados em conjunto.
  • Conteúdo para redes sociais: Use o MiniMax H3 para criar Shorts, Reels e Stories em 9:16 ou peças de feed em 1:1, com uma abertura clara e enquadramento pronto para a plataforma.
  • Pré-visualização para cinema e publicidade: Use o MiniMax H3 para testar um movimento de câmera, um plano de iluminação, um momento de ação, uma transição de cena ou uma trilha temporária antes de comprometer recursos com a produção.
  • Narrativas de marca e estilizadas: Use o MiniMax H3 para explorar sequências de títulos, pôsteres animados, momentos com personagens e visuais gráficos quando uma ideia escrita precisar de um tratamento audiovisual refinado.

Como funciona#


  1. Descreva o plano: Diga ao MiniMax H3 o que aparece, o que muda ao longo do tempo, como a câmera se move, qual deve ser a aparência da cena e o que deve ser ouvido.
  2. Escolha o formato de entrega: Selecione uma proporção e uma duração de 5–15 segundos. O MiniMax H3 mantém a resolução fixa em 2K, portanto não há nível de qualidade para configurar.
  3. Gere e refine: O modelo cria vídeo e áudio estéreo em conjunto. Revise o movimento, o texto, os rostos, a sincronização labial e o tempo do som; depois, altere uma instrução por vez.

Parâmetros#


A primeira tabela lista os controles disponibilizados pela ferramenta MiniMax H3 Text-to-Video nesta página.


ParâmetroObrigatórioTipoPadrãoIntervalo / OpçõesComo escolher
prompt*Sim (*)StringPrompt de exemplo1–4,000 caracteresForneça ao MiniMax H3 um briefing estruturado que cubra o objeto, uma ação principal, a câmera, o ambiente e a iluminação, o estilo visual, o áudio e o final desejado. Uma estrutura clara é mais importante do que usar todo o limite.
aspect_ratioNãoString16:921:9, 16:9, 4:3, 1:1, 3:4, 9:16Adapte a saída do MiniMax H3 ao destino: 21:9 para planos cinematográficos ultrawide, 16:9 para vídeos em geral e anúncios, 4:3 para enquadramento editorial ou retrô, 1:1 para feeds, 3:4 para produtos em retrato e 9:16 para vídeos verticais em redes sociais.
resolutionNãoString2k2kValor fixo para esta ferramenta e associado ao nível 1440p abaixo. Escolha o MiniMax H3 quando a saída precisar de detalhes em alta resolução sem selecionar outro nível de qualidade.
durationNãoInteger55–15 segundos, em incrementos de 1 segundoUse clipes do MiniMax H3 de 5–7 segundos para uma ação ou iterações rápidas, de 8–10 segundos para uma mudança simples e de 11–15 segundos somente quando o prompt definir um início, um desenvolvimento e um final claros.

\* Campo obrigatório.


A tabela a seguir resume a família mais ampla de modelos MiniMax H3. As entradas descritas para os modos de quadro inicial/final e Omni-Reference estão disponíveis em workflows separados, não como controles desta página Text-to-Video.


Dimensão principalMiniMax H3
ModeloMiniMax-H3
Duração da saídaO MiniMax H3 gera vídeos de 5–15 segundos.
Proporção da saídaModo de quadro inicial/final: segue a proporção original da imagem de entrada.<br>Modo Text-to-Video: segue a proporção 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16 selecionada pelo usuário.<br>Modo Omni-Reference: usa uma dessas seis proporções ou Auto, que permite ao MiniMax H3 escolher a proporção da saída.
ResoluçãoO MiniMax H3 oferece dois níveis documentados. Modo 768p (disponível posteriormente): para proporções de 16:9 a 9:16, o lado menor tem 768 pixels; para saídas mais largas, a resolução total é de cerca de 1 MP — por exemplo, 21:9 corresponde a 1536×672. Um resultado em 768p pode receber upgrade para 1440p.<br>Modo 1440p / 2K: para proporções de 16:9 a 9:16, o lado menor tem 1440 pixels; para saídas mais largas, a resolução total é de cerca de 3.7 MP — por exemplo, 21:9 corresponde a 2976×1248.
Taxa de quadros da saídaO MiniMax H3 gera a 24 FPS.
Áudio da saídaTodo resultado do MiniMax H3 inclui áudio estéreo nativo.
Entrada de quadro inicial/finalImagens: 0, 1 ou 2; largura e altura de 256–5760 pixels cada; proporção de 5:2 a 2:5 (0.4–2.5). Sem entrada de imagem, o MiniMax H3 funciona no modo Text-to-Video — a ferramenta oferecida nesta página.
Entrada Omni-ReferenceImagens: até 9; largura e altura de 256–5760 pixels cada.<br>Vídeos: até 3; cada um com 2–15 segundos; duração combinada dos vídeos de até 15 segundos; largura e altura de 256–5760 pixels cada; proporção de 5:2 a 2:5 (0.4–2.5).<br>Áudio: até 3 clipes; cada um com 2–15 segundos; duração combinada do áudio de até 15 segundos. O áudio deve acompanhar uma imagem ou um vídeo e não pode ser a única referência.<br>Entrada mista: até 12 arquivos no total. Sem entrada de imagem, vídeo ou áudio, o workflow se torna Text-to-Video.
Formatos de entrada compatíveisO MiniMax H3 aceita vídeo: H.264/AVC ou H.265/HEVC; áudio incorporado: AAC ou MP3.<br>Imagem: JPG, JPEG, PNG, WEBP, HEIC ou HEIF.<br>Áudio: WAV ou MP3.
Limites de tamanho da entradaCada vídeo: 50 MB; cada imagem: 30 MB; cada arquivo de áudio: 15 MB. Não há um limite separado para a combinação das mídias além dos limites por arquivo, mas o corpo da solicitação da API é limitado a 64 MB; recomenda-se usar entrada de mídia baseada em URL.
Limite do promptO guia do produto MiniMax H3 permite até 7,000 caracteres. Esta implementação Text-to-Video aceita atualmente 1–4,000 caracteres, como mostra a tabela de controles da página acima.

Preços#


O MiniMax H3 custa $0.13 USD por segundo gerado em 2K nesta página.


DuraçãoPreço por vídeo
5 segundos$0.65
10 segundos$1.30
15 segundos$1.95

Para lotes com 1–4 saídas, calcule o total como duration × $0.13 × output count.


Dicas e exemplos de prompts#


Use esta estrutura reutilizável de prompt para o MiniMax H3:


[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]


  • Separe os movimentos: Descreva o movimento do objeto e o movimento da câmera de forma independente.
  • Mostre a sequência: Use “começa com”, “depois” e “termina em” quando o clipe tiver mais de um momento.
  • Nomeie as fontes sonoras: Diga ao MiniMax H3 quem fala, o que produz cada som, qual é a ambiência e se a música deve se destacar ou permanecer sutil.
  • Limite ideias concorrentes: Um objeto principal, uma ação central e um estilo coerente são mais fáceis para o MiniMax H3 seguir.

Prompt fraco


> Um anúncio de relógio de luxo, cinematográfico e dinâmico, com música.


Prompt melhorado para o MiniMax H3


> Um relógio automático de aço escovado repousa sobre uma pedra vulcânica preta. Uma faixa estreita de luz de estúdio percorre o cristal de safira enquanto o ponteiro dos segundos se move e gotas de condensação se formam na caixa. Comece com um macro extremo, depois faça uma órbita lenta de 30 graus e termine no mostrador do relógio. Comercial de luxo com alto contraste e fundo preto profundo. Áudio: tique-taque mecânico suave e um único pulso cinematográfico grave; sem diálogo.


A versão melhorada oferece ao MiniMax H3 um objeto identificável, uma ação temporizada, direção de câmera separada, iluminação, acabamento visual, fontes sonoras e um plano final que pode ser revisado.


Como o MiniMax H3 se compara#


Use esta comparação do MiniMax H3 como um guia da família de modelos; a resolução e a duração máximas podem não estar disponíveis simultaneamente, e os workflows da RunComfy podem oferecer diferentes entradas, níveis de resolução e controles de áudio.


ModeloResoluçãoDuração máximaÁudioDestaque
MiniMax H3Até 2K15sEstéreo nativo (voz, SFX, música)Relaciona referências de texto, imagem, vídeo e áudio por meio da linguagem para transferência de movimento V2V e edição de produção; os pesos públicos estão planejados, mas ainda não foram lançados.
Hailuo 021080p~10sNenhumA forte aderência ao prompt e o movimento centrado na física são adequados para ginástica, dança, movimento de produtos e outros planos de ação sem som que receberão áudio posteriormente na produção.
Kling 3.0Até 4K15sÁudio nativo com sincronização labialCoordena mudanças de câmera em vários planos com diálogos multilíngues atribuídos a falantes e sincronização labial — útil para anúncios roteirizados, storyboards e cenas conduzidas por personagens.
Seedance 2.01080p15sÁudio e vídeo conjuntosCombina muitas referências de imagem, vídeo e áudio com geração audiovisual conjunta e sincronização labial precisa para anúncios sensíveis à identidade, histórias de marca e edições com muitas referências.
Veo 3.14K8sDiálogo e efeitos nativosCombina diálogos e efeitos orientados por prompt com controles de quadro inicial/final, imagem de referência e extensão de cena — adequado para transições cinematográficas e sequências montadas.

Para o Hailuo 02, os valores máximos indicados variam conforme o modo: a saída em 1080p é limitada a 6 segundos, enquanto a saída de 10 segundos está disponível em 512p ou 768p.


No MiniMax H3, os recursos Omni-Reference e V2V pertencem a workflows relacionados; a ferramenta Text-to-Video desta página continua aceitando apenas prompts.


O que diferencia o MiniMax H3 é a combinação: uma família de modelos de uso geral que relaciona texto, imagem, vídeo e áudio, gera som estéreo nativo e alcança 2K por $0.13 por segundo gerado nesta página. Escolha o MiniMax H3 quando quiser começar com um briefing em texto e manter um caminho para criação ou edição guiada por referências em workflows relacionados. Com base nas informações disponíveis publicamente, execute o mesmo briefing em cada modelo antes de definir um pipeline.


Mais modelos para testar#


Se o MiniMax H3 não for o ponto de partida certo para um projeto, compare estes workflows especializados na RunComfy:


  • MiniMax H3 Image-to-Video: Comece com uma imagem e, opcionalmente, oriente o quadro final quando a composição, a identidade ou a aparência do produto precisarem permanecer ancoradas.
  • MiniMax H3 Reference-to-Video: Combine imagens com vídeo e áudio opcionais quando movimento, estilo de câmera, voz, música ou outros detalhes das fontes precisarem ser preservados.
  • Hailuo 02 Image-to-Video: Teste uma geração anterior da MiniMax quando quiser um workflow focado em animação de imagens.
  • Hailuo 2.3 Pro: Anime uma imagem estática em 1080p com movimento estável e consciente da física, expressões faciais sutis e iluminação natural — uma boa opção para planos refinados de produtos, retratos e personagens.
  • Kling 3.0: Anime uma imagem inicial com um quadro final opcional, referências de elementos, prompts de planos temporizados e áudio sincronizado para sequências controladas de marcas e personagens.
  • Seedance 2.0 Pro: Combine até nove imagens, três vídeos e três clipes de áudio para manter a identidade, a linguagem de câmera e a fala, os efeitos e a música sincronizados em clipes de 4–15 segundos.

Recursos oficiais#


  • Publicação de lançamento do MiniMax H3
  • Site oficial da MiniMax

Modelos relacionados

pixverse/v5.5/image-to-video

Anime uma imagem inicial com texto e configure proporção, resolução, duração, estilo, áudio e vários clipes.

kling-video-o1/image-to-video/reference

Gere um vídeo a partir de imagens de referência e elementos obrigatórios. Use tokens @Image e @Element na ordem dos arrays e defina com precisão a duração e a proporção.

veo-3-1/fast/first-last-frame-to-video

Transforme imagens em vídeos cinematográficos com Veo 3.1 Fast e crie conteúdos criativos em instantes.

ai-avatar/v2/pro

Crie um vídeo de avatar a partir de um arquivo de imagem e áudio obrigatório, com um prompt de texto opcional para orientação de geração.

sora-2/pro/image-to-video

Anime uma imagem de referência com o Sora 2 Pro usando um prompt e escolha o tamanho e a duração.

cinematic-video-generator

Geração de vídeo com qualidade cinematográfica no nível do Seedance 2.0, alta fidelidade visual e movimento natural

Perguntas Frequentes

O MiniMax H3 já está disponível na RunComfy?

Sim. O MiniMax H3 Text-to-Video está disponível no navegador e pela RunComfy API usando os créditos da sua conta.

O que é o MiniMax H3?

O MiniMax H3 é a família de modelos de geração e edição multimodal de uso geral da MiniMax. Seu projeto mais amplo abrange texto, imagem, vídeo e áudio, enquanto cada workflow disponibiliza entradas diferentes. Esta página oferece o workflow Text-to-Video baseado apenas em prompt.

Para que o MiniMax H3 pode ser usado?

A MiniMax posiciona o H3 para publicidade, branding, e-commerce, cinema, criação de títulos, pôsteres animados, storytelling em formato curto, conceitos de produtos e UI, games, personagens virtuais e animação estilizada. O workflow Text-to-Video atual é ideal para conceitos curtos que podem ser dirigidos a partir de um prompt escrito.

Que resolução e duração de clipe o MiniMax H3 Text-to-Video suporta?

Nesta página, o MiniMax H3 gera somente vídeo 2K. Escolha qualquer duração em segundos inteiros de 5 a 15; o padrão é 5 segundos. Este workflow não oferece uma opção 768p.

O MiniMax H3 gera áudio?

Sim. Este workflow Text-to-Video gera áudio estéreo nativo junto com o vídeo. Descreva diálogos, ambiência, efeitos sonoros ou música no prompt; não há um controle separado para áudio. Os resultados podem variar, então revise a sincronização labial e o tempo do áudio.

Posso usar referências de imagem, vídeo ou áudio nesta página do MiniMax H3?

Não. Esta página é o workflow MiniMax H3 Text-to-Video baseado apenas em prompt, e sua API aceita somente prompt, aspect_ratio, resolution e duration. Para usar mídias de origem, escolha um workflow H3 Image-to-Video ou Reference-to-Video separado.

O que significa contexto multimodal para a família de modelos MiniMax H3?

Nos workflows H3 compatíveis com referências, a linguagem natural pode atribuir funções diferentes a texto, imagens, vídeo e áudio. Por exemplo, uma fonte pode definir o movimento da câmera, outra o personagem e outra a voz. Esse é um recurso da família de modelos, não uma função de upload de mídia na página atual.

Preciso hospedar o MiniMax H3 por conta própria?

Não. A RunComfy fornece o MiniMax H3 pelo navegador e por uma API HTTP, então você não precisa hospedar nem escalar o modelo por conta própria. A publicação de lançamento da MiniMax em 31 de julho descreveu um plano condicionado para liberar os pesos do modelo; verifique a disponibilidade atual e os termos da licença antes de planejar uma hospedagem própria.

Quanto custa o MiniMax H3 Text-to-Video?

O MiniMax H3 Text-to-Video custa $0.13 por segundo gerado em 2K. Um vídeo de 5 segundos custa $0.65, um de 10 segundos custa $1.30 e um de 15 segundos custa $1.95. A geração em lote multiplica o custo baseado na duração pelo número de saídas.

Como o MiniMax H3 é diferente do Hailuo 02?

A MiniMax descreve o Hailuo 02 como focado em arquitetura, dados e escala, enquanto o MiniMax H3 se concentra na generalização de tarefas e modalidades. O H3 também adiciona áudio estéreo nativo e saída 2K ao seu workflow Text-to-Video.

Como faço para ir do teste do MiniMax H3 no navegador para a integração via API?

Teste o prompt, a proporção e a duração na RunComfy. Depois, chame o mesmo template MiniMax H3 Text-to-Video pela API com prompt (obrigatório), aspect_ratio, resolution (somente 2k) e duration (5–15). Este workflow não tem campos para upload de mídia.

Siga-nos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Suporte
  • Discord
  • E-mail
  • Status do Sistema
  • afiliado
Modelos de Vídeo
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • Ver todos os modelos →
Modelos de Imagem
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • Ver todos os modelos →
Legal
  • Termos de Serviço
  • Política de Privacidade
  • Política de Cookies
RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.

Exemplos do MiniMax H3

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...