Crie vídeos com áudio a partir de texto usando o Wan 2.5.
Este é o modelo 4K da família O3 da Kuaishou orientado por referências, ajustado para a renderização final e para manter o elemento principal estável ao longo de toda a cena. Forneça até sete imagens — ou quatro junto com um vídeo de referência — e uma descrição para gerar um clipe 4K de 3 a 15 segundos com movimento fisicamente realista e áudio opcional.
É indicado para vídeo 4K com padrão de transmissão de uma pessoa, produto ou estilo específico, sem filmagem, rotoscopia manual ou GPUs próprias.
| Parâmetro | Obrigatório | Tipo | Padrão | Faixa / Opções | Descrição |
|---|---|---|---|---|---|
| prompt* | Sim (*) | string | — | Texto livre | Cena, elemento principal, ação, câmera e iluminação. |
| images | Não | array de URLs | — | Até 7 sem vídeo, até 4 com vídeo | Imagens que fixam identidade e estilo. |
| aspect_ratio | Não | string | 16:9 | 16:9, 9:16, 1:1 | Proporção do quadro. |
| duration | Não | integer | 5 | De 3 a 15 | Duração em segundos; cobrança linear. |
| sound | Não | boolean | false | true / false | Gera áudio correspondente, somente sem vídeo. |
| shot_type | Não | string | customize | customize, intelligent | Modo de edição: intelligent define automaticamente o ritmo e a estrutura; customize segue o prompt com precisão. |
Crie vídeos com áudio a partir de texto usando o Wan 2.5.
Transforme imagens em vídeos fluidos e criativos com o Hailuo 02 Pro.
Animação de imagem Pro: clipes cinematográficos de 3–15 s a partir de US$ 0,112 por segundo.
Transforme ideias em vídeos realistas e dinâmicos com Hunyuan Video da Tencent.
Crie vídeos cinematográficos com IA e controle preciso de imagem e texto
Gere vídeos cinematográficos com controle preciso e som realista
É o modelo O3 4K da Kuaishou orientado por referências, ajustado para clipes cinematográficos de 3 a 15 segundos que preservam a identidade. Serve para filmes de marca centrados em personagens, reels premium de produto e campanhas com personagens visualmente consistentes, onde movimento fisicamente realista e detalhes 4K são essenciais.
Busca a maior resolução e os melhores detalhes finais da linha O3 reference-to-video. O Pro entrega saída HD por um preço menor; o Standard custa ainda menos e é voltado a rascunhos e grande volume, segundo informações públicas.
São aceitas até sete imagens sem vídeo de referência e até quatro quando um vídeo também é usado. Referências nítidas em ângulos diferentes costumam melhorar a preservação da identidade.
Sim. Sem vídeo de referência, o controle sound pode sintetizar áudio ambiente na mesma geração. Vem desativado e o preço é o mesmo com ou sem som.
São aceitas 16:9, 9:16 e 1:1 para cinema, social vertical e quadrado. A duração vai de 3 a 15 segundos em incrementos de um segundo. Confira os limites atuais no painel da RunComfy.
Ele extrai características do elemento principal de vários pontos de vista e as carrega por todos os quadros, principal vantagem de reference-to-video em relação a text-to-video. Referências nítidas, bem iluminadas e em ângulos variados oferecem a maior consistência.
Somente o prompt é obrigatório; images, aspect_ratio, duration, sound, shot_type, multi-prompt e element_list são opcionais. As URLs devem ser públicas. Os limites podem variar por modo ou provedor, portanto consulte o painel da RunComfy.
Sim. Faça o protótipo na interface da RunComfy e depois chame o mesmo modelo pelo backend usando a API HTTP e os mesmos parâmetros, sem gerenciar hospedagem, GPUs ou escala.
A tarifa fixa é $0.42 por segundo de vídeo, com ou sem som. Um clipe de 5 segundos custa cerca de $2.10 e um de 15 segundos, cerca de $6.30. O valor é descontado do saldo em USD/créditos da RunComfy e novos usuários normalmente recebem um valor de teste.
RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.





