FLUX 3 Video transforma prompts de texto em clipes cinematográficos com áudio nativo
Seedance 2.0 Pro é um modelo multimodal de texto para vídeo da ByteDance Seed que transforma descrições de cena e referências opcionais em clipes cinematográficos curtos. Na RunComfy, a geração usa um prompt e, opcionalmente, imagens (até 9), vídeos (até 3) e áudios (até 3). Você também define proporção, duração, resolução, geração de áudio, seed e ferramentas, como '[{ "type": "web_search" }]' para permitir pesquisa on-line quando o modelo considerar útil.
Saída deste playground: 480p / 720p / 1080p / 4K · 4–15 segundos · proporções adaptive (padrão), 16:9, 9:16, 4:3, 3:4, 1:1, 21:9 · áudio nativo opcional quando Generate audio está ativado
As entradas correspondem ao esquema OpenAPI Input deste template RunComfy.
| Parâmetro | Obrigatório | Tipo | Padrão | Faixa / Opções | Descrição |
|---|---|---|---|---|---|
| prompt* | Sim (*) | string | — | CN ~≤500 caracteres, EN ~≤1000 palavras recomendadas | Prompt do vídeo |
| image_url (Images) | Não | array (URIs de imagem) | [] | 0–9 | jpeg, png, webp, bmp, tiff, gif |
| video_url (Videos) | Não | array (URIs de vídeo) | [] | 0–3 | mp4, mov; 2–15 s por clipe |
| audio_url (Audio URLs) | Não | array (URIs de áudio) | [] | 0–3 | wav, mp3; 2–15 s, < 15 MB |
| aspect_ratio | Não | string | adaptive | adaptive, 16:9, 9:16, 4:3, 3:4, 1:1, 21:9 | O modelo escolhe a proporção mais próxima; confira o resultado real |
| duration | Não | integer | 5 | 4–15 segundos | Duração inteira do clipe |
| resolution | Não | string | 720p | 480p, 720p, 1080p, 4k | Predefinição da resolução de saída |
| generate_audio | Não | boolean | true | true / false | Quando true, gera áudio sincronizado (fala, SFX, música) |
| seed | Não | integer | — | — | Semente aleatória usada na geração |
| tools | Não | array de objetos | [] | apenas 'type': web_search | Declara ferramentas permitidas; consulte 'usage.tool_usage.web_search' |
1) Descreva a cena — Inclua o elemento principal, a ação, o ambiente, o clima, a luz e a câmera. Recomendam-se cerca de ≤500 caracteres em chinês ou ≤1000 palavras em inglês.
2) Adicione referências opcionais — Envie imagens para aparência ou identidade e vídeos ou áudios curtos, respeitando duração e tamanho.
3) Escolha a proporção — Use adaptive para explorar ou um formato fixo, como 9:16 ou 16:9, para uma entrega conhecida.
4) Defina a duração — Qualquer número inteiro de 4 a 15 segundos.
5) Escolha a resolução — 480p para rascunhos, 720p para equilíbrio, 1080p para mais detalhes ou 4K para máxima nitidez.
6) Gere áudio — Mantenha ativado para diálogos, SFX ou música; desative para vídeo sem som.
7) Seed opcional — Mantenha o valor de seed fixo durante as iterações para que as mudanças venham do prompt ou da mídia.
8) Pesquisa opcional — Adicione tools '[{ "type": "web_search" }]' para permitir consulta a fatos atuais; depois leia 'usage.tool_usage.web_search' na tarefa.
9) Gere e refine — Ajuste o texto, troque referências ou altere proporção, duração e resolução.
Em resumo, o Seedance 2.0 Pro na RunComfy aceita texto, até nove imagens, três vídeos e três áudios de referência, clipes de 4–15 s, predefinições de 480p–4K, proporções flexíveis incluindo adaptive e áudio nativo opcional, de acordo com os campos do playground.
FLUX 3 Video transforma prompts de texto em clipes cinematográficos com áudio nativo
Crie vídeos envolventes a partir de imagens com som sincronizado
Crie vídeos dinâmicos com IA a partir de texto, rápido e intuitivo.
MiniMax H3: texto para vídeo 768p/2K com áudio estéreo nativo
Anime uma foto estática em um vídeo fluido de 720P ou 1080P a partir de um único prompt.
Anime uma imagem de origem obrigatória por meio de um prompt. Escolha 6, 8 ou 10 segundos, de 1080p a 2160p, 25 ou 50 FPS, proporção 16:9 fixa e áudio gerado opcional.
Neste playground, a resolução pode ser 480p, 720p (padrão), 1080p ou 4K. A proporção pode ser adaptive — o modelo escolhe a mais próxima e a tarefa informa a saída real — ou fixa: 16:9, 9:16, 4:3, 3:4, 1:1 ou 21:9.
Para o prompt, recomendam-se cerca de ≤500 caracteres em chinês ou ≤1000 palavras em inglês. São aceitas até 9 imagens (jpeg, png, webp, bmp, tiff, gif), 3 vídeos (mp4, mov) de 2–15 segundos cada e 3 arquivos de áudio (wav, mp3), cada um com 2–15 segundos e menos de 15 MB. Apenas o prompt é obrigatório.
Use a API da RunComfy com os mesmos campos Input do playground: prompt, image_url, video_url, audio_url, aspect_ratio, duration, resolution, generate_audio e seed. Valide prompts e limites na interface e depois use sua chave de API e créditos para automatizar as tarefas.
Ele busca clipes cinematográficos curtos com referências multimodais, controle de 4–15 segundos, proporções flexíveis incluindo adaptive e áudio nativo quando generate_audio está ativo, útil para lip-sync, SFX e música sincronizados. Os resultados dependem do conteúdo; compare com os mesmos prompts e referências.
A escolha depende do fluxo. Este template oferece até nove imagens, três vídeos, três áudios, predefinições de 480p–4K e áudio gerado opcional. Wan 2.5 e Kling 2.6 diferem em preço, limites e pontos fortes; teste-os em paralelo com seus prompts e referências.
Sim. Imagens, vídeos ou áudios de referência e um prompt claro ajudam a fixar identidade, roupa e tom. O esquema da API não documenta uma sintaxe especial “@”; a consistência vem do alinhamento entre texto e mídia dentro dos limites.
Quando Generate audio (generate_audio) está true, que é o padrão, o modelo gera vídeo com áudio sincronizado — fala, SFX e música. Defina false para vídeo sem som. A qualidade do lip-sync ainda depende da clareza do prompt e da cena.
Duration é um número inteiro de 4 a 15 segundos, com 5 como padrão. Escolha qualquer valor inteiro do intervalo em cada geração.
O uso comercial depende da licença do modelo da ByteDance e dos termos da RunComfy. Consulte a licença e a documentação oficiais ou fale com hi@runcomfy.com antes de usar vídeos em campanhas pagas ou distribuição pública.
Equipes e criadores que precisam de clipes cinematográficos curtos com referências opcionais de imagem, vídeo e áudio, proporções para cada plataforma, exportação de até 4K e áudio integrado: anúncios, vídeos sociais, pré-visualização e testes narrativos de marca.
RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.





