Animação de imagem Pro: clipes cinematográficos de 3–15 s a partir de US$ 0,112 por segundo.
FLUX 3 é o próximo modelo unificado da Black Forest Labs, treinado conjuntamente com imagens, vídeo e áudio para que movimento e som sejam compreendidos a partir da mesma base. Esta página se concentra no vídeo e antecipa como será usar FLUX 3 Video em produção.
Observação: FLUX 3 Video estará disponível em breve. Esta página apresenta uma prévia da experiência enquanto a Black Forest Labs finaliza o modelo público e a API.
Por que criadores recorrem à experiência do FLUX 3 Video:
Um resumo rápido do que FLUX 3 Video pode fazer:
A Black Forest Labs descreve FLUX 3 Video como um único modelo multimodal com vários modos de geração, todos com áudio nativo. As tarefas oficialmente confirmadas são:
Além desses modos, FLUX 3 Video também oferece:
FLUX 3 Video se destaca porque imagem e som são concebidos juntos, e não combinados posteriormente. Em uma única passagem, ele pode produzir diálogo, efeitos sonoros, ambiente e música sincronizados à ação: uma porta bate com seu próprio impacto, um alarme pulsa no ritmo de uma luz de aviso e um personagem fala enquanto a câmera atravessa a mesma cena.
Essa sincronização é consequência do treinamento do modelo. A Black Forest Labs informa que a previsão de vídeo respondeu por mais de 95% do processamento de treinamento do FLUX 3, obrigando o modelo a aprender contato, movimento, peso, causa e efeito — em outras palavras, como o mundo físico realmente se comporta. O áudio é então aprendido como consequência desse modelo de mundo; por isso, os sons coincidem com os eventos na tela que os causam, e a fala acompanha o movimento dos lábios. Para criadores, isso significa movimentos fisicamente plausíveis e uma trilha sonora que reforça a edição em vez de entrar em conflito com ela.
Estas recomendações ajudam a obter resultados previsíveis durante a prévia do FLUX 3 Video:
Como FLUX 3 Video ainda está em acesso antecipado, a evidência mais clara vem das avaliações preliminares da própria Black Forest Labs, realizadas com clipes de 10 segundos em 720p e áudio. Nesses testes lado a lado, os avaliadores preferiram FLUX 3 a uma ampla variedade de concorrentes: Luma Ray 3.2 em 93% das comparações, Runway Gen-4.5 em 77%, Grok Imagine Video em até 69%, Kling v3 Pro em 60% e tanto Seedance 2.0 quanto Gemini Omni Flash em 52%. São números preliminares que devem mudar, mas permitem basear as comparações abaixo em recursos, não apenas em divulgação.
FLUX 3 Video é uma prévia de um modelo ainda em acesso antecipado limitado, por isso vale alinhar as expectativas:
Considere FLUX 3 Video uma visão de onde o modelo pretende chegar: recursos e limites continuarão mudando à medida que ele se aproxima da disponibilidade geral.
A Black Forest Labs está lançando FLUX 3 AI como uma única base multimodal com várias edições, cada uma disponibilizada em etapas após seu próprio período de acesso antecipado. Segundo o plano oficial de lançamento:
A Black Forest Labs confirmou que pretende disponibilizar pesos abertos. Quando a base FLUX 3 Dev estiver disponível, o próximo passo natural será um fluxo de trabalho comunitário com FLUX 3 LoRA, incluindo o fine-tuning de FLUX 3 dev LoRA para personagens recorrentes, estilos e identidades de marca, repetindo o amplo ecossistema de LoRA criado em torno das versões anteriores do FLUX.
Para a maioria das equipes, FLUX 3 Video atenderá à produção diária de clipes, enquanto FLUX 3 Dev e FLUX 3 dev LoRA abrirão caminho para personalização com hospedagem própria.
Em resumo, FLUX 3 Video estará disponível em breve no RunComfy: uma única base multimodal que transforma prompts e mídias de referência em clipes cinematográficos com áudio nativo sincronizado.
Animação de imagem Pro: clipes cinematográficos de 3–15 s a partir de US$ 0,112 por segundo.
Crie vídeos em 1080p a partir de texto com IA que capta movimento e emoção de forma realista.
Edite um vídeo existente com instruções de texto e até dez imagens de referência opcionais, com controle para preservar o áudio original.
Crie um vídeo com o Wan 2.1 a partir de um prompt e configure resolução, proporção, número de quadros, taxa de quadros e outras opções.
Gere um vídeo a partir de uma imagem, um áudio e um prompt, com controle separado da influência do texto e do áudio.
Crie vídeos de alta qualidade a partir de prompts de texto com o Tencent Hunyuan Video.
FLUX 3 Video estará disponível em breve. Esta prévia permite conhecer a experiência do FLUX 3 Video enquanto a Black Forest Labs finaliza o modelo multimodal unificado e sua API. Até que a infraestrutura do FLUX 3 seja ativada, os campos de entrada e os limites exibidos refletem o modelo que atualmente alimenta esta prévia.
FLUX 3 Video foi criado para transformar prompts e referências opcionais de imagem, vídeo e áudio em clipes cinematográficos curtos com áudio nativo. Ele atende à criação de anúncios, à pré-visualização de filmes e a narrativas de marca nas quais a consistência das referências e a sincronização do som são importantes.
FLUX 3 Video leva o trabalho da Black Forest Labs para movimento e áudio em uma única base multimodal. Ele oferece cinco tarefas oficialmente confirmadas — texto para vídeo, imagem para vídeo, vídeo para vídeo, continuação de vídeo + áudio e keyframe para vídeo —, além de áudio nativo, diálogo multilíngue e clipes de até 20 segundos em uma única geração. Os ganhos exatos dependem do conteúdo; quando o modelo for lançado, compare os clipes usando o mesmo prompt.
FLUX 3 Video gera clipes de até 20 segundos em uma única passagem, aproximadamente o dobro do limite de 10 segundos comum à maioria dos modelos de vídeo. Isso abre espaço para falas e planos dramáticos mais lentos. Também é possível encadear clipes em sequências de vários planos com duração de minutos, mantendo os personagens consistentes. No modelo que atualmente alimenta esta prévia, a duração varia de 4 a 15 segundos; o FLUX 3 Video completo foi projetado para chegar a 20 segundos.
Sim. O áudio nativo é um objetivo central do FLUX 3 Video. No modelo que atualmente alimenta esta prévia, você pode ativar a geração de áudio para produzir fala, efeitos sonoros e música sincronizados, o que viabiliza clipes multilíngues com sincronização labial. Também é possível desativá-la para gerar um vídeo sem som. A qualidade da sincronização labial depende da clareza do prompt e da cena descrita.
A maior parte do processamento de treinamento do FLUX 3 foi dedicada à previsão de vídeo, por isso o modelo precisou aprender contato, movimento, peso, causa e efeito — em essência, como o mundo físico se comporta. O áudio nativo é aprendido sobre esse modelo de mundo; assim, os sons coincidem com os acontecimentos na tela que os causam, e a fala acompanha o movimento dos lábios. Na prática, FLUX 3 Video se destaca por rostos expressivos e movimentos fisicamente plausíveis.
A orientação por referências é parte central do FLUX 3 Video. Na prática, imagens de referência combinadas com um prompt claro ajudam a fixar identidade, figurino e tom entre os quadros, e FLUX 3 foi projetado para levar o elemento principal — personagem ou objeto — de um clipe de origem para uma nova cena. No modelo que atualmente alimenta esta prévia, você pode anexar imagens, vídeos e áudios de referência dentro dos limites aceitos para reforçar a consistência.
No modelo que atualmente alimenta esta prévia, recomenda-se limitar os prompts a cerca de 500 caracteres em chinês ou 1000 palavras em inglês. Você pode anexar até 9 imagens de referência, 3 vídeos de referência (2–15 segundos cada) e 3 áudios de referência (2–15 segundos, com menos de 15 MB). Apenas prompt é obrigatório. Consulte o painel de parâmetros atual, pois os limites serão alterados quando FLUX 3 Video for lançado.
As resoluções disponíveis são 480p, 720p (padrão), 1080p e 4K. A proporção pode ser adaptativa (padrão, em que o modelo escolhe a opção mais próxima) ou fixa em 16:9, 9:16, 4:3, 3:4, 1:1 ou 21:9. No modelo que atualmente alimenta esta prévia, duration aceita um número inteiro de 4 a 15 segundos e o padrão é 5; o FLUX 3 Video completo foi projetado para chegar a 20 segundos em uma única geração.
FLUX 3 AI foi planejado como uma única base com várias edições. Além do FLUX 3 Video hospedado, a Black Forest Labs anunciou FLUX 3 Image, FLUX 3 Action (o projeto de robótica FLUX-mimic) e FLUX 3 Dev, uma base multimodal de pesos abertos. A Black Forest Labs confirmou que pretende disponibilizar pesos abertos. Quando a base FLUX 3 Dev for lançada, espera-se um fluxo de trabalho comunitário com FLUX 3 LoRA, incluindo treinamento de FLUX 3 dev LoRA para personagens recorrentes, estilos e identidades de marca.
Crie o protótipo na interface de modelos do RunComfy e depois chame o mesmo template pela API RunComfy usando campos de entrada idênticos (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio e seed). Primeiro valide os prompts e os limites das mídias na interface; depois use a chave da API e os créditos da sua conta para automatizar as tarefas.
As gerações consomem créditos de acordo com a duração do vídeo criado pelo modelo que atualmente alimenta esta prévia, Seedance 2.0 Pro: $0.08 por segundo em 480p, $0.175 por segundo em 720p, $0.40 por segundo em 1080p e $0.90 por segundo em 4K. Consulte o preço exibido nesta página, que será atualizado quando FLUX 3 Video for lançado.
RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.





