logo
RunComfy
  • ComfyUI
  • TreinadorNovo
  • Modelos
  • API
  • Preços
discord logo
MODELOS
Explorar
Todos os modelos
BIBLIOTECA
Gerações
APIS DE MODELOS
Documentação da API
Chaves API
CONTA
Uso

FLUX 3 Video: geração multimodal de vídeo com áudio nativo na página do modelo e via API | RunComfy

blackforestlabs/flux-3/video

FLUX 3 Video cria clipes de até 20 segundos com áudio nativo sincronizado. Atualmente, está em acesso antecipado limitado e ainda não foi lançado no RunComfy.

Prompt de texto para o vídeo (recomenda-se até cerca de 500 caracteres em chinês ou 1000 palavras em inglês).
Imagens de referência para o modo de referência multimodal (0–9). Formatos aceitos: jpeg, png, webp, bmp, tiff, gif.
Vídeos de referência para o modo de referência multimodal (0–3). Formatos aceitos: mp4, mov. A duração deve ficar entre 2 e 15 segundos.
Áudios de referência para o modo de referência multimodal (0–3). Formatos aceitos: wav, mp3. A duração deve ficar entre 2 e 15 segundos, e o arquivo deve ter menos de 15 MB.
O padrão é adaptativo: o modelo escolhe a proporção mais próxima e a proporção efetivamente usada é retornada na consulta da tarefa.
Número inteiro de segundos no intervalo [4, 15].
Quando ativado, o modelo produz um vídeo com áudio sincronizado (fala, efeitos sonoros e música).
Semente aleatória usada na geração do vídeo.
Quando `web_search` é incluído, o modelo pode realizar uma pesquisa online conforme o prompt (por exemplo, sobre produtos específicos ou o clima atual). Isso pode deixar as informações mais atualizadas, mas aumenta a latência.
Idle
FLUX 3 Video is coming soon. Now the model is Seedance 2.0 Pro. Billed on total video seconds (input + output). The rate per second is $0.08 for 480p, $0.175 for 720p, $0.40 for 1080p, and $0.90 for 4k.

Introdução à criação de vídeos com FLUX 3 Video

FLUX 3 Video estará disponível em breve no RunComfy. Trata-se do modelo multimodal unificado da Black Forest Labs aplicado a vídeo e áudio, capaz de transformar prompts e mídias de referência em clipes cinematográficos com áudio nativo sincronizado. Ao substituir a edição quadro a quadro, as máscaras manuais e a dublagem separada por uma geração orientada por prompts, FLUX 3 Video atende equipes de marketing, agências, artistas de pré-visualização cinematográfica e estúdios de jogos que precisam criar rapidamente clipes curtos com estética de cinema. Para desenvolvedores, FLUX 3 Video no RunComfy pode ser usado tanto no navegador quanto por uma API HTTP, sem a necessidade de hospedar ou escalar o modelo por conta própria.
Ideal para: anúncios em vídeo de alta conversão | pré-visualização cinematográfica fiel aos planos | narrativas de marca multilíngues com sincronização labial

Black Forest Labs / FLUX 3 Video#


FLUX 3 é o próximo modelo unificado da Black Forest Labs, treinado conjuntamente com imagens, vídeo e áudio para que movimento e som sejam compreendidos a partir da mesma base. Esta página se concentra no vídeo e antecipa como será usar FLUX 3 Video em produção.


Observação: FLUX 3 Video estará disponível em breve. Esta página apresenta uma prévia da experiência enquanto a Black Forest Labs finaliza o modelo público e a API.


Destaques do FLUX 3 Video#


Por que criadores recorrem à experiência do FLUX 3 Video:


  • Dispense a suíte de edição: um briefing escrito substitui a edição na timeline, a dublagem e os ajustes manuais.
  • Dirija como um plano de cinema: no FLUX 3 Video, ângulo de câmera, atmosfera e ritmo são definidos pelas palavras do seu prompt.
  • Som na mesma geração: cada clipe já chega com áudio nativo sincronizado, sem uma etapa separada de dublagem.
  • Adequado a entregas reais: os resultados são pensados para anúncios, pré-visualização e redes sociais, não apenas para cenas de teste.

Visão geral do FLUX 3 Video#


Um resumo rápido do que FLUX 3 Video pode fazer:


  • Duração do clipe: até 20 segundos em uma única geração, aproximadamente o dobro do limite de 10 segundos comum à maioria dos modelos de vídeo, com possibilidade de encadear planos em sequências de vários minutos.
  • Áudio: som nativo e sincronizado, gerado junto com a imagem e opcional quando você precisa de um vídeo sem som.
  • Entradas: prompts de texto e referências de imagem, vídeo e áudio (até cerca de dez imagens de referência), permitindo editar e recombinar conteúdo com a mesma facilidade com que gera do zero.
  • Resolução: 720p durante o acesso antecipado, com resoluções maiores previstas à medida que o modelo amadurece.
  • Proporções: ampla variedade, do formato vertical 9:16 ao ultrawide 21:9, para redes sociais, cinema e materiais de produto.
  • Estilos: filmagem espontânea de câmera portátil, animação e estética cinematográfica refinada em um só modelo.
  • Status: acesso antecipado limitado; FLUX 3 Video estará disponível em breve no RunComfy.

Principais recursos do FLUX 3 Video#


A Black Forest Labs descreve FLUX 3 Video como um único modelo multimodal com vários modos de geração, todos com áudio nativo. As tarefas oficialmente confirmadas são:


  • Texto para vídeo: gere apenas com um prompt escrito um clipe completo, com voz, de até 20 segundos.
  • Imagem para vídeo: anime a partir de um quadro inicial ou use as imagens fornecidas como referências visuais para orientar o movimento.
  • Vídeo para vídeo: leve os elementos centrais de um clipe de origem — o mesmo personagem ou objeto — para uma nova cena ou contexto.
  • Continuação de vídeo + áudio: prolongue um vídeo de entrada e sua trilha sonora em vez de começar do zero.
  • Keyframe para vídeo: defina momentos-chave e deixe o modelo preencher a transição controlada entre eles.

Além desses modos, FLUX 3 Video também oferece:


  • Diálogo multilíngue com movimentos da boca sincronizados à fala.
  • Encadeamento agêntico de múltiplos planos que conecta clipes em sequências de vários minutos, mantendo os personagens consistentes.
  • Ampla variedade de estilos e proporções, desde filmagens espontâneas de câmera portátil até animação e cinema.
  • Tipografia expressiva e design animado renderizados diretamente no quadro.
  • Realismo fundamentado no mundo físico: segundo a Black Forest Labs, FLUX 3 Video já se destaca em rostos expressivos e na correspondência entre sons e acontecimentos físicos na tela.

Áudio nativo e movimento fundamentado no mundo físico no FLUX 3 Video#


FLUX 3 Video se destaca porque imagem e som são concebidos juntos, e não combinados posteriormente. Em uma única passagem, ele pode produzir diálogo, efeitos sonoros, ambiente e música sincronizados à ação: uma porta bate com seu próprio impacto, um alarme pulsa no ritmo de uma luz de aviso e um personagem fala enquanto a câmera atravessa a mesma cena.


Essa sincronização é consequência do treinamento do modelo. A Black Forest Labs informa que a previsão de vídeo respondeu por mais de 95% do processamento de treinamento do FLUX 3, obrigando o modelo a aprender contato, movimento, peso, causa e efeito — em outras palavras, como o mundo físico realmente se comporta. O áudio é então aprendido como consequência desse modelo de mundo; por isso, os sons coincidem com os eventos na tela que os causam, e a fala acompanha o movimento dos lábios. Para criadores, isso significa movimentos fisicamente plausíveis e uma trilha sonora que reforça a edição em vez de entrar em conflito com ela.


Dicas de prompt e referência para FLUX 3 Video#


Estas recomendações ajudam a obter resultados previsíveis durante a prévia do FLUX 3 Video:


  • Seja específico sobre a câmera e o movimento (plano médio fechado, aproximação lenta, câmera na mão ou fixa).
  • Use imagens para o que precisa permanecer estável (rosto, figurino, logotipo) e texto para o que deve evoluir (ação, atmosfera).
  • Mantenha os vídeos e áudios de referência entre 2 e 15 segundos, e os áudios de referência abaixo de 15 MB.
  • Com o áudio ativado, indique o tom do diálogo ou o som ambiente que deseja ouvir.
  • Mantenha a semente fixa durante as iterações para que as mudanças venham do prompt, não da aleatoriedade.
  • Simplifique o prompt se o resultado parecer confuso ou contraditório.

Comparação do FLUX 3 Video com outros modelos#


Como FLUX 3 Video ainda está em acesso antecipado, a evidência mais clara vem das avaliações preliminares da própria Black Forest Labs, realizadas com clipes de 10 segundos em 720p e áudio. Nesses testes lado a lado, os avaliadores preferiram FLUX 3 a uma ampla variedade de concorrentes: Luma Ray 3.2 em 93% das comparações, Runway Gen-4.5 em 77%, Grok Imagine Video em até 69%, Kling v3 Pro em 60% e tanto Seedance 2.0 quanto Gemini Omni Flash em 52%. São números preliminares que devem mudar, mas permitem basear as comparações abaixo em recursos, não apenas em divulgação.


FLUX 3 Video vs FLUX.2#


  • Da imagem estática ao movimento: todas as versões anteriores do FLUX, inclusive FLUX.2, geram apenas imagens estáticas; FLUX 3 é a primeira a incorporar vídeo e áudio sincronizado à mesma base, levando o tratamento de referências, a fidelidade ao prompt e a tipografia do FLUX para os clipes.
  • DNA compartilhado: as características que tornaram as imagens FLUX confiáveis — manter um personagem, produto ou logotipo estável — são as mesmas que FLUX 3 Video estende ao longo de um plano.
  • Novo território: movimento, estabilidade temporal e áudio sincronizado com o ritmo são desafios novos para um laboratório que começou com imagens, justamente por isso existe o período de acesso antecipado.

FLUX 3 Video vs Seedance 2.0#


  • Os dados: nos primeiros testes da Black Forest Labs, FLUX 3 foi preferido ao Seedance 2.0 em 52% das comparações, ficando praticamente empatado com um modelo de vídeo multimodal maduro e comprovado.
  • Recursos: Seedance 2.0 combina texto, imagem, vídeo e áudio em uma única solicitação e entrega cerca de quinze segundos de vídeo com vários planos, de 480p a 4K, áudio multifaixa nativo e sincronizado, além de ciclos de edição e extensão. FLUX 3 Video oferece uma proposta multimodal semelhante e, segundo a Black Forest Labs, se destaca especialmente em rostos expressivos, na sincronização do som com eventos físicos e em diálogos multilíngues.
  • Como escolher: se você precisa colocar algo em produção hoje, Seedance 2.0 é a opção comprovada; FLUX 3 Video é o modelo a acompanhar conforme o lançamento público se aproxima.

FLUX 3 Video vs Kling, Runway e Luma#


  • Os dados: FLUX 3 foi preferido ao Kling v3 Pro em 60%, ao Runway Gen-4.5 em 77% e ao Luma Ray 3.2 em 93% das primeiras comparações da Black Forest Labs.
  • O que explica a diferença: essas margens acompanham os pontos fortes declarados do FLUX 3 Video — rostos humanos expressivos, áudio sincronizado a acontecimentos físicos na tela, diálogo multilíngue e encadeamento consistente de vários planos —, detalhes que fazem um clipe curto parecer um trabalho finalizado, não uma renderização de teste.

O que esperar do FLUX 3 Video no acesso antecipado#


FLUX 3 Video é uma prévia de um modelo ainda em acesso antecipado limitado, por isso vale alinhar as expectativas:


  • Pontos fortes atuais: clipes longos e coerentes, cenas dramáticas ou guiadas por diálogo e áudio nativo sincronizado já funcionam bem nos primeiros testes práticos.
  • Ainda em evolução: a fidelidade às referências na geração de imagem para vídeo pode oscilar nas versões iniciais, e ações muito rápidas e intensas ainda não têm a energia cinética dos concorrentes mais voltados ao movimento.
  • Lançamento gradual: a resolução começa em aproximadamente 720p, com opções maiores previstas, enquanto preços e pesos abertos ainda aguardam confirmação da Black Forest Labs.

Considere FLUX 3 Video uma visão de onde o modelo pretende chegar: recursos e limites continuarão mudando à medida que ele se aproxima da disponibilidade geral.


Edições do FLUX 3 Video e a família mais ampla FLUX 3 AI#


A Black Forest Labs está lançando FLUX 3 AI como uma única base multimodal com várias edições, cada uma disponibilizada em etapas após seu próprio período de acesso antecipado. Segundo o plano oficial de lançamento:


  • FLUX 3 Video: geração e edição de vídeo e áudio por APIs e acesso privado aos pesos, a experiência apresentada nesta página.
  • FLUX 3 Image: síntese e edição de imagens, também disponibilizadas por APIs e acesso privado aos pesos.
  • FLUX 3 Action (FLUX-mimic): previsão de ações para robótica, desenvolvida com parceiros como a mimic robotics e já testada em linhas de produção da Audi.
  • FLUX 3 Dev: uma base multimodal de pesos abertos que abrange geração de imagem, vídeo e áudio, além de previsão de ações, destinada a equipes que desejam executar e adaptar o modelo por conta própria.

A Black Forest Labs confirmou que pretende disponibilizar pesos abertos. Quando a base FLUX 3 Dev estiver disponível, o próximo passo natural será um fluxo de trabalho comunitário com FLUX 3 LoRA, incluindo o fine-tuning de FLUX 3 dev LoRA para personagens recorrentes, estilos e identidades de marca, repetindo o amplo ecossistema de LoRA criado em torno das versões anteriores do FLUX.


Para a maioria das equipes, FLUX 3 Video atenderá à produção diária de clipes, enquanto FLUX 3 Dev e FLUX 3 dev LoRA abrirão caminho para personalização com hospedagem própria.


Recursos oficiais do FLUX 3 Video#


  • Black Forest Labs

Em resumo, FLUX 3 Video estará disponível em breve no RunComfy: uma única base multimodal que transforma prompts e mídias de referência em clipes cinematográficos com áudio nativo sincronizado.

Modelos relacionados

kling-video-o3/pro/image-to-video

Animação de imagem Pro: clipes cinematográficos de 3–15 s a partir de US$ 0,112 por segundo.

hailuo-2-3/pro/text-to-video

Crie vídeos em 1080p a partir de texto com IA que capta movimento e emoção de forma realista.

kling-video-o1/standard/video-edit

Edite um vídeo existente com instruções de texto e até dez imagens de referência opcionais, com controle para preservar o áudio original.

wan-2-1/text-to-video

Crie um vídeo com o Wan 2.1 a partir de um prompt e configure resolução, proporção, número de quadros, taxa de quadros e outras opções.

aurora

Gere um vídeo a partir de uma imagem, um áudio e um prompt, com controle separado da influência do texto e do áudio.

hunyuan/text-to-video

Crie vídeos de alta qualidade a partir de prompts de texto com o Tencent Hunyuan Video.

Perguntas Frequentes

FLUX 3 Video já está disponível no RunComfy?

FLUX 3 Video estará disponível em breve. Esta prévia permite conhecer a experiência do FLUX 3 Video enquanto a Black Forest Labs finaliza o modelo multimodal unificado e sua API. Até que a infraestrutura do FLUX 3 seja ativada, os campos de entrada e os limites exibidos refletem o modelo que atualmente alimenta esta prévia.

Para que serve o FLUX 3 Video?

FLUX 3 Video foi criado para transformar prompts e referências opcionais de imagem, vídeo e áudio em clipes cinematográficos curtos com áudio nativo. Ele atende à criação de anúncios, à pré-visualização de filmes e a narrativas de marca nas quais a consistência das referências e a sincronização do som são importantes.

O que o FLUX 3 Video aprimora em relação às abordagens de vídeo anteriores?

FLUX 3 Video leva o trabalho da Black Forest Labs para movimento e áudio em uma única base multimodal. Ele oferece cinco tarefas oficialmente confirmadas — texto para vídeo, imagem para vídeo, vídeo para vídeo, continuação de vídeo + áudio e keyframe para vídeo —, além de áudio nativo, diálogo multilíngue e clipes de até 20 segundos em uma única geração. Os ganhos exatos dependem do conteúdo; quando o modelo for lançado, compare os clipes usando o mesmo prompt.

Qual pode ser a duração de um clipe do FLUX 3 Video?

FLUX 3 Video gera clipes de até 20 segundos em uma única passagem, aproximadamente o dobro do limite de 10 segundos comum à maioria dos modelos de vídeo. Isso abre espaço para falas e planos dramáticos mais lentos. Também é possível encadear clipes em sequências de vários planos com duração de minutos, mantendo os personagens consistentes. No modelo que atualmente alimenta esta prévia, a duração varia de 4 a 15 segundos; o FLUX 3 Video completo foi projetado para chegar a 20 segundos.

FLUX 3 Video oferece áudio nativo e sincronização labial?

Sim. O áudio nativo é um objetivo central do FLUX 3 Video. No modelo que atualmente alimenta esta prévia, você pode ativar a geração de áudio para produzir fala, efeitos sonoros e música sincronizados, o que viabiliza clipes multilíngues com sincronização labial. Também é possível desativá-la para gerar um vídeo sem som. A qualidade da sincronização labial depende da clareza do prompt e da cena descrita.

Por que o movimento e o som do FLUX 3 Video parecem realistas?

A maior parte do processamento de treinamento do FLUX 3 foi dedicada à previsão de vídeo, por isso o modelo precisou aprender contato, movimento, peso, causa e efeito — em essência, como o mundo físico se comporta. O áudio nativo é aprendido sobre esse modelo de mundo; assim, os sons coincidem com os acontecimentos na tela que os causam, e a fala acompanha o movimento dos lábios. Na prática, FLUX 3 Video se destaca por rostos expressivos e movimentos fisicamente plausíveis.

FLUX 3 Video consegue manter personagens ou estilos consistentes ao longo de um clipe?

A orientação por referências é parte central do FLUX 3 Video. Na prática, imagens de referência combinadas com um prompt claro ajudam a fixar identidade, figurino e tom entre os quadros, e FLUX 3 foi projetado para levar o elemento principal — personagem ou objeto — de um clipe de origem para uma nova cena. No modelo que atualmente alimenta esta prévia, você pode anexar imagens, vídeos e áudios de referência dentro dos limites aceitos para reforçar a consistência.

Quais limites de entrada devo conhecer antes de usar FLUX 3 Video no RunComfy?

No modelo que atualmente alimenta esta prévia, recomenda-se limitar os prompts a cerca de 500 caracteres em chinês ou 1000 palavras em inglês. Você pode anexar até 9 imagens de referência, 3 vídeos de referência (2–15 segundos cada) e 3 áudios de referência (2–15 segundos, com menos de 15 MB). Apenas prompt é obrigatório. Consulte o painel de parâmetros atual, pois os limites serão alterados quando FLUX 3 Video for lançado.

Quais opções de resolução, proporção e duração esta prévia do FLUX 3 Video oferece?

As resoluções disponíveis são 480p, 720p (padrão), 1080p e 4K. A proporção pode ser adaptativa (padrão, em que o modelo escolhe a opção mais próxima) ou fixa em 16:9, 9:16, 4:3, 3:4, 1:1 ou 21:9. No modelo que atualmente alimenta esta prévia, duration aceita um número inteiro de 4 a 15 segundos e o padrão é 5; o FLUX 3 Video completo foi projetado para chegar a 20 segundos em uma única geração.

FLUX 3 Video terá pesos abertos ou fine-tuning com LoRA?

FLUX 3 AI foi planejado como uma única base com várias edições. Além do FLUX 3 Video hospedado, a Black Forest Labs anunciou FLUX 3 Image, FLUX 3 Action (o projeto de robótica FLUX-mimic) e FLUX 3 Dev, uma base multimodal de pesos abertos. A Black Forest Labs confirmou que pretende disponibilizar pesos abertos. Quando a base FLUX 3 Dev for lançada, espera-se um fluxo de trabalho comunitário com FLUX 3 LoRA, incluindo treinamento de FLUX 3 dev LoRA para personagens recorrentes, estilos e identidades de marca.

Como passo dos testes do FLUX 3 Video no navegador para uma integração de produção via API?

Crie o protótipo na interface de modelos do RunComfy e depois chame o mesmo template pela API RunComfy usando campos de entrada idênticos (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio e seed). Primeiro valide os prompts e os limites das mídias na interface; depois use a chave da API e os créditos da sua conta para automatizar as tarefas.

Quanto custa gerar vídeos nesta prévia do FLUX 3 Video?

As gerações consomem créditos de acordo com a duração do vídeo criado pelo modelo que atualmente alimenta esta prévia, Seedance 2.0 Pro: $0.08 por segundo em 480p, $0.175 por segundo em 720p, $0.40 por segundo em 1080p e $0.90 por segundo em 4K. Consulte o preço exibido nesta página, que será atualizado quando FLUX 3 Video for lançado.

Siga-nos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Suporte
  • Discord
  • E-mail
  • Status do Sistema
  • afiliado
Modelos de Vídeo
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • Ver todos os modelos →
Modelos de Imagem
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • Ver todos os modelos →
Legal
  • Termos de Serviço
  • Política de Privacidade
  • Política de Cookies
RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.

Exemplos do FLUX 3 Video

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...