logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

FLUX 3 Video: generación multimodal de vídeo con audio nativo en modelos y API | RunComfy

blackforestlabs/flux-3/video

FLUX 3 Video crea clips de hasta 20 segundos con audio nativo sincronizado. Actualmente se encuentra en acceso anticipado limitado y todavía no está disponible en RunComfy.

Prompt de texto para el vídeo (se recomiendan hasta unos 500 caracteres en chino o 1000 palabras en inglés).
Imágenes de referencia para el modo de referencia multimodal (0–9). Formatos compatibles: JPEG, PNG, WebP, BMP, TIFF y GIF.
Vídeos de referencia para el modo de referencia multimodal (0–3). Formatos compatibles: MP4 y MOV. La duración debe estar entre 2 y 15 segundos.
Audios de referencia para el modo de referencia multimodal (0–3). Formatos compatibles: WAV y MP3. Cada audio debe durar entre 2 y 15 segundos y ocupar menos de 15 MB.
El valor predeterminado es adaptativo: el modelo elige la relación más cercana y la relación real se devuelve al consultar la tarea.
Número entero de segundos dentro del intervalo [4, 15].
Si está activado, el modelo produce un vídeo con audio sincronizado (voz, efectos de sonido y música).
Semilla aleatoria para generar el vídeo.
Si se incluye `web_search`, el modelo puede realizar una búsqueda en línea según el prompt, por ejemplo para consultar productos concretos o el tiempo actual. Esto puede mejorar la actualidad de los datos, pero aumenta la latencia.
Idle
FLUX 3 Video is coming soon. Now the model is Seedance 2.0 Pro. Billed on total video seconds (input + output). The rate per second is $0.08 for 480p, $0.175 for 720p, $0.40 for 1080p, and $0.90 for 4k.

Introducción a la creación con FLUX 3 Video

FLUX 3 Video llegará próximamente a RunComfy. Es el modelo multimodal unificado de Black Forest Labs aplicado al vídeo y el audio: convierte prompts y medios de referencia en clips cinematográficos con audio nativo sincronizado. Al sustituir la edición fotograma a fotograma, las máscaras manuales y el doblaje por separado por una generación guiada mediante prompts, FLUX 3 Video está pensado para equipos de marketing, agencias, artistas de previsualización cinematográfica y estudios de videojuegos que necesitan producir con rapidez clips breves de aspecto cinematográfico. Los desarrolladores podrán usar FLUX 3 Video en RunComfy tanto desde el navegador como mediante una API HTTP, sin tener que alojar ni escalar el modelo.
Ideal para: anuncios de vídeo de alta conversión | Previsualización cinematográfica precisa por plano | Historias de marca multilingües con sincronización labial

Black Forest Labs / FLUX 3 Video#


FLUX 3 es el próximo modelo unificado de Black Forest Labs, entrenado de forma conjunta con imágenes, vídeo y audio para que el movimiento y el sonido se comprendan desde una misma base. Esta página se centra en su vertiente de vídeo y anticipa cómo será utilizar FLUX 3 Video en producción.


Nota: FLUX 3 Video llegará próximamente. Esta página ofrece una vista previa de la experiencia mientras Black Forest Labs termina el modelo público y la API.


Funciones destacadas de FLUX 3 Video#


Estas son algunas razones por las que los creadores recurrirán a FLUX 3 Video:


  • Prescinde del programa de edición: un encargo escrito sustituye la edición en la línea de tiempo, el doblaje y la limpieza manual.
  • Dirige como si fuera un plano: en FLUX 3 Video, el ángulo de cámara, el ambiente y el ritmo parten de las palabras que escribes.
  • Sonido en la misma generación: cada clip llega con audio nativo sincronizado, sin un paso de doblaje independiente.
  • Adaptado a entregas reales: los resultados están pensados para anuncios, previsualizaciones y publicaciones sociales, no solo para pruebas.

FLUX 3 Video de un vistazo#


Resumen rápido de lo que puede hacer FLUX 3 Video:


  • Duración del clip: hasta 20 segundos en una sola generación, aproximadamente el doble del límite de 10 segundos habitual en muchos modelos de vídeo, con la posibilidad de encadenar planos en secuencias de varios minutos.
  • Audio: sonido nativo y sincronizado que se genera junto a la imagen; también puede desactivarse para producir material silencioso.
  • Entradas: prompts de texto e imágenes, vídeos y audios de referencia (hasta unas diez imágenes), por lo que edita y remezcla con la misma facilidad con que genera desde cero.
  • Resolución: 720p durante el acceso anticipado, con resoluciones superiores previstas a medida que el modelo madure.
  • Relaciones de aspecto: una amplia selección desde 9:16 vertical hasta 21:9 ultraancho para formatos sociales, cinematográficos y de producto.
  • Estilos: aspecto espontáneo de videocámara, animación y acabados cinematográficos con un solo modelo.
  • Estado: acceso anticipado limitado; FLUX 3 Video llegará próximamente a RunComfy.

Capacidades principales de FLUX 3 Video#


Black Forest Labs describe FLUX 3 Video como un modelo multimodal único con varios modos de generación, todos con audio nativo. Las tareas confirmadas oficialmente son:


  • Texto a vídeo: genera a partir de un único prompt escrito un clip completamente sonorizado de hasta 20 segundos.
  • Imagen a vídeo: anima desde un fotograma inicial o utiliza imágenes aportadas como referencias visuales para orientar el movimiento.
  • Vídeo a vídeo: traslada elementos centrales de un clip de origen, como el mismo personaje u objeto, a otra escena o contexto.
  • Continuación de vídeo y audio: amplía un vídeo de entrada y su banda sonora en lugar de empezar de nuevo.
  • Fotograma clave a vídeo: define momentos concretos y deja que el modelo complete una transición controlada entre ellos.

Además de estos modos, FLUX 3 Video ofrece:


  • Diálogo multilingüe con movimientos de boca ajustados al habla.
  • Encadenamiento autónomo de varios planos, capaz de unir clips en secuencias de minutos y mantener coherentes a los personajes.
  • Una amplia gama de estilos y relaciones de aspecto, desde vídeo espontáneo de videocámara hasta animación y estética cinematográfica.
  • Tipografía sólida y diseño animado representados directamente dentro del fotograma.
  • Realismo basado en el mundo físico: Black Forest Labs señala que FLUX 3 Video ya destaca por sus rostros expresivos y por asociar los sonidos a los acontecimientos físicos visibles.

Audio nativo y movimiento coherente con el mundo físico en FLUX 3 Video#


FLUX 3 Video destaca porque imagen y sonido se conciben juntos, en lugar de unirse posteriormente. En una sola generación puede crear diálogo, efectos de sala, ambiente y música sincronizados con la acción: una puerta se cierra con su propio golpe, una alarma pulsa al ritmo de una luz de aviso y un personaje puede hablar mientras la cámara se desplaza por el mismo plano.


Esta sincronización es consecuencia del entrenamiento. Según Black Forest Labs, la predicción de vídeo concentró más del 95 % del cómputo de entrenamiento de FLUX 3, lo que obligó al modelo a aprender contacto, movimiento, peso, causa y efecto; en otras palabras, el comportamiento del mundo físico. El audio se aprende después como consecuencia de ese modelo del mundo, por lo que los sonidos coinciden con los sucesos visibles que los producen y la voz sigue el movimiento de los labios. Para los creadores, esto significa un movimiento físicamente verosímil y una banda sonora que refuerza la edición en lugar de luchar contra ella.


Consejos para prompts y referencias en FLUX 3 Video#


Estas recomendaciones te ayudarán a obtener resultados previsibles durante la fase de vista previa de FLUX 3 Video:


  • Especifica la cámara y el movimiento (primer plano medio, lento acercamiento, cámara en mano o fija).
  • Usa imágenes para aquello que deba permanecer estable (rostro, vestuario, logotipo) y texto para lo que deba evolucionar (acción, ambiente).
  • Mantén los vídeos y audios de referencia entre 2 y 15 segundos, y el audio por debajo de 15 MB.
  • Con el audio activado, indica el tono del diálogo o el sonido ambiente que quieres escuchar.
  • Mantén fija la semilla mientras iteras para que los cambios procedan del prompt y no del azar.
  • Simplifica el prompt si el resultado parece confuso o contradictorio.

Comparación de FLUX 3 Video con otros modelos#


Como FLUX 3 Video sigue en acceso anticipado, las pruebas más claras proceden de las evaluaciones preliminares de Black Forest Labs con clips de 10 segundos a 720p y con audio. En esas comparaciones directas, los evaluadores prefirieron FLUX 3 frente a un amplio grupo de modelos: Luma Ray 3.2 en el 93 % de las comparaciones, Runway Gen-4.5 en el 77 %, Grok Imagine Video hasta en el 69 %, Kling v3 Pro en el 60 % y tanto Seedance 2.0 como Gemini Omni Flash en el 52 %. Son cifras iniciales que probablemente cambiarán, pero permiten basar las comparaciones siguientes en capacidades y no solo en expectativas.


FLUX 3 Video frente a FLUX.2#


  • De imagen estática a movimiento: todas las versiones anteriores de FLUX, incluida FLUX.2, solo generan imágenes fijas. FLUX 3 es la primera que integra vídeo y audio sincronizado en la misma base, de modo que la gestión de referencias, la fidelidad al prompt y la tipografía de FLUX llegan ahora a los clips.
  • ADN compartido: FLUX 3 Video extiende a todo un plano las cualidades que hacen fiables las imágenes de FLUX: mantener estable un personaje, producto o logotipo.
  • Territorio nuevo: el movimiento, la estabilidad temporal y el audio sincronizado con la acción son retos nuevos para un laboratorio centrado hasta ahora en imágenes; por eso existe esta etapa de acceso anticipado.

FLUX 3 Video frente a Seedance 2.0#


  • Los datos: en las primeras pruebas de Black Forest Labs, FLUX 3 fue preferido a Seedance 2.0 en el 52 % de las comparaciones, prácticamente un empate con un modelo de vídeo multimodal consolidado.
  • Capacidades: Seedance 2.0 combina texto, imagen, vídeo y audio en una sola solicitud y devuelve unos quince segundos de vídeo con varios planos, entre 480p y 4K, con audio multipista nativo y sincronizado, además de ciclos de edición y ampliación. FLUX 3 Video comparte esa ambición multimodal y, según Black Forest Labs, destaca especialmente por sus rostros expresivos, la asociación del sonido con los sucesos físicos y el diálogo multilingüe.
  • Cómo elegir: si tienes que publicar hoy, Seedance 2.0 es la opción probada; FLUX 3 Video es el modelo que conviene seguir de cerca mientras se acerca su lanzamiento público.

FLUX 3 Video frente a Kling, Runway y Luma#


  • Los datos: FLUX 3 fue preferido a Kling v3 Pro en el 60 %, a Runway Gen-4.5 en el 77 % y a Luma Ray 3.2 en el 93 % de las primeras comparaciones de Black Forest Labs.
  • Qué explica la diferencia: esos márgenes coinciden con los puntos fuertes declarados de FLUX 3 Video: rostros humanos expresivos, audio ajustado a los acontecimientos físicos visibles, diálogo multilingüe y encadenamiento coherente de varios planos. Son los detalles que hacen que un clip breve parezca terminado y no una simple prueba de renderizado.

Qué esperar de FLUX 3 Video durante el acceso anticipado#


FLUX 3 Video es una vista previa de un modelo que sigue en acceso anticipado limitado, por lo que conviene ajustar las expectativas:


  • Ya destaca: los clips largos y coherentes, las escenas dramáticas y guiadas por diálogo, y el audio nativo sincronizado funcionan bien en las primeras pruebas prácticas.
  • Aún está madurando: en las primeras versiones, la fidelidad a la referencia al pasar de imagen a vídeo puede ser irregular, y la acción muy rápida y enérgica todavía no alcanza la intensidad cinética de los competidores más centrados en movimiento.
  • Despliegue progresivo: la resolución comienza alrededor de 720p y se esperan resoluciones más altas, mientras que Black Forest Labs aún debe confirmar los precios y los pesos abiertos.

Considera FLUX 3 Video una visión de hacia dónde se dirige el modelo: sus capacidades y limitaciones seguirán cambiando hasta alcanzar la disponibilidad general.


Ediciones de FLUX 3 Video y la familia más amplia de FLUX 3 AI#


Black Forest Labs está desplegando FLUX 3 AI como una base multimodal única con varias ediciones, cada una publicada por fases tras su propio periodo de acceso anticipado. Según el plan oficial:


  • FLUX 3 Video: generación y edición de vídeo y audio mediante APIs y acceso privado a los pesos; es la experiencia que anticipa esta página.
  • FLUX 3 Image: síntesis y edición de imágenes, también mediante APIs y acceso privado a los pesos.
  • FLUX 3 Action (FLUX-mimic): predicción de acciones para robótica, creada con socios como mimic robotics y ya probada en líneas de producción de Audi.
  • FLUX 3 Dev: una base multimodal de pesos abiertos para generar imágenes, vídeo y audio, además de predecir acciones, dirigida a equipos que quieran ejecutar y adaptar el modelo por su cuenta.

Black Forest Labs ha confirmado que prevé publicar pesos abiertos. Cuando esté disponible la base FLUX 3 Dev, el siguiente paso natural será un flujo comunitario de FLUX 3 LoRA, incluido el ajuste fino de FLUX 3 dev LoRA para personajes recurrentes, estilos y apariencias de marca, siguiendo el amplio ecosistema LoRA que surgió alrededor de versiones anteriores de FLUX.


Para la mayoría de equipos, FLUX 3 Video cubrirá la producción diaria de clips, mientras que FLUX 3 Dev y FLUX 3 dev LoRA abrirán la puerta a personalizaciones alojadas por el propio equipo.


Recursos oficiales de FLUX 3 Video#


  • Black Forest Labs

En resumen, FLUX 3 Video llegará próximamente a RunComfy: una base multimodal que convierte prompts y medios de referencia en clips cinematográficos con audio nativo sincronizado.

Modelos relacionados

happyhorse-1.0/text-to-video

HappyHorse 1.0 con salida nativa 1080p, movimiento cinematográfico y coherencia multi-plano.

kling-video-o1/image-to-video/reference

Genere un vídeo a partir de las imágenes de referencia y los elementos obligatorios. Use tokens @Image y @Element en el mismo orden de los arrays y defina con precisión la duración y la relación de aspecto.

kling-3.0/standard/image-to-video

Convierta imágenes fijas en clips de movimiento cinematográficos con cámara y control de audio.

one-to-all-animation/14b

Anime la imagen de un personaje de referencia con movimiento de un video de conducción usando controles de indicación, resolución, inferencia, guía de imagen y guía de pose.

kling-3.0/standard/text-to-video

Crea películas de múltiples escenas con diálogos sincronizados y personajes consistentes. Use Kling 3.0 on RunComfy.

seedance-2.0/pro

Crea clips cinematográficos 2K con sincronización labial precisa y control de cámara.

Preguntas Frecuentes

¿FLUX 3 Video ya está disponible en RunComfy?

FLUX 3 Video llegará próximamente. Esta vista previa permite explorar la experiencia mientras Black Forest Labs termina el modelo multimodal unificado y su API. Hasta que se active el backend de FLUX 3, los campos de entrada y los límites visibles corresponden al modelo que actualmente impulsa esta demostración.

¿Para qué sirve FLUX 3 Video?

FLUX 3 Video está diseñado para convertir prompts e imágenes, vídeos y audios de referencia opcionales en clips cinematográficos breves con audio nativo. Está pensado para creatividad publicitaria, previsualización de películas y narrativas de marca donde importan la coherencia de las referencias y el sonido sincronizado.

¿Qué mejora FLUX 3 Video frente a enfoques de vídeo anteriores?

FLUX 3 Video busca llevar el trabajo de Black Forest Labs al movimiento y el audio dentro de una misma base multimodal. Hay cinco tareas confirmadas oficialmente: texto a vídeo, imagen a vídeo, vídeo a vídeo, continuación de vídeo y audio, y fotograma clave a vídeo. También ofrece audio nativo, diálogo multilingüe y clips de hasta 20 segundos en una sola generación. Las mejoras exactas dependen de tu contenido; cuando se publique, compara clips usando el mismo prompt.

¿Cuánto puede durar un clip de FLUX 3 Video?

FLUX 3 Video genera clips de hasta 20 segundos en una sola pasada, aproximadamente el doble del límite de 10 segundos habitual en muchos modelos de vídeo, lo que permite incluir pausas de diálogo y planos dramáticos más lentos. También pueden encadenarse clips en secuencias de varios planos y minutos de duración manteniendo coherentes a los personajes. En el modelo que actualmente impulsa esta demostración, la duración va de 4 a 15 segundos; el modelo FLUX 3 Video completo está diseñado para llegar a 20 segundos.

¿FLUX 3 Video admite audio nativo y sincronización labial?

Sí. El audio nativo es uno de los objetivos principales de FLUX 3 Video. En el modelo que actualmente impulsa esta demostración puedes activar la generación de audio para producir voz, efectos de sonido y música sincronizados, lo que permite crear clips multilingües con sincronización labial. También puedes desactivarla si necesitas vídeo sin sonido. La calidad de la sincronización depende de la claridad del prompt y de la escena descrita.

¿Por qué parecen realistas el movimiento y el sonido de FLUX 3 Video?

La predicción de vídeo concentró la mayor parte del cómputo de entrenamiento de FLUX 3, por lo que el modelo tuvo que aprender contacto, movimiento, peso, causa y efecto; en esencia, cómo se comporta el mundo físico. El audio nativo se aprende sobre ese modelo del mundo, de modo que los sonidos coinciden con los acontecimientos visibles que los producen y la voz sigue el movimiento de los labios. En la práctica, FLUX 3 Video destaca por sus rostros expresivos y un movimiento físicamente verosímil.

¿Puede FLUX 3 Video mantener coherentes a los personajes o el estilo durante un clip?

La guía mediante referencias es un elemento central de FLUX 3 Video. Las imágenes de referencia y un prompt claro ayudan a fijar la identidad, el vestuario y el tono entre fotogramas, y FLUX 3 está diseñado para trasladar un sujeto de un clip de origen a una escena nueva. En el modelo que actualmente impulsa esta demostración puedes adjuntar imágenes, vídeos y audios de referencia dentro de los límites permitidos para reforzar la coherencia.

¿Qué límites de entrada debo conocer antes de usar FLUX 3 Video en RunComfy?

En el modelo que actualmente impulsa esta demostración, se recomiendan hasta unos 500 caracteres para prompts en chino o unas 1000 palabras en inglés. Puedes adjuntar hasta 9 imágenes de referencia, 3 vídeos de referencia de 2–15 segundos cada uno y 3 audios de referencia de 2–15 segundos y menos de 15 MB. Solo el prompt es obligatorio. Consulta el panel de parámetros, ya que los límites cambiarán cuando FLUX 3 Video esté disponible.

¿Qué resoluciones, relaciones de aspecto y duraciones ofrece esta vista previa de FLUX 3 Video?

Las resoluciones disponibles son 480p, 720p (predeterminada), 1080p y 4K. La relación de aspecto puede ser adaptativa (predeterminada, el modelo elige la más cercana) o fija: 16:9, 9:16, 4:3, 3:4, 1:1 o 21:9. En el modelo que actualmente impulsa esta demostración, la duración es un número entero de segundos entre 4 y 15, con 5 como valor predeterminado; el modelo FLUX 3 Video completo está diseñado para llegar a 20 segundos en una sola generación.

¿FLUX 3 Video ofrecerá pesos abiertos o ajuste fino mediante LoRA?

FLUX 3 AI se ha planteado como una sola base con varias ediciones. Junto al FLUX 3 Video alojado, Black Forest Labs ha anunciado FLUX 3 Image, FLUX 3 Action (el proyecto de robótica FLUX-mimic) y FLUX 3 Dev, una base multimodal de pesos abiertos. Black Forest Labs ha confirmado que prevé publicar pesos abiertos; cuando llegue FLUX 3 Dev, cabe esperar un flujo comunitario de FLUX 3 LoRA, incluido el entrenamiento de FLUX 3 dev LoRA para personajes recurrentes, estilos y apariencias de marca.

¿Cómo paso de probar FLUX 3 Video en el navegador a integrarlo mediante API en producción?

Crea un prototipo en la interfaz de modelos de RunComfy y después llama a la misma plantilla desde la API de RunComfy con idénticos campos Input (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Valida primero los prompts y los límites de los medios en la interfaz y utiliza después la clave de API y los créditos de tu cuenta para automatizar tareas.

¿Cuánto cuesta generar un vídeo en esta demostración de FLUX 3 Video?

Las generaciones consumen créditos en función de la duración del vídeo creado por el modelo que actualmente impulsa esta demostración, Seedance 2.0 Pro: $0.08 por segundo en 480p, $0.175 por segundo en 720p, $0.40 por segundo en 1080p y $0.90 por segundo en 4K. Consulta el precio mostrado en esta página, que se actualizará cuando se lance FLUX 3 Video.

Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • Ver todos los modelos →
Modelos de Imagen
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.

Ejemplos de FLUX 3 Video

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...