HappyHorse 1.0 con salida nativa 1080p, movimiento cinematográfico y coherencia multi-plano.
FLUX 3 es el próximo modelo unificado de Black Forest Labs, entrenado de forma conjunta con imágenes, vídeo y audio para que el movimiento y el sonido se comprendan desde una misma base. Esta página se centra en su vertiente de vídeo y anticipa cómo será utilizar FLUX 3 Video en producción.
Nota: FLUX 3 Video llegará próximamente. Esta página ofrece una vista previa de la experiencia mientras Black Forest Labs termina el modelo público y la API.
Estas son algunas razones por las que los creadores recurrirán a FLUX 3 Video:
Resumen rápido de lo que puede hacer FLUX 3 Video:
Black Forest Labs describe FLUX 3 Video como un modelo multimodal único con varios modos de generación, todos con audio nativo. Las tareas confirmadas oficialmente son:
Además de estos modos, FLUX 3 Video ofrece:
FLUX 3 Video destaca porque imagen y sonido se conciben juntos, en lugar de unirse posteriormente. En una sola generación puede crear diálogo, efectos de sala, ambiente y música sincronizados con la acción: una puerta se cierra con su propio golpe, una alarma pulsa al ritmo de una luz de aviso y un personaje puede hablar mientras la cámara se desplaza por el mismo plano.
Esta sincronización es consecuencia del entrenamiento. Según Black Forest Labs, la predicción de vídeo concentró más del 95 % del cómputo de entrenamiento de FLUX 3, lo que obligó al modelo a aprender contacto, movimiento, peso, causa y efecto; en otras palabras, el comportamiento del mundo físico. El audio se aprende después como consecuencia de ese modelo del mundo, por lo que los sonidos coinciden con los sucesos visibles que los producen y la voz sigue el movimiento de los labios. Para los creadores, esto significa un movimiento físicamente verosímil y una banda sonora que refuerza la edición en lugar de luchar contra ella.
Estas recomendaciones te ayudarán a obtener resultados previsibles durante la fase de vista previa de FLUX 3 Video:
Como FLUX 3 Video sigue en acceso anticipado, las pruebas más claras proceden de las evaluaciones preliminares de Black Forest Labs con clips de 10 segundos a 720p y con audio. En esas comparaciones directas, los evaluadores prefirieron FLUX 3 frente a un amplio grupo de modelos: Luma Ray 3.2 en el 93 % de las comparaciones, Runway Gen-4.5 en el 77 %, Grok Imagine Video hasta en el 69 %, Kling v3 Pro en el 60 % y tanto Seedance 2.0 como Gemini Omni Flash en el 52 %. Son cifras iniciales que probablemente cambiarán, pero permiten basar las comparaciones siguientes en capacidades y no solo en expectativas.
FLUX 3 Video es una vista previa de un modelo que sigue en acceso anticipado limitado, por lo que conviene ajustar las expectativas:
Considera FLUX 3 Video una visión de hacia dónde se dirige el modelo: sus capacidades y limitaciones seguirán cambiando hasta alcanzar la disponibilidad general.
Black Forest Labs está desplegando FLUX 3 AI como una base multimodal única con varias ediciones, cada una publicada por fases tras su propio periodo de acceso anticipado. Según el plan oficial:
Black Forest Labs ha confirmado que prevé publicar pesos abiertos. Cuando esté disponible la base FLUX 3 Dev, el siguiente paso natural será un flujo comunitario de FLUX 3 LoRA, incluido el ajuste fino de FLUX 3 dev LoRA para personajes recurrentes, estilos y apariencias de marca, siguiendo el amplio ecosistema LoRA que surgió alrededor de versiones anteriores de FLUX.
Para la mayoría de equipos, FLUX 3 Video cubrirá la producción diaria de clips, mientras que FLUX 3 Dev y FLUX 3 dev LoRA abrirán la puerta a personalizaciones alojadas por el propio equipo.
En resumen, FLUX 3 Video llegará próximamente a RunComfy: una base multimodal que convierte prompts y medios de referencia en clips cinematográficos con audio nativo sincronizado.
HappyHorse 1.0 con salida nativa 1080p, movimiento cinematográfico y coherencia multi-plano.
Genere un vídeo a partir de las imágenes de referencia y los elementos obligatorios. Use tokens @Image y @Element en el mismo orden de los arrays y defina con precisión la duración y la relación de aspecto.
Convierta imágenes fijas en clips de movimiento cinematográficos con cámara y control de audio.
Anime la imagen de un personaje de referencia con movimiento de un video de conducción usando controles de indicación, resolución, inferencia, guía de imagen y guía de pose.
Crea películas de múltiples escenas con diálogos sincronizados y personajes consistentes. Use Kling 3.0 on RunComfy.
Crea clips cinematográficos 2K con sincronización labial precisa y control de cámara.
FLUX 3 Video llegará próximamente. Esta vista previa permite explorar la experiencia mientras Black Forest Labs termina el modelo multimodal unificado y su API. Hasta que se active el backend de FLUX 3, los campos de entrada y los límites visibles corresponden al modelo que actualmente impulsa esta demostración.
FLUX 3 Video está diseñado para convertir prompts e imágenes, vídeos y audios de referencia opcionales en clips cinematográficos breves con audio nativo. Está pensado para creatividad publicitaria, previsualización de películas y narrativas de marca donde importan la coherencia de las referencias y el sonido sincronizado.
FLUX 3 Video busca llevar el trabajo de Black Forest Labs al movimiento y el audio dentro de una misma base multimodal. Hay cinco tareas confirmadas oficialmente: texto a vídeo, imagen a vídeo, vídeo a vídeo, continuación de vídeo y audio, y fotograma clave a vídeo. También ofrece audio nativo, diálogo multilingüe y clips de hasta 20 segundos en una sola generación. Las mejoras exactas dependen de tu contenido; cuando se publique, compara clips usando el mismo prompt.
FLUX 3 Video genera clips de hasta 20 segundos en una sola pasada, aproximadamente el doble del límite de 10 segundos habitual en muchos modelos de vídeo, lo que permite incluir pausas de diálogo y planos dramáticos más lentos. También pueden encadenarse clips en secuencias de varios planos y minutos de duración manteniendo coherentes a los personajes. En el modelo que actualmente impulsa esta demostración, la duración va de 4 a 15 segundos; el modelo FLUX 3 Video completo está diseñado para llegar a 20 segundos.
Sí. El audio nativo es uno de los objetivos principales de FLUX 3 Video. En el modelo que actualmente impulsa esta demostración puedes activar la generación de audio para producir voz, efectos de sonido y música sincronizados, lo que permite crear clips multilingües con sincronización labial. También puedes desactivarla si necesitas vídeo sin sonido. La calidad de la sincronización depende de la claridad del prompt y de la escena descrita.
La predicción de vídeo concentró la mayor parte del cómputo de entrenamiento de FLUX 3, por lo que el modelo tuvo que aprender contacto, movimiento, peso, causa y efecto; en esencia, cómo se comporta el mundo físico. El audio nativo se aprende sobre ese modelo del mundo, de modo que los sonidos coinciden con los acontecimientos visibles que los producen y la voz sigue el movimiento de los labios. En la práctica, FLUX 3 Video destaca por sus rostros expresivos y un movimiento físicamente verosímil.
La guía mediante referencias es un elemento central de FLUX 3 Video. Las imágenes de referencia y un prompt claro ayudan a fijar la identidad, el vestuario y el tono entre fotogramas, y FLUX 3 está diseñado para trasladar un sujeto de un clip de origen a una escena nueva. En el modelo que actualmente impulsa esta demostración puedes adjuntar imágenes, vídeos y audios de referencia dentro de los límites permitidos para reforzar la coherencia.
En el modelo que actualmente impulsa esta demostración, se recomiendan hasta unos 500 caracteres para prompts en chino o unas 1000 palabras en inglés. Puedes adjuntar hasta 9 imágenes de referencia, 3 vídeos de referencia de 2–15 segundos cada uno y 3 audios de referencia de 2–15 segundos y menos de 15 MB. Solo el prompt es obligatorio. Consulta el panel de parámetros, ya que los límites cambiarán cuando FLUX 3 Video esté disponible.
Las resoluciones disponibles son 480p, 720p (predeterminada), 1080p y 4K. La relación de aspecto puede ser adaptativa (predeterminada, el modelo elige la más cercana) o fija: 16:9, 9:16, 4:3, 3:4, 1:1 o 21:9. En el modelo que actualmente impulsa esta demostración, la duración es un número entero de segundos entre 4 y 15, con 5 como valor predeterminado; el modelo FLUX 3 Video completo está diseñado para llegar a 20 segundos en una sola generación.
FLUX 3 AI se ha planteado como una sola base con varias ediciones. Junto al FLUX 3 Video alojado, Black Forest Labs ha anunciado FLUX 3 Image, FLUX 3 Action (el proyecto de robótica FLUX-mimic) y FLUX 3 Dev, una base multimodal de pesos abiertos. Black Forest Labs ha confirmado que prevé publicar pesos abiertos; cuando llegue FLUX 3 Dev, cabe esperar un flujo comunitario de FLUX 3 LoRA, incluido el entrenamiento de FLUX 3 dev LoRA para personajes recurrentes, estilos y apariencias de marca.
Crea un prototipo en la interfaz de modelos de RunComfy y después llama a la misma plantilla desde la API de RunComfy con idénticos campos Input (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Valida primero los prompts y los límites de los medios en la interfaz y utiliza después la clave de API y los créditos de tu cuenta para automatizar tareas.
Las generaciones consumen créditos en función de la duración del vídeo creado por el modelo que actualmente impulsa esta demostración, Seedance 2.0 Pro: $0.08 por segundo en 480p, $0.175 por segundo en 720p, $0.40 por segundo en 1080p y $0.90 por segundo en 4K. Consulta el precio mostrado en esta página, que se actualizará cuando se lance FLUX 3 Video.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.





