Donnez vie à vos scripts avec un rendu cinématique fluide et précis
FLUX 3 est le prochain modèle unifié de Black Forest Labs. Entraîné conjointement sur des images, des vidéos et des contenus audio, il raisonne sur le mouvement et le son à partir d’une fondation commune. Cette page se concentre sur son versant vidéo et donne un aperçu de l’utilisation de FLUX 3 Video en production.
Remarque : FLUX 3 Video sera bientôt disponible. Cette page présente l’expérience en avant-première pendant que Black Forest Labs finalise le modèle public et l’API.
Pourquoi les créateurs s’intéressent à FLUX 3 Video :
Un aperçu rapide de ce que FLUX 3 Video peut faire :
Black Forest Labs présente FLUX 3 Video comme un modèle multimodal unique offrant plusieurs modes de génération, chaque sortie intégrant un audio natif. Les tâches officiellement confirmées sont :
Au-delà de ces modes, FLUX 3 Video propose également :
FLUX 3 Video se distingue parce que l’image et le son sont conçus ensemble et non assemblés après coup. En une seule génération, il peut produire des dialogues, des bruitages, une ambiance et une musique synchronisés avec l’action : une porte qui claque a son propre impact sonore, une alarme pulse au rythme d’un voyant et un personnage peut parler pendant que la caméra se déplace dans le même plan.
Cette synchronisation découle de l’entraînement du modèle. D’après Black Forest Labs, la prédiction vidéo a représenté plus de 95 % du calcul d’entraînement de FLUX 3, obligeant le modèle à apprendre les contacts, les mouvements, le poids, les causes et leurs effets, autrement dit le fonctionnement du monde physique. L’audio est ensuite appris comme une conséquence de ce modèle du monde : les sons coïncident avec les événements visibles qui les provoquent et la parole suit les mouvements des lèvres. Pour les créateurs, cela se traduit par des mouvements physiquement plausibles et une bande-son qui renforce le montage au lieu de le contrarier.
Ces conseils vous aideront à obtenir des résultats prévisibles pendant la période d’aperçu de FLUX 3 Video :
Comme FLUX 3 Video est encore en accès anticipé, les éléments les plus probants viennent des évaluations préliminaires de Black Forest Labs sur des séquences de 10 secondes en 720p, générées avec le son. Lors de ces comparaisons directes, les évaluateurs ont préféré FLUX 3 à un large éventail de concurrents : Luma Ray 3.2 dans 93 % des cas, Runway Gen-4.5 dans 77 %, Grok Imagine Video dans jusqu’à 69 %, Kling v3 Pro dans 60 %, et Seedance 2.0 comme Gemini Omni Flash dans 52 %. Ces chiffres sont préliminaires et devraient évoluer, mais ils permettent d’ancrer les comparaisons ci-dessous dans les capacités plutôt que dans les promesses.
FLUX 3 Video est l’aperçu d’un modèle encore en accès anticipé limité. Il convient donc de garder les éléments suivants à l’esprit :
Considérez FLUX 3 Video comme un aperçu de la direction prise par le modèle : ses capacités et ses limites continueront d’évoluer jusqu’à sa disponibilité générale.
Black Forest Labs déploie FLUX 3 AI comme une fondation multimodale unique déclinée en plusieurs éditions, chacune étant publiée par étapes après sa propre période d’accès anticipé. D’après le calendrier officiel :
Black Forest Labs a confirmé que des poids ouverts sont prévus. Dès que la fondation FLUX 3 Dev sera disponible, un workflow communautaire FLUX 3 LoRA devrait logiquement suivre, avec notamment l’ajustement fin FLUX 3 dev LoRA pour des personnages récurrents, des styles et des identités de marque, à l’image du vaste écosystème LoRA né autour des précédentes versions de FLUX.
Pour la plupart des équipes, FLUX 3 Video couvrira les besoins quotidiens en séquences, tandis que FLUX 3 Dev et FLUX 3 dev LoRA ouvriront la voie à une personnalisation auto-hébergée.
En résumé, FLUX 3 Video sera bientôt disponible sur RunComfy : une fondation multimodale qui transforme des prompts et des médias de référence en séquences cinématographiques avec un audio natif synchronisé.
Donnez vie à vos scripts avec un rendu cinématique fluide et précis
Transformez vos visuels statiques en contenu vidéo synchronisé avec le mouvement et haute définition grâce à Wan 2.6 et son contrôle flexible.
Animez vos images avec style grâce à une génération vidéo fluide et réaliste.
Génération cinématographique 4K à partir de références, à 0,42 $ par seconde de sortie.
Créez une vidéo synchronisée sur les lèvres à partir des URL vidéo et audio requises, avec cinq modes pour gérer les durées d'entrée qui ne correspondent pas.
Modifie une vidéo source à partir d’un prompt texte, avec audio natif facultatif.
FLUX 3 Video sera bientôt disponible. Cet aperçu vous permet d’explorer l’expérience pendant que Black Forest Labs finalise le modèle multimodal unifié et son API. Tant que le backend FLUX 3 n’est pas activé, les champs et limites visibles correspondent au modèle qui alimente actuellement cet aperçu.
FLUX 3 Video transforme des prompts ainsi que des références image, vidéo et audio facultatives en courtes séquences cinématographiques avec un son natif. Il s’adresse à la création publicitaire, à la prévisualisation cinématographique et aux récits de marque pour lesquels la cohérence des références et la synchronisation du son sont essentielles.
FLUX 3 Video transpose les travaux de Black Forest Labs au mouvement et à l’audio sur une même fondation multimodale. Cinq tâches sont officiellement confirmées : texte vers vidéo, image vers vidéo, vidéo vers vidéo, continuation vidéo et audio, et image clé vers vidéo. S’y ajoutent l’audio natif, les dialogues multilingues et des séquences pouvant atteindre 20 secondes en une génération. Les progrès exacts dépendent de votre contenu ; une fois le modèle disponible, comparez les séquences avec le même prompt.
FLUX 3 Video génère des séquences allant jusqu’à 20 secondes en une seule passe, soit environ deux fois la limite de 10 secondes courante chez de nombreux modèles vidéo. Cela laisse davantage de place aux pauses de dialogue et aux plans dramatiques lents. Les séquences peuvent aussi être enchaînées en scènes multi-plans de plusieurs minutes tout en préservant la cohérence des personnages. Avec le modèle qui alimente actuellement cet aperçu, la durée va de 4 à 15 secondes ; la version complète de FLUX 3 Video vise 20 secondes.
Oui. L’audio natif est l’un des objectifs principaux de FLUX 3 Video. Avec le modèle qui alimente actuellement cet aperçu, vous pouvez activer la génération audio afin de produire des dialogues, des effets sonores et de la musique synchronisés, ce qui permet de créer des séquences multilingues avec synchronisation labiale. Vous pouvez la désactiver pour obtenir une vidéo muette. La qualité de la synchronisation dépend de la clarté du prompt et de la scène décrite.
La prédiction vidéo a représenté l’essentiel du calcul d’entraînement de FLUX 3. Le modèle a donc dû apprendre les contacts, les mouvements, le poids, les causes et leurs effets, c’est-à-dire le fonctionnement du monde physique. L’audio natif s’appuie sur ce modèle du monde : les sons correspondent aux événements visibles qui les provoquent et la parole suit les mouvements des lèvres. En pratique, FLUX 3 Video se distingue par ses visages expressifs et ses mouvements physiquement plausibles.
Le guidage par référence est au cœur de FLUX 3 Video. Des images de référence et un prompt clair aident à fixer l’identité, les vêtements et l’ambiance d’une image à l’autre, tandis que FLUX 3 est conçu pour transposer un sujet d’une séquence source à une nouvelle scène. Avec le modèle qui alimente actuellement cet aperçu, vous pouvez joindre des références image, vidéo et audio dans les limites prises en charge afin de renforcer la cohérence.
Avec le modèle qui alimente actuellement cet aperçu, il est recommandé de limiter les prompts à environ 500 caractères en chinois ou 1 000 mots en anglais. Vous pouvez joindre jusqu’à 9 images de référence, 3 vidéos de référence de 2 à 15 secondes chacune et 3 fichiers audio de référence de 2 à 15 secondes et de moins de 15 Mo. Seul le prompt est obligatoire. Consultez le panneau des paramètres, car les limites changeront lorsque FLUX 3 Video sera disponible.
Les résolutions disponibles sont 480p, 720p par défaut, 1080p et 4K. Le format peut être adaptatif, auquel cas le modèle choisit par défaut le plus proche, ou fixé sur 16:9, 9:16, 4:3, 3:4, 1:1 ou 21:9. Avec le modèle qui alimente actuellement cet aperçu, la durée est un nombre entier de secondes compris entre 4 et 15, avec 5 secondes par défaut ; la version complète de FLUX 3 Video vise 20 secondes en une seule génération.
FLUX 3 AI est conçu comme une fondation unique déclinée en plusieurs éditions. Aux côtés de FLUX 3 Video hébergé, Black Forest Labs a annoncé FLUX 3 Image, FLUX 3 Action (le projet de robotique FLUX-mimic) et FLUX 3 Dev, une fondation multimodale à poids ouverts. Black Forest Labs a confirmé que des poids ouverts sont prévus. Lorsque FLUX 3 Dev sera disponible, un workflow communautaire FLUX 3 LoRA devrait voir le jour, avec notamment l’entraînement FLUX 3 dev LoRA pour des personnages récurrents, des styles et des identités de marque.
Créez votre prototype dans l’interface de modèles RunComfy, puis appelez le même template via l’API RunComfy avec des champs Input identiques (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Validez d’abord les prompts et les limites des médias dans l’interface, puis utilisez la clé API et les crédits de votre compte pour automatiser vos tâches.
Les générations consomment des crédits selon la durée de la vidéo produite par le modèle qui alimente actuellement cet aperçu, Seedance 2.0 Pro : $0.08 par seconde en 480p, $0.175 par seconde en 720p, $0.40 par seconde en 1080p et $0.90 par seconde en 4K. Consultez le tarif affiché sur cette page ; il sera mis à jour au lancement de FLUX 3 Video.
RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.





