logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

FLUX 3 Video : génération vidéo multimodale avec audio natif sur Models et via API | RunComfy

blackforestlabs/flux-3/video

FLUX 3 Video crée des séquences allant jusqu’à 20 secondes avec un audio natif synchronisé. Le modèle est actuellement en accès anticipé limité et n’est pas encore disponible sur RunComfy.

Prompt textuel pour la vidéo (recommandation : environ 500 caractères maximum en chinois ou 1 000 mots maximum en anglais).
Images de référence pour le mode de référence multimodal (0 à 9). Formats pris en charge : JPEG, PNG, WebP, BMP, TIFF et GIF.
Vidéos de référence pour le mode de référence multimodal (0 à 3). Formats pris en charge : MP4 et MOV. Chaque vidéo doit durer entre 2 et 15 secondes.
Fichiers audio de référence pour le mode de référence multimodal (0 à 3). Formats pris en charge : WAV et MP3. Chaque fichier doit durer entre 2 et 15 secondes et peser moins de 15 Mo.
Le réglage par défaut est adaptatif : le modèle choisit le format le plus proche et le format réel est renvoyé lors de la consultation de la tâche.
Nombre entier de secondes compris dans l’intervalle [4, 15].
Lorsque cette option est activée, le modèle produit une vidéo avec un son synchronisé (voix, effets sonores et musique).
Graine aléatoire utilisée pour générer la vidéo.
Lorsque `web_search` est activé, le modèle peut effectuer une recherche en ligne en fonction du prompt, par exemple sur un produit précis ou la météo actuelle. Les informations peuvent ainsi être plus à jour, au prix d’un temps de traitement plus long.
Idle
FLUX 3 Video is coming soon. Now the model is Seedance 2.0 Pro. Billed on total video seconds (input + output). The rate per second is $0.08 for 480p, $0.175 for 720p, $0.40 for 1080p, and $0.90 for 4k.

Présentation de la création avec FLUX 3 Video

FLUX 3 Video sera bientôt disponible sur RunComfy. Il s’agit du modèle multimodal unifié de Black Forest Labs appliqué à la vidéo et à l’audio : il transforme des prompts et des médias de référence en séquences cinématographiques avec un son natif synchronisé. En remplaçant le montage image par image, le masquage manuel et le doublage séparé par une génération pilotée par prompt, FLUX 3 Video s’adresse aux équipes marketing, aux agences, aux artistes de prévisualisation cinématographique et aux studios de jeux qui ont besoin de produire rapidement de courtes séquences cinématographiques. Les développeurs pourront utiliser FLUX 3 Video sur RunComfy dans le navigateur comme via une API HTTP, sans avoir à héberger ni à dimensionner le modèle.
Idéal pour : publicités vidéo à fort taux de conversion | Prévisualisation cinématographique fidèle au plan | Récits de marque multilingues avec synchronisation labiale

Black Forest Labs / FLUX 3 Video#


FLUX 3 est le prochain modèle unifié de Black Forest Labs. Entraîné conjointement sur des images, des vidéos et des contenus audio, il raisonne sur le mouvement et le son à partir d’une fondation commune. Cette page se concentre sur son versant vidéo et donne un aperçu de l’utilisation de FLUX 3 Video en production.


Remarque : FLUX 3 Video sera bientôt disponible. Cette page présente l’expérience en avant-première pendant que Black Forest Labs finalise le modèle public et l’API.


Points forts de FLUX 3 Video#


Pourquoi les créateurs s’intéressent à FLUX 3 Video :


  • Contournez le logiciel de montage : un brief écrit remplace le montage sur la timeline, le doublage et le nettoyage manuel.
  • Dirigez comme un plan : dans FLUX 3 Video, l’angle de caméra, l’ambiance et le rythme découlent des mots que vous écrivez.
  • Le son dans la même génération : chaque séquence est livrée avec un audio natif synchronisé, sans étape de doublage séparée.
  • Adapté aux livrables réels : les résultats sont conçus pour les publicités, la prévisualisation et les réseaux sociaux, pas seulement pour des séquences de test.

FLUX 3 Video en bref#


Un aperçu rapide de ce que FLUX 3 Video peut faire :


  • Durée des séquences : jusqu’à 20 secondes en une seule génération, soit environ deux fois la limite de 10 secondes courante chez la plupart des modèles vidéo, avec la possibilité d’enchaîner des plans en séquences de plusieurs minutes.
  • Audio : son natif et synchronisé généré en même temps que l’image, avec la possibilité de le désactiver pour obtenir une vidéo muette.
  • Entrées : prompts textuels et références image, vidéo et audio (jusqu’à une dizaine d’images), ce qui permet de modifier et de remixer aussi facilement que de générer de zéro.
  • Résolution : 720p pendant l’accès anticipé ; des résolutions supérieures sont attendues à mesure que le modèle gagne en maturité.
  • Formats : un large choix du 9:16 vertical au 21:9 ultra-large pour les réseaux sociaux, le cinéma et les formats produit.
  • Styles : prise spontanée au caméscope, animation ou rendu cinématographique soigné à partir d’un même modèle.
  • Statut : accès anticipé limité ; FLUX 3 Video sera donc bientôt disponible sur RunComfy.

Capacités clés de FLUX 3 Video#


Black Forest Labs présente FLUX 3 Video comme un modèle multimodal unique offrant plusieurs modes de génération, chaque sortie intégrant un audio natif. Les tâches officiellement confirmées sont :


  • Texte vers vidéo : génère à partir d’un simple prompt écrit une séquence entièrement sonorisée pouvant atteindre 20 secondes.
  • Image vers vidéo : anime une image de départ ou utilise les images fournies comme références visuelles pour orienter le mouvement.
  • Vidéo vers vidéo : transpose les éléments principaux d’une séquence source, comme le même personnage ou objet, dans une nouvelle scène ou un nouveau contexte.
  • Continuation vidéo et audio : prolonge une vidéo d’entrée et sa bande-son au lieu de repartir de zéro.
  • Image clé vers vidéo : vous définissez des moments précis et le modèle complète la transition contrôlée entre eux.

Au-delà de ces modes, FLUX 3 Video propose également :


  • Des dialogues multilingues avec des mouvements de bouche qui suivent la parole.
  • Un enchaînement agentique de plusieurs plans, capable de relier des séquences pendant plusieurs minutes tout en préservant la cohérence des personnages.
  • Une grande variété de styles et de formats, de l’aspect spontané d’un caméscope à l’animation et au rendu cinématographique.
  • Une typographie soignée et du design animé directement dans l’image.
  • Un réalisme ancré dans le monde physique : Black Forest Labs souligne que FLUX 3 Video se distingue déjà par ses visages expressifs et par la synchronisation des sons avec les événements physiques à l’écran.

Audio natif et mouvement ancré dans le monde réel avec FLUX 3 Video#


FLUX 3 Video se distingue parce que l’image et le son sont conçus ensemble et non assemblés après coup. En une seule génération, il peut produire des dialogues, des bruitages, une ambiance et une musique synchronisés avec l’action : une porte qui claque a son propre impact sonore, une alarme pulse au rythme d’un voyant et un personnage peut parler pendant que la caméra se déplace dans le même plan.


Cette synchronisation découle de l’entraînement du modèle. D’après Black Forest Labs, la prédiction vidéo a représenté plus de 95 % du calcul d’entraînement de FLUX 3, obligeant le modèle à apprendre les contacts, les mouvements, le poids, les causes et leurs effets, autrement dit le fonctionnement du monde physique. L’audio est ensuite appris comme une conséquence de ce modèle du monde : les sons coïncident avec les événements visibles qui les provoquent et la parole suit les mouvements des lèvres. Pour les créateurs, cela se traduit par des mouvements physiquement plausibles et une bande-son qui renforce le montage au lieu de le contrarier.


Conseils sur les prompts et les références pour FLUX 3 Video#


Ces conseils vous aideront à obtenir des résultats prévisibles pendant la période d’aperçu de FLUX 3 Video :


  • Soyez précis sur la caméra et le mouvement (plan rapproché taille, lent travelling avant, caméra à l’épaule ou fixe).
  • Utilisez des images pour ce qui doit rester stable (visage, costume, logo) et du texte pour ce qui doit évoluer (action, ambiance).
  • Limitez les vidéos et contenus audio de référence à 2–15 secondes, et les fichiers audio à 15 Mo.
  • Lorsque l’audio est activé, précisez le ton du dialogue ou le son ambiant souhaité.
  • Conservez la même graine pendant vos itérations afin que les changements viennent du prompt et non du hasard.
  • Simplifiez le prompt si le résultat paraît confus ou contradictoire.

Comparaison de FLUX 3 Video avec d’autres modèles#


Comme FLUX 3 Video est encore en accès anticipé, les éléments les plus probants viennent des évaluations préliminaires de Black Forest Labs sur des séquences de 10 secondes en 720p, générées avec le son. Lors de ces comparaisons directes, les évaluateurs ont préféré FLUX 3 à un large éventail de concurrents : Luma Ray 3.2 dans 93 % des cas, Runway Gen-4.5 dans 77 %, Grok Imagine Video dans jusqu’à 69 %, Kling v3 Pro dans 60 %, et Seedance 2.0 comme Gemini Omni Flash dans 52 %. Ces chiffres sont préliminaires et devraient évoluer, mais ils permettent d’ancrer les comparaisons ci-dessous dans les capacités plutôt que dans les promesses.


FLUX 3 Video face à FLUX.2#


  • De l’image fixe au mouvement : toutes les versions précédentes de FLUX, y compris FLUX.2, génèrent uniquement des images fixes. FLUX 3 est la première à réunir vidéo et audio synchronisé sur la même fondation, afin d’étendre aux séquences la gestion des références, la fidélité au prompt et la typographie propres à FLUX.
  • Un ADN commun : FLUX 3 Video étend à tout un plan les qualités qui rendent les images FLUX fiables, notamment la stabilité d’un personnage, d’un produit ou d’un logo.
  • Un nouveau terrain : le mouvement, la stabilité temporelle et l’audio calé sur l’action sont des problématiques nouvelles pour un laboratoire historiquement centré sur l’image ; c’est précisément la raison de cette période d’accès anticipé.

FLUX 3 Video face à Seedance 2.0#


  • Les données : lors des premiers tests de Black Forest Labs, FLUX 3 a été préféré à Seedance 2.0 dans 52 % des comparaisons, soit une quasi-égalité avec un modèle vidéo multimodal éprouvé et mature.
  • Les capacités : Seedance 2.0 associe texte, image, vidéo et audio dans une seule requête et produit environ quinze secondes de vidéo multi-plan de 480p à 4K, avec un son multipiste natif et synchronisé ainsi que des boucles de modification et de prolongation. FLUX 3 Video partage cette ambition multimodale et, d’après Black Forest Labs, excelle particulièrement sur les visages expressifs, l’association du son aux événements physiques et les dialogues multilingues.
  • Comment choisir : si vous devez produire aujourd’hui, Seedance 2.0 est une solution éprouvée ; FLUX 3 Video est le modèle à suivre à l’approche de sa sortie publique.

FLUX 3 Video face à Kling, Runway et Luma#


  • Les données : FLUX 3 a été préféré à Kling v3 Pro dans 60 %, à Runway Gen-4.5 dans 77 % et à Luma Ray 3.2 dans 93 % des premières comparaisons de Black Forest Labs.
  • Ce qui explique l’écart : ces résultats correspondent aux atouts annoncés de FLUX 3 Video : visages humains expressifs, audio calé sur les événements physiques à l’écran, dialogues multilingues et enchaînement cohérent de plusieurs plans. Ce sont ces détails qui donnent à une courte séquence l’aspect d’un produit fini plutôt que d’un rendu de test.

À quoi s’attendre pendant l’accès anticipé à FLUX 3 Video#


FLUX 3 Video est l’aperçu d’un modèle encore en accès anticipé limité. Il convient donc de garder les éléments suivants à l’esprit :


  • Déjà convaincant : les séquences longues et cohérentes, les scènes dramatiques ou portées par le dialogue ainsi que l’audio natif synchronisé donnent de bons résultats dans les premiers essais pratiques.
  • Encore en maturation : dans les premières versions, le respect des références en image vers vidéo peut manquer de régularité, et les actions très rapides et intenses n’atteignent pas encore l’énergie cinétique des concurrents les plus axés sur le mouvement.
  • Déploiement progressif : la résolution commence autour de 720p et devrait augmenter. Black Forest Labs doit encore confirmer les tarifs et les poids ouverts.

Considérez FLUX 3 Video comme un aperçu de la direction prise par le modèle : ses capacités et ses limites continueront d’évoluer jusqu’à sa disponibilité générale.


Les éditions FLUX 3 Video et l’ensemble de la famille FLUX 3 AI#


Black Forest Labs déploie FLUX 3 AI comme une fondation multimodale unique déclinée en plusieurs éditions, chacune étant publiée par étapes après sa propre période d’accès anticipé. D’après le calendrier officiel :


  • FLUX 3 Video : génération et montage vidéo et audio via des APIs et un accès privé aux poids, soit l’expérience présentée sur cette page.
  • FLUX 3 Image : synthèse et retouche d’images, également via des APIs et un accès privé aux poids.
  • FLUX 3 Action (FLUX-mimic) : prédiction d’actions pour la robotique, développée avec des partenaires comme mimic robotics et déjà testée sur les chaînes de production d’Audi.
  • FLUX 3 Dev : fondation multimodale à poids ouverts couvrant la génération d’images, de vidéos et de contenus audio ainsi que la prédiction d’actions, destinée aux équipes qui souhaitent exécuter et adapter elles-mêmes le modèle.

Black Forest Labs a confirmé que des poids ouverts sont prévus. Dès que la fondation FLUX 3 Dev sera disponible, un workflow communautaire FLUX 3 LoRA devrait logiquement suivre, avec notamment l’ajustement fin FLUX 3 dev LoRA pour des personnages récurrents, des styles et des identités de marque, à l’image du vaste écosystème LoRA né autour des précédentes versions de FLUX.


Pour la plupart des équipes, FLUX 3 Video couvrira les besoins quotidiens en séquences, tandis que FLUX 3 Dev et FLUX 3 dev LoRA ouvriront la voie à une personnalisation auto-hébergée.


Ressources officielles de FLUX 3 Video#


  • Black Forest Labs

En résumé, FLUX 3 Video sera bientôt disponible sur RunComfy : une fondation multimodale qui transforme des prompts et des médias de référence en séquences cinématographiques avec un audio natif synchronisé.

Modèles associés

veo-3-1/text-to-video

Donnez vie à vos scripts avec un rendu cinématique fluide et précis

wan-2-6/image-to-video

Transformez vos visuels statiques en contenu vidéo synchronisé avec le mouvement et haute définition grâce à Wan 2.6 et son contrôle flexible.

seedance-1-0/pro/image-to-video

Animez vos images avec style grâce à une génération vidéo fluide et réaliste.

kling-video-o3/4K/reference-to-video

Génération cinématographique 4K à partir de références, à 0,42 $ par seconde de sortie.

sync/lipsync/v2/pro

Créez une vidéo synchronisée sur les lèvres à partir des URL vidéo et audio requises, avec cinq modes pour gérer les durées d'entrée qui ne correspondent pas.

seedance-2.0-mini/video-to-video

Modifie une vidéo source à partir d’un prompt texte, avec audio natif facultatif.

Questions Fréquemment Posées

FLUX 3 Video est-il déjà disponible sur RunComfy ?

FLUX 3 Video sera bientôt disponible. Cet aperçu vous permet d’explorer l’expérience pendant que Black Forest Labs finalise le modèle multimodal unifié et son API. Tant que le backend FLUX 3 n’est pas activé, les champs et limites visibles correspondent au modèle qui alimente actuellement cet aperçu.

À quoi sert FLUX 3 Video ?

FLUX 3 Video transforme des prompts ainsi que des références image, vidéo et audio facultatives en courtes séquences cinématographiques avec un son natif. Il s’adresse à la création publicitaire, à la prévisualisation cinématographique et aux récits de marque pour lesquels la cohérence des références et la synchronisation du son sont essentielles.

Qu’améliore FLUX 3 Video par rapport aux approches vidéo précédentes ?

FLUX 3 Video transpose les travaux de Black Forest Labs au mouvement et à l’audio sur une même fondation multimodale. Cinq tâches sont officiellement confirmées : texte vers vidéo, image vers vidéo, vidéo vers vidéo, continuation vidéo et audio, et image clé vers vidéo. S’y ajoutent l’audio natif, les dialogues multilingues et des séquences pouvant atteindre 20 secondes en une génération. Les progrès exacts dépendent de votre contenu ; une fois le modèle disponible, comparez les séquences avec le même prompt.

Quelle peut être la durée d’une séquence FLUX 3 Video ?

FLUX 3 Video génère des séquences allant jusqu’à 20 secondes en une seule passe, soit environ deux fois la limite de 10 secondes courante chez de nombreux modèles vidéo. Cela laisse davantage de place aux pauses de dialogue et aux plans dramatiques lents. Les séquences peuvent aussi être enchaînées en scènes multi-plans de plusieurs minutes tout en préservant la cohérence des personnages. Avec le modèle qui alimente actuellement cet aperçu, la durée va de 4 à 15 secondes ; la version complète de FLUX 3 Video vise 20 secondes.

FLUX 3 Video prend-il en charge l’audio natif et la synchronisation labiale ?

Oui. L’audio natif est l’un des objectifs principaux de FLUX 3 Video. Avec le modèle qui alimente actuellement cet aperçu, vous pouvez activer la génération audio afin de produire des dialogues, des effets sonores et de la musique synchronisés, ce qui permet de créer des séquences multilingues avec synchronisation labiale. Vous pouvez la désactiver pour obtenir une vidéo muette. La qualité de la synchronisation dépend de la clarté du prompt et de la scène décrite.

Pourquoi les mouvements et le son de FLUX 3 Video paraissent-ils réalistes ?

La prédiction vidéo a représenté l’essentiel du calcul d’entraînement de FLUX 3. Le modèle a donc dû apprendre les contacts, les mouvements, le poids, les causes et leurs effets, c’est-à-dire le fonctionnement du monde physique. L’audio natif s’appuie sur ce modèle du monde : les sons correspondent aux événements visibles qui les provoquent et la parole suit les mouvements des lèvres. En pratique, FLUX 3 Video se distingue par ses visages expressifs et ses mouvements physiquement plausibles.

FLUX 3 Video peut-il préserver la cohérence des personnages ou du style pendant une séquence ?

Le guidage par référence est au cœur de FLUX 3 Video. Des images de référence et un prompt clair aident à fixer l’identité, les vêtements et l’ambiance d’une image à l’autre, tandis que FLUX 3 est conçu pour transposer un sujet d’une séquence source à une nouvelle scène. Avec le modèle qui alimente actuellement cet aperçu, vous pouvez joindre des références image, vidéo et audio dans les limites prises en charge afin de renforcer la cohérence.

Quelles limites d’entrée faut-il connaître avant d’utiliser FLUX 3 Video sur RunComfy ?

Avec le modèle qui alimente actuellement cet aperçu, il est recommandé de limiter les prompts à environ 500 caractères en chinois ou 1 000 mots en anglais. Vous pouvez joindre jusqu’à 9 images de référence, 3 vidéos de référence de 2 à 15 secondes chacune et 3 fichiers audio de référence de 2 à 15 secondes et de moins de 15 Mo. Seul le prompt est obligatoire. Consultez le panneau des paramètres, car les limites changeront lorsque FLUX 3 Video sera disponible.

Quelles résolutions, quels formats et quelles durées cet aperçu de FLUX 3 Video propose-t-il ?

Les résolutions disponibles sont 480p, 720p par défaut, 1080p et 4K. Le format peut être adaptatif, auquel cas le modèle choisit par défaut le plus proche, ou fixé sur 16:9, 9:16, 4:3, 3:4, 1:1 ou 21:9. Avec le modèle qui alimente actuellement cet aperçu, la durée est un nombre entier de secondes compris entre 4 et 15, avec 5 secondes par défaut ; la version complète de FLUX 3 Video vise 20 secondes en une seule génération.

FLUX 3 Video proposera-t-il des poids ouverts ou un ajustement fin LoRA ?

FLUX 3 AI est conçu comme une fondation unique déclinée en plusieurs éditions. Aux côtés de FLUX 3 Video hébergé, Black Forest Labs a annoncé FLUX 3 Image, FLUX 3 Action (le projet de robotique FLUX-mimic) et FLUX 3 Dev, une fondation multimodale à poids ouverts. Black Forest Labs a confirmé que des poids ouverts sont prévus. Lorsque FLUX 3 Dev sera disponible, un workflow communautaire FLUX 3 LoRA devrait voir le jour, avec notamment l’entraînement FLUX 3 dev LoRA pour des personnages récurrents, des styles et des identités de marque.

Comment passer des essais de FLUX 3 Video dans le navigateur à une intégration API en production ?

Créez votre prototype dans l’interface de modèles RunComfy, puis appelez le même template via l’API RunComfy avec des champs Input identiques (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Validez d’abord les prompts et les limites des médias dans l’interface, puis utilisez la clé API et les crédits de votre compte pour automatiser vos tâches.

Combien coûte une génération dans cet aperçu de FLUX 3 Video ?

Les générations consomment des crédits selon la durée de la vidéo produite par le modèle qui alimente actuellement cet aperçu, Seedance 2.0 Pro : $0.08 par seconde en 480p, $0.175 par seconde en 720p, $0.40 par seconde en 1080p et $0.90 par seconde en 4K. Consultez le tarif affiché sur cette page ; il sera mis à jour au lancement de FLUX 3 Video.

Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • Voir tous les modèles →
Modèles d'images
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.

Exemples de FLUX 3 Video

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...