Genera video da 4 a 12 secondi dal testo su 480p, 720p o 1080p, con sei proporzioni più audio e controlli della fotocamera fissa.
FLUX 3 è il prossimo modello unificato di Black Forest Labs, addestrato congiuntamente su immagini, video e audio affinché movimento e suono vengano compresi dalla stessa base. Questa pagina si concentra sulle funzioni video e anticipa l’esperienza di FLUX 3 Video in produzione.
Nota: FLUX 3 Video sarà presto disponibile. Questa pagina mostra un’anteprima dell’esperienza mentre Black Forest Labs completa il modello pubblico e l’API.
Ecco perché i creator si rivolgono all’esperienza FLUX 3 Video:
Una rapida panoramica delle capacità di FLUX 3 Video:
Black Forest Labs descrive FLUX 3 Video come un unico modello multimodale con diverse modalità di generazione, tutte dotate di audio nativo. Le attività confermate ufficialmente sono:
Oltre a queste modalità, FLUX 3 Video offre anche:
FLUX 3 Video si distingue perché immagini e suono vengono progettati insieme e non uniti in seguito. In un unico passaggio può produrre dialoghi, rumori di scena, atmosfera e musica sincronizzati con l’azione: una porta che sbatte genera il proprio impatto, un allarme pulsa al ritmo di una spia e un personaggio può parlare mentre la videocamera attraversa la stessa inquadratura.
Questa sincronizzazione deriva dall’addestramento. Secondo Black Forest Labs, la previsione video ha rappresentato oltre il 95% del calcolo di addestramento di FLUX 3, obbligando il modello a imparare contatto, movimento, peso, causa ed effetto, in altre parole il comportamento del mondo fisico. L’audio viene quindi appreso come conseguenza di questo modello del mondo: i suoni coincidono con gli eventi visibili che li producono e la voce segue il movimento delle labbra. Per i creator, ciò significa movimenti fisicamente plausibili e una colonna sonora che rafforza il montaggio invece di contrastarlo.
Questi consigli aiutano a ottenere risultati prevedibili durante l’anteprima di FLUX 3 Video:
Poiché FLUX 3 Video è ancora in accesso anticipato, i dati più chiari provengono dalle valutazioni preliminari di Black Forest Labs su clip di 10 secondi a 720p generate con audio. Nei confronti diretti, i valutatori hanno preferito FLUX 3 a un’ampia serie di modelli: Luma Ray 3.2 nel 93% dei confronti, Runway Gen-4.5 nel 77%, Grok Imagine Video fino al 69%, Kling v3 Pro nel 60%, e sia Seedance 2.0 sia Gemini Omni Flash nel 52%. Sono dati iniziali e destinati a cambiare, ma permettono di basare i confronti seguenti sulle capacità anziché sull’entusiasmo.
FLUX 3 Video è l’anteprima di un modello ancora in accesso anticipato limitato, quindi è utile definire le aspettative:
Considera FLUX 3 Video un’anticipazione della direzione del modello: capacità e limiti continueranno a evolversi fino alla disponibilità generale.
Black Forest Labs sta distribuendo FLUX 3 AI come un’unica base multimodale con diverse edizioni, ciascuna rilasciata per fasi dopo il proprio periodo di accesso anticipato. Secondo il piano ufficiale:
Black Forest Labs ha confermato di voler pubblicare pesi aperti. Quando la base FLUX 3 Dev sarà disponibile, il naturale passo successivo sarà un workflow FLUX 3 LoRA della community, compreso il fine-tuning FLUX 3 dev LoRA per personaggi ricorrenti, stili e identità di marca, sul modello del vasto ecosistema LoRA nato intorno alle precedenti versioni di FLUX.
Per la maggior parte dei team, FLUX 3 Video gestirà la produzione quotidiana di clip, mentre FLUX 3 Dev e FLUX 3 dev LoRA apriranno le porte alla personalizzazione in self-hosting.
In breve, FLUX 3 Video sarà presto disponibile su RunComfy: un’unica base multimodale che trasforma prompt e contenuti di riferimento in clip cinematografiche con audio nativo sincronizzato.
Genera video da 4 a 12 secondi dal testo su 480p, 720p o 1080p, con sei proporzioni più audio e controlli della fotocamera fissa.
Genera un video di 5 o 10 secondi da un prompt richiesto. Facoltativamente aggiungi una traccia audio WAV o MP3, un prompt negativo e una delle 13 dimensioni di output.
Trasforma le tue immagini in video fluidi e cinematografici con l'IA
Rimuovi gli sfondi con la variante Fast e configura codec, rifinitura dei bordi e tipo di soggetto.
Trasforma immagini di riferimento in video fluidi a 720P o 1080P con un solo prompt.
Genera voce e audio naturali da testo, audio di riferimento o un'immagine.
FLUX 3 Video sarà presto disponibile. Questa anteprima permette di esplorare l’esperienza mentre Black Forest Labs completa il modello multimodale unificato e la relativa API. Finché non verrà attivato il backend FLUX 3, i campi di input e i limiti visibili corrisponderanno al modello che attualmente alimenta l’anteprima.
FLUX 3 Video è progettato per trasformare prompt e riferimenti facoltativi sotto forma di immagini, video e audio in brevi clip cinematografiche con audio nativo. È pensato per creatività pubblicitarie, previsualizzazione cinematografica e narrazioni di marca in cui contano la coerenza dei riferimenti e il suono sincronizzato.
FLUX 3 Video porta il lavoro di Black Forest Labs nel movimento e nell’audio all’interno di un’unica base multimodale. Le cinque attività confermate ufficialmente sono: da testo a video, da immagine a video, da video a video, continuazione di video e audio e da fotogramma chiave a video. A queste si aggiungono audio nativo, dialoghi multilingue e clip di massimo 20 secondi in un’unica generazione. I miglioramenti effettivi dipendono dai contenuti; quando il modello sarà disponibile, confronta le clip usando lo stesso prompt.
FLUX 3 Video genera clip di massimo 20 secondi in un unico passaggio, circa il doppio del limite di 10 secondi comune a molti modelli video, lasciando spazio a pause di dialogo e inquadrature drammatiche più lente. Le clip possono inoltre essere concatenate in sequenze di più inquadrature e diversi minuti mantenendo coerenti i personaggi. Nel modello che attualmente alimenta questa anteprima, la durata va da 4 a 15 secondi; il modello FLUX 3 Video completo è progettato per arrivare a 20 secondi.
Sì. L’audio nativo è uno degli obiettivi principali di FLUX 3 Video. Nel modello che attualmente alimenta questa anteprima puoi attivare la generazione audio per produrre voce, effetti sonori e musica sincronizzati, rendendo possibili clip multilingue con sincronizzazione labiale. Puoi disattivarla per ottenere un video muto. La qualità della sincronizzazione dipende dalla chiarezza del prompt e dalla scena descritta.
La previsione video ha assorbito la maggior parte del calcolo di addestramento di FLUX 3, quindi il modello ha dovuto imparare contatto, movimento, peso, causa ed effetto, in sostanza il comportamento del mondo fisico. L’audio nativo si basa su questo modello del mondo: i suoni coincidono con gli eventi visibili che li producono e la voce segue il movimento delle labbra. In pratica, FLUX 3 Video si distingue per i volti espressivi e i movimenti fisicamente plausibili.
La guida tramite riferimenti è un elemento centrale di FLUX 3 Video. Le immagini di riferimento e un prompt chiaro aiutano a fissare identità, abbigliamento e atmosfera nei diversi fotogrammi, mentre FLUX 3 è progettato per trasferire un soggetto da una clip sorgente a una nuova scena. Nel modello che attualmente alimenta questa anteprima puoi allegare immagini, video e audio di riferimento entro i limiti supportati per rafforzare la coerenza.
Nel modello che attualmente alimenta questa anteprima, si consigliano al massimo circa 500 caratteri per i prompt in cinese o 1000 parole per quelli in inglese. Puoi allegare fino a 9 immagini di riferimento, 3 video di riferimento da 2–15 secondi ciascuno e 3 file audio di riferimento, ciascuno della durata di 2–15 secondi e di dimensione inferiore a 15 MB. È obbligatorio solo il prompt. Consulta il pannello dei parametri, perché i limiti cambieranno quando FLUX 3 Video sarà disponibile.
Le risoluzioni disponibili sono 480p, 720p (predefinita), 1080p e 4K. Le proporzioni possono essere adattive (impostazione predefinita, in cui il modello sceglie il rapporto più vicino) oppure fisse su 16:9, 9:16, 4:3, 3:4, 1:1 o 21:9. Nel modello che attualmente alimenta questa anteprima, la durata è un numero intero di secondi da 4 a 15, con valore predefinito 5; il modello FLUX 3 Video completo è progettato per arrivare a 20 secondi in un’unica generazione.
FLUX 3 AI è progettato come un’unica base con diverse edizioni. Oltre a FLUX 3 Video ospitato, Black Forest Labs ha annunciato FLUX 3 Image, FLUX 3 Action (il progetto di robotica FLUX-mimic) e FLUX 3 Dev, una base multimodale a pesi aperti. Black Forest Labs ha confermato che i pesi aperti sono in programma; quando sarà disponibile FLUX 3 Dev, è prevedibile un workflow FLUX 3 LoRA della community, incluso l’addestramento FLUX 3 dev LoRA per personaggi ricorrenti, stili e identità di marca.
Crea un prototipo nell’interfaccia dei modelli RunComfy, quindi richiama lo stesso template tramite l’API RunComfy usando gli stessi campi Input (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Verifica prima i prompt e i limiti dei contenuti nell’interfaccia, poi usa la chiave API e i crediti del tuo account per i processi automatizzati.
Le generazioni consumano crediti in base alla durata del video prodotto dal modello che attualmente alimenta questa anteprima, Seedance 2.0 Pro: $0.08 al secondo per 480p, $0.175 al secondo per 720p, $0.40 al secondo per 1080p e $0.90 al secondo per 4K. Consulta il prezzo mostrato in questa pagina, che verrà aggiornato al lancio di FLUX 3 Video.
RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.





