logo
RunComfy
  • ComfyUI
  • TrainerNuovo
  • Modelli
  • API
  • Prezzi
discord logo
MODELLI
Esplora
Tutti i modelli
LIBRERIA
Generazioni
API DEI MODELLI
Documentazione API
Chiavi API
ACCOUNT
Utilizzo

FLUX 3 Video: generazione video multimodale con audio nativo su Models e API | RunComfy

blackforestlabs/flux-3/video

FLUX 3 Video crea clip di massimo 20 secondi con audio nativo sincronizzato. Attualmente è disponibile in accesso anticipato limitato e non è ancora attivo su RunComfy.

Prompt testuale per il video (si consigliano al massimo circa 500 caratteri in cinese o 1000 parole in inglese).
Immagini di riferimento per la modalità di riferimento multimodale (0–9). Formati supportati: JPEG, PNG, WebP, BMP, TIFF e GIF.
Video di riferimento per la modalità di riferimento multimodale (0–3). Formati supportati: MP4 e MOV. La durata deve essere compresa tra 2 e 15 secondi.
Audio di riferimento per la modalità di riferimento multimodale (0–3). Formati supportati: WAV e MP3. La durata deve essere compresa tra 2 e 15 secondi e il file deve essere inferiore a 15 MB.
L’impostazione predefinita è adattiva: il modello sceglie il rapporto più vicino e quello effettivo viene restituito quando si consulta l’attività.
Numero intero di secondi nell’intervallo [4, 15].
Se l’opzione è attiva, il modello restituisce un video con audio sincronizzato (voce, effetti sonori e musica).
Seed casuale per la generazione del video.
Quando è incluso `web_search`, il modello può effettuare una ricerca online in base al prompt, ad esempio su prodotti specifici o sul meteo attuale. Questo può migliorare l’aggiornamento dei dati, ma aumenta la latenza.
Idle
FLUX 3 Video is coming soon. Now the model is Seedance 2.0 Pro. Billed on total video seconds (input + output). The rate per second is $0.08 for 480p, $0.175 for 720p, $0.40 for 1080p, and $0.90 for 4k.

Introduzione alla creazione con FLUX 3 Video

FLUX 3 Video sarà presto disponibile su RunComfy. È il modello multimodale unificato di Black Forest Labs applicato a video e audio: trasforma prompt e contenuti di riferimento in clip cinematografiche con audio nativo sincronizzato. Sostituendo il montaggio fotogramma per fotogramma, le maschere manuali e il doppiaggio separato con una generazione guidata dai prompt, FLUX 3 Video è pensato per team di marketing, agenzie, artisti di previsualizzazione cinematografica e studi di videogiochi che devono creare rapidamente brevi clip cinematografiche. Gli sviluppatori potranno usare FLUX 3 Video su RunComfy sia nel browser sia tramite API HTTP, senza dover ospitare o scalare autonomamente il modello.
Ideale per: annunci video ad alta conversione | Previsualizzazione cinematografica fedele alle inquadrature | Narrazioni di marca multilingue con sincronizzazione labiale

Black Forest Labs / FLUX 3 Video#


FLUX 3 è il prossimo modello unificato di Black Forest Labs, addestrato congiuntamente su immagini, video e audio affinché movimento e suono vengano compresi dalla stessa base. Questa pagina si concentra sulle funzioni video e anticipa l’esperienza di FLUX 3 Video in produzione.


Nota: FLUX 3 Video sarà presto disponibile. Questa pagina mostra un’anteprima dell’esperienza mentre Black Forest Labs completa il modello pubblico e l’API.


Funzioni principali di FLUX 3 Video#


Ecco perché i creator si rivolgono all’esperienza FLUX 3 Video:


  • Salta il software di montaggio: un brief scritto sostituisce il montaggio sulla timeline, il doppiaggio e la pulizia manuale.
  • Dirigilo come un’inquadratura: in FLUX 3 Video, angolazione della videocamera, atmosfera e ritmo derivano dalle parole che scrivi.
  • Audio nella stessa generazione: ogni clip viene prodotto con audio nativo sincronizzato, senza un passaggio di doppiaggio separato.
  • Adatto a contenuti reali: i risultati sono pensati per annunci, previsualizzazione e pubblicazioni social, non soltanto per filmati di prova.

FLUX 3 Video in breve#


Una rapida panoramica delle capacità di FLUX 3 Video:


  • Durata clip: fino a 20 secondi in un’unica generazione, circa il doppio del limite di 10 secondi comune alla maggior parte dei modelli video, con la possibilità di concatenare le inquadrature in sequenze di diversi minuti.
  • Audio: suono nativo e sincronizzato generato insieme alle immagini; può essere disattivato quando serve un filmato muto.
  • Input: prompt testuali e riferimenti immagine, video e audio (fino a circa dieci immagini), così il modello modifica e rielabora con la stessa facilità con cui genera da zero.
  • Risoluzione: 720p durante l’accesso anticipato; sono previste risoluzioni più elevate man mano che il modello matura.
  • Proporzioni: un’ampia gamma, dal 9:16 verticale al 21:9 ultrawide, per formati social, cinematografici e di prodotto.
  • Stili: riprese spontanee da videocamera, animazione e cinematografia rifinita con un solo modello.
  • Stato: accesso anticipato limitato; FLUX 3 Video sarà presto disponibile su RunComfy.

Capacità chiave di FLUX 3 Video#


Black Forest Labs descrive FLUX 3 Video come un unico modello multimodale con diverse modalità di generazione, tutte dotate di audio nativo. Le attività confermate ufficialmente sono:


  • Da testo a video: genera da un solo prompt scritto una clip interamente sonorizzata della durata massima di 20 secondi.
  • Da immagine a video: anima a partire da un fotogramma iniziale o utilizza le immagini fornite come riferimenti visivi per guidare il movimento.
  • Da video a video: trasferisce gli elementi centrali di una clip sorgente, come lo stesso personaggio o oggetto, in una nuova scena o in un nuovo contesto.
  • Continuazione di video e audio: prolunga un video di input e la sua colonna sonora invece di ricominciare.
  • Da fotogramma chiave a video: definisce i momenti principali e lascia al modello il compito di completare la transizione controllata.

Oltre a queste modalità, FLUX 3 Video offre anche:


  • Dialoghi multilingue con movimenti della bocca sincronizzati alla voce.
  • Concatenamento autonomo di più inquadrature, che collega le clip in sequenze di diversi minuti mantenendo coerenti i personaggi.
  • Un’ampia gamma di stili e proporzioni, dalle riprese spontanee da videocamera fino all’animazione e alla cinematografia.
  • Tipografia efficace e design animato riprodotti direttamente nel fotogramma.
  • Realismo basato sul mondo fisico: Black Forest Labs segnala che FLUX 3 Video si distingue già per i volti espressivi e l’allineamento dei suoni agli eventi fisici visibili.

Audio nativo e movimento ancorato al mondo reale in FLUX 3 Video#


FLUX 3 Video si distingue perché immagini e suono vengono progettati insieme e non uniti in seguito. In un unico passaggio può produrre dialoghi, rumori di scena, atmosfera e musica sincronizzati con l’azione: una porta che sbatte genera il proprio impatto, un allarme pulsa al ritmo di una spia e un personaggio può parlare mentre la videocamera attraversa la stessa inquadratura.


Questa sincronizzazione deriva dall’addestramento. Secondo Black Forest Labs, la previsione video ha rappresentato oltre il 95% del calcolo di addestramento di FLUX 3, obbligando il modello a imparare contatto, movimento, peso, causa ed effetto, in altre parole il comportamento del mondo fisico. L’audio viene quindi appreso come conseguenza di questo modello del mondo: i suoni coincidono con gli eventi visibili che li producono e la voce segue il movimento delle labbra. Per i creator, ciò significa movimenti fisicamente plausibili e una colonna sonora che rafforza il montaggio invece di contrastarlo.


Suggerimenti per prompt e riferimenti in FLUX 3 Video#


Questi consigli aiutano a ottenere risultati prevedibili durante l’anteprima di FLUX 3 Video:


  • Specifica con precisione videocamera e movimento (primo piano medio, lento movimento in avanti, camera a mano o fissa).
  • Usa le immagini per ciò che deve restare stabile (volto, costume, logo) e il testo per ciò che deve evolversi (azione, atmosfera).
  • Mantieni video e audio di riferimento tra 2 e 15 secondi e i file audio sotto i 15 MB.
  • Con l’audio attivo, indica il tono del dialogo o il suono ambientale desiderato.
  • Mantieni fisso il seed durante le iterazioni, così le variazioni derivano dal prompt e non dal caso.
  • Semplifica il prompt se il risultato appare confuso o contraddittorio.

Confronto tra FLUX 3 Video e altri modelli#


Poiché FLUX 3 Video è ancora in accesso anticipato, i dati più chiari provengono dalle valutazioni preliminari di Black Forest Labs su clip di 10 secondi a 720p generate con audio. Nei confronti diretti, i valutatori hanno preferito FLUX 3 a un’ampia serie di modelli: Luma Ray 3.2 nel 93% dei confronti, Runway Gen-4.5 nel 77%, Grok Imagine Video fino al 69%, Kling v3 Pro nel 60%, e sia Seedance 2.0 sia Gemini Omni Flash nel 52%. Sono dati iniziali e destinati a cambiare, ma permettono di basare i confronti seguenti sulle capacità anziché sull’entusiasmo.


FLUX 3 Video e FLUX.2 a confronto#


  • Dall’immagine al movimento: tutte le versioni precedenti di FLUX, inclusa FLUX.2, generano soltanto immagini statiche. FLUX 3 è la prima a integrare video e audio sincronizzato nella stessa base, estendendo alle clip la gestione dei riferimenti, la fedeltà al prompt e la tipografia di FLUX.
  • DNA condiviso: FLUX 3 Video estende a un’intera inquadratura le caratteristiche che rendono affidabili le immagini FLUX, mantenendo stabile un personaggio, un prodotto o un logo.
  • Un territorio nuovo: movimento, stabilità temporale e audio sincronizzato all’azione sono problemi nuovi per un laboratorio finora concentrato sulle immagini; è proprio questo il motivo della fase di accesso anticipato.

FLUX 3 Video e Seedance 2.0 a confronto#


  • I dati: nei primi test di Black Forest Labs, FLUX 3 è stato preferito a Seedance 2.0 nel 52% dei confronti, sostanzialmente alla pari con un modello video multimodale maturo e collaudato.
  • Capacità: Seedance 2.0 combina testo, immagini, video e audio in un’unica richiesta e restituisce circa quindici secondi di video multi-inquadratura da 480p a 4K, con audio multitraccia nativo e sincronizzato e cicli di modifica e prolungamento. FLUX 3 Video condivide questa ambizione multimodale e, secondo Black Forest Labs, eccelle in particolare nei volti espressivi, nell’abbinamento del suono agli eventi fisici e nei dialoghi multilingue.
  • Come scegliere: se devi pubblicare oggi, Seedance 2.0 è la scelta collaudata; FLUX 3 Video è il modello da tenere d’occhio in vista dell’uscita pubblica.

FLUX 3 Video e Kling, Runway e Luma a confronto#


  • I dati: nei primi confronti di Black Forest Labs, FLUX 3 è stato preferito a Kling v3 Pro nel 60%, a Runway Gen-4.5 nel 77% e a Luma Ray 3.2 nel 93% dei casi.
  • Cosa determina il divario: questi margini rispecchiano i punti di forza dichiarati di FLUX 3 Video: volti umani espressivi, audio allineato agli eventi fisici visibili, dialoghi multilingue e concatenamento coerente di più inquadrature. Sono i dettagli che fanno apparire una breve clip come un prodotto finito anziché un rendering di prova.

Cosa aspettarsi da FLUX 3 Video durante l’accesso anticipato#


FLUX 3 Video è l’anteprima di un modello ancora in accesso anticipato limitato, quindi è utile definire le aspettative:


  • Già convincente: clip lunghe e coerenti, scene drammatiche e basate sui dialoghi e audio nativo sincronizzato funzionano bene nei primi test pratici.
  • Ancora in evoluzione: nelle prime versioni, l’aderenza ai riferimenti da immagine a video può essere incostante e l’azione molto rapida ed energica non raggiunge ancora l’intensità cinetica dei concorrenti più specializzati nel movimento.
  • Distribuzione progressiva: la risoluzione parte da circa 720p e sono previste risoluzioni superiori, mentre prezzi e pesi aperti devono ancora essere confermati da Black Forest Labs.

Considera FLUX 3 Video un’anticipazione della direzione del modello: capacità e limiti continueranno a evolversi fino alla disponibilità generale.


Edizioni di FLUX 3 Video e famiglia FLUX 3 AI#


Black Forest Labs sta distribuendo FLUX 3 AI come un’unica base multimodale con diverse edizioni, ciascuna rilasciata per fasi dopo il proprio periodo di accesso anticipato. Secondo il piano ufficiale:


  • FLUX 3 Video: generazione e modifica di video e audio tramite API e accesso privato ai pesi, l’esperienza presentata in anteprima in questa pagina.
  • FLUX 3 Image: sintesi e modifica di immagini, anch’esse offerte tramite API e accesso privato ai pesi.
  • FLUX 3 Action (FLUX-mimic): previsione di azioni per la robotica, sviluppata con partner come mimic robotics e già testata sulle linee di produzione Audi.
  • FLUX 3 Dev: una base multimodale a pesi aperti che comprende la generazione di immagini, video e audio oltre alla previsione di azioni, per i team che desiderano eseguire e adattare autonomamente il modello.

Black Forest Labs ha confermato di voler pubblicare pesi aperti. Quando la base FLUX 3 Dev sarà disponibile, il naturale passo successivo sarà un workflow FLUX 3 LoRA della community, compreso il fine-tuning FLUX 3 dev LoRA per personaggi ricorrenti, stili e identità di marca, sul modello del vasto ecosistema LoRA nato intorno alle precedenti versioni di FLUX.


Per la maggior parte dei team, FLUX 3 Video gestirà la produzione quotidiana di clip, mentre FLUX 3 Dev e FLUX 3 dev LoRA apriranno le porte alla personalizzazione in self-hosting.


Risorse ufficiali di FLUX 3 Video#


  • Black Forest Labs

In breve, FLUX 3 Video sarà presto disponibile su RunComfy: un’unica base multimodale che trasforma prompt e contenuti di riferimento in clip cinematografiche con audio nativo sincronizzato.

Modelli correlati

seedance-v1.5-pro/text-to-video

Genera video da 4 a 12 secondi dal testo su 480p, 720p o 1080p, con sei proporzioni più audio e controlli della fotocamera fissa.

wan-2-5/text-to-video

Genera un video di 5 o 10 secondi da un prompt richiesto. Facoltativamente aggiungi una traccia audio WAV o MP3, un prompt negativo e una delle 13 dimensioni di output.

kling-2-5/turbo/image-to-video

Trasforma le tue immagini in video fluidi e cinematografici con l'IA

video-background-removal/fast/video-to-video

Rimuovi gli sfondi con la variante Fast e configura codec, rifinitura dei bordi e tipo di soggetto.

happyhorse-1.1/reference-to-video

Trasforma immagini di riferimento in video fluidi a 720P o 1080P con un solo prompt.

seed-audio-1.0/text-to-audio

Genera voce e audio naturali da testo, audio di riferimento o un'immagine.

Domande Frequenti

FLUX 3 Video è già disponibile su RunComfy?

FLUX 3 Video sarà presto disponibile. Questa anteprima permette di esplorare l’esperienza mentre Black Forest Labs completa il modello multimodale unificato e la relativa API. Finché non verrà attivato il backend FLUX 3, i campi di input e i limiti visibili corrisponderanno al modello che attualmente alimenta l’anteprima.

A cosa serve FLUX 3 Video?

FLUX 3 Video è progettato per trasformare prompt e riferimenti facoltativi sotto forma di immagini, video e audio in brevi clip cinematografiche con audio nativo. È pensato per creatività pubblicitarie, previsualizzazione cinematografica e narrazioni di marca in cui contano la coerenza dei riferimenti e il suono sincronizzato.

Quali miglioramenti offre FLUX 3 Video rispetto agli approcci video precedenti?

FLUX 3 Video porta il lavoro di Black Forest Labs nel movimento e nell’audio all’interno di un’unica base multimodale. Le cinque attività confermate ufficialmente sono: da testo a video, da immagine a video, da video a video, continuazione di video e audio e da fotogramma chiave a video. A queste si aggiungono audio nativo, dialoghi multilingue e clip di massimo 20 secondi in un’unica generazione. I miglioramenti effettivi dipendono dai contenuti; quando il modello sarà disponibile, confronta le clip usando lo stesso prompt.

Quanto può durare una clip di FLUX 3 Video?

FLUX 3 Video genera clip di massimo 20 secondi in un unico passaggio, circa il doppio del limite di 10 secondi comune a molti modelli video, lasciando spazio a pause di dialogo e inquadrature drammatiche più lente. Le clip possono inoltre essere concatenate in sequenze di più inquadrature e diversi minuti mantenendo coerenti i personaggi. Nel modello che attualmente alimenta questa anteprima, la durata va da 4 a 15 secondi; il modello FLUX 3 Video completo è progettato per arrivare a 20 secondi.

FLUX 3 Video supporta audio nativo e sincronizzazione labiale?

Sì. L’audio nativo è uno degli obiettivi principali di FLUX 3 Video. Nel modello che attualmente alimenta questa anteprima puoi attivare la generazione audio per produrre voce, effetti sonori e musica sincronizzati, rendendo possibili clip multilingue con sincronizzazione labiale. Puoi disattivarla per ottenere un video muto. La qualità della sincronizzazione dipende dalla chiarezza del prompt e dalla scena descritta.

Perché movimento e suono di FLUX 3 Video appaiono realistici?

La previsione video ha assorbito la maggior parte del calcolo di addestramento di FLUX 3, quindi il modello ha dovuto imparare contatto, movimento, peso, causa ed effetto, in sostanza il comportamento del mondo fisico. L’audio nativo si basa su questo modello del mondo: i suoni coincidono con gli eventi visibili che li producono e la voce segue il movimento delle labbra. In pratica, FLUX 3 Video si distingue per i volti espressivi e i movimenti fisicamente plausibili.

FLUX 3 Video può mantenere coerenti i personaggi o lo stile durante una clip?

La guida tramite riferimenti è un elemento centrale di FLUX 3 Video. Le immagini di riferimento e un prompt chiaro aiutano a fissare identità, abbigliamento e atmosfera nei diversi fotogrammi, mentre FLUX 3 è progettato per trasferire un soggetto da una clip sorgente a una nuova scena. Nel modello che attualmente alimenta questa anteprima puoi allegare immagini, video e audio di riferimento entro i limiti supportati per rafforzare la coerenza.

Quali limiti di input devo conoscere prima di usare FLUX 3 Video su RunComfy?

Nel modello che attualmente alimenta questa anteprima, si consigliano al massimo circa 500 caratteri per i prompt in cinese o 1000 parole per quelli in inglese. Puoi allegare fino a 9 immagini di riferimento, 3 video di riferimento da 2–15 secondi ciascuno e 3 file audio di riferimento, ciascuno della durata di 2–15 secondi e di dimensione inferiore a 15 MB. È obbligatorio solo il prompt. Consulta il pannello dei parametri, perché i limiti cambieranno quando FLUX 3 Video sarà disponibile.

Quali risoluzioni, proporzioni e durate offre questa anteprima di FLUX 3 Video?

Le risoluzioni disponibili sono 480p, 720p (predefinita), 1080p e 4K. Le proporzioni possono essere adattive (impostazione predefinita, in cui il modello sceglie il rapporto più vicino) oppure fisse su 16:9, 9:16, 4:3, 3:4, 1:1 o 21:9. Nel modello che attualmente alimenta questa anteprima, la durata è un numero intero di secondi da 4 a 15, con valore predefinito 5; il modello FLUX 3 Video completo è progettato per arrivare a 20 secondi in un’unica generazione.

FLUX 3 Video offrirà pesi aperti o fine-tuning LoRA?

FLUX 3 AI è progettato come un’unica base con diverse edizioni. Oltre a FLUX 3 Video ospitato, Black Forest Labs ha annunciato FLUX 3 Image, FLUX 3 Action (il progetto di robotica FLUX-mimic) e FLUX 3 Dev, una base multimodale a pesi aperti. Black Forest Labs ha confermato che i pesi aperti sono in programma; quando sarà disponibile FLUX 3 Dev, è prevedibile un workflow FLUX 3 LoRA della community, incluso l’addestramento FLUX 3 dev LoRA per personaggi ricorrenti, stili e identità di marca.

Come posso passare dai test di FLUX 3 Video nel browser all’integrazione API in produzione?

Crea un prototipo nell’interfaccia dei modelli RunComfy, quindi richiama lo stesso template tramite l’API RunComfy usando gli stessi campi Input (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Verifica prima i prompt e i limiti dei contenuti nell’interfaccia, poi usa la chiave API e i crediti del tuo account per i processi automatizzati.

Quanto costa generare un video in questa anteprima di FLUX 3 Video?

Le generazioni consumano crediti in base alla durata del video prodotto dal modello che attualmente alimenta questa anteprima, Seedance 2.0 Pro: $0.08 al secondo per 480p, $0.175 al secondo per 720p, $0.40 al secondo per 1080p e $0.90 al secondo per 4K. Consulta il prezzo mostrato in questa pagina, che verrà aggiornato al lancio di FLUX 3 Video.

Seguici
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Supporto
  • Discord
  • Email
  • Stato del Sistema
  • affiliato
Modelli Video
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • Visualizza tutti i modelli →
Modelli Immagine
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • Visualizza tutti i modelli →
Legale
  • Termini di Servizio
  • Informativa sulla Privacy
  • Informativa sui Cookie
RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.

Esempi di FLUX 3 Video

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...