Anima l'immagine di un personaggio di riferimento con il movimento di un video di movimento utilizzando prompt positivo e negativo oltre a impostazioni di generazione regolabili.
Wan 3.0 è il modello di generazione video all-in-one di Wan-AI che trasforma testo, immagini, video, audio, file e pagine Web in clip coerenti con audio sincronizzato. Questa pagina fornisce Wan 3.0 Image to Video: fornisci un'immagine del primo fotogramma e un messaggio e anima quel fotogramma in una clip di 2-30 secondi, con un ultimo fotogramma opzionale per fissare come finisce la ripresa. Lo stesso modello sottostante esegue anche la conversione da testo a video e da riferimento a video, quindi l'aspetto che sviluppi qui si trasferisce a tutta la famiglia.
| Wan 3.0 vantaggio | Cosa significa per te |
|---|---|
| Un modello, tanti input | Wan 3.0 gestisce testo, immagini del primo/ultimo fotogramma, immagini di riferimento, video, audio, documenti e collegamenti, quindi raramente è necessario cambiare strumento tra le idee. |
| Controllo del primo e dell'ultimo fotogramma | In questa pagina puoi impostare sia il fotogramma di apertura che quello di chiusura, offrendo a Wan 3.0 un controllo più stretto su come inizia e si risolve una ripresa rispetto a un'animazione del solo primo fotogramma. |
| Uscita flessibile da 2 a 30 secondi | Wan 3.0 esegue il rendering di bozze brevi o riprese singole più lunghe, in modo che le iterazioni rapide e le riprese finite provengano dallo stesso punto finale. |
| Audio sincronizzato, opzionale | Ogni risultato Wan 3.0 può includere una traccia audio corrispondente oppure puoi esportare una clip silenziosa: la commutazione dell'audio non cambia il prezzo. |
La prima tabella elenca i controlli esposti dallo strumento Wan 3.0 Image to Video in questa pagina.
| Parametro | Obbligatorio | Digitare | Predefinito | Gamma / Opzioni | Come scegliere |
|---|---|---|---|---|---|
prompt* | Sì (*) | Stringa | Esempio di richiesta | Fino a 20.000 caratteri | Descrivi il soggetto, il suo movimento, il movimento della fotocamera, l'illuminazione e lo stile. La struttura chiara conta più della lunghezza. |
image_url* | Sì (*) | Stringa | Immagine di esempio | URL immagine o Base64 | Il primo fotogramma Wan 3.0 si anima da. Utilizzare un'immagine nitida, ben illuminata e ordinata per la migliore conservazione del soggetto. |
end_image_url | No | Stringa | vuoto | URL immagine o Base64 | Un ultimo fotogramma opzionale; impostalo quando la posa o la composizione finale è fissa. |
risoluzione | No | Stringa | 720p | 480p, 720p, 1080p | Utilizza 480p per bozze rapide e 1080p per una pubblicazione più dettagliata. |
aspect_ratio | No | Stringa | adaptive | adaptive, 16:9, 9:16, 1:1, 4:3, 3:4 | Lascia adaptive per seguire l'immagine di input o forza un rapporto per un posizionamento specifico. |
durata | No | Intero | "5" | 2–30 secondi | Mantienilo corto mentre raffini il movimento, quindi sollevalo una volta confermata la direzione. |
thinking_mode | No | Booleano | falso | vero / falso | Abilita per istruzioni complesse che combinano diversi movimenti o regole di composizione. |
enable_audio | No | Booleano | vero | vero / falso | Prosegui per una traccia audio sincronizzata; disattivare per una clip silenziosa. |
seme | No | Intero | Casuale | 0–2147483647 | Correggi un seme per riprodurre un risultato mentre apporti modifiche piccole e comparabili. |
La tabella seguente riassume il modello Wan 3.0 più ampio. Gli input di riferimento, documento e solo testo sono disponibili tramite le altre modalità e gli strumenti gemelli del modello, non come controlli in questa pagina Immagine a video.
| Dimensione fondamentale | Wan 3.0 |
|---|---|
| Modello | wan3.0-video |
| Modalità di generazione | Testo in video; Immagine in video (primo fotogramma o primo + ultimo fotogramma); Riferimento al video da immagini, video e audio; oltre a riferimenti a documenti e collegamenti Web. |
| Durata dell'output | 2–30 secondi. Con l'ingresso video, l'ingresso e l'uscita rimangono entro 30 secondi. Un'opzione di durata intelligente consente a Wan 3.0 di consigliare una durata. |
| Risoluzione | 480P, 720P o 1080P. |
| Proporzioni di output | adaptive (consigliato dall'ingresso) o 16:9, 4:3, 1:1, 3:4, 9:16. |
| Audio in uscita | Audio sincronizzato opzionale, generato con l'immagine e attivo per impostazione predefinita. |
| Input primo/ultimo fotogramma | Fino a un first_frame e uno last_frame. Immagini: JPEG, JPG, PNG, BMP o WEBP; 240–8000 pixel per lato; proporzioni fino a "8:1"; fino a 20 MB ciascuno. |
| Immagini di riferimento | Fino a 10 immagini di riferimento per coerenza di soggetto, oggetto o scena. |
| Video di riferimento | Fino a 5 clip; MP4 o MOV; "1–15" secondi ciascuno; video combinato fino a 15 secondi; 240–4096 pixel per lato; fino a 100 MB per clip. |
| Audio di riferimento | Fino a 5 clip; WAV o MP3; audio combinato fino a 15 secondi; fino a 15 MB ciascuno. |
| Documento/input web | Un documento (DOCX, PDF, PPTX, XLSX, TXT e simili, fino a 50 pagine) o un collegamento Web pubblico. |
| Esclusività della modalità | Gli input del primo/ultimo frame non possono essere combinati con input di riferimento, documento o collegamento nella stessa richiesta. |
| Limite richiesta | Fino a 20.000 caratteri. |
Il prezzo di Wan 3.0 dipende dalla risoluzione scelta e dalla durata generata. L'attivazione o la disattivazione dell'audio Wan 3.0 non modifica la velocità.
| Risoluzione | Prezzo al secondo | 5 | 10 | Anni '30 |
|---|---|---|---|---|
| 480p | $ 0,06 | $ 0,30 | $ 0,60 | $ 1,80 |
| 720p | $ 0,12 | $ 0,60 | $ 1,20 | $ 3,60 |
| 1080p | $ 0,25 | $ 1,25 | $ 2,50 | $ 7,50 |
Per lotti da 1 a 4 output, calcolare il totale come "durata × frequenza al secondo × conteggio output".
Utilizza questa struttura Wan 3.0 riutilizzabile:
[soggetto + dettagli di definizione] + [un movimento nel tempo] + [inquadratura e movimento della telecamera] + [ambientazione + illuminazione] + [trattamento visivo] + [audio] + [fotogramma o vincolo finale]
Utilizza questo confronto Wan 3.0 come guida alla famiglia modello; la risoluzione e la durata massime potrebbero non essere disponibili insieme e strumenti diversi possono esporre input e controlli diversi. Basato su informazioni disponibili al pubblico.
| Modello | Risoluzione | Durata massima | Audio | Eccezionale |
|---|---|---|---|---|
| Wan 3.0 | 480p–1080p | Anni '30 | Audio sincronizzato opzionale | Un modello all-in-one che comprende testo, primo/ultimo fotogramma e riferimento al video da immagini, video e audio, oltre a documenti e input web. |
| Kling 3.0 | Fino a 4K | 15 | Audio nativo con sincronizzazione labiale | Coordina i cambi di telecamera multi-scatto e i dialoghi assegnati agli oratori per spot pubblicitari e scene di personaggi. |
| Hailuo 02 | 1080p | ~10 secondi | Nessuno | Movimento focalizzato sulla fisica e forte aderenza immediata per azioni silenziose e scatti di prodotti. |
| Seminazione 2.5 | 1080p | Anni '30 | Audio e video congiunti | Generazione ricca di riferimenti con parlato ed effetti sincronizzati per modifiche sensibili all'identità. |
| Veo 3.1 | 4K | 8s | Dialoghi ed effetti nativi | Controlli del primo/ultimo fotogramma e di riferimento adatti alle transizioni cinematografiche e alle sequenze assemblate. |
Ciò che distingue Wan 3.0 è l'ampiezza: un singolo modello che anima un primo fotogramma, onora un ultimo fotogramma e può estrarre immagini, video, audio, documenti e collegamenti, generando al contempo un suono sincronizzato opzionale. Scegli Wan 3.0 Image to Video quando hai una cornice di apertura da dare vita e passa al testo o agli strumenti di riferimento quando cambia il punto di partenza.
Anima l'immagine di un personaggio di riferimento con il movimento di un video di movimento utilizzando prompt positivo e negativo oltre a impostazioni di generazione regolabili.
Crea video dinamici da immagini con effetti AI intuitivi.
Crea un video animato da un’immagine di riferimento e un video sorgente, scegliendo dimensioni di output e seed.
Genera voce e audio naturali da testo, audio di riferimento o un'immagine.
Aggiungi con Pikadditions una persona o un oggetto di un’immagine a un video esistente.
Trasforma un'immagine di riferimento in un video di 5 o 10 secondi, con prompt negativo opzionale e generazione di audio nativo.
Wan 3.0 image-to-video acquisisce una singola immagine del primo fotogramma e la anima in una clip breve e coerente in base al messaggio di testo. È ideale per trasformare in movimento scatti di prodotti, ritratti, foto di lifestyle o concept art senza rigging o keyframe manuali.
Fornisci sempre un'immagine del primo fotogramma e, facoltativamente, puoi aggiungere un'immagine dell'ultimo fotogramma quando la posa o la composizione finale sono importanti. Wan 3.0 genera quindi un movimento continuo che inizia dal primo fotogramma e si risolve verso l'ultimo, offrendoti un controllo più preciso su come inizia e finisce la ripresa.
Poiché il primo fotogramma viene utilizzato direttamente come apertura del video, Wan 3.0 tende a mantenere l'aspetto del soggetto e l'inquadratura coerenti per tutta la clip. L'utilizzo di un'immagine in ingresso nitida, ben illuminata e ordinata garantisce la migliore conservazione del soggetto.
Wan 3.0 supporta l'output 480p, 720p e 1080p, con 720p come impostazione predefinita comune. La durata è regolabile da 2 a 30 secondi e le proporzioni possono essere widescreen, verticale, quadrato o classico oppure impostate su adaptive in modo che segua l'immagine in ingresso. Controllare il pannello dei parametri RunComfy per i limiti di corrente esatti.
SÌ. Wan 3.0 può produrre una traccia audio sincronizzata insieme alla clip e puoi disattivare l'audio quando hai bisogno solo di riprese mute. La commutazione dell'audio non modifica il costo di generazione.
Le immagini di input devono essere formati comuni come JPEG, PNG o WEBP, con una risoluzione e proporzioni ragionevoli. I fotogrammi di qualità molto bassa o molto disordinati possono ridurre la qualità del movimento, quindi preferisci un primo fotogramma pulito e ad alta risoluzione. I limiti possono variare in base alle impostazioni del provider.
SÌ. Puoi prototipare Wan 3.0 nell'interfaccia utente del modello RunComfy, quindi richiamare lo stesso modello tramite RunComfy HTTP API con parametri identici per la produzione o l'automazione. Ciò ti consente di passare da un test del browser a una pipeline integrata senza modificare il modello.
Le generazioni consumano usd o crediti in base alla risoluzione e alla durata dell'output: 0,06 $ al secondo a 480p, 0,12 $ al secondo a 720p e 0,25 $ al secondo a 1080p. I nuovi utenti in genere ricevono un importo di prova gratuito per provare Wan 3.0 prima di impegnarsi in tirature più grandi.
RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.





