logo
RunComfy
  • ComfyUI
  • TrainerNuovo
  • Modelli
  • API
  • Prezzi
discord logo
MODELLI
Esplora
Tutti i modelli
LIBRERIA
Generazioni
API DEI MODELLI
Documentazione API
Chiavi API
ACCOUNT
Utilizzo

Wan 3.0: conversione da immagine a video, primo-ultimo fotogramma, audio su Models and API | RunComfy

wan-ai/wan-3.0/image-to-video

Wan 3.0 anima l'immagine del primo fotogramma in un video coerente con controllo opzionale dell'ultimo fotogramma, durata flessibile, proporzioni e audio per brevi clip raffinati.

Descrivi il movimento, l'azione, il movimento della fotocamera, l'illuminazione e lo stile in cui desideri animare il primo fotogramma.
Immagine del primo fotogramma animata dal modello nel video. Utilizzare un'immagine chiara e di alta qualità per una migliore conservazione del soggetto.
Immagine facoltativa dell'ultimo fotogramma utilizzata per guidare la posa, la composizione o la scena finale del video.
Livello di risoluzione dell'output. Utilizza 480p per bozze veloci e 1080p per risultati di qualità superiore.
Proporzioni di uscita. Utilizza adaptive per far corrispondere le proporzioni dell'immagine in ingresso.
Durata del video generato in secondi. L'intervallo è 2-30. Inizia brevemente a ripetere, quindi aumenta una volta che il movimento sembra corretto.
Abilita un'interpretazione più approfondita e tempestiva per scene complesse con molteplici requisiti di movimento o composizione.
Quando è attivo, il video in uscita include una traccia audio sincronizzata. Disattiva per una clip silenziosa.
Seme casuale per risultati riproducibili. L'intervallo è compreso tra 0 e 2147483647.
Idle
The rate is $0.06 per second for 480p, $0.12 per second for 720p, and $0.25 per second for 1080p.

Introduzione a Wan 3.0

Wan 3.0 image-to-video dà vita a una singola immagine del primo fotogramma come clip cinematografica, con guida opzionale dell'ultimo fotogramma, durata di 2-30 secondi, controllo delle proporzioni e audio sincronizzato. Scambiando keyframing manuali lenti con movimenti guidati che mantengono il soggetto e la scena coerenti, è adatto ai professionisti del marketing, ai creatori di ritratti e stili di vita e ai team social che spediscono rapidamente brevi clip. Per gli sviluppatori, Wan 3.0 su RunComfy può essere utilizzato sia nel browser che tramite HTTP API, quindi non è necessario ospitare o ridimensionare il modello manualmente.
Ideale per: clip di prodotto e marketing | Animazione verticale | Video sociale verticale

Perché scegliere Wan 3.0#


Wan 3.0 è il modello di generazione video all-in-one di Wan-AI che trasforma testo, immagini, video, audio, file e pagine Web in clip coerenti con audio sincronizzato. Questa pagina fornisce Wan 3.0 Image to Video: fornisci un'immagine del primo fotogramma e un messaggio e anima quel fotogramma in una clip di 2-30 secondi, con un ultimo fotogramma opzionale per fissare come finisce la ripresa. Lo stesso modello sottostante esegue anche la conversione da testo a video e da riferimento a video, quindi l'aspetto che sviluppi qui si trasferisce a tutta la famiglia.


Wan 3.0 vantaggioCosa significa per te
Un modello, tanti inputWan 3.0 gestisce testo, immagini del primo/ultimo fotogramma, immagini di riferimento, video, audio, documenti e collegamenti, quindi raramente è necessario cambiare strumento tra le idee.
Controllo del primo e dell'ultimo fotogrammaIn questa pagina puoi impostare sia il fotogramma di apertura che quello di chiusura, offrendo a Wan 3.0 un controllo più stretto su come inizia e si risolve una ripresa rispetto a un'animazione del solo primo fotogramma.
Uscita flessibile da 2 a 30 secondiWan 3.0 esegue il rendering di bozze brevi o riprese singole più lunghe, in modo che le iterazioni rapide e le riprese finite provengano dallo stesso punto finale.
Audio sincronizzato, opzionaleOgni risultato Wan 3.0 può includere una traccia audio corrispondente oppure puoi esportare una clip silenziosa: la commutazione dell'audio non cambia il prezzo.

Migliori casi d'uso#


  • Video di prodotti e marketing: utilizza Wan 3.0 per trasformare la foto di un prodotto o di una confezione in un breve clip promozionale con movimento e inquadratura controllati.
  • Animazione di ritratti e stili di vita: lascia che Wan 3.0 animi un ritratto, una moda o uno stile di vita trasformandoli in un momento naturale e in linea con il marchio.
  • Contenuti sui social media: produci clip Wan 3.0 verticali, quadrati o widescreen da una singola immagine per reel, shorts, storie o posizionamenti nei feed.
  • Prototipazione creativa: prova la direzione, il movimento e lo stile visivo della telecamera da un fotogramma fisso con Wan 3.0 prima di impegnarti in un passaggio di produzione completo.

Come funziona#


  1. Imposta il fotogramma di apertura: carica un'immagine del primo fotogramma pulita e ad alta risoluzione che Wan 3.0 darà vita.
  2. Descrivi il movimento: spiega a Wan 3.0 cosa si muove, come si muove la telecamera e come la luce e la scena si sviluppano nel tempo.
  3. Guida il finale (facoltativo): aggiungi un'immagine dell'ultimo fotogramma quando la posa, la composizione o la scena finale conta e Wan 3.0 collegherà le due.
  4. Scegli il formato di consegna: scegli una risoluzione, un formato, una durata di 2-30 secondi e se generare audio, quindi esamina il risultato Wan 3.0 e perfeziona un'istruzione alla volta.

Parametri#


La prima tabella elenca i controlli esposti dallo strumento Wan 3.0 Image to Video in questa pagina.


ParametroObbligatorioDigitarePredefinitoGamma / OpzioniCome scegliere
prompt*Sì (*)StringaEsempio di richiestaFino a 20.000 caratteriDescrivi il soggetto, il suo movimento, il movimento della fotocamera, l'illuminazione e lo stile. La struttura chiara conta più della lunghezza.
image_url*Sì (*)StringaImmagine di esempioURL immagine o Base64Il primo fotogramma Wan 3.0 si anima da. Utilizzare un'immagine nitida, ben illuminata e ordinata per la migliore conservazione del soggetto.
end_image_urlNoStringavuotoURL immagine o Base64Un ultimo fotogramma opzionale; impostalo quando la posa o la composizione finale è fissa.
risoluzioneNoStringa720p480p, 720p, 1080pUtilizza 480p per bozze rapide e 1080p per una pubblicazione più dettagliata.
aspect_ratioNoStringaadaptiveadaptive, 16:9, 9:16, 1:1, 4:3, 3:4Lascia adaptive per seguire l'immagine di input o forza un rapporto per un posizionamento specifico.
durataNoIntero"5"2–30 secondiMantienilo corto mentre raffini il movimento, quindi sollevalo una volta confermata la direzione.
thinking_modeNoBooleanofalsovero / falsoAbilita per istruzioni complesse che combinano diversi movimenti o regole di composizione.
enable_audioNoBooleanoverovero / falsoProsegui per una traccia audio sincronizzata; disattivare per una clip silenziosa.
semeNoInteroCasuale0–2147483647Correggi un seme per riprodurre un risultato mentre apporti modifiche piccole e comparabili.

  • Campo obbligatorio.

La tabella seguente riassume il modello Wan 3.0 più ampio. Gli input di riferimento, documento e solo testo sono disponibili tramite le altre modalità e gli strumenti gemelli del modello, non come controlli in questa pagina Immagine a video.


Dimensione fondamentaleWan 3.0
Modellowan3.0-video
Modalità di generazioneTesto in video; Immagine in video (primo fotogramma o primo + ultimo fotogramma); Riferimento al video da immagini, video e audio; oltre a riferimenti a documenti e collegamenti Web.
Durata dell'output2–30 secondi. Con l'ingresso video, l'ingresso e l'uscita rimangono entro 30 secondi. Un'opzione di durata intelligente consente a Wan 3.0 di consigliare una durata.
Risoluzione480P, 720P o 1080P.
Proporzioni di outputadaptive (consigliato dall'ingresso) o 16:9, 4:3, 1:1, 3:4, 9:16.
Audio in uscitaAudio sincronizzato opzionale, generato con l'immagine e attivo per impostazione predefinita.
Input primo/ultimo fotogrammaFino a un first_frame e uno last_frame. Immagini: JPEG, JPG, PNG, BMP o WEBP; 240–8000 pixel per lato; proporzioni fino a "8:1"; fino a 20 MB ciascuno.
Immagini di riferimentoFino a 10 immagini di riferimento per coerenza di soggetto, oggetto o scena.
Video di riferimentoFino a 5 clip; MP4 o MOV; "1–15" secondi ciascuno; video combinato fino a 15 secondi; 240–4096 pixel per lato; fino a 100 MB per clip.
Audio di riferimentoFino a 5 clip; WAV o MP3; audio combinato fino a 15 secondi; fino a 15 MB ciascuno.
Documento/input webUn documento (DOCX, PDF, PPTX, XLSX, TXT e simili, fino a 50 pagine) o un collegamento Web pubblico.
Esclusività della modalitàGli input del primo/ultimo frame non possono essere combinati con input di riferimento, documento o collegamento nella stessa richiesta.
Limite richiestaFino a 20.000 caratteri.

Prezzi#


Il prezzo di Wan 3.0 dipende dalla risoluzione scelta e dalla durata generata. L'attivazione o la disattivazione dell'audio Wan 3.0 non modifica la velocità.


RisoluzionePrezzo al secondo510Anni '30
480p$ 0,06$ 0,30$ 0,60$ 1,80
720p$ 0,12$ 0,60$ 1,20$ 3,60
1080p$ 0,25$ 1,25$ 2,50$ 7,50

Per lotti da 1 a 4 output, calcolare il totale come "durata × frequenza al secondo × conteggio output".


Suggerimenti e suggerimenti di riferimento#


Utilizza questa struttura Wan 3.0 riutilizzabile:


[soggetto + dettagli di definizione] + [un movimento nel tempo] + [inquadratura e movimento della telecamera] + [ambientazione + illuminazione] + [trattamento visivo] + [audio] + [fotogramma o vincolo finale]


  • Inizia con l'oggetto: Indica cosa contiene il primo fotogramma, quindi descrivi come Wan 3.0 dovrebbe spostarlo.
  • Separa la fotocamera dal soggetto: Descrivi il movimento del soggetto e il movimento della fotocamera in modo indipendente per risultati Wan 3.0 più puliti.
  • Utilizza un primo fotogramma nitido: Sfocatura, confusione o bassa risoluzione nell'input si ripercuotono sul video.
  • Ancora il finale: Raggiungi un'immagine dell'ultimo fotogramma quando una posa o composizione finale specifica non è negoziabile.
  • Attiva la modalità di pensiero: attivala quando uno scatto Wan 3.0 sovrappone diversi movimenti o regole di composizione.
  • Correggi il seed: blocca un seed una volta che una ripresa sembra corretta in modo da poter confrontare equamente le piccole modifiche ai prompt.

Come si confronta Wan 3.0#


Utilizza questo confronto Wan 3.0 come guida alla famiglia modello; la risoluzione e la durata massime potrebbero non essere disponibili insieme e strumenti diversi possono esporre input e controlli diversi. Basato su informazioni disponibili al pubblico.


ModelloRisoluzioneDurata massimaAudioEccezionale
Wan 3.0480p–1080pAnni '30Audio sincronizzato opzionaleUn modello all-in-one che comprende testo, primo/ultimo fotogramma e riferimento al video da immagini, video e audio, oltre a documenti e input web.
Kling 3.0Fino a 4K15Audio nativo con sincronizzazione labialeCoordina i cambi di telecamera multi-scatto e i dialoghi assegnati agli oratori per spot pubblicitari e scene di personaggi.
Hailuo 021080p~10 secondiNessunoMovimento focalizzato sulla fisica e forte aderenza immediata per azioni silenziose e scatti di prodotti.
Seminazione 2.51080pAnni '30Audio e video congiuntiGenerazione ricca di riferimenti con parlato ed effetti sincronizzati per modifiche sensibili all'identità.
Veo 3.14K8sDialoghi ed effetti nativiControlli del primo/ultimo fotogramma e di riferimento adatti alle transizioni cinematografiche e alle sequenze assemblate.

Ciò che distingue Wan 3.0 è l'ampiezza: un singolo modello che anima un primo fotogramma, onora un ultimo fotogramma e può estrarre immagini, video, audio, documenti e collegamenti, generando al contempo un suono sincronizzato opzionale. Scegli Wan 3.0 Image to Video quando hai una cornice di apertura da dare vita e passa al testo o agli strumenti di riferimento quando cambia il punto di partenza.


Altri modelli da provare#


  • Wan 3.0 Text to Video: Genera una clip solo da un prompt quando non hai un'immagine iniziale.
  • Wan 3.0 Riferimento al video: Combina immagini, video e riferimenti audio per coerenza tra personaggi e oggetti.
  • Seedance 2.5 Text to Video: Produci bozze di rendering veloci ed economiche dal testo.
  • Kling 3.0: Anima un'immagine iniziale con un fotogramma finale opzionale e audio sincronizzato.

Risorse ufficiali#


  • Wan 3.0 riferimento API generazione video (Alibaba Cloud Model Studio)
  • Panoramica della famiglia di modelli Wan

Modelli correlati

one-to-all-animation/1.3b

Anima l'immagine di un personaggio di riferimento con il movimento di un video di movimento utilizzando prompt positivo e negativo oltre a impostazioni di generazione regolabili.

pika-2-2/image-to-video

Crea video dinamici da immagini con effetti AI intuitivi.

wan-2-2/animate/video-to-video

Crea un video animato da un’immagine di riferimento e un video sorgente, scegliendo dimensioni di output e seed.

seed-audio-1.0/text-to-audio

Genera voce e audio naturali da testo, audio di riferimento o un'immagine.

pikadditions

Aggiungi con Pikadditions una persona o un oggetto di un’immagine a un video esistente.

kling-2-6/pro/image-to-video

Trasforma un'immagine di riferimento in un video di 5 o 10 secondi, con prompt negativo opzionale e generazione di audio nativo.

Domande Frequenti

A cosa serve Wan 3.0 nei flussi di lavoro da immagine a video?

Wan 3.0 image-to-video acquisisce una singola immagine del primo fotogramma e la anima in una clip breve e coerente in base al messaggio di testo. È ideale per trasformare in movimento scatti di prodotti, ritratti, foto di lifestyle o concept art senza rigging o keyframe manuali.

Come funziona l'opzione primo e ultimo fotogramma in Wan 3.0?

Fornisci sempre un'immagine del primo fotogramma e, facoltativamente, puoi aggiungere un'immagine dell'ultimo fotogramma quando la posa o la composizione finale sono importanti. Wan 3.0 genera quindi un movimento continuo che inizia dal primo fotogramma e si risolve verso l'ultimo, offrendoti un controllo più preciso su come inizia e finisce la ripresa.

Quanto bene Wan 3.0 preserva il soggetto dall'immagine di input?

Poiché il primo fotogramma viene utilizzato direttamente come apertura del video, Wan 3.0 tende a mantenere l'aspetto del soggetto e l'inquadratura coerenti per tutta la clip. L'utilizzo di un'immagine in ingresso nitida, ben illuminata e ordinata garantisce la migliore conservazione del soggetto.

Quali risoluzioni, durate e proporzioni supporta la conversione da immagine a video Wan 3.0?

Wan 3.0 supporta l'output 480p, 720p e 1080p, con 720p come impostazione predefinita comune. La durata è regolabile da 2 a 30 secondi e le proporzioni possono essere widescreen, verticale, quadrato o classico oppure impostate su adaptive in modo che segua l'immagine in ingresso. Controllare il pannello dei parametri RunComfy per i limiti di corrente esatti.

Wan 3.0 può generare audio insieme al video?

SÌ. Wan 3.0 può produrre una traccia audio sincronizzata insieme alla clip e puoi disattivare l'audio quando hai bisogno solo di riprese mute. La commutazione dell'audio non modifica il costo di generazione.

Quali limiti di input dovrei conoscere prima di utilizzare Wan 3.0?

Le immagini di input devono essere formati comuni come JPEG, PNG o WEBP, con una risoluzione e proporzioni ragionevoli. I fotogrammi di qualità molto bassa o molto disordinati possono ridurre la qualità del movimento, quindi preferisci un primo fotogramma pulito e ad alta risoluzione. I limiti possono variare in base alle impostazioni del provider.

Gli sviluppatori possono utilizzare Wan 3.0 tramite l'API RunComfy?

SÌ. Puoi prototipare Wan 3.0 nell'interfaccia utente del modello RunComfy, quindi richiamare lo stesso modello tramite RunComfy HTTP API con parametri identici per la produzione o l'automazione. Ciò ti consente di passare da un test del browser a una pipeline integrata senza modificare il modello.

Quanto costa generare con Wan 3.0 su RunComfy?

Le generazioni consumano usd o crediti in base alla risoluzione e alla durata dell'output: 0,06 $ al secondo a 480p, 0,12 $ al secondo a 720p e 0,25 $ al secondo a 1080p. I nuovi utenti in genere ricevono un importo di prova gratuito per provare Wan 3.0 prima di impegnarsi in tirature più grandi.

Seguici
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Supporto
  • Discord
  • Email
  • Stato del Sistema
  • affiliato
Modelli Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Visualizza tutti i modelli →
Modelli Immagine
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Visualizza tutti i modelli →
Legale
  • Termini di Servizio
  • Informativa sulla Privacy
  • Informativa sui Cookie
RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.

Esempi di Wan 3.0

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...