logo
RunComfy
  • ComfyUI
  • TrainerNuovo
  • Modelli
  • API
  • Prezzi
discord logo
MODELLI
Esplora
Tutti i modelli
LIBRERIA
Generazioni
API DEI MODELLI
Documentazione API
Chiavi API
ACCOUNT
Utilizzo

Wan 2.2 S2V: generatore da voce a video | RunComfy

wan-ai/wan-2-2/speech-to-video

Combina un'immagine e un file audio per creare il video di un personaggio che parla, canta o si esibisce in 480P o 720P.

Immagine JPG, JPEG, PNG, BMP o WEBP richiesta. La larghezza e l'altezza devono superare 400 pixel e non possono superare 7000 pixel.
0:00
0:00
È richiesto audio WAV o MP3 di durata inferiore a 20 secondi e inferiore a 15 MB.
Scegli tra parlato, canto o performance; valore predefinito: parlato.
Scegli l'uscita 480P o 720P; predefinito: 480P.
Idle
The rate is $0.10 per second for 480P, and $0.20 per second for 720P.

Panoramica di Wan 2.2 S2V

Wan 2.2 S2V trasforma un’immagine fissa e una traccia audio obbligatorie nel video di un personaggio. Seleziona parlato, canto o performance in base alla registrazione, quindi scegli la risoluzione 480P o 720P. I campi immagine e audio prevedono limiti di formato, dimensioni, durata e peso del file.

Funzionalità Wan 2.2 S2V

Ingresso immagine e audio

Crea un video da un'immagine richiesta e un file audio richiesto, senza un messaggio di testo.

Movimento dei personaggi guidato dall'audio

Utilizza la registrazione per guidare il video di un personaggio, con una modalità selezionata per il parlato, il canto o un'esibizione più ampia.

Tre modalità di animazione

Scegli parlato per i dialoghi, canto per la voce o performance per un'animazione più ampia del personaggio; parlato è l'impostazione predefinita.

Due risoluzioni di uscita

Genera a 480P per impostazione predefinita o seleziona 720P quando è necessaria una risoluzione di output più elevata.

Wan 2.2 S2V notizie ed esempi su X

Modelli correlati

flux-3/keyframes-to-video/draft

FLUX 3 Draft Keyframe: anteprime video veloci con più fotogrammi chiave a 720p

gemini-omni-flash/image-to-video

Anima un’immagine statica e trasformala in un breve video con audio sincronizzato.

seedance-2.5/text-to-video/720p

Seedance 2.5: video AI cinematografico con maggiore coerenza e clip più lunghi

seedance-v1.5-pro/image-to-video

Trasforma immagini statiche in clip video cinematografiche con transizioni fluide, realistiche e flessibilità creativa – powered by Seedance 1.5 Pro.

hailuo-2-3/fast/standard/image-to-video

Trasforma immagini statiche in video realistici e dinamici in pochi istanti.

veo-3-1/fast/first-last-frame-to-video

Crea video dinamici e cinematografici in pochi secondi da una singola immagine con Veo 3.1 Fast.

Domande Frequenti

Quali input richiede Wan 2.2 S2V?

Richiede un'immagine e un file audio. In questa interfaccia non viene visualizzato alcun messaggio di testo.

Quali formati di immagine sono supportati?

Utilizza JPG, JPEG, PNG, BMP o WEBP. La larghezza e l'altezza dell'immagine devono superare 400 pixel e non possono superare 7000 pixel.

Quali sono i requisiti audio?

Utilizza audio WAV o MP3 di durata inferiore a 20 secondi. Il file deve inoltre essere inferiore a 15 MB.

Quali modalità di animazione sono disponibili?

Scegli parlato, canto o performance. Il parlato è l’impostazione predefinita.

Quali risoluzioni posso generare?

Scegli 480P o 720P. L'impostazione predefinita è 480P.

Quanto costa la generazione?

Un video di 5 secondi richiede 68 crediti.

Quando dovrei scegliere di parlare, cantare o esibirmi?

Scegli parlato per i dialoghi, canto per le parti vocali e performance per un’animazione più ampia del personaggio, non limitata al parlare o al cantare.

Perché un caricamento potrebbe essere rifiutato?

Controlla il tipo di file e i limiti supportati. Le immagini devono soddisfare entrambe le regole relative alle dimensioni, mentre l'audio deve soddisfare le regole del formato, della durata e delle dimensioni del file.

Wan 2.2 S2V supporta la generazione in batch?

Sì. Le dimensioni batch supportate sono 1, 2, 3 e 4 attività.

La modalità di esecuzione cambia i requisiti di immagine e audio?

No. Le modalità speech, sing e perform applicano gli stessi limiti di formato, dimensioni, durata e dimensione del file.

Seguici
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Supporto
  • Discord
  • Email
  • Stato del Sistema
  • affiliato
Modelli Video
  • PixVerse V6
  • PixVerse V6 Text To Video
  • PixVerse C1
  • Wan 2.6 Flash
  • Wan 2.5
  • Wan 3.0
  • Visualizza tutti i modelli →
Modelli Immagine
  • Qwen Image 2.1
  • Qwen Image 2.1 T2I
  • Wan 2.6 Image to Image
  • Seedream 5.0 Pro
  • Nano Banana Pro
  • Flux 2 Pro
  • Visualizza tutti i modelli →
Legale
  • Termini di Servizio
  • Informativa sulla Privacy
  • Informativa sui Cookie
RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...