logo
RunComfy
  • ComfyUI
  • TrainerNuovo
  • Modelli
  • API
  • Prezzi
discord logo
MODELLI
Esplora
Tutti i modelli
LIBRERIA
Generazioni
API DEI MODELLI
Documentazione API
Chiavi API
ACCOUNT
Utilizzo

Wan 2.2 S2V: generatore da voce a video | RunComfy

wan-ai/wan-2-2/speech-to-video

Combina un'immagine e un file audio per creare il video di un personaggio che parla, canta o si esibisce in 480P o 720P.

Immagine JPG, JPEG, PNG, BMP o WEBP richiesta. La larghezza e l'altezza devono superare 400 pixel e non possono superare 7000 pixel.
0:00
0:00
È richiesto audio WAV o MP3 di durata inferiore a 20 secondi e inferiore a 15 MB.
Scegli tra parlato, canto o performance; valore predefinito: parlato.
Scegli l'uscita 480P o 720P; predefinito: 480P.
Idle
The rate is $0.10 per second for 480P, and $0.20 per second for 720P.

Panoramica di Wan 2.2 S2V

Wan 2.2 S2V trasforma un’immagine fissa e una traccia audio obbligatorie nel video di un personaggio. Seleziona parlato, canto o performance in base alla registrazione, quindi scegli la risoluzione 480P o 720P. I campi immagine e audio prevedono limiti di formato, dimensioni, durata e peso del file.

Funzionalità Wan 2.2 S2V

Ingresso immagine e audio

Crea un video da un'immagine richiesta e un file audio richiesto, senza un messaggio di testo.

Movimento dei personaggi guidato dall'audio

Utilizza la registrazione per guidare il video di un personaggio, con una modalità selezionata per il parlato, il canto o un'esibizione più ampia.

Tre modalità di animazione

Scegli parlato per i dialoghi, canto per la voce o performance per un'animazione più ampia del personaggio; parlato è l'impostazione predefinita.

Due risoluzioni di uscita

Genera a 480P per impostazione predefinita o seleziona 720P quando è necessaria una risoluzione di output più elevata.

Wan 2.2 S2V notizie ed esempi su X

Modelli correlati

bytedance/upscale/video

Ingrandisci un video sorgente alla risoluzione e alla frequenza dei fotogrammi selezionate.

veo-3/image-to-video

Movimenti realistici, regia dinamica e controllo dello stile.

kling-3.0/4k/text-to-video

Genera video cinematografici text-to-video nativi in 4K con dialoghi sincronizzati e personaggi coerenti.

veo-3-1/fast/extend-video

Estendi un video esistente di 7 secondi a 720p, con guida tramite prompt e generazione audio opzionale.

kling-video-o1/video-to-video/edit

Modifica un video di riferimento con un prompt e riferimenti facoltativi a elementi o immagini, scegliendo se mantenere l’audio originale.

ltx-2-19b/text-to-video/lora

Crea clip sincronizzate da prompt con controllo preciso dell’audio e dello stile tramite LoRA.

Domande Frequenti

Quali input richiede Wan 2.2 S2V?

Richiede un'immagine e un file audio. In questa interfaccia non viene visualizzato alcun messaggio di testo.

Quali formati di immagine sono supportati?

Utilizza JPG, JPEG, PNG, BMP o WEBP. La larghezza e l'altezza dell'immagine devono superare 400 pixel e non possono superare 7000 pixel.

Quali sono i requisiti audio?

Utilizza audio WAV o MP3 di durata inferiore a 20 secondi. Il file deve inoltre essere inferiore a 15 MB.

Quali modalità di animazione sono disponibili?

Scegli parlato, canto o performance. Il parlato è l’impostazione predefinita.

Quali risoluzioni posso generare?

Scegli 480P o 720P. L'impostazione predefinita è 480P.

Quanto costa la generazione?

Un video di 5 secondi richiede 68 crediti.

Quando dovrei scegliere di parlare, cantare o esibirmi?

Scegli parlato per i dialoghi, canto per le parti vocali e performance per un’animazione più ampia del personaggio, non limitata al parlare o al cantare.

Perché un caricamento potrebbe essere rifiutato?

Controlla il tipo di file e i limiti supportati. Le immagini devono soddisfare entrambe le regole relative alle dimensioni, mentre l'audio deve soddisfare le regole del formato, della durata e delle dimensioni del file.

Wan 2.2 S2V supporta la generazione in batch?

Sì. Le dimensioni batch supportate sono 1, 2, 3 e 4 attività.

La modalità di esecuzione cambia i requisiti di immagine e audio?

No. Le modalità speech, sing e perform applicano gli stessi limiti di formato, dimensioni, durata e dimensione del file.

Seguici
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Supporto
  • Discord
  • Email
  • Stato del Sistema
  • affiliato
Modelli Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Visualizza tutti i modelli →
Modelli Immagine
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Visualizza tutti i modelli →
Legale
  • Termini di Servizio
  • Informativa sulla Privacy
  • Informativa sui Cookie
RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...