logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

Wan 2.2 S2V: Generador de voz a vídeo | RunComfy

wan-ai/wan-2-2/speech-to-video

Combine una imagen y un archivo de audio para crear un video de un personaje hablando, cantando o actuando en 480P o 720P.

Imagen JPG, JPEG, PNG, BMP o WEBP requerida. El ancho y el alto deben ser superiores a 400 píxeles y no superar los 7000.
0:00
0:00
Audio WAV o MP3 requerido de menos de 20 segundos y menos de 15 MB.
Elija habla, canto o actuación; valor predeterminado: habla.
Elija salida 480P o 720P; predeterminado: 480P.
Idle
The rate is $0.10 per second for 480P, and $0.20 per second for 720P.

Descripción general de Wan 2.2 S2V

Wan 2.2 S2V convierte una imagen fija y una pista de audio obligatorias en un vídeo de personaje. Selecciona habla, canto o actuación según la grabación y elige una resolución de 480P o 720P. Los campos de imagen y audio tienen límites de formato, dimensiones, duración y tamaño de archivo.

Funciones de Wan 2.2 S2V

Entrada de imagen y audio

Crea un vídeo a partir de una imagen y un archivo de audio obligatorios, sin necesidad de un prompt de texto.

Movimiento de personajes impulsado por audio

Utilice la grabación para reproducir el vídeo de un personaje, con un modo seleccionado para hablar, cantar o una interpretación más amplia.

Tres modos de animación

Elija habla para diálogos, canto para voces o actuación para una interpretación más amplia; habla es el valor predeterminado.

Dos resoluciones de salida

Genere a 480P de forma predeterminada o seleccione 720P cuando se necesite una resolución de salida más alta.

Wan 2.2 S2V noticias y ejemplos sobre X

Modelos relacionados

hailuo-02/pro/text-to-video

Cree un vídeo de seis segundos a partir de un prompt de texto requerido con Hailuo 02 Pro y una expansión del prompt opcional.

kling-video-o1/standard/video-edit

Edite un video existente con una instrucción de texto y hasta diez imágenes de referencia opcionales, con un control para preservar el audio original.

seedvr2/upscale/video

Restaure y mejore un video requerido. Controle el ancho de salida, el límite de cuadros, la velocidad de fotogramas, la semilla, la guía de restauración y el tamaño del lote.

hailuo-2-3/standard/text-to-video

Convierte tus ideas en videos realistas con movimiento fluido y detalle vivo.

runway-gen-3-alpha/turbo/image-to-video

Animaciones realistas con control total de estilo, forma y ritmo.

one-to-all-animation/1.3b

Anime la imagen de un personaje de referencia con movimiento de un video de conducción usando indicaciones positivas y negativas, además de configuraciones de generación ajustables.

Preguntas Frecuentes

¿Qué entradas requiere Wan 2.2 S2V?

Requiere una imagen y un archivo de audio. Esta interfaz no incluye ningún campo para un prompt de texto.

¿Qué formatos de imagen son compatibles?

Utilice JPG, JPEG, PNG, BMP o WEBP. El ancho y el alto de la imagen deben superar los 400 píxeles y no exceder los 7000.

¿Cuáles son los requisitos de audio?

Utilice audio WAV o MP3 de menos de 20 segundos. El archivo también debe tener un tamaño inferior a 15 MB.

¿Qué modos de animación están disponibles?

Elija habla, canto o actuación. El habla es el valor predeterminado.

¿Qué resoluciones puedo generar?

Elija 480P o 720P. El valor predeterminado es 480P.

¿Cuánto cuesta la generación?

Un vídeo de 5 segundos requiere 68 créditos.

¿Cuándo debo elegir hablar, cantar o actuar?

Elija habla para los diálogos, canto para las voces y actuación para una animación más amplia del personaje, no limitada a hablar o cantar.

¿Por qué se podría rechazar una carga?

Verifique el tipo de archivo admitido y los límites. Las imágenes deben cumplir ambas reglas de dimensión, mientras que el audio debe cumplir las reglas de formato, duración y tamaño de archivo.

¿Wan 2.2 S2V admite la generación por lotes?

Sí. Los tamaños de lote admitidos son 1, 2, 3 y 4 tareas.

¿El modo de interpretación cambia los requisitos de imagen y audio?

No. Los modos speech, sing y perform utilizan los mismos límites de formato, dimensiones, duración y tamaño de archivo.

Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Ver todos los modelos →
Modelos de Imagen
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...