Genera voz y audio naturales a partir de texto, audio de referencia o una imagen.
Wan 2.6 Reference-to-Video utiliza un prompt y un reference_video_url_1 obligatorios. Opcionalmente, puede agregar reference_video_url_2 y reference_video_url_3. En el prompt, identifique los clips en orden como character1, character2 y character3; incluso una sola referencia debe identificarse como character1.
> Nota del esquema: la lista required también contiene img_url, pero el objeto properties actual no define un campo img_url. Esta página no adivina su propósito, formato o dimensiones.
| Parámetro | Requerido | Predeterminado/opciones | Qué controla |
|---|---|---|---|
prompt | Sí | prompt de ejemplo | Instrucciones de generación, menos de 1.500 caracteres. Consulte los clips como character1, character2 y character3 en el orden de entrada. |
reference_video_url_1 | Sí | URL de vídeo de ejemplo | Primer clip de referencia. MP4 o MOV; 2 a 30 segundos; menos de 100 MB. Cuando se usa solo, la referencia utilizable más larga es de 5 segundos. |
reference_video_url_2 | No | — | Segundo clip de referencia. MP4 o MOV; 2 a 30 segundos; menos de 100 MB. Con el clip 1, la porción más larga utilizable es de 2,5 segundos por clip. |
reference_video_url_3 | No | — | Tercer clip de referencia. MP4 o MOV; 2 a 30 segundos; menos de 100 MB. Con los clips 1 y 2, la porción más larga utilizable es de 1,66 segundos por clip. |
duration | No | Predeterminado 5; 5 o 10 | Duración del vídeo generado en segundos. |
size | No | Predeterminado 1280*720 | Opciones exactas: 1280720, 7201280, 960960, 1088832, 8321088, 19201080, 10801920, 14401440, 16321248, 12481632. |
shot_type | No | Predeterminado multi; multi o single | Selecciona un resultado de varios planos o un solo plano. |
negative_prompt | No | — | Describe elementos o cualidades a evitar. |
seed | No | 0–2147483647 | Establece la semilla aleatoria cuando la repetibilidad es útil. |
audio | No | Predeterminado true | Activa o desactiva el audio generado. No acepta un archivo de audio separado ni un mensaje de audio. |
prompt enfocado y haz referencia a cada clip con la etiqueta characterX correspondiente.duration, un size exacto y el shot_type apropiado.negative_prompt con moderación, configure seed cuando necesite iteraciones comparables y elija si se debe generar audio.audio, pero no hay controles de idioma, voz, música o efectos de sonido.Genera voz y audio naturales a partir de texto, audio de referencia o una imagen.
Transforma imágenes estáticas en clips de video cinematográficos con transiciones fluidas, realistas y flexibilidad creativa – impulsado por Seedance 1.5 Pro.
Seedance 2.5 FLF2V 480p: Transiciones del primer borrador del último cuadro a menor costo
Dirige escenas con calidad profesional usando plantillas y comandos.
Genera vídeos cinematográficos nativos en 4K a partir de texto, con diálogo sincronizado y personajes coherentes.
Modelo de video con IA multimodal y audio nativo para generación desde texto, imágenes y referencias.
duration es 5 o 10 segundos. size tiene exactamente diez opciones: 1280*720, 720*1280, 960*960, 1088*832, 832*1088, 1920*1080, 1080*1920, 1440*1440, 1632*1248 y 1248*1632. Se requiere un reference_video_url_1; reference_video_url_2 y reference_video_url_3 son opcionales. Cada referencia debe ser MP4 o MOV, de 2 a 30 segundos y menos de 100 MB. El límite de referencia utilizable documentado es de 5 segundos para un clip, 2,5 segundos para dos y 1,66 segundos para tres.
La lista required contiene img_url, pero el objeto properties actual no define ese campo. Por lo tanto, esta página no puede confirmar su propósito, requisitos de archivo o dimensiones. Siga la interfaz RunComfy actual o la documentación de API si solicita información adicional.
Primero verifique el mensaje y la configuración en la interfaz del modelo RunComfy, luego envíe los mismos campos documentados a través de la integración API actual: prompt, los campos de URL del video de referencia, duration, size, shot_type, negative_prompt, seed y audio. Utilice la documentación API más reciente para autenticación, estado de solicitud, límites de tarifas y facturación.
Este esquema no proporciona datos de referencia sobre calidad, velocidad, fidelidad de movimiento o sincronización de labios en comparación con esos modelos. Lo que confirma es un flujo de trabajo basado en referencias con uno a tres clips, salida de 5 o 10 segundos, diez tamaños, control de estructura de toma y generación de audio opcional.
La página acepta un texto prompt, pero el esquema no enumera idiomas de mensajes ni idiomas de voz garantizados. El interruptor audio controla si se genera audio; no existe un campo de idioma, transcripción, voz, música o efectos de sonido separados.
Sí. audio es un conmutador booleano de generación de audio y su valor predeterminado es true. La página no expone una carga de audio independiente, un mensaje de audio, un selector de voz ni controles para tipos de audio individuales.
Es adecuado para vídeos cortos guiados por referencias en los que uno a tres clips originales deben influir en los sujetos o el movimiento. Las etiquetas characterX claras, las referencias compatibles y un mensaje enfocado son especialmente útiles para anuncios, clips sociales, tomas conceptuales y pruebas narrativas breves.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.















