Convierte imágenes fijas en vídeos cinematográficos 4K nativos con una imagen inicial obligatoria, una imagen final opcional y sonido sincronizado.
prompt puede incluir sujeto, acción, entorno, iluminación, cámara y, si corresponde, sonido.duration solo admite 5 o 10 segundos; el valor predeterminado es 5.aspect_ratio ofrece 16:9, 9:16 y 1:1, con 16:9 como opción predeterminada.negative_prompt para señalar elementos o defectos que no quieres ver.generate_audio está activado de forma predeterminada. Admite voz en chino e inglés; otros idiomas se traducen al inglés.prompt los sonidos o el diálogo que importan.9:16 para vertical, 16:9 para horizontal o 1:1 para cuadrado.negative_prompt para problemas específicos, como desenfoque o deformaciones.Este modelo de texto a vídeo no incluye una entrada de imagen. Para animar una imagen existente, utiliza Kling 2.6 Pro Image-to-Video.
Convierte imágenes fijas en vídeos cinematográficos 4K nativos con una imagen inicial obligatoria, una imagen final opcional y sonido sincronizado.
Sustituye una zona seleccionada de un vídeo mediante una máscara o una descripción, con imagen y prompt opcionales.
Genera canciones de hasta 4 minutos con voces y letras a partir de etiquetas de estilo.
Convierte imágenes estáticas en clips fluidos con control de audio.
Separa personas u objetos del fondo del vídeo y configura códec, refinado de bordes y tipo de sujeto.
Convierte tus imágenes en videos con calidad cinematográfica y control creativo total
Es un modelo que crea un clip corto directamente desde una descripción escrita de la escena. Esta variante no necesita una imagen inicial.
Solo prompt es obligatorio. Úsalo para describir el sujeto, la acción, el entorno y la puesta en escena.
duration solo acepta 5 o 10 segundos. aspect_ratio ofrece 16:9, 9:16 y 1:1.
generate_audio activa o desactiva la generación de audio nativo y viene activado. Admite voz en chino e inglés; los demás idiomas se traducen al inglés.
Con negative_prompt indicas elementos o cualidades que quieres evitar, como desenfoque o deformaciones.
No. El esquema de entrada de esta variante de texto a vídeo no incluye un campo de imagen. Para partir de una imagen, utiliza el modelo de imagen a vídeo.
Describe con precisión la acción visible, el entorno, la iluminación y la cámara. Si activas el audio, añade también los sonidos o el contenido hablado.
Los valores iniciales son duration = 5, aspect_ratio = 16:9 y generate_audio = true. El prompt negativo empieza con «blur, distort, and low quality».
Sí. Puedes ejecutar el modelo en RunComfy o integrarlo en un flujo mediante la API HTTP.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.





