Genera canciones con voces de hasta 4 minutos a partir de etiquetas de estilo y letras.
prompt puede incluir sujeto, acción, entorno, iluminación, cámara y, si corresponde, sonido.duration solo admite 5 o 10 segundos; el valor predeterminado es 5.aspect_ratio ofrece 16:9, 9:16 y 1:1, con 16:9 como opción predeterminada.negative_prompt para señalar elementos o defectos que no quieres ver.generate_audio está activado de forma predeterminada. Admite voz en chino e inglés; otros idiomas se traducen al inglés.prompt los sonidos o el diálogo que importan.9:16 para vertical, 16:9 para horizontal o 1:1 para cuadrado.negative_prompt para problemas específicos, como desenfoque o deformaciones.Este modelo de texto a vídeo no incluye una entrada de imagen. Para animar una imagen existente, utiliza Kling 2.6 Pro Image-to-Video.
Genera canciones con voces de hasta 4 minutos a partir de etiquetas de estilo y letras.
Genera vídeos cinematográficos con audio sincronizado a partir de un prompt de texto.
Generación cinematográfica 4K a partir de referencias, a 0,419 $ por segundo de salida.
Anima una imagen inicial mediante un prompt y controla LoRA, fotogramas, FPS, resolución, relación de aspecto, pasos y seed.
Anime una imagen requerida a partir de un prompt obligatorio. Controle el tamaño de salida, el recuento de fotogramas, la velocidad de fotogramas, la intensidad del movimiento de la cámara, el semilla, los pasos, la guía y el desplazamiento.
Crea clips sincronizados a partir de prompts con control preciso del audio y del estilo mediante LoRA.
Es un modelo que crea un clip corto directamente desde una descripción escrita de la escena. Esta variante no necesita una imagen inicial.
Solo prompt es obligatorio. Úsalo para describir el sujeto, la acción, el entorno y la puesta en escena.
duration solo acepta 5 o 10 segundos. aspect_ratio ofrece 16:9, 9:16 y 1:1.
generate_audio activa o desactiva la generación de audio nativo y viene activado. Admite voz en chino e inglés; los demás idiomas se traducen al inglés.
Con negative_prompt indicas elementos o cualidades que quieres evitar, como desenfoque o deformaciones.
No. El esquema de entrada de esta variante de texto a vídeo no incluye un campo de imagen. Para partir de una imagen, utiliza el modelo de imagen a vídeo.
Describe con precisión la acción visible, el entorno, la iluminación y la cámara. Si activas el audio, añade también los sonidos o el contenido hablado.
Los valores iniciales son duration = 5, aspect_ratio = 16:9 y generate_audio = true. El prompt negativo empieza con «blur, distort, and low quality».
Sí. Puedes ejecutar el modelo en RunComfy o integrarlo en un flujo mediante la API HTTP.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.





