Convierte imágenes en videos naturales con transiciones precisas
Este es el modelo de texto a vídeo de la familia O3 de Kuaishou, optimizado para movimiento cinematográfico, sujetos estables y física plausible a partir de un único prompt. El nivel Estándar ofrece un precio competitivo sin renunciar al aspecto O3, y incluye generación de sonido opcional para que los clips puedan salir del modelo con el sonido ya mezclado.
Se adapta a los equipos que necesitan tomas breves ajustadas al briefing, sin un equipo de cámara, una sala de edición ni una búsqueda de material con licencia.
| Parámetro | Requerido | Tipo | Por defecto | Rango / Opciones | Descripción |
|---|---|---|---|---|---|
| prompt* | Sí (*) | string | — | Texto libre | Descripción de la escena que cubre sujeto, movimiento, cámara y atmósfera. |
| aspect_ratio | No | string | 16:9 | 16:9, 9:16, 1:1 | Relación de aspecto de salida. |
| duration | No | integer | 5 | 3 – 15 | Duración del clip en segundos. |
| sound | No | boolean | false | true / false | Genera sonido sincronizado con el vídeo. |
| shot_type | No | string | customize | customize, intelligent | Modo de edición; intelligent decide automáticamente el alcance, customize sigue el prompt. |
| multi_prompt | No | array | — | 0 – 20 elementos | Segmentos de prompts adicionales para guiar las transiciones de escenas; las duraciones de los segmentos deben sumar la duración total del vídeo. |
El nivel Estándar factura por segundo de vídeo generado en RunComfy. Habilitar el sonido añade un recargo aproximado del 33% sobre la tarifa sin sonido.
| Producción | Tarifa por segundo |
|---|---|
| Vídeo sin sonido | $0.084 |
| Vídeo con sonido | $0.112 |
Ejemplos de costes estimados
| Duración | sin sonido | Con sonido |
|---|---|---|
| 3 s | ~$0.252 | ~$0.336 |
| 5 s (predeterminado) | ~$0.420 | ~$0.560 |
| 10 s | ~$0.840 | ~$1.120 |
| 15 s | ~$1.260 | ~$1.680 |
1) Abra el modelo Kling Video O3 en RunComfy y abra el panel de generación.
2) Escriba un prompt que nombre el sujeto, la acción, el entorno, el movimiento de la cámara y la iluminación en lenguaje de toma.
3) Elija una relación de aspecto que coincida con el formato de destino: 16:9 para YouTube, 9:16 para Reels y Shorts, 1:1 para feeds.
4) Establezca la duración entre 3 y 15 segundos; comience en 3–5 s mientras itera con el prompt, luego extienda para el renderizado final.
5) Active el sonido sólo cuando realmente necesite audio sincronizado, ya que aumenta el coste por segundo.
6) Elija shot_type — customize para un control preciso mediante el prompt, intelligent cuando desee que el modelo gestione el ritmo.
7) Ejecute la generación, obtenga una vista previa del resultado y descargue el clip de su historial de trabajo.
8) Para la automatización, envíe los mismos campos al endpoint de la API de RunComfy e integre la URL de salida en su flujo de trabajo.
Convierte imágenes en videos naturales con transiciones precisas
Transforma imágenes en videos realistas con máscaras y referencias.
Convierte imágenes en videos realistas con efectos cinematográficos.
Generación de vídeo de nivel Pro guiada por referencias: clips de 3 a 15 segundos desde 0,112 $ por segundo.
Crea videos de alta calidad con audio sincronizado a partir de texto usando Sora 2 Pro.
Convierte imágenes en videos realistas con movimiento 3D y física precisa.
Kling Video O3 es el modelo de texto a vídeo de la familia O3 de Kuaishou que convierte un único prompt en un clip cinematográfico con sujetos estables, movimiento natural y física plausible. En un flujo de trabajo de texto a vídeo en RunComfy, usted describe la escena, la cámara y la atmósfera, y el modelo devuelve un vídeo terminado, opcionalmente con sonido sincronizado. Está diseñado para creadores que desean una generación rápida y ágil sin edición manual ni equipo de cámara.
Kling Video O3 es más adecuado para tomas cinematográficas cortas: reels sociales, creatividades publicitarias, aguijones de marca, visualizaciones de productos y exploración de conceptos para diseño y guiones gráficos. Las duraciones flexibles de 3–15 segundos y las relaciones de aspecto 16:9, 9:16 y 1:1 facilitan la entrega a TikTok, Reels, YouTube y formatos para el feed desde un solo modelo. El interruptor de sonido opcional también cubre los casos en los que necesita un clip que salga del modelo con el sonido ya mezclado.
En comparación con el nivel O3 Pro, Kling Video O3 Standard ofrece una tarifa por segundo más baja sin renunciar al aspecto O3, lo cual es útil cuando necesita iterar o generar a un mayor volumen. En comparación con versiones anteriores de Kling, como la línea V3.0, la familia O3 busca ofrecer un mayor realismo de movimiento y una coherencia de sujeto basada en la información disponible del proveedor. Los controles de prompts, relación de aspecto, duración, sonido y tipo de toma siguen siendo los mismos para que los prompts existentes se transfieran fácilmente.
Los equipos de marketing, editores de vídeo, creadores de redes sociales y diseñadores de producto pueden utilizar Kling Video O3 para producir clips promocionales breves, moodboards animados y vídeos sociales de formato corto sin contratar intérpretes ni buscar material de archivo. Los desarrolladores pueden incluir el mismo modelo en procesos automatizados que convierten metadatos de briefings en recursos de vídeo listos para publicar. Para los creadores de guiones gráficos y artistas conceptuales, el modelo también acelera la visualización de escenas que de otro modo necesitarían una previsualización.
Kling Video O3 acepta un prompt de texto obligatorio y admite relaciones de aspecto de 16:9, 9:16 y 1:1, con duraciones en segundos completos desde 3 hasta 15 segundos. El sonido se puede activar o desactivar y shot_type acepta customize o intelligent para editar. Para cualquier otra restricción, como longitud de prompts, recuentos de segmentos de varios prompts o simultaneidad de procesamiento, consulte el panel de parámetros RunComfy actual para conocer los límites exactos, ya que pueden variar según el modo o la configuración del proveedor.
Sí. Puede crear un prototipo de Kling Video O3 en la interfaz web de RunComfy AI Playground, introduciendo el prompt, la relación de aspecto, la duración, el sonido y el tipo de plano hasta que la salida coincida con su objetivo. Una vez que la configuración sea estable, llame al mismo modelo a través de la API de RunComfy con parámetros idénticos desde su backend, flujo de contenido o CMS para automatizar la generación. Esto mantiene la iteración creativa en el navegador mientras la producción se ejecuta en código, sin cambiar el comportamiento del modelo.
Las generaciones Kling Video O3 consumen créditos USD de su saldo RunComfy y, según la información disponible del proveedor, el nivel Estándar se factura a $0.084 por segundo sin sonido y a $0.112 por segundo con sonido, aproximadamente un recargo de 33% por habilitar el audio. Por lo tanto, un clip predeterminado de 5 segundos sin sonido cuesta unos $0.42, mientras que un clip de 15 segundos con sonido cuesta unos $1.68. Los nuevos usuarios normalmente obtienen créditos USD de prueba gratuitos para experimentar; consulte la sección Generación de la página del modelo para conocer las tarifas más actuales.
Kling Video O3 responde bien a prompts concisos y priorizados escritas en lenguaje de toma: empiece por el movimiento de la cámara y el tipo de toma, luego nombre el sujeto, la acción, el entorno, la iluminación y la hora del día. Señales específicas como "slow push-in", "golden hour rim light" o "handheld with slight sway" anclan el movimiento y tienen más efecto que una larga cadena de adjetivos. Para los clips de 10–15 segundos, describa un arco de movimiento claro en lugar de varias acciones no relacionadas para mantener el resultado coherente.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.





