Convierte texto o imágenes en videos cinematográficos precisos
Seed Audio 1.0 es un modelo text-to-audio de Bytedance que convierte prompts escritos en voz y audio hablado claros y naturales. Puedes guiar el resultado de tres formas: con un prompt de texto, con hasta tres clips de referencia cortos o con una sola imagen de referencia que oriente la interpretación.
Formato de salida: solo audio / formatos wav, mp3, pcm u ogg_opus / frecuencia de muestreo de 8 kHz a 48 kHz
Seed Audio 1.0 ofrece síntesis de audio rápida y flexible con control sobre la interpretación.
| Parámetro | Obligatorio | Tipo | Predeterminado | Rango / opciones | Descripción |
|---|---|---|---|---|---|
| prompt* | Sí (*) | string | — | Texto libre | Texto que se sintetizará; cita las referencias por orden con @Audio1, @Audio2 y @Audio3. |
| voice | No | string | vivi_mixed_en_zh_ja_es_id | Lista de voces predefinidas | Voz predefinida utilizada para la síntesis. |
| audio_urls | No | array | — | Hasta 3 URL | Clips de referencia (wav/mp3/pcm/ogg_opus), de hasta 30 s y 10MB cada uno. |
| image_url | No | string | — | jpeg/png/webp, hasta 10MB | Una imagen de referencia; no se puede combinar con referencias de audio. |
| output_format | No | string | mp3 | wav, mp3, pcm, ogg_opus | Contenedor del audio de salida. |
| sample_rate | No | integer | 24000 | 8000 - 48000 | Frecuencia de muestreo de salida, en Hz. |
| speed | No | number | 1 | 0.5 - 2.0 | Velocidad de lectura; 1.0 corresponde al ritmo normal. |
| volume | No | number | 1 | 0.5 - 2.0 | Volumen de salida; 1.0 corresponde al nivel normal. |
| pitch | No | integer | 0 | -12 - 12 | Cambio de tono, en semitonos. |
Seed Audio 1.0 se factura en RunComfy según la duración del audio generado.
| Unidad de facturación | Tarifa |
|---|---|
| Por minuto de audio generado | $0.21 |
Ejemplos de coste estimado
| Duración | Coste aproximado |
|---|---|
| 15 s | ~$0.053 |
| 30 s | ~$0.105 |
| 60 s | ~$0.21 |
| 120 s | ~$0.42 |
Sigue estos pasos para obtener una lectura clara con Seed Audio 1.0.
Convierte texto o imágenes en videos cinematográficos precisos
Animación de imágenes con calidad Pro: clips cinematográficos de 3 a 15 segundos desde 0,123 $ por segundo.
Generación cinematográfica 4K a partir de referencias, a 0,47 $ por segundo de salida.
LTX 2.5 Pro texto a vídeo con AV sincronizado en modo calidad
Seedance 2.5 Reference to Video 1080p: clips cinematográficos 1080p con múltiples referencias
Convierte imágenes estáticas en videos reales con velocidad y detalle profesional.
Seed Audio 1.0 es un modelo text-to-audio de Bytedance que convierte prompts escritos en voz y audio hablado claros y naturales. En RunComfy, escribe el texto que quieres escuchar y, si lo necesitas, guía la interpretación con una voz predefinida, clips de referencia o una sola imagen. Está pensado para crear audio mediante prompts sin organizar sesiones de grabación.
Seed Audio 1.0 funciona bien para locuciones, narraciones, diálogos de personajes, fragmentos de ficción sonora y lecturas multilingües. Las voces predefinidas y los controles de interpretación permiten ajustar el ritmo, el volumen y el tono a una escena o una marca. También admite audio de referencia cuando necesitas mantener una interpretación coherente en varios clips.
Puedes añadir hasta tres clips de referencia y citarlos por orden en el prompt mediante @Audio1, @Audio2 y @Audio3. Así puedes combinar fuentes o trasladar una interpretación concreta a la lectura. Como alternativa, puedes aportar una sola imagen para orientar el tono, pero no es posible combinar referencias de imagen y audio en una misma solicitud. Para obtener resultados fiables, cada clip debe durar aproximadamente 30 segundos como máximo y ocupar hasta 10MB.
Creadores de contenido, equipos de producto y estudios de localización pueden usar Seed Audio 1.0 para locuciones explicativas, mensajes de aplicaciones, anuncios y doblaje en varios idiomas. Los desarrolladores también pueden integrarlo en flujos que generen voz bajo demanda a partir de guiones o textos de campaña. La combinación de voces predefinidas y referencias sirve tanto para borradores rápidos como para personajes más específicos.
Seed Audio 1.0 requiere un prompt y admite de forma opcional una voz, audio de referencia o una imagen, además de controles de velocidad, volumen y tono. Puede devolver wav, mp3, pcm u ogg_opus, con frecuencias de muestreo de 8 kHz a 48 kHz. Los límites exactos de tamaño y formato pueden variar según el proveedor, así que consulta el panel de parámetros de RunComfy antes de diseñar tu integración.
Sí. Puedes probar Seed Audio 1.0 en la interfaz web de RunComfy AI Playground y ajustar el prompt, la voz, las referencias y los controles hasta obtener el resultado deseado. Después, llama al mismo modelo mediante la API con idénticos parámetros para automatizar la generación desde tu backend o flujo de contenidos. El comportamiento del modelo se mantiene entre las pruebas en el navegador y las ejecuciones en producción.
Las generaciones de Seed Audio 1.0 se descuentan de tu saldo en usd o credits de RunComfy y, según la información disponible del proveedor, cuestan $0.21 por minuto de audio generado. Los usuarios nuevos suelen recibir un saldo de prueba gratuito; después, el uso sigue las reglas de la sección Generation de la página. Consulta esa sección para conocer la tarifa vigente y cualquier diferencia específica entre modos.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.