FLUX 3 Draft I2V: Vista previa rápida de borradores de fotografías a vídeo a 720p
Seed Audio 1.0 es un modelo text-to-audio de Bytedance que convierte prompts escritos en voz y audio hablado claros y naturales. Puedes guiar el resultado de tres formas: con un prompt de texto, con hasta tres clips de referencia cortos o con una sola imagen de referencia que oriente la interpretación.
Formato de salida: solo audio / formatos wav, mp3, pcm u ogg_opus / frecuencia de muestreo de 8 kHz a 48 kHz
Seed Audio 1.0 ofrece síntesis de audio rápida y flexible con control sobre la interpretación.
| Parámetro | Obligatorio | Tipo | Predeterminado | Rango / opciones | Descripción |
|---|---|---|---|---|---|
| prompt* | Sí (*) | string | — | Texto libre | Texto que se sintetizará; cita las referencias por orden con @Audio1, @Audio2 y @Audio3. |
| voice | No | string | vivi_mixed_en_zh_ja_es_id | Lista de voces predefinidas | Voz predefinida utilizada para la síntesis. |
| audio_urls | No | array | — | Hasta 3 URL | Clips de referencia (wav/mp3/pcm/ogg_opus), de hasta 30 s y 10MB cada uno. |
| image_url | No | string | — | jpeg/png/webp, hasta 10MB | Una imagen de referencia; no se puede combinar con referencias de audio. |
| output_format | No | string | mp3 | wav, mp3, pcm, ogg_opus | Contenedor del audio de salida. |
| sample_rate | No | integer | 24000 | 8000 - 48000 | Frecuencia de muestreo de salida, en Hz. |
| speed | No | number | 1 | 0.5 - 2.0 | Velocidad de lectura; 1.0 corresponde al ritmo normal. |
| volume | No | number | 1 | 0.5 - 2.0 | Volumen de salida; 1.0 corresponde al nivel normal. |
| pitch | No | integer | 0 | -12 - 12 | Cambio de tono, en semitonos. |
Seed Audio 1.0 se factura en RunComfy según la duración del audio generado.
| Unidad de facturación | Tarifa |
|---|---|
| Por minuto de audio generado | $0.075 |
Ejemplos de coste estimado
| Duración | Coste aproximado |
|---|---|
| 15 s | ~$0.019 |
| 30 s | ~$0.038 |
| 60 s | ~$0.075 |
| 120 s | ~$0.150 |
Sigue estos pasos para obtener una lectura clara con Seed Audio 1.0.
FLUX 3 Draft I2V: Vista previa rápida de borradores de fotografías a vídeo a 720p
Convierte tus imágenes en videos HD con movimientos realistas y rápidos
Convierte imágenes en videos animados con calidad profesional.
Genere un video con audio sincronizado a partir de un prompt de texto obligatorio. Elija `1280x720` o `720x1280` y una duración de `4`, `8` o `12` segundos.
Anime una imagen requerida del primer fotograma a partir de un prompt de texto, guiando opcionalmente el final con una imagen del último fotograma.
Anima una imagen inicial con Hailuo 02 Pro mediante un prompt para crear un vídeo de seis segundos.
Seed Audio 1.0 es un modelo text-to-audio de Bytedance que convierte prompts escritos en voz y audio hablado claros y naturales. En RunComfy, escribe el texto que quieres escuchar y, si lo necesitas, guía la interpretación con una voz predefinida, clips de referencia o una sola imagen. Está pensado para crear audio mediante prompts sin organizar sesiones de grabación.
Seed Audio 1.0 funciona bien para locuciones, narraciones, diálogos de personajes, fragmentos de ficción sonora y lecturas multilingües. Las voces predefinidas y los controles de interpretación permiten ajustar el ritmo, el volumen y el tono a una escena o una marca. También admite audio de referencia cuando necesitas mantener una interpretación coherente en varios clips.
Puedes añadir hasta tres clips de referencia y citarlos por orden en el prompt mediante @Audio1, @Audio2 y @Audio3. Así puedes combinar fuentes o trasladar una interpretación concreta a la lectura. Como alternativa, puedes aportar una sola imagen para orientar el tono, pero no es posible combinar referencias de imagen y audio en una misma solicitud. Para obtener resultados fiables, cada clip debe durar aproximadamente 30 segundos como máximo y ocupar hasta 10MB.
Creadores de contenido, equipos de producto y estudios de localización pueden usar Seed Audio 1.0 para locuciones explicativas, mensajes de aplicaciones, anuncios y doblaje en varios idiomas. Los desarrolladores también pueden integrarlo en flujos que generen voz bajo demanda a partir de guiones o textos de campaña. La combinación de voces predefinidas y referencias sirve tanto para borradores rápidos como para personajes más específicos.
Seed Audio 1.0 requiere un prompt y admite de forma opcional una voz, audio de referencia o una imagen, además de controles de velocidad, volumen y tono. Puede devolver wav, mp3, pcm u ogg_opus, con frecuencias de muestreo de 8 kHz a 48 kHz. Los límites exactos de tamaño y formato pueden variar según el proveedor, así que consulta el panel de parámetros de RunComfy antes de diseñar tu integración.
Sí. Puedes probar Seed Audio 1.0 en la interfaz web de RunComfy AI Playground y ajustar el prompt, la voz, las referencias y los controles hasta obtener el resultado deseado. Después, llama al mismo modelo mediante la API con idénticos parámetros para automatizar la generación desde tu backend o flujo de contenidos. El comportamiento del modelo se mantiene entre las pruebas en el navegador y las ejecuciones en producción.
Las generaciones de Seed Audio 1.0 se descuentan de tu saldo en usd o credits de RunComfy y, según la información disponible del proveedor, cuestan $0.075 por minuto de audio generado. Los usuarios nuevos suelen recibir un saldo de prueba gratuito; después, el uso sigue las reglas de la sección Generation de la página. Consulta esa sección para conocer la tarifa vigente y cualquier diferencia específica entre modos.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.