logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

Seed Audio 1.0: text-to-audio con voces predefinidas y audio de referencia en RunComfy Models y mediante la API | RunComfy

bytedance/seed-audio-1.0/text-to-audio

Seed Audio 1.0 genera voz y audio hablado naturales a partir de texto, clips de referencia o una imagen. Permite ajustar la voz predefinida, la velocidad, el tono y el formato de salida desde el navegador o mediante la API.

Texto que se sintetizará. Cita los clips de referencia por orden con @Audio1, @Audio2 y @Audio3.
Voz predefinida que se usará para la síntesis.
Hasta 3 clips de referencia, citados en el prompt como @Audio1, @Audio2 y @Audio3. Cada clip puede durar hasta 30s y ocupar 10MB; formatos: wav/mp3/pcm/ogg_opus.
Una única imagen de referencia (jpeg/png/webp, hasta 10MB). No se puede combinar con referencias de audio.
Formato del contenedor del audio de salida.
Frecuencia de muestreo del audio de salida en Hz.
Velocidad de lectura. 1.0 es normal, 0.5 es la mitad y 2.0 el doble.
Volumen de salida. 1.0 es normal, 0.5 es la mitad, 2.0 es el doble.
Desplazamiento del tono de voz en semitonos. 0 es neutro, -12 baja una octava y 12 sube una octava.
Idle
The rate is $0.075 per minute.

Introducción a Seed Audio 1.0

Seed Audio 1.0 de Bytedance convierte prompts escritos en audio natural de alta calidad. Puedes guiar el resultado con texto, hasta tres clips de referencia o una sola imagen, por una tarifa de $0.075 por minuto. La síntesis mediante prompts reemplaza las sesiones de grabación y la coordinación de locutores, y permite a creadores, equipos de producto y estudios de localización producir contenido hablado en pocos minutos. El modelo está disponible en RunComfy desde el navegador y mediante una API HTTP, sin alojarlo ni escalarlo.
Ideal para: locución y narración | localización multilingüe | prototipos de audio interactivo

Bytedance / Seed Audio 1.0#


Seed Audio 1.0 es un modelo text-to-audio de Bytedance que convierte prompts escritos en voz y audio hablado claros y naturales. Puedes guiar el resultado de tres formas: con un prompt de texto, con hasta tres clips de referencia cortos o con una sola imagen de referencia que oriente la interpretación.


Formato de salida: solo audio / formatos wav, mp3, pcm u ogg_opus / frecuencia de muestreo de 8 kHz a 48 kHz


Aspectos destacados#


Seed Audio 1.0 ofrece síntesis de audio rápida y flexible con control sobre la interpretación.


  • Tres formas de guiar la síntesis: usa solo texto, una voz predefinida o tu propio audio de referencia; también puedes emplear una imagen como alternativa al audio.
  • Referencias de audio por orden: cita hasta tres clips en el prompt mediante @Audio1, @Audio2 y @Audio3 para combinar fuentes o trasladar una interpretación concreta a la lectura.
  • Voces predefinidas multilingües: elige entre voces que combinan inglés, chino, español, japonés, indonesio y portugués.
  • Controles de interpretación: ajusta la velocidad, el volumen y el tono para adaptar el ritmo y el carácter a tu proyecto.
  • Salida flexible: exporta en wav, mp3, pcm u ogg_opus, con frecuencias de muestreo de hasta 48 kHz para seguir editando el audio.

Parámetros#


ParámetroObligatorioTipoPredeterminadoRango / opcionesDescripción
prompt*Sí (*)string—Texto libreTexto que se sintetizará; cita las referencias por orden con @Audio1, @Audio2 y @Audio3.
voiceNostringvivi_mixed_en_zh_ja_es_idLista de voces predefinidasVoz predefinida utilizada para la síntesis.
audio_urlsNoarray—Hasta 3 URLClips de referencia (wav/mp3/pcm/ogg_opus), de hasta 30 s y 10MB cada uno.
image_urlNostring—jpeg/png/webp, hasta 10MBUna imagen de referencia; no se puede combinar con referencias de audio.
output_formatNostringmp3wav, mp3, pcm, ogg_opusContenedor del audio de salida.
sample_rateNointeger240008000 - 48000Frecuencia de muestreo de salida, en Hz.
speedNonumber10.5 - 2.0Velocidad de lectura; 1.0 corresponde al ritmo normal.
volumeNonumber10.5 - 2.0Volumen de salida; 1.0 corresponde al nivel normal.
pitchNointeger0-12 - 12Cambio de tono, en semitonos.

Precios#


Seed Audio 1.0 se factura en RunComfy según la duración del audio generado.


Unidad de facturaciónTarifa
Por minuto de audio generado$0.075

Ejemplos de coste estimado


DuraciónCoste aproximado
15 s~$0.019
30 s~$0.038
60 s~$0.075
120 s~$0.150

Cómo usarlo#


Sigue estos pasos para obtener una lectura clara con Seed Audio 1.0.


  1. Abre Seed Audio 1.0 en RunComfy y despliega el panel de generación.
  2. Escribe el texto que quieres convertir en voz. Usa una puntuación natural para marcar bien las frases y las pausas.
  3. Elige una voz predefinida o añade audio de referencia si buscas una interpretación concreta.
  4. Para usar referencias, añade hasta tres URL de clips y cítalos en el prompt como @Audio1, @Audio2 y @Audio3.
  5. Como alternativa, aporta una imagen de referencia en lugar de audio para orientar el tono de la lectura.
  6. Ajusta la velocidad, el volumen y el tono; después, elige el output_format y el sample_rate adecuados para tu flujo de trabajo.
  7. Ejecuta la generación, escucha el resultado y descarga el archivo desde el historial de tareas.
  8. Para automatizar el proceso, envía los mismos campos al endpoint de Seed Audio 1.0 en RunComfy; no necesitas alojar el modelo.

Consejos para prompts y referencias#


  • Escribe como quieres que suene: las frases cortas y una puntuación clara suelen producir un ritmo más estable.
  • Usa clips de referencia breves y limpios; cada uno debe durar menos de 30 segundos y ocupar como máximo 10MB.
  • Haz coincidir el orden de los clips con las menciones del prompt para que @Audio1, @Audio2 y @Audio3 apunten a las fuentes correctas.
  • Usa una voz predefinida para borradores rápidos y cambia al audio de referencia cuando necesites un carácter concreto.
  • Recurre a una imagen solo cuando no vayas a aportar audio, ya que ambos tipos de referencia no pueden combinarse.
  • Ajusta la velocidad y el tono poco a poco; los cambios bruscos pueden hacer que la voz suene poco natural.

Comparación de Seed Audio 1.0 con otros modelos#


  • Prompts multimodales: a diferencia de muchas herramientas de voz que solo aceptan texto, Seed Audio 1.0 puede usar texto, audio de referencia o una imagen para orientar el resultado, según la información pública disponible.
  • Gestión de referencias: citar los clips por orden mediante marcadores @Audio ofrece más control que disponer de una única ranura de voz fija.
  • Flexibilidad de salida: la variedad de contenedores y frecuencias de muestreo facilita integrar el audio generado en flujos de trabajo existentes.

Modelos relacionados

flux-3/image-to-video/draft

FLUX 3 Draft I2V: Vista previa rápida de borradores de fotografías a vídeo a 720p

hailuo-02/image-to-video

Convierte tus imágenes en videos HD con movimientos realistas y rápidos

pika-2-2/image-to-video

Convierte imágenes en videos animados con calidad profesional.

sora-2/text-to-video

Genere un video con audio sincronizado a partir de un prompt de texto obligatorio. Elija `1280x720` o `720x1280` y una duración de `4`, `8` o `12` segundos.

kling-video-o1/standard/image-to-video

Anime una imagen requerida del primer fotograma a partir de un prompt de texto, guiando opcionalmente el final con una imagen del último fotograma.

hailuo-02/pro/image-to-video

Anima una imagen inicial con Hailuo 02 Pro mediante un prompt para crear un vídeo de seis segundos.

Preguntas Frecuentes

¿Qué es Seed Audio 1.0 y qué función cumple en un flujo text-to-audio?

Seed Audio 1.0 es un modelo text-to-audio de Bytedance que convierte prompts escritos en voz y audio hablado claros y naturales. En RunComfy, escribe el texto que quieres escuchar y, si lo necesitas, guía la interpretación con una voz predefinida, clips de referencia o una sola imagen. Está pensado para crear audio mediante prompts sin organizar sesiones de grabación.

¿Para qué tipos de generación resulta más adecuado Seed Audio 1.0?

Seed Audio 1.0 funciona bien para locuciones, narraciones, diálogos de personajes, fragmentos de ficción sonora y lecturas multilingües. Las voces predefinidas y los controles de interpretación permiten ajustar el ritmo, el volumen y el tono a una escena o una marca. También admite audio de referencia cuando necesitas mantener una interpretación coherente en varios clips.

¿Cómo usa Seed Audio 1.0 el audio y las imágenes de referencia?

Puedes añadir hasta tres clips de referencia y citarlos por orden en el prompt mediante @Audio1, @Audio2 y @Audio3. Así puedes combinar fuentes o trasladar una interpretación concreta a la lectura. Como alternativa, puedes aportar una sola imagen para orientar el tono, pero no es posible combinar referencias de imagen y audio en una misma solicitud. Para obtener resultados fiables, cada clip debe durar aproximadamente 30 segundos como máximo y ocupar hasta 10MB.

¿Qué equipos y casos de uso se benefician más de Seed Audio 1.0 en producción?

Creadores de contenido, equipos de producto y estudios de localización pueden usar Seed Audio 1.0 para locuciones explicativas, mensajes de aplicaciones, anuncios y doblaje en varios idiomas. Los desarrolladores también pueden integrarlo en flujos que generen voz bajo demanda a partir de guiones o textos de campaña. La combinación de voces predefinidas y referencias sirve tanto para borradores rápidos como para personajes más específicos.

¿Qué opciones de entrada y salida debo conocer antes de usar Seed Audio 1.0?

Seed Audio 1.0 requiere un prompt y admite de forma opcional una voz, audio de referencia o una imagen, además de controles de velocidad, volumen y tono. Puede devolver wav, mp3, pcm u ogg_opus, con frecuencias de muestreo de 8 kHz a 48 kHz. Los límites exactos de tamaño y formato pueden variar según el proveedor, así que consulta el panel de parámetros de RunComfy antes de diseñar tu integración.

¿Se puede usar Seed Audio 1.0 mediante la API de RunComfy?

Sí. Puedes probar Seed Audio 1.0 en la interfaz web de RunComfy AI Playground y ajustar el prompt, la voz, las referencias y los controles hasta obtener el resultado deseado. Después, llama al mismo modelo mediante la API con idénticos parámetros para automatizar la generación desde tu backend o flujo de contenidos. El comportamiento del modelo se mantiene entre las pruebas en el navegador y las ejecuciones en producción.

¿Cuánto cuesta generar con Seed Audio 1.0 en RunComfy?

Las generaciones de Seed Audio 1.0 se descuentan de tu saldo en usd o credits de RunComfy y, según la información disponible del proveedor, cuestan $0.075 por minuto de audio generado. Los usuarios nuevos suelen recibir un saldo de prueba gratuito; después, el uso sigue las reglas de la sección Generation de la página. Consulta esa sección para conocer la tarifa vigente y cualquier diferencia específica entre modos.

Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Ver todos los modelos →
Modelos de Imagen
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.