logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

Seed Audio 1.0: text-to-audio con voces predefinidas y audio de referencia en RunComfy Models y mediante la API | RunComfy

bytedance/seed-audio-1.0/text-to-audio

Seed Audio 1.0 genera voz y audio hablado naturales a partir de texto, clips de referencia o una imagen. Permite ajustar la voz predefinida, la velocidad, el tono y el formato de salida desde el navegador o mediante la API.

Índice

1. Primeros pasos2. Autenticación3. Referencia de la APIEnviar una solicitudEstado de la solicitudObtener resultadosCancelar solicitud4. Archivos de entradaArchivo alojado (URL)5. EsquemaEsquema de entradaEsquema de salida

1. Primeros pasos

Usa la API de RunComfy para ejecutar bytedance/seed-audio-1.0/text-to-audio. Para entradas y salidas admitidas, consulta el esquema.

curl --request POST \
  --url https://model-api.runcomfy.net/v1/models/bytedance/seed-audio-1.0/text-to-audio \
  --header "Content-Type: application/json" \
  --header "Authorization: Bearer <token>" \
  --data '{
    "prompt": "Welcome back to the late-night show. Settle in, pour something warm, and let's ease into the next track together."
  }'

2. Autenticación

Define la variable de entorno YOUR_API_TOKEN con tu clave API (gestión en Perfil) e incluye en cada solicitud un token Bearer en la cabecera Authorization : Authorization: Bearer $YOUR_API_TOKEN.

3. Referencia de la API

Enviar una solicitud

Envía un trabajo de generación asíncrono y recibe de inmediato un request_id y URLs para consultar estado, obtener resultados y cancelar.

curl --request POST \
  --url https://model-api.runcomfy.net/v1/models/bytedance/seed-audio-1.0/text-to-audio \
  --header "Content-Type: application/json" \
  --header "Authorization: Bearer <token>" \
  --data '{
    "prompt": "Welcome back to the late-night show. Settle in, pour something warm, and let's ease into the next track together."
  }'

Estado de la solicitud

Obtiene el estado actual de un request_id ("in_queue", "in_progress", "completed" o "cancelled").

curl --request GET \
  --url https://model-api.runcomfy.net/v1/requests/{request_id}/status \
  --header "Authorization: Bearer <token>"

Obtener resultados

Obtiene las salidas finales y metadatos del request_id; si el trabajo no ha terminado, la respuesta devuelve el estado actual para seguir haciendo polling.

curl --request GET \
  --url https://model-api.runcomfy.net/v1/requests/{request_id}/result \
  --header "Authorization: Bearer <token>"

Cancelar solicitud

Cancela un trabajo en cola por request_id; los trabajos en curso no se pueden cancelar.

curl --request POST \
  --url https://model-api.runcomfy.net/v1/requests/{request_id}/cancel \
  --header "Authorization: Bearer <token>"

4. Archivos de entrada

Archivo alojado (URL)

Proporciona una URL HTTPS públicamente accesible. El host debe permitir peticiones del servidor (sin login/cookies), sin rate limit agresivo ni bloqueo de bots. Recomendado: imágenes ≤ 50 MB (~4K), vídeos ≤ 100 MB (~2–5 min a 720p). Para activos privados, URLs estables o firmadas.

5. Esquema

Esquema de entrada

{
  "type": "object",
  "title": "Esquema de entrada",
  "required": [
    "prompt"
  ],
  "properties": {
    "prompt": {
      "title": "Prompt",
      "description": "Texto que se sintetizará. Cita los clips de referencia por orden con @Audio1, @Audio2 y @Audio3.",
      "type": "string",
      "default": "Welcome back to the late-night show. Settle in, pour something warm, and let's ease into the next track together."
    },
    "voice": {
      "title": "Voz",
      "description": "Voz predefinida que se usará para la síntesis.",
      "type": "string",
      "enum": [
        "vivi_mixed_en_zh_ja_es_id",
        "mindy_en_es_id_pt_zh",
        "kian_en_zh",
        "cedric_en_zh",
        "sophie_en_zh",
        "jean_en_zh",
        "magnus_en_zh",
        "mabel_en_zh",
        "nadia_en_zh",
        "opal_en_zh",
        "pearl_en_zh",
        "quentin_en_zh",
        "corinne_mixed_en_zh",
        "esther_mixed_en_zh",
        "lyla_mixed_en_zh",
        "tracy_es_zh",
        "sandy_es_mixed_en_zh",
        "felix_zh",
        "celeste_zh",
        "monkey_king_zh"
      ],
      "default": "vivi_mixed_en_zh_ja_es_id"
    },
    "audio_urls": {
      "title": "URL de los audios de referencia",
      "description": "Hasta 3 clips de referencia, citados en el prompt como @Audio1, @Audio2 y @Audio3. Cada clip puede durar hasta 30s y ocupar 10MB; formatos: wav/mp3/pcm/ogg_opus.",
      "type": "array",
      "items": {
        "type": "string",
        "format": "audio_uri"
      },
      "maxItems": 3
    },
    "image_url": {
      "title": "URL de la imagen de referencia",
      "description": "Una única imagen de referencia (jpeg/png/webp, hasta 10MB). No se puede combinar con referencias de audio.",
      "type": "string"
    },
    "output_format": {
      "title": "Formato de salida",
      "description": "Formato del contenedor del audio de salida.",
      "type": "string",
      "enum": [
        "wav",
        "mp3",
        "pcm",
        "ogg_opus"
      ],
      "default": "mp3"
    },
    "sample_rate": {
      "title": "Frecuencia de muestreo (Hz)",
      "description": "Frecuencia de muestreo del audio de salida en Hz.",
      "type": "integer",
      "enum": [
        8000,
        16000,
        24000,
        32000,
        44100,
        48000
      ],
      "default": 24000
    },
    "speed": {
      "title": "Velocidad",
      "description": "Velocidad de lectura. 1.0 es normal, 0.5 es la mitad y 2.0 el doble.",
      "type": "number",
      "minimum": 0.5,
      "maximum": 2,
      "default": 1
    },
    "volume": {
      "title": "Volumen",
      "description": "Volumen de salida. 1.0 es normal, 0.5 es la mitad, 2.0 es el doble.",
      "type": "number",
      "minimum": 0.5,
      "maximum": 2,
      "default": 1
    },
    "pitch": {
      "title": "Tono",
      "description": "Desplazamiento del tono de voz en semitonos. 0 es neutro, -12 baja una octava y 12 sube una octava.",
      "type": "integer",
      "minimum": -12,
      "maximum": 12,
      "default": 0
    }
  }
}

Esquema de salida

{
  "output": {
    "type": "object",
    "properties": {
      "image": {
        "type": "string",
        "format": "uri",
        "description": "URL de una sola imagen"
      },
      "video": {
        "type": "string",
        "format": "uri",
        "description": "URL de un solo vídeo"
      },
      "images": {
        "type": "array",
        "description": "varias URLs de imagen",
        "items": {
          "type": "string",
          "format": "uri"
        }
      },
      "videos": {
        "type": "array",
        "description": "varias URLs de vídeo",
        "items": {
          "type": "string",
          "format": "uri"
        }
      }
    }
  }
}
Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Ver todos los modelos →
Modelos de Imagen
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.