logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

Seed Audio 1.0 : Text-to-Audio avec voix prédéfinies et fichiers audio de référence dans RunComfy Models et via l’API | RunComfy

bytedance/seed-audio-1.0/text-to-audio

Seed Audio 1.0 génère de la parole naturelle à partir de texte, de clips de référence ou d’une image. Voix prédéfinies, vitesse d’élocution, hauteur et format de sortie sont réglables dans le navigateur et via l’API.

Table des matières

1. Démarrage2. Authentification3. Référence APISoumettre une requêteStatut de la requêteRécupérer les résultatsAnnuler une requête4. Fichiers en entréeFichier hébergé (URL)5. SchémaSchéma d'entréeSchéma de sortie

1. Démarrage

Utilisez l'API RunComfy pour exécuter bytedance/seed-audio-1.0/text-to-audio. Pour les entrées et sorties acceptées, voir le schéma.

curl --request POST \
  --url https://model-api.runcomfy.net/v1/models/bytedance/seed-audio-1.0/text-to-audio \
  --header "Content-Type: application/json" \
  --header "Authorization: Bearer <token>" \
  --data '{
    "prompt": "Welcome back to the late-night show. Settle in, pour something warm, and let's ease into the next track together."
  }'

2. Authentification

Définissez la variable d'environnement YOUR_API_TOKEN avec votre clé API (gestion dans Profil) et incluez à chaque requête un jeton Bearer dans l'en-tête Authorization : Authorization: Bearer $YOUR_API_TOKEN.

3. Référence API

Soumettre une requête

Soumettez une tâche de génération asynchrone et recevez immédiatement un request_id ainsi que des URLs pour le statut, les résultats et l'annulation.

curl --request POST \
  --url https://model-api.runcomfy.net/v1/models/bytedance/seed-audio-1.0/text-to-audio \
  --header "Content-Type: application/json" \
  --header "Authorization: Bearer <token>" \
  --data '{
    "prompt": "Welcome back to the late-night show. Settle in, pour something warm, and let's ease into the next track together."
  }'

Statut de la requête

Récupère l'état actuel pour un request_id (« in_queue », « in_progress », « completed » ou « cancelled »).

curl --request GET \
  --url https://model-api.runcomfy.net/v1/requests/{request_id}/status \
  --header "Authorization: Bearer <token>"

Récupérer les résultats

Récupère les sorties finales et métadonnées pour le request_id ; si le travail n'est pas terminé, la réponse indique l'état actuel pour poursuivre le polling.

curl --request GET \
  --url https://model-api.runcomfy.net/v1/requests/{request_id}/result \
  --header "Authorization: Bearer <token>"

Annuler une requête

Annule un travail en file d'attente via request_id ; les travaux en cours ne peuvent pas être annulés.

curl --request POST \
  --url https://model-api.runcomfy.net/v1/requests/{request_id}/cancel \
  --header "Authorization: Bearer <token>"

4. Fichiers en entrée

Fichier hébergé (URL)

Fournissez une URL HTTPS accessible publiquement. L'hôte doit autoriser les récupérations côté serveur (sans login/cookies), sans limitation de débit ni blocage des bots. Recommandé : images ≤ 50 Mo (~4K), vidéos ≤ 100 Mo (~2–5 min en 720p). Préférez des URL stables ou pré-signées pour les actifs privés.

5. Schéma

Schéma d'entrée

{
  "type": "object",
  "title": "Schéma d'entrée",
  "required": [
    "prompt"
  ],
  "properties": {
    "prompt": {
      "title": "Prompt",
      "description": "Texte à synthétiser. Référencez les clips dans l’ordre avec @Audio1, @Audio2 et @Audio3.",
      "type": "string",
      "default": "Welcome back to the late-night show. Settle in, pour something warm, and let's ease into the next track together."
    },
    "voice": {
      "title": "Voix",
      "description": "Voix prédéfinie utilisée pour la synthèse.",
      "type": "string",
      "enum": [
        "vivi_mixed_en_zh_ja_es_id",
        "mindy_en_es_id_pt_zh",
        "kian_en_zh",
        "cedric_en_zh",
        "sophie_en_zh",
        "jean_en_zh",
        "magnus_en_zh",
        "mabel_en_zh",
        "nadia_en_zh",
        "opal_en_zh",
        "pearl_en_zh",
        "quentin_en_zh",
        "corinne_mixed_en_zh",
        "esther_mixed_en_zh",
        "lyla_mixed_en_zh",
        "tracy_es_zh",
        "sandy_es_mixed_en_zh",
        "felix_zh",
        "celeste_zh",
        "monkey_king_zh"
      ],
      "default": "vivi_mixed_en_zh_ja_es_id"
    },
    "audio_urls": {
      "title": "URL des fichiers audio de référence",
      "description": "Jusqu’à 3 clips de référence, cités dans le prompt avec @Audio1, @Audio2 et @Audio3. Par clip : 30s et 10MB maximum ; formats : wav/mp3/pcm/ogg_opus.",
      "type": "array",
      "items": {
        "type": "string",
        "format": "audio_uri"
      },
      "maxItems": 3
    },
    "image_url": {
      "title": "URL de l’image de référence",
      "description": "Une seule image de référence (jpeg/png/webp, jusqu’à 10MB). Incompatible avec les fichiers audio de référence.",
      "type": "string"
    },
    "output_format": {
      "title": "Format de sortie",
      "description": "Format conteneur de l’audio généré.",
      "type": "string",
      "enum": [
        "wav",
        "mp3",
        "pcm",
        "ogg_opus"
      ],
      "default": "mp3"
    },
    "sample_rate": {
      "title": "Fréquence d’échantillonnage (Hz)",
      "description": "Fréquence d’échantillonnage de l’audio généré, en Hz.",
      "type": "integer",
      "enum": [
        8000,
        16000,
        24000,
        32000,
        44100,
        48000
      ],
      "default": 24000
    },
    "speed": {
      "title": "Vitesse d’élocution",
      "description": "Vitesse d’élocution. 1.0 correspond au rythme normal, 0.5 à la moitié et 2.0 au double.",
      "type": "number",
      "minimum": 0.5,
      "maximum": 2,
      "default": 1
    },
    "volume": {
      "title": "Volume",
      "description": "Volume de sortie. 1.0 correspond au niveau normal, 0.5 à la moitié et 2.0 au double.",
      "type": "number",
      "minimum": 0.5,
      "maximum": 2,
      "default": 1
    },
    "pitch": {
      "title": "Hauteur tonale",
      "description": "Décalage de la hauteur de la voix en demi-tons. 0 est neutre, -12 descend d’une octave et 12 monte d’une octave.",
      "type": "integer",
      "minimum": -12,
      "maximum": 12,
      "default": 0
    }
  }
}

Schéma de sortie

{
  "output": {
    "type": "object",
    "properties": {
      "image": {
        "type": "string",
        "format": "uri",
        "description": "URL d'une seule image"
      },
      "video": {
        "type": "string",
        "format": "uri",
        "description": "URL d'une seule vidéo"
      },
      "images": {
        "type": "array",
        "description": "plusieurs URLs d'images",
        "items": {
          "type": "string",
          "format": "uri"
        }
      },
      "videos": {
        "type": "array",
        "description": "plusieurs URLs de vidéos",
        "items": {
          "type": "string",
          "format": "uri"
        }
      }
    }
  }
}
Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Voir tous les modèles →
Modèles d'images
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.