logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

Seed Audio 1.0 : Text-to-Audio avec voix prédéfinies et fichiers audio de référence dans RunComfy Models et via l’API | RunComfy

bytedance/seed-audio-1.0/text-to-audio

Seed Audio 1.0 génère de la parole naturelle à partir de texte, de clips de référence ou d’une image. Voix prédéfinies, vitesse d’élocution, hauteur et format de sortie sont réglables dans le navigateur et via l’API.

Texte à synthétiser. Référencez les clips dans l’ordre avec @Audio1, @Audio2 et @Audio3.
Voix prédéfinie utilisée pour la synthèse.
Jusqu’à 3 clips de référence, cités dans le prompt avec @Audio1, @Audio2 et @Audio3. Par clip : 30s et 10MB maximum ; formats : wav/mp3/pcm/ogg_opus.
Une seule image de référence (jpeg/png/webp, jusqu’à 10MB). Incompatible avec les fichiers audio de référence.
Format conteneur de l’audio généré.
Fréquence d’échantillonnage de l’audio généré, en Hz.
Vitesse d’élocution. 1.0 correspond au rythme normal, 0.5 à la moitié et 2.0 au double.
Volume de sortie. 1.0 correspond au niveau normal, 0.5 à la moitié et 2.0 au double.
Décalage de la hauteur de la voix en demi-tons. 0 est neutre, -12 descend d’une octave et 12 monte d’une octave.
Idle
The rate is $0.075 per minute.

Présentation de Seed Audio 1.0

Seed Audio 1.0 de Bytedance transforme des instructions écrites en audio naturel de haute qualité. L’interprétation peut être guidée par du texte, jusqu’à trois clips de référence ou une seule image, pour un tarif de $0.075 par minute. La synthèse pilotée par prompt évite les séances d’enregistrement et la coordination d’interprètes, ce qui permet aux équipes de création, de produit et de localisation de produire rapidement des contenus parlés. Le modèle est accessible sur RunComfy dans le navigateur et via une API HTTP, sans hébergement ni infrastructure de mise à l’échelle à gérer.
Idéal pour : voix off et narration | localisation multilingue | prototypes audio interactifs

Bytedance / Seed Audio 1.0#


Seed Audio 1.0 est un modèle text-to-audio de Bytedance qui transforme des instructions écrites en parole claire et naturelle. L’interprétation peut être guidée de trois façons : par un simple prompt texte, par un maximum de trois courts clips de référence ou par une seule image de référence.


Format de sortie : audio uniquement / formats wav, mp3, pcm, ogg_opus / fréquence d’échantillonnage de 8 kHz à 48 kHz.


Points forts#


Seed Audio 1.0 est conçu pour une synthèse vocale rapide et souple, avec une interprétation réglable.


  • Trois modes de guidage : générez l’audio à partir du texte seul, d’une voix prédéfinie ou de vos propres fichiers audio de référence. Une image peut également guider l’interprétation à la place de l’audio.
  • Fichiers audio de référence ordonnés : utilisez @Audio1, @Audio2 et @Audio3 dans le prompt pour associer jusqu’à trois clips, combiner leurs influences ou reprendre une manière de parler.
  • Voix multilingues : les préréglages couvrent l’anglais, le chinois, l’espagnol, le japonais, l’indonésien et le portugais, ainsi que des profils mixtes.
  • Réglage de l’interprétation : ajustez la vitesse d’élocution, le volume et la hauteur pour obtenir le rythme et le ton adaptés au projet.
  • Sortie flexible : exportez en wav, mp3, pcm ou ogg_opus jusqu’à 48 kHz pour faciliter le montage ultérieur.

Paramètres#


ParamètreObligatoireTypeValeur par défautPlage / optionsDescription
prompt*Oui (*)string—Texte libreTexte à synthétiser ; indiquez les références dans l’ordre avec @Audio1, @Audio2 et @Audio3.
voiceNonstringvivi_mixed_en_zh_ja_es_idListe des voix prédéfiniesVoix prédéfinie utilisée pour la synthèse.
audio_urlsNonarray—Jusqu’à 3 URLClips de référence (wav/mp3/pcm/ogg_opus), chacun limité à 30s et 10MB.
image_urlNonstring—jpeg/png/webp, jusqu’à 10MBUne image de référence ; incompatible avec les fichiers audio de référence.
output_formatNonstringmp3wav, mp3, pcm, ogg_opusFormat conteneur de l’audio généré.
sample_rateNoninteger240008000 - 48000Fréquence d’échantillonnage de sortie en Hz.
speedNonnumber10.5 - 2.0Vitesse d’élocution ; 1.0 correspond au rythme normal.
volumeNonnumber10.5 - 2.0Volume de sortie ; 1.0 correspond au niveau normal.
pitchNoninteger0-12 - 12Décalage de la hauteur de la voix en demi-tons.

Tarifs#


Seed Audio 1.0 est facturé sur RunComfy en fonction de la durée de l’audio généré.


Unité de facturationTarif
Par minute d’audio généré$0.075

Exemples de coûts estimés


DuréeCoût approximatif
15 s~$0.019
30 s~$0.038
60 s~$0.075
120 s~$0.150

Mode d’emploi#


Pour obtenir une synthèse vocale propre avec Seed Audio 1.0 :


  1. Ouvrez Seed Audio 1.0 sur RunComfy et accédez à la section de génération.
  2. Saisissez le texte à prononcer. Une ponctuation naturelle aide le modèle à placer correctement le phrasé et les pauses.
  3. Choisissez une voix prédéfinie, ou ajoutez un fichier audio de référence si vous recherchez une interprétation particulière.
  4. Pour utiliser des fichiers audio de référence, ajoutez jusqu’à trois URL de clips et mentionnez-les dans le prompt avec @Audio1, @Audio2 et @Audio3.
  5. Vous pouvez aussi fournir une seule image à la place de l’audio afin de guider le ton de la voix.
  6. Réglez la vitesse d’élocution, le volume et la hauteur, puis choisissez des valeurs output_format et sample_rate adaptées à votre flux de travail.
  7. Lancez la génération, écoutez l’aperçu et téléchargez le fichier depuis l’historique des tâches.
  8. Pour automatiser le processus, envoyez les mêmes champs au point de terminaison Seed Audio 1.0 sur RunComfy ; aucun hébergement propre n’est nécessaire.

Conseils pour les prompts et les références#


  • Écrivez comme le texte doit être prononcé : des phrases courtes et une ponctuation claire donnent un rythme plus régulier.
  • Utilisez des clips de référence courts et propres ; chacun doit rester sous 30 secondes et 10MB pour un résultat fiable.
  • Faites correspondre l’ordre des clips aux mentions @Audio1, @Audio2 et @Audio3 dans le prompt.
  • Utilisez une voix prédéfinie pour les premiers essais, puis passez à un fichier audio de référence lorsqu’une interprétation précise est nécessaire.
  • N’utilisez une image de référence que si aucun fichier audio de référence n’est fourni, car les deux modes ne peuvent pas être combinés.
  • Modifiez la vitesse d’élocution et la hauteur par petits paliers ; des écarts importants peuvent rendre la voix artificielle.

Comparaison de Seed Audio 1.0 avec d’autres modèles#


  • Guidage multimodal : contrairement à de nombreux outils vocaux limités au texte, Seed Audio 1.0 accepte, d’après les informations publiques disponibles, du texte, un fichier audio de référence ou une image pour façonner le résultat.
  • Gestion des références : les mentions @Audio1, @Audio2 et @Audio3 offrent un contrôle plus précis qu’un unique préréglage vocal.
  • Sortie flexible : plusieurs formats de conteneur et une large plage de fréquences d’échantillonnage facilitent l’intégration aux flux de production existants.

Modèles associés

happyhorse-1.0/text-to-video

HappyHorse 1.0 avec sortie native 1080p, mouvement cinématographique et cohérence multi-plans.

sora-2/text-to-video

Générez une vidéo avec un audio synchronisé à partir d'une invite de texte requise. Choisissez `1280x720` ou `720x1280` et une durée de `4`, `8` ou `12` secondes.

hailuo-2-3/pro/image-to-video

Transformez vos images statiques en vidéos 1080p fluides et réalistes avec une précision créative.

seedance-2.0-mini/image-to-video

Anime une image de départ en clip cinématographique avec audio natif.

flux-3/first-last-frame-to-video/draft

FLUX 3 Draft FLF : aperçus vidéo rapides des images de début et de fin à 720p

ace-step/audio-outpaint

Prolongez un morceau au début, à la fin ou des deux côtés en respectant son style.

Questions Fréquemment Posées

Qu’est-ce que Seed Audio 1.0 et quel rôle joue-t-il dans un flux text-to-audio ?

Seed Audio 1.0 est un modèle text-to-audio de Bytedance qui transforme des instructions écrites en parole claire et naturelle. Sur RunComfy, vous saisissez le texte à prononcer et pouvez guider l’interprétation avec une voix prédéfinie, des clips de référence ou une seule image. Il permet ainsi de créer du contenu parlé sans organiser de session d’enregistrement.

Pour quels types de génération Seed Audio 1.0 est-il le plus adapté ?

Seed Audio 1.0 convient aux voix off, à la narration, aux répliques de personnages, aux courts extraits de fiction audio et aux versions multilingues. Les voix prédéfinies et les réglages de vitesse d’élocution, de volume et de hauteur permettent d’adapter le résultat à une scène ou à une marque. Les fichiers audio de référence aident aussi à conserver une interprétation cohérente sur plusieurs clips.

Comment Seed Audio 1.0 utilise-t-il l’audio et les images de référence ?

Vous pouvez ajouter jusqu’à trois clips et les citer dans le prompt, dans l’ordre, avec @Audio1, @Audio2 et @Audio3. Cela permet de combiner des influences ou de reprendre une interprétation précise. Une seule image peut aussi guider le ton de la voix, mais les fichiers audio et l’image de référence ne peuvent pas être utilisés dans la même requête. Pour un résultat fiable, chaque clip doit durer 30 secondes au maximum et ne pas dépasser 10MB.

Quelles équipes et quels usages bénéficient le plus de Seed Audio 1.0 en production ?

Les équipes de contenu, de produit et de localisation peuvent utiliser Seed Audio 1.0 pour des vidéos explicatives, des messages vocaux d’application, des publicités et des doublages multilingues. Les développeurs peuvent intégrer la génération de parole à partir de scripts ou de textes de campagne dans leurs pipelines. Les voix prédéfinies accélèrent les brouillons, tandis que les références permettent un travail plus précis sur les voix de personnages.

Quelles options d’entrée et de sortie Seed Audio 1.0 propose-t-il ?

Un prompt est obligatoire ; une voix, un fichier audio de référence ou une image peuvent être ajoutés. La vitesse d’élocution, le volume et la hauteur sont réglables. La sortie est disponible en wav, mp3, pcm ou ogg_opus, avec une fréquence d’échantillonnage comprise entre 8 kHz et 48 kHz. Les tailles et formats acceptés sont indiqués dans les réglages de la page RunComfy du modèle et peuvent varier selon le fournisseur.

Les développeurs peuvent-ils utiliser Seed Audio 1.0 via l’API RunComfy ?

Oui. Ajustez d’abord le prompt, la voix, les références et l’interprétation dans le RunComfy AI Playground. Vous pouvez ensuite appeler Seed Audio 1.0 avec les mêmes paramètres via l’API RunComfy depuis votre backend ou votre pipeline de contenu. La configuration validée dans le navigateur reste ainsi identique lors de l’automatisation.

Combien coûte une génération avec Seed Audio 1.0 sur RunComfy ?

D’après les informations disponibles du fournisseur, Seed Audio 1.0 coûte $0.075 par minute d’audio généré. Les coûts sont déduits du solde USD ou des crédits RunComfy ; les nouveaux utilisateurs disposent généralement d’un crédit d’essai gratuit. Consultez la section « Génération » de la page Seed Audio 1.0 pour connaître les tarifs actuels et les éventuelles différences entre les modes.

Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Voir tous les modèles →
Modèles d'images
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.