HappyHorse 1.0 avec sortie native 1080p, mouvement cinématographique et cohérence multi-plans.
Seed Audio 1.0 est un modèle text-to-audio de Bytedance qui transforme des instructions écrites en parole claire et naturelle. L’interprétation peut être guidée de trois façons : par un simple prompt texte, par un maximum de trois courts clips de référence ou par une seule image de référence.
Format de sortie : audio uniquement / formats wav, mp3, pcm, ogg_opus / fréquence d’échantillonnage de 8 kHz à 48 kHz.
Seed Audio 1.0 est conçu pour une synthèse vocale rapide et souple, avec une interprétation réglable.
| Paramètre | Obligatoire | Type | Valeur par défaut | Plage / options | Description |
|---|---|---|---|---|---|
| prompt* | Oui (*) | string | — | Texte libre | Texte à synthétiser ; indiquez les références dans l’ordre avec @Audio1, @Audio2 et @Audio3. |
| voice | Non | string | vivi_mixed_en_zh_ja_es_id | Liste des voix prédéfinies | Voix prédéfinie utilisée pour la synthèse. |
| audio_urls | Non | array | — | Jusqu’à 3 URL | Clips de référence (wav/mp3/pcm/ogg_opus), chacun limité à 30s et 10MB. |
| image_url | Non | string | — | jpeg/png/webp, jusqu’à 10MB | Une image de référence ; incompatible avec les fichiers audio de référence. |
| output_format | Non | string | mp3 | wav, mp3, pcm, ogg_opus | Format conteneur de l’audio généré. |
| sample_rate | Non | integer | 24000 | 8000 - 48000 | Fréquence d’échantillonnage de sortie en Hz. |
| speed | Non | number | 1 | 0.5 - 2.0 | Vitesse d’élocution ; 1.0 correspond au rythme normal. |
| volume | Non | number | 1 | 0.5 - 2.0 | Volume de sortie ; 1.0 correspond au niveau normal. |
| pitch | Non | integer | 0 | -12 - 12 | Décalage de la hauteur de la voix en demi-tons. |
Seed Audio 1.0 est facturé sur RunComfy en fonction de la durée de l’audio généré.
| Unité de facturation | Tarif |
|---|---|
| Par minute d’audio généré | $0.075 |
Exemples de coûts estimés
| Durée | Coût approximatif |
|---|---|
| 15 s | ~$0.019 |
| 30 s | ~$0.038 |
| 60 s | ~$0.075 |
| 120 s | ~$0.150 |
Pour obtenir une synthèse vocale propre avec Seed Audio 1.0 :
HappyHorse 1.0 avec sortie native 1080p, mouvement cinématographique et cohérence multi-plans.
Générez une vidéo avec un audio synchronisé à partir d'une invite de texte requise. Choisissez `1280x720` ou `720x1280` et une durée de `4`, `8` ou `12` secondes.
Transformez vos images statiques en vidéos 1080p fluides et réalistes avec une précision créative.
Anime une image de départ en clip cinématographique avec audio natif.
FLUX 3 Draft FLF : aperçus vidéo rapides des images de début et de fin à 720p
Prolongez un morceau au début, à la fin ou des deux côtés en respectant son style.
Seed Audio 1.0 est un modèle text-to-audio de Bytedance qui transforme des instructions écrites en parole claire et naturelle. Sur RunComfy, vous saisissez le texte à prononcer et pouvez guider l’interprétation avec une voix prédéfinie, des clips de référence ou une seule image. Il permet ainsi de créer du contenu parlé sans organiser de session d’enregistrement.
Seed Audio 1.0 convient aux voix off, à la narration, aux répliques de personnages, aux courts extraits de fiction audio et aux versions multilingues. Les voix prédéfinies et les réglages de vitesse d’élocution, de volume et de hauteur permettent d’adapter le résultat à une scène ou à une marque. Les fichiers audio de référence aident aussi à conserver une interprétation cohérente sur plusieurs clips.
Vous pouvez ajouter jusqu’à trois clips et les citer dans le prompt, dans l’ordre, avec @Audio1, @Audio2 et @Audio3. Cela permet de combiner des influences ou de reprendre une interprétation précise. Une seule image peut aussi guider le ton de la voix, mais les fichiers audio et l’image de référence ne peuvent pas être utilisés dans la même requête. Pour un résultat fiable, chaque clip doit durer 30 secondes au maximum et ne pas dépasser 10MB.
Les équipes de contenu, de produit et de localisation peuvent utiliser Seed Audio 1.0 pour des vidéos explicatives, des messages vocaux d’application, des publicités et des doublages multilingues. Les développeurs peuvent intégrer la génération de parole à partir de scripts ou de textes de campagne dans leurs pipelines. Les voix prédéfinies accélèrent les brouillons, tandis que les références permettent un travail plus précis sur les voix de personnages.
Un prompt est obligatoire ; une voix, un fichier audio de référence ou une image peuvent être ajoutés. La vitesse d’élocution, le volume et la hauteur sont réglables. La sortie est disponible en wav, mp3, pcm ou ogg_opus, avec une fréquence d’échantillonnage comprise entre 8 kHz et 48 kHz. Les tailles et formats acceptés sont indiqués dans les réglages de la page RunComfy du modèle et peuvent varier selon le fournisseur.
Oui. Ajustez d’abord le prompt, la voix, les références et l’interprétation dans le RunComfy AI Playground. Vous pouvez ensuite appeler Seed Audio 1.0 avec les mêmes paramètres via l’API RunComfy depuis votre backend ou votre pipeline de contenu. La configuration validée dans le navigateur reste ainsi identique lors de l’automatisation.
D’après les informations disponibles du fournisseur, Seed Audio 1.0 coûte $0.075 par minute d’audio généré. Les coûts sont déduits du solde USD ou des crédits RunComfy ; les nouveaux utilisateurs disposent généralement d’un crédit d’essai gratuit. Consultez la section « Génération » de la page Seed Audio 1.0 pour connaître les tarifs actuels et les éventuelles différences entre les modes.
RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.