logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

Ace Step : génération musicale avec voix, paroles et contrôle du style par tags dans Models et via l’API | RunComfy

acestep-ai/ace-step/text-to-audio

Créez des morceaux pouvant durer jusqu’à 4 minutes à partir de tags de style et de paroles facultatives, avec des voix originales et une grande fidélité acoustique, dans RunComfy Models et via l’API HTTP.

Liste de genres, d’ambiances et d’instruments séparés par des virgules, utilisée pour orienter le style du morceau.
Contenu vocal facultatif. Laissez le champ vide pour que l’IA écrive les paroles, ou utilisez [inst] / [instrumental] pour supprimer le chant.
Durée de l’audio en secondes.
Idle
The rate is $0.0002 per second.

Présentation d’Ace Step

Ace Step d’ACE Studio transforme des tags de style et des paroles facultatives en morceaux complets allant jusqu’à 4 minutes au tarif de $0.0002 par seconde, avec des voix cohérentes, une instrumentation aboutie et une grande fidélité acoustique. En remplaçant les séances de composition, les réservations de chanteurs et la production multipiste par une génération pilotée par tags et prompts, Ace Step accélère l’idéation musicale des équipes média, studios de jeu, créateurs de contenu et producteurs publicitaires. Le modèle est accessible sur RunComfy dans le navigateur comme via une API HTTP, sans avoir à l’héberger ni à le dimensionner.
Idéal pour : prototypage de maquettes musicales | musique de film et de jeu | musique publicitaire au format court

ACE Studio / Ace Step#


Ace Step est un modèle de génération musicale qui transforme des tags de style séparés par des virgules et des paroles facultatives en chansons complètes, avec voix, instrumentation et paroles synchronisées. Conçu pour itérer rapidement, il accepte des durées allant de quelques secondes à 4 minutes (240 secondes).


Format de sortie : audio uniquement / durée de 5–240 secondes / stéréo / fréquence d’échantillonnage définie par le fournisseur.


Points forts#


  • Génération guidée par tags : composez un morceau en énumérant des genres, ambiances et instruments, sans rédiger de longs paragraphes.
  • Voix et paroles : Ace Step peut écrire ses propres paroles ou chanter celles que vous fournissez en synchronisant les lignes vocales.
  • Grande fidélité acoustique : le modèle préserve l’équilibre dynamique, l’espace sonore et la clarté des instruments sur toute la plage allant jusqu’à 4 minutes.
  • Durée flexible : créez aussi bien de courtes boucles que des morceaux complets de 240 secondes.
  • Reproductibilité : fixez le seed pour retrouver exactement un résultat lorsque vous modifiez les tags ou les paroles.
  • Cohérence entre interface et API : les mêmes paramètres fonctionnent dans l’interface RunComfy Models et via l’API HTTP.

Paramètres#


ParamètreObligatoireTypeValeur par défautPlage / OptionsDescription
tags*Oui (*)string—Texte libreListe de genres, ambiances et instruments séparés par des virgules.
lyricsNonstring—Texte libre ou [inst] / [instrumental]Contenu vocal ; laissez vide pour des paroles écrites par l’IA, ou utilisez [inst] pour une version instrumentale.
durationNoninteger605 – 240Durée de l’audio en secondes.
seedNoninteger-1-1 – 2147483647Seed aléatoire pour reproduire un résultat ; -1 génère une nouvelle variation.

Tarifs#


Sur RunComfy, Ace Step est facturé selon la durée de l’audio généré.


Unité de facturationTarif
Par seconde d’audio généré$0.0002

Exemples de coûts estimés


DuréeCoût approximatif
30 s~$0.006
60 s (par défaut)~$0.012
120 s~$0.024
240 s (4 min)~$0.048

Mode d’emploi#


1) Ouvrez le modèle Ace Step sur RunComfy, puis affichez le panneau de génération.

2) Saisissez des tags comme "lofi, hiphop, chill, mellow piano" pour définir le genre, l’ambiance et l’instrumentation.

3) Ajoutez éventuellement des paroles en séparant clairement couplets et refrains, ou saisissez [inst] pour créer un instrumental.

4) Réglez duration entre 5 et 240 secondes. Commencez par un extrait court pour valider la direction avant de lancer un rendu complet de 4 minutes.

5) Fixez le seed pour comparer précisément l’effet d’une modification des tags ou des paroles, ou conservez -1 pour obtenir davantage de variété.

6) Lancez la génération, écoutez le résultat et téléchargez le fichier audio depuis l’historique de vos tâches.

7) Pour l’API, envoyez les mêmes champs à l’endpoint Ace Step de RunComfy ; aucun auto-hébergement n’est nécessaire.

8) Enregistrez les associations de tags et les seeds prometteurs comme presets afin de conserver une direction sonore cohérente sur tout le projet.


Conseils pour les prompts et références#


  • Associez plusieurs tags complémentaires (par exemple "trap, dark, 808, brass") pour fixer en une passe le genre, l’instrumentation et l’énergie.
  • Combinez avec prudence des tags contrastés (par exemple "chill, trap") afin de créer un mélange original sans brouiller l’arrangement.
  • Structurez les paroles avec des marqueurs [Verse] et [Chorus] explicites et un nombre de syllabes régulier pour obtenir un phrasé vocal plus net.
  • Commencez par des maquettes de 30–45 s afin de valider la direction avant de demander des rendus plus longs de 120–240 s.
  • Fixez le seed pendant les itérations et ne changez que les tags ou les paroles pour attribuer clairement les différences à vos modifications.
  • Évitez les consignes contradictoires telles que "low-fi yet ultra-hi-fi" : retenez une esthétique dominante par morceau dans Ace Step.
  • Pour un instrumental, indiquez [inst] ou [instrumental] dans le champ lyrics au lieu de le laisser vide.
  • Si le morceau paraît précipité ou artificiellement étiré, ajustez duration plutôt que de surcharger les paroles de contraintes.

Comparaison d’Ace Step avec d’autres modèles#


  • D’après les informations publiques disponibles, Ace Step privilégie le contrôle par tags et les morceaux allant jusqu’à 4 minutes, tandis que certains modèles de la famille Suno s’appuient davantage sur des prompts libres et des durées plus courtes par défaut.
  • Contrairement aux systèmes exclusivement instrumentaux comme MusicGen, Ace Step génère en une seule passe la voix, les paroles et l’instrumentation.
  • Cas d’usage idéal : choisissez Ace Step si vous recherchez des morceaux complets avec voix, un contrôle précis du genre par tags et des seeds reproductibles pour vos itérations.

Modèles associés

seedance-v1.5-pro/image-to-video

Transformez des images statiques en clips vidéo cinématographiques avec des transitions fluides et réalistes et une flexibilité créative – propulsé par Seedance 1.5 Pro.

wan-2.7/text-to-video

Créez des clips 1080p avec plusieurs références et un contrôle précis des images.

kling-2-6/motion-control-pro

Modèle de mouvement cinématographique pour la création de scènes fluides et le montage visuel adaptatif.

dreamina-3-0/image-to-video

Transformez vos images en vidéos 2K fluides et réalistes avec Dreamina 3.0.

sora-2/image-to-video

Générez des vidéos réalistes à partir d'images avec audio synchronisé.

hailuo-2-3/standard/image-to-video

Créez des vidéos réalistes à partir d'images avec un contrôle créatif précis.

Questions Fréquemment Posées

Qu’est-ce qu’Ace Step et quel rôle joue-t-il dans un flux texte-vers-audio ?

Ace Step est un modèle de génération musicale d’acestep-ai qui transforme des tags de style et des prompts en morceaux complets, avec mélodie, rythme et voix. Dans un flux texte-vers-audio sur RunComfy, vous décrivez le genre, l’ambiance et la structure ; Ace Step produit ensuite une composition cohérente avec des paroles synchronisées. Il s’adresse aux créateurs qui souhaitent générer rapidement de la musique à partir de prompts, sans passer par une composition manuelle.

Pour quels types de génération Ace Step est-il le mieux adapté ?

Ace Step convient particulièrement à la création de musique de fond, de courtes maquettes de chanson, de boucles d’ambiance, de jingles publicitaires et de pistes de référence pour la vidéo ou le jeu. Ses tags permettent de guider précisément le genre, le tempo et l’énergie avec quelques mots. La génération de voix et de paroles en fait également un bon outil pour les premières versions d’une chanson et le prototypage créatif.

Comment Ace Step se compare-t-il aux autres modèles musicaux texte-vers-audio en matière de qualité et de contrôle ?

Par rapport à de nombreux modèles audio généralistes, Ace Step met l’accent sur la fidélité acoustique, l’équilibre dynamique, l’espace sonore et la clarté des instruments. Son interface par tags donne aux artistes techniques et designers un contrôle plus direct du genre et de l’énergie qu’un prompt entièrement libre. Le paramètre seed permet aussi aux développeurs de reproduire un résultat pour itérer de façon cohérente dans une direction donnée.

Quelles équipes et quels usages bénéficient le plus d’Ace Step en production ?

Designers, artistes techniques, vidéastes et équipes produit peuvent utiliser Ace Step pour les bandes-annonces, les contenus sociaux, les prototypes audio de jeux, les vidéos e-commerce et les créations publicitaires. Les développeurs peuvent l’intégrer à des pipelines qui génèrent une bande-son à la demande à partir des métadonnées d’une scène ou d’un brief de campagne. Comme le modèle gère à la fois les voix et les instrumentaux, une seule interface couvre de nombreux besoins audio.

Quelles limites d’entrée et de sortie faut-il connaître avant d’utiliser Ace Step ?

Ace Step propose une durée flexible, de quelques secondes à environ 4 minutes (240 secondes) par génération. D’autres contraintes, comme la longueur du prompt, les formats audio pris en charge et les combinaisons de tags, dépendent de la configuration actuelle du fournisseur. Consultez donc le panneau de paramètres RunComfy avant de bâtir votre intégration. Il affiche toujours les valeurs en vigueur pour l’endpoint texte-vers-audio, qui peuvent varier selon le mode ou le fournisseur.

Comment passer des essais d’Ace Step dans Playground à une utilisation en production via l’API RunComfy ?

Dans l’interface web RunComfy AI Playground, ajustez les tags de style, les prompts, la durée et le seed jusqu’à ce que la sortie texte-vers-audio d’Ace Step corresponde à votre objectif. Une fois la configuration stabilisée, appelez le même modèle via l’API RunComfy avec des paramètres identiques pour automatiser la génération depuis votre backend ou votre pipeline de contenu. Vous pouvez ainsi itérer dans le navigateur puis exécuter la production en code, sans modifier le comportement du modèle.

Comment la génération audio avec Ace Step est-elle facturée sur RunComfy ?

Les générations Ace Step consomment des crédits USD de votre solde RunComfy et, d’après les informations disponibles auprès du fournisseur, sont facturées $0.0002 par seconde. Les nouveaux utilisateurs disposent généralement d’un montant d’essai gratuit en USD ; l’utilisation suit ensuite les règles affichées dans la section Generation de la page du modèle. Consultez cette section sur RunComfy pour connaître le tarif actuel et les éventuelles différences entre modes.

Puis-je utiliser commercialement les créations texte-vers-audio d’Ace Step ?

RunComfy donne accès au modèle Ace Step et à son flux de génération audio, mais les droits d’exploitation commerciale de la musique produite dépendent de la licence de l’auteur et du fournisseur d’origine, acestep-ai. Avant de publier des morceaux dans des produits commerciaux, publicités, films ou jeux, consultez la licence officielle d’Ace Step et les conditions du fournisseur. Pour toute question propre à la plateforme, écrivez à hi@runcomfy.com.

Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Voir tous les modèles →
Modèles d'images
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.