logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

Ace Step 1.5 : génération musicale avec voix, paroles et contrôle du style par tags dans Models et via l’API | RunComfy

acestep-ai/ace-step-1.5/text-to-audio

Créez des morceaux pouvant durer jusqu’à 4 minutes à partir de tags de style et de paroles facultatives, avec des voix originales et une grande fidélité acoustique, dans RunComfy Models ou via l’API HTTP.

Liste de genres, d’ambiances et d’instruments séparés par des virgules, utilisée pour orienter le style du morceau.
Contenu vocal facultatif. Laissez ce champ vide ou utilisez [inst] / [instrumental] pour créer un instrumental ; utilisez les marqueurs [Verse], [Chorus] et [Bridge] pour structurer la chanson.
Durée de l’audio en secondes.
Idle
The rate is $0.0003 per second.

Présentation d’Ace Step 1.5

Ace Step 1.5 d’ACE Studio transforme des tags de style et des paroles structurées facultatives en morceaux complets allant jusqu’à 4 minutes au tarif de $0.0003 par seconde. Il prend en charge plus de 50 langues et produit des voix cohérentes avec une grande fidélité acoustique. En remplaçant les séances de composition, les réservations de chanteurs et la production multipiste par une génération pilotée par tags et prompts, Ace Step 1.5 accélère l’idéation musicale des équipes média, studios de jeu, créateurs de contenu et producteurs publicitaires. Le modèle est accessible sur RunComfy dans le navigateur comme via une API HTTP, sans avoir à l’héberger ni à le dimensionner.
Idéal pour : prototypage de maquettes musicales | musique de film et de jeu | musique publicitaire au format court

ACE Studio / Ace Step 1.5#


Ace Step 1.5 est un modèle de génération musicale qui transforme des tags de style séparés par des virgules et des paroles structurées facultatives en chansons complètes, avec voix, instrumentation et phrasé synchronisé aux paroles. Il prend en charge plus de 50 langues, fonctionne efficacement et permet d’itérer rapidement sur des durées allant de quelques secondes à 4 minutes (240 secondes).


Format de sortie : audio uniquement / durée de 5–240 secondes / stéréo / fréquence d’échantillonnage définie par le fournisseur.


Paramètres#


ParamètreObligatoireTypeValeur par défautPlage / OptionsDescription
tags*Oui (*)string—Texte libreListe de genres, ambiances et instruments séparés par des virgules.
lyricsNonstring—Texte libre ou [inst] / [instrumental]Contenu vocal ; utilisez des marqueurs comme [Verse], [Chorus] et [Bridge] pour structurer la chanson.
durationNoninteger605 – 240Durée de l’audio en secondes.
seedNoninteger-1-1 – 2147483647Seed aléatoire permettant de reproduire le résultat ; -1 crée une nouvelle variation.

Tarifs#


Sur RunComfy, Ace Step 1.5 est facturé selon la durée de l’audio généré.


Unité de facturationTarif
Par seconde d’audio généré$0.0003

Exemples de coûts estimés


DuréeCoût approximatif
30 s~$0.009
60 s (par défaut)~$0.018
120 s~$0.036
240 s (4 min)~$0.072

Mode d’emploi#


1) Ouvrez le modèle Ace Step 1.5 sur RunComfy, puis affichez le panneau de génération.

2) Saisissez des tags comme "lofi, hiphop, chill, mellow piano" pour définir le genre, l’ambiance et l’instrumentation.

3) Ajoutez éventuellement des paroles en séparant clairement les sections [Verse], [Chorus] et [Bridge], ou saisissez [inst] pour créer un instrumental.

4) Réglez duration entre 5 et 240 secondes. Commencez par un extrait court pour valider la direction avant de lancer un rendu complet de 4 minutes.

5) Fixez le seed pour comparer précisément l’effet d’une modification des tags ou des paroles, ou conservez -1 pour obtenir davantage de variété.

6) Lancez la génération, écoutez le résultat et téléchargez le fichier audio depuis l’historique de vos tâches.

7) Pour l’API, envoyez les mêmes champs à l’endpoint Ace Step 1.5 de RunComfy ; aucun auto-hébergement n’est nécessaire.

8) Enregistrez les associations de tags et les seeds prometteurs comme presets afin de conserver une direction sonore cohérente sur tout le projet.

Modèles associés

Kling 1.5 Pro

Créez des vidéos immersives à partir de textes ou d’images en un clic

infinite-talk/fast/multi

Générez une vidéo à partir de deux pistes audio et d’une image, puis réglez l’ordre des intervenants.

kling-video-o3/pro/image-to-video

Animation d’image en qualité Pro : clips cinématographiques de 3 à 15 secondes à partir de 0,123 $ par seconde.

pixverse/v5.5/effects

Animez une image source obligatoire avec l’un des 48 effets prédéfinis et des réglages de résolution, durée, prompt négatif et optimisation.

flux-3/keyframes-to-video/draft

FLUX 3 Draft Keyframes : aperçus vidéo rapides multi-images clés à 720p

pika-2-2/text-to-video

Créez des vidéos de haute qualité à partir de prompts textuels avec Pika 2.2.

Questions Fréquemment Posées

Qu’est-ce qu’Ace Step 1.5 et à quoi sert-il dans un flux texte-vers-audio ?

Ace Step 1.5 est un modèle de génération musicale d’acestep-ai qui transforme des tags de style et des paroles structurées facultatives en morceaux complets, avec mélodie, rythme et voix. Dans un flux texte-vers-audio sur RunComfy, vous décrivez le genre, l’ambiance et la structure ; Ace Step 1.5 produit ensuite une composition cohérente dont le phrasé suit les paroles. Il s’adresse aux créateurs qui souhaitent générer rapidement de la musique à partir de prompts, sans passer par une composition manuelle.

Pour quels types de génération Ace Step 1.5 est-il le mieux adapté ?

Ace Step 1.5 convient particulièrement à la création de musique de fond pour la vidéo, de courtes maquettes de chanson, de boucles d’ambiance, de jingles publicitaires et de pistes de référence pour les scènes de jeu. Ses tags permettent d’orienter le genre, l’instrumentation et l’énergie avec quelques mots. La génération de voix et de paroles en fait aussi un bon outil pour les premières versions d’une chanson et le prototypage créatif.

Comment Ace Step 1.5 se compare-t-il à la version d’origine d’Ace Step et aux autres modèles musicaux ?

Par rapport à la première version, Ace Step 1.5 conserve le contrôle par tags et la durée maximale de 4 minutes, tout en étendant la prise en charge des paroles multilingues à plus de 50 langues et en améliorant l’interprétation des paroles structurées. Contrairement aux systèmes exclusivement instrumentaux, il produit en une seule passe voix, instrumentation et phrasé synchronisé. Le paramètre seed permet également aux développeurs de reproduire un résultat pour itérer de façon cohérente dans une direction donnée.

Quelles équipes et quels usages bénéficient le plus d’Ace Step 1.5 en production ?

Designers, artistes techniques, vidéastes et équipes produit peuvent utiliser Ace Step 1.5 pour les bandes-annonces, les contenus sociaux, les prototypes audio de jeux, les vidéos e-commerce et les créations publicitaires. Les développeurs peuvent l’intégrer à des pipelines qui génèrent une bande-son à la demande à partir des métadonnées d’une scène ou d’un brief de campagne. Comme Ace Step 1.5 gère à la fois les voix et les instrumentaux dans de nombreuses langues, une seule interface couvre une grande variété de besoins audio.

Quelles limites d’entrée et de sortie faut-il connaître avant d’utiliser Ace Step 1.5 ?

Ace Step 1.5 accepte une durée flexible de 5 à 240 secondes (4 minutes) par génération, avec un seul champ tags obligatoire et des lyrics structurées facultatives. D’autres contraintes, notamment les formats audio pris en charge et les combinaisons de tags, dépendent de la configuration actuelle du fournisseur. Consultez donc le panneau de paramètres RunComfy avant de bâtir votre intégration ; les limites peuvent varier selon le mode ou le fournisseur.

Comment passer des essais d’Ace Step 1.5 dans l’interface du modèle à une utilisation en production via l’API RunComfy ?

Dans l’interface web RunComfy AI Playground, ajustez les tags de style, les paroles, la durée et le seed jusqu’à ce que la sortie texte-vers-audio d’Ace Step 1.5 corresponde à votre objectif. Une fois la configuration stabilisée, appelez le même modèle via l’API RunComfy avec des paramètres identiques pour automatiser la génération depuis votre backend ou votre pipeline de contenu. Vous pouvez ainsi itérer dans le navigateur puis exécuter la production en code, sans modifier le comportement du modèle.

Comment la génération audio avec Ace Step 1.5 est-elle facturée sur RunComfy ?

Les générations Ace Step 1.5 consomment des crédits USD de votre solde RunComfy et, d’après les informations disponibles auprès du fournisseur, sont facturées $0.0003 par seconde. Les nouveaux utilisateurs disposent généralement d’un montant d’essai gratuit en USD ; l’utilisation suit ensuite les règles affichées dans la section Generation de la page du modèle. Consultez cette section sur RunComfy pour connaître le tarif actuel et les éventuelles différences entre modes.

Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Voir tous les modèles →
Modèles d'images
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.