logo
RunComfy
  • ComfyUI
  • TrainerNuovo
  • Modelli
  • API
  • Prezzi
discord logo
MODELLI
Esplora
Tutti i modelli
LIBRERIA
Generazioni
API DEI MODELLI
Documentazione API
Chiavi API
ACCOUNT
Utilizzo

Ace Step: musica da testo con voce, testi e controllo tramite tag di stile su RunComfy e via API | RunComfy

acestep-ai/ace-step/text-to-audio

Genera da tag di stile e testi opzionali brani lunghi fino a 4 minuti, con voci originali e alta fedeltà acustica, su RunComfy e via API HTTP.

Elenco separato da virgole di tag di genere, stato d'animo e strumento per guidare lo stile della traccia generata.
Contenuto vocale opzionale per la traccia. Lascia vuoto per i testi generati dall'intelligenza artificiale o utilizza [inst] / [instrumental] per nessuna voce.
Durata dell'audio in secondi.
Idle
The rate is $0.0002 per second.

Introduzione a Ace Step

Ace Step di ACE Studio trasforma tag testuali di stile e testi opzionali in brani completi lunghi fino a 4 minuti al costo di $0.0002 al secondo, con voce coerente, strumentazione definita e alta fedeltà acustica. La generazione basata su tag e controllata dal prompt sostituisce sessioni di composizione manuale, ingaggio di cantanti e produzione multitraccia, accelerando l'ideazione musicale per team media, studi di videogiochi, creator e produttori pubblicitari. Gli sviluppatori possono usare Ace Step su RunComfy nel browser o tramite API HTTP, senza dover ospitare o scalare il modello.
Ideale per: prototipi di demo musicali | colonne sonore per cinema e videogiochi | musica pubblicitaria breve

ACE Studio / Ace Step#


Ace Step è un modello text-to-music che trasforma tag di stile separati da virgole e testi opzionali in brani completi con voce, strumentazione e testo sincronizzato. È progettato per iterazioni rapide e supporta durate da pochi secondi fino a 4 minuti (240 secondi).


Formato di output: solo audio / durata 5–240 secondi / stereo / frequenza di campionamento definita dal fornitore.


Funzionalità principali#


  • Generazione text-to-music tramite tag: componi una traccia elencando generi, atmosfere e strumenti invece di scrivere lunghi paragrafi.
  • Generazione di voce e testo: Ace Step può scrivere il testo oppure cantare quello fornito dall'utente con linee vocali sincronizzate.
  • Alta fedeltà acustica: mantiene equilibrio dinamico, qualità spaziale e chiarezza degli strumenti lungo l'intero intervallo di 4 minuti.
  • Durata flessibile: passa da loop brevi a tracce di 240 secondi adatte a brani completi.
  • Riproducibilità: imposta un seed fisso per ricreare lo stesso risultato mentre modifichi tag o testo.
  • Parità tra API e browser: gli stessi parametri funzionano nell'interfaccia RunComfy e tramite API HTTP.

Parametri#


ParametroObbligatorioTipoPredefinitoIntervallo / OpzioniDescrizione
tags*Sì (*)string—Testo liberoElenco separato da virgole di tag relativi a genere, atmosfera e strumenti.
lyricsNostring—Testo libero o [inst] / [instrumental]Contenuto vocale; lascia vuoto per un testo generato dall'IA oppure usa [inst] per una traccia strumentale.
durationNointeger605 – 240Durata dell'audio in secondi.
seedNointeger-1-1 – 2147483647Seed casuale per la riproducibilità; -1 produce un risultato casuale.

Prezzi#


Ace Step su RunComfy fattura l'audio generato in base alla durata.


Unità di fatturazioneTariffa
Per secondo di audio generato$0.0002

Esempi di costi stimati


DurataCosto indicativo
30 s~$0.006
60 s (predefinito)~$0.012
120 s~$0.024
240 s (4 min)~$0.048

Come si usa#


1) Apri Ace Step su RunComfy e mostra il pannello di generazione.

2) Inserisci tag di stile come "lofi, hiphop, chill, mellow piano" per definire genere, atmosfera e strumentazione.

3) Aggiungi facoltativamente il testo; separa chiaramente strofa e ritornello oppure usa [inst] per un brano strumentale.

4) Imposta duration in secondi (5–240); inizia con una durata breve per verificare la direzione prima di generare tutti i 4 minuti.

5) Blocca seed per confrontare l'effetto delle modifiche a tag o testo oppure lascialo su -1 per ottenere più varietà.

6) Avvia la generazione, ascolta l'anteprima e scarica il file audio dalla cronologia dei job.

7) Per usare l'API, invia gli stessi campi all'endpoint Ace Step su RunComfy; non serve alcun self-hosting.

8) Salva come preset i seed e le combinazioni di tag più efficaci per mantenere coerente la direzione sonora del progetto.


Suggerimenti per prompt e riferimenti#


  • Combina più tag complementari, ad esempio "trap, dark, 808, brass", per definire in un unico passaggio genere, strumentazione ed energia.
  • Accosta con cautela tag contrastanti, ad esempio "chill, trap", per trovare combinazioni originali senza rendere confuso l'arrangiamento.
  • Fornisci un testo strutturato con indicatori chiari [Verse] e [Chorus] e un numero coerente di sillabe per un fraseggio vocale più pulito.
  • Parti da bozze di 30–45 s per verificare la direzione prima di richiedere rendering più lunghi di 120–240 s.
  • Mantieni fisso seed durante le iterazioni e cambia soltanto tag o testo, così potrai attribuire le differenze alle singole modifiche.
  • Evita indicazioni contraddittorie come "low-fi yet ultra-hi-fi" e scegli un'estetica dominante per ogni traccia in Ace Step.
  • Per i brani strumentali, usa [inst] o [instrumental] nel campo lyrics invece di lasciarlo vuoto.
  • Se il risultato sembra troppo affrettato o diluito, modifica duration invece di imporre troppi vincoli al testo.

Confronto tra Ace Step e altri modelli#


  • In base alle informazioni pubblicamente disponibili, Ace Step punta sul controllo tramite tag e su brani lunghi fino a 4 minuti, mentre alcuni modelli della famiglia Suno privilegiano prompt liberi e durate predefinite più brevi.
  • Rispetto ai sistemi soltanto strumentali come MusicGen, Ace Step genera nativamente voce, testo e strumentazione in un unico passaggio.
  • Caso d'uso ideale: scegli Ace Step quando ti servono brani completi con voce, controllo del genere tramite tag e seed riproducibili per le iterazioni.

Modelli correlati

wan-2-6/video-to-video

Crea un video da un messaggio di testo e da una a tre clip di riferimento, con controlli per durata, dimensioni di output, struttura della ripresa, seme, messaggio negativo e generazione dell'audio.

Kling 1.5 Pro

Video realistici da testo o immagine con controllo creativo totale.

ltx-2/pro/text-to-video

Genera un video da un prompt obbligatorio con una durata di 6, 8 o 10 secondi, da 1080p a 2160p, 25 o 50 FPS, proporzioni 16:9 fisse e audio opzionale.

hailuo-2-3/standard/image-to-video

Trasforma le tue immagini in video realistici con controllo creativo e fluido.

kling-video-o3/4K/reference-to-video

Generazione cinematografica 4K da riferimenti a $0.42 per secondo di output.

kling-video-o3/4K/text-to-video

Generazione cinematografica text-to-video in 4K a $0.42 per secondo di output.

Domande Frequenti

Che cos'è Ace Step e che cosa fa in un flusso text-to-sound?

Ace Step è un modello text-to-music di acestep-ai che trasforma tag di stile e prompt in tracce complete con melodia, ritmo e voce. In un flusso text-to-sound su RunComfy descrivi genere, atmosfera e struttura; Ace Step genera quindi un brano coerente con testo sincronizzato. È pensato per chi vuole creare musica rapidamente tramite prompt, senza comporla manualmente.

Per quali attività di generazione è più adatto Ace Step?

Ace Step è ideale per creare musica di sottofondo, brevi demo, loop ambientali, jingle pubblicitari e tracce di riferimento per scene video o videogiochi. Il controllo tramite tag permette di orientare genere, tempo ed energia con pochi descrittori. La generazione di voce e testo è utile anche per bozze di canzoni e prototipi creativi.

Come si confronta Ace Step con altri modelli musicali text-to-sound in termini di qualità e controllo?

Rispetto a molti modelli audio generici, Ace Step punta su un'elevata precisione acustica, con attenzione all'equilibrio dinamico, alla resa spaziale e alla chiarezza degli strumenti. L'interfaccia basata su tag offre ad artisti tecnici e designer un controllo più diretto di genere ed energia rispetto ai soli prompt liberi. Il parametro seed consente inoltre agli sviluppatori di ripetere le iterazioni in modo coerente.

Quali team e casi d'uso traggono maggiore vantaggio da Ace Step in produzione?

Designer, artisti tecnici, creator video e product team possono usare Ace Step per trailer, contenuti social, prototipi audio per videogiochi, video e-commerce e creatività pubblicitarie. Gli sviluppatori possono integrarlo in pipeline che generano colonne sonore on demand in base ai metadati della scena o al brief della campagna. Il supporto di voce e strumentali copre molte esigenze audio da un'unica interfaccia.

Quali limiti di input e output è necessario conoscere prima di usare Ace Step?

Ace Step offre una durata flessibile, da pochi secondi fino a circa 4 minuti (240 secondi) per generazione. Gli altri vincoli, come lunghezza del prompt, formati audio e combinazioni di tag, dipendono dalla configurazione attuale del fornitore. Controlla quindi il pannello dei parametri RunComfy: i limiti possono cambiare in base alla modalità o al provider e il pannello mostra sempre i valori attivi per l'endpoint text-to-sound.

Come si passa dai test di Ace Step nel Playground all'uso in produzione tramite l'API RunComfy?

Puoi provare Ace Step nella Web UI del RunComfy AI Playground e regolare tag di stile, prompt, durata e seed finché il risultato text-to-sound non corrisponde all'obiettivo. Quando la configurazione è stabile, richiama lo stesso modello Ace Step tramite l'API RunComfy con parametri identici per automatizzare la generazione dal backend o dalla pipeline di contenuti. L'iterazione resta nel browser e la produzione nel codice, senza cambiare il comportamento del modello.

Come viene calcolato il prezzo dell'audio generato con Ace Step su RunComfy?

Le generazioni Ace Step consumano crediti USD dal saldo RunComfy e, in base alle informazioni disponibili sul fornitore, costano $0.0002 al secondo. In genere i nuovi utenti ricevono un importo di prova gratuito; in seguito si applicano le regole della sezione Generation nella pagina del modello. Consulta quella sezione per le tariffe aggiornate e le eventuali differenze tra modalità.

Posso usare commercialmente gli output text-to-sound di Ace Step?

RunComfy fornisce l'accesso ad Ace Step e al flusso di generazione audio, ma i diritti commerciali sulla musica dipendono dalla licenza dell'autore e provider originale, acestep-ai. Prima di pubblicare tracce in prodotti, pubblicità, film o videogiochi, verifica la licenza ufficiale di Ace Step e i termini del provider. Per dubbi relativi alla piattaforma puoi scrivere a hi@runcomfy.com.

Seguici
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Supporto
  • Discord
  • Email
  • Stato del Sistema
  • affiliato
Modelli Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Visualizza tutti i modelli →
Modelli Immagine
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Visualizza tutti i modelli →
Legale
  • Termini di Servizio
  • Informativa sulla Privacy
  • Informativa sui Cookie
RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.