logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

Ace Step: Text-to-Music con voces, letras y control mediante etiquetas en Models y API | RunComfy

acestep-ai/ace-step/text-to-audio

Genera canciones de hasta 4 minutos a partir de etiquetas de estilo y letras opcionales, con voces originales y alta fidelidad acústica, desde RunComfy Models y la API HTTP.

Lista de etiquetas de género, ambiente e instrumentos separadas por comas para definir el estilo de la pista generada.
Contenido vocal opcional para la pista. Déjalo en blanco para que la IA genere la letra, o usa [inst] / [instrumental] para crear una pieza sin voz.
Duración del audio, en segundos.
Idle
The rate is $0.0002 per second.

Introducción a Ace Step

Ace Step de ACE Studio convierte etiquetas de estilo y letras opcionales en canciones completas de hasta 4 minutos por $0.0002 por segundo, con voces coherentes, instrumentación definida y alta fidelidad acústica. La generación controlada por etiquetas y prompts sustituye sesiones manuales de composición, contratación de cantantes y producción multipista, y acelera la creación de ideas musicales para equipos de medios, estudios de videojuegos, creadores de contenido y equipos publicitarios. Los desarrolladores pueden usar Ace Step en RunComfy desde el navegador o mediante una API HTTP, sin alojar ni escalar el modelo.
Ideal para: prototipos de maquetas musicales | Música para cine y videojuegos | Música para anuncios breves

ACE Studio / Ace Step#


Ace Step es un modelo de generación de texto a música que convierte etiquetas de estilo separadas por comas y letras opcionales en canciones completas con voces, instrumentación y letras sincronizadas. El modelo está diseñado para una iteración rápida y admite duraciones desde unos pocos segundos hasta 4 minutos (240 segundos).


Formato de salida: Solo audio / duración 5–240 segundos / estéreo / frecuencia de muestreo definida por el proveedor.


Puntos destacados#


  • Conversión de texto a música basada en etiquetas: componga pistas enumerando géneros, estados de ánimo e instrumentos en lugar de escribir párrafos detallados.
  • Generación de letras y voces: Ace Step puede escribir sus propias letras o cantar letras proporcionadas por el usuario con líneas vocales sincronizadas.
  • Alta fidelidad acústica: mantiene el equilibrio dinámico, la calidad espacial y la claridad del instrumento durante los 4 minutos de duración máxima.
  • Duración flexible: ajustable desde bucles cortos hasta pistas completas de hasta 240 segundos.
  • Reproducibilidad: establezca una semilla fija para recrear resultados exactos al iterar en etiquetas o letras.
  • API y paridad del navegador: los mismos parámetros funcionan en la interfaz de usuario del modelo RunComfy y mediante una API HTTP.

Parámetros#


ParámetroRequeridoTipoPor defectoRango / OpcionesDescripción
tags*Sí (*)string—Texto libreLista de etiquetas de género, ambiente e instrumentos separadas por comas.
lyricsNostring—Texto libre o [inst] / [instrumental]Contenido vocal; déjelo en blanco para letras generadas por IA, use [inst] para instrumental.
durationNointeger605 – 240Duración del audio en segundos.
seedNointeger-1-1 – 2147483647Semilla aleatoria para obtener resultados reproducibles; -1 aleatoriza.

Precios#


Ace Step en RunComfy utiliza facturación basada en tiempo para el audio generado.


Unidad de facturaciónTarifa
Por segundo de audio generado$0.0002

Ejemplos de costes estimados


DuraciónCoste aprox.
30 s~$0.006
60 s (predeterminado)~$0.012
120 s~$0.024
240 s (4 mín.)~$0.048

Cómo utilizar#


1) Abra el modelo Ace Step en RunComfy y abra el panel de generación.

2) Introduzca etiquetas de estilo como "lofi, hiphop, chill, mellow piano" para definir el género, el estado de ánimo y la instrumentación.

3) Añada una letra si lo desea; mantenga las secciones de verso y coro claramente separadas, o use [inst] para un instrumental.

4) Establezca la duración en segundos (5–240); empiece con un clip breve para probar la dirección antes de comprometerse con un renderizado completo de 4 minutos.

5) Fije la semilla cuando desee comparar el impacto de los cambios de etiquetas o letras, o déjela en -1 para variar.

6) Ejecute la generación, obtenga una vista previa del resultado y descargue el archivo de audio de su historial de trabajo.

7) Para uso de API, envíe los mismos campos al endpoint de Ace Step en RunComfy; no se requiere autohospedaje.

8) Guarde semillas prometedoras y combinaciones de etiquetas como ajustes preestablecidos para mantener la dirección sonora constante en todo el proyecto.


Consejos sobre prompts y referencias#


  • Utilice múltiples etiquetas complementarias (por ejemplo, "trap, dark, 808, brass") para bloquear el género, la instrumentación y la energía en una sola pasada.
  • Combine etiquetas contrastantes con cuidado (por ejemplo, "chill, trap") para encontrar combinaciones únicas sin confundir el arreglo.
  • Proporcione letras estructuradas con marcadores [Verse] y [Chorus] claros y recuentos de sílabas consistentes para un fraseo vocal más limpio.
  • Comience con borradores de 30–45 s para validar la dirección antes de solicitar renderizados de 120–240 s más largos.
  • Fije la semilla al iterar; solo cambie etiquetas o letras para que pueda atribuir diferencias a sus ediciones.
  • Evite señales contradictorias como "low-fi yet ultra-hi-fi": elija una estética dominante por pista en Ace Step.
  • Para pistas instrumentales, use [inst] o [instrumental] en el campo de letra en lugar de dejarlo en blanco.
  • Si las duraciones suenan apresuradas o alargadas artificialmente, ajuste el campo de duración en lugar de restringir demasiado la letra.

Cómo se compara Ace Step con otros modelos#


  • Según información disponible públicamente, Ace Step se centra en el control basado en etiquetas y en canciones de hasta 4 minutos, mientras que algunos modelos de la familia Suno se basan en prompts de formato libre con pistas predeterminadas más cortas.
  • En comparación con sistemas exclusivamente instrumentales como MusicGen, Ace Step genera de forma nativa voces y letras junto con la instrumentación en una sola pasada.
  • Caso de uso ideal: elija Ace Step cuando necesite canciones completas con voces, control de género a nivel de etiqueta y semillas reproducibles para iterar.

Modelos relacionados

pikascenes

Compón una escena a partir de 1–6 imágenes y anímala como vídeo con Pikascenes.

wan-3.0/image-to-video

Wan 3.0 convierte una imagen del primer fotograma en un vídeo cinematográfico con sonido

seedance-2.5/reference-to-video/480p

Seedance 2.5 Referencia 480p: Vídeo borrador multireferencia a menor coste

wan-2-2/lora/image-to-video

Anima una imagen inicial mediante un prompt y controla LoRA, fotogramas, FPS, resolución, relación de aspecto, pasos y seed.

Hailuo Video 01 Director

Dirige escenas con calidad profesional usando plantillas y comandos.

Hailuo Video 01 Live

Convierte tus ilustraciones 2D en animaciones fluidas con IA avanzada.

Preguntas Frecuentes

¿Qué es Ace Step y qué hace en un flujo de trabajo de conversión de texto a sonido?

Ace Step es un modelo de conversión de texto a música de acestep-ai que convierte etiquetas de estilo y prompts en pistas de audio completas con melodía, ritmo y voz. En un flujo de trabajo de texto a música en RunComfy, usted describe el género, el estado de ánimo y la estructura, y Ace Step genera una pieza musical coherente con letras sincronizadas. Está diseñado para creadores que desean una generación de música rápida y ágil sin composición manual.

¿Para qué tipo de tareas de generación es más adecuado Ace Step?

Ace Step es más adecuado para tareas de generación de texto a música, como generar música de fondo, demostraciones de canciones breves, bucles ambientales, jingles publicitarios y pistas de referencia para escenas de vídeo o juegos. Maneja bien el control de etiquetas de estilo, por lo que puede controlar el género, el tempo y la energía con unos pocos descriptores. La generación de voces y letras también lo hace útil para escribir borradores y crear prototipos creativos.

¿Cómo se compara Ace Step con otros modelos de texto a música en cuanto a calidad y control?

En comparación con muchos modelos de audio generales, Ace Step se centra en una fidelidad acústica detallada, prestando atención al equilibrio dinámico, la calidad espacial y la claridad del instrumento. La interfaz de etiquetas de estilo brinda a los artistas y diseñadores técnicos un control más directo sobre el género y la energía que los prompts de formato libre. La reproducibilidad mediante el parámetro seed también ayuda a los desarrolladores a iterar consistentemente en una dirección elegida.

¿Qué equipos y casos de uso se benefician más de Ace Step en producción?

Los diseñadores, artistas técnicos, creadores de vídeo y equipos de producto pueden utilizar la generación de texto a música Ace Step para avances, contenido social, prototipos de audio de juegos, vídeos de comercio electrónico y creatividades publicitarias. Los desarrolladores pueden integrarlo en flujos que necesitan bandas sonoras bajo demanda vinculadas a metadatos de escena o briefings de campaña. Dado que el modelo admite voces e instrumentos, cubre una amplia gama de necesidades de audio desde una única interfaz.

¿Qué límites de entrada y salida debo conocer antes de usar Ace Step?

Ace Step admite una duración flexible, ajustable desde unos pocos segundos hasta aproximadamente 4 minutos (240 segundos) por generación. Otras restricciones, como la longitud del prompt, los formatos de audio admitidos y las combinaciones de etiquetas, dependen de la configuración actual del proveedor, así que consulte el panel de parámetros RunComfy para conocer los límites exactos antes de diseñar el flujo de trabajo. Los límites pueden variar según el modo o la configuración del proveedor, y el panel siempre refleja los valores actuales para el endpoint de texto a música.

¿Cómo paso de probar Ace Step en Playground a usarlo en producción a través de la API de RunComfy?

Puede crear un prototipo de Ace Step en la interfaz web de RunComfy AI Playground ajustando las etiquetas de estilo, los prompts, la duración y la semilla hasta que el resultado de texto a música coincida con su objetivo. Una vez que la configuración sea estable, llame al mismo modelo Ace Step a través de la API de RunComfy con parámetros idénticos para automatizar la generación desde su backend o flujo de contenido. Esto mantiene la iteración creativa en el navegador y la producción se ejecuta en código, sin cambiar el comportamiento del modelo subyacente.

¿Cómo se manejan los precios al generar audio con Ace Step en RunComfy?

Las generaciones Ace Step consumen créditos USD de su saldo RunComfy y, según la información disponible del proveedor, el modelo se factura por segundo en $0.0002. Los nuevos usuarios normalmente obtienen créditos USD de prueba gratuitos para experimentar, después de lo cual el uso sigue las tarifas de generación que se muestran en la página del modelo. Para conocer las tarifas más actuales y las diferencias específicas del modo, consulte la sección Generación de la página Ace Step en RunComfy.

¿Puedo utilizar comercialmente los resultados generados con Ace Step?

RunComfy proporciona acceso al modelo Ace Step y al flujo de trabajo para generar audio, pero los derechos de uso comercial de la música generada dependen de la licencia del creador y del proveedor del modelo original (acestep-ai). Antes de publicar pistas en productos comerciales, anuncios, películas o juegos, revise la licencia oficial Ace Step y los términos del proveedor para confirmar los casos de uso permitidos. Si algo no está claro, puede comunicarse con hi@runcomfy.com para obtener orientación sobre preguntas relacionadas con la plataforma.

Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Ver todos los modelos →
Modelos de Imagen
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.