logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

Ace Step 1.5: Text-to-Music con voces, letras y control mediante etiquetas en Models y API | RunComfy

acestep-ai/ace-step-1.5/text-to-audio

Genera canciones de hasta 4 minutos a partir de etiquetas de estilo y letras opcionales, con voces originales y alta fidelidad acústica, desde RunComfy Models y la API HTTP.

Lista de etiquetas de género, ambiente e instrumentos separadas por comas para definir el estilo de la pista generada.
Contenido vocal opcional para la pista. Déjalo en blanco o usa [inst] / [instrumental] para crear una pieza instrumental; usa los marcadores [Verse], [Chorus] y [Bridge] para estructurar la canción.
Duración del audio, en segundos.
Idle
The rate is $0.0004 per second.

Introducción a Ace Step 1.5

Ace Step 1.5 de ACE Studio convierte etiquetas de estilo y letras estructuradas opcionales en canciones completas de hasta 4 minutos por $0.0004 por segundo. Admite más de 50 idiomas y ofrece voces coherentes con alta fidelidad acústica. La generación controlada por etiquetas y prompts sustituye sesiones manuales de composición, contratación de cantantes y producción multipista, y acelera la ideación musical para equipos de medios, estudios de videojuegos, creadores de contenido y equipos publicitarios. Los desarrolladores pueden usar Ace Step 1.5 en RunComfy desde el navegador o mediante una API HTTP, sin alojar ni escalar el modelo.
Ideal para: prototipos de maquetas musicales | Música para cine y videojuegos | Música para anuncios breves

ACE Studio / Ace Step 1.5#


Ace Step 1.5 es un modelo de generación de texto a música que convierte etiquetas de estilo separadas por comas y letras estructuradas opcionales en canciones completas con voces, instrumentación y fraseo sincronizado de la letra. Admite más de 50 idiomas, se ejecuta de manera eficiente y está diseñado para una iteración rápida con duraciones desde unos pocos segundos hasta 4 minutos (240 segundos).


Formato de salida: Solo audio / duración 5–240 segundos / estéreo / frecuencia de muestreo definida por el proveedor.


Parámetros#


ParámetroRequeridoTipoPor defectoRango / OpcionesDescripción
tags*Sí (*)string—Texto libreLista de etiquetas de género, ambiente e instrumentos separadas por comas.
lyricsNostring—Texto libre o [inst] / [instrumental]Contenido vocal; utilice marcadores de sección como [Verse], [Chorus], [Bridge] para estructurar la canción.
durationNointeger605 – 240Duración del audio en segundos.
seedNointeger-1-1 – 2147483647Semilla aleatoria para obtener resultados reproducibles; -1 aleatoriza.

Precios#


Ace Step 1.5 en RunComfy utiliza facturación basada en tiempo para el audio generado.


Unidad de facturaciónTarifa
Por segundo de audio generado$0.0004

Ejemplos de costes estimados


DuraciónCoste aprox.
30 s~$0.012
60 s (predeterminado)~$0.024
120 s~$0.048
240 s (4 mín.)~$0.096

Cómo utilizar#


1) Abra el modelo Ace Step 1.5 en RunComfy y abra el panel de generación.

2) Introduzca etiquetas de estilo como "lofi, hiphop, chill, mellow piano" para definir el género, el estado de ánimo y la instrumentación.

3) Añada una letra si lo desea; mantenga las secciones [Verse], [Chorus] y [Bridge] claramente separadas o use [inst] para un instrumental.

4) Establezca la duración en segundos (5–240); empiece con un clip breve para probar la dirección antes de comprometerse con un renderizado completo de 4 minutos.

5) Fije la semilla cuando desee comparar el impacto de los cambios de etiquetas o letras, o déjela en -1 para variar.

6) Ejecute la generación, obtenga una vista previa del resultado y descargue el archivo de audio de su historial de trabajo.

7) Para uso de API, envíe los mismos campos al endpoint de Ace Step 1.5 en RunComfy; no se requiere autohospedaje.

8) Guarde semillas prometedoras y combinaciones de etiquetas como ajustes preestablecidos para mantener la dirección sonora constante en todo el proyecto.

Modelos relacionados

hailuo-02/image-to-video

Convierte tus imágenes en videos HD con movimientos realistas y rápidos

kling-2-6/pro/text-to-video

Convierte un prompt en un vídeo corto con duración, formato y generación de audio configurables.

happyhorse-1.1/text-to-video

Modelo de video con IA multimodal y audio nativo para generación desde texto, imágenes y referencias.

ltx-2/pro/image-to-video

Anime una imagen de origen obligatoria mediante un prompt. Elija 6, 8 o 10 segundos, de 1080p a 2160p, 25 o 50 FPS, formato 16:9 fijo y audio generado opcional.

seedance-2.0/fast

Genera clips cinematográficos con mayor rapidez mediante referencias multimodales, sincronización labial y control de cámara.

hailuo-02/pro/image-to-video

Anima una imagen inicial con Hailuo 02 Pro mediante un prompt para crear un vídeo de seis segundos.

Preguntas Frecuentes

¿Qué es Ace Step 1.5 y qué hace en un flujo de trabajo de texto a audio?

Ace Step 1.5 es un modelo de conversión de texto a música de acestep-ai que convierte etiquetas de estilo y letras estructuradas opcionales en pistas de audio completas con melodía, ritmo y voz. En un flujo de trabajo de texto a audio en RunComfy, usted describe el género, el estado de ánimo y la estructura de la canción, y Ace Step 1.5 genera una pieza musical coherente con fraseo sincronizado de la letra. Está diseñado para creadores que desean una generación de música rápida y ágil sin composición manual.

¿Para qué tipo de tareas de generación es más adecuado Ace Step 1.5?

Ace Step 1.5 es más adecuado para tareas de conversión de texto a audio, como música de fondo para vídeos, demostraciones de canciones cortas, bucles ambientales, jingles publicitarios y pistas de referencia para escenas de juegos. Maneja bien el estilo basado en etiquetas, por lo que puede controlar el género, la instrumentación y la energía con unos pocos descriptores. La generación de letras y voces también hace que Ace Step 1.5 sea útil para escribir borradores y crear prototipos creativos.

¿Cómo se compara Ace Step 1.5 con Ace Step original y otros modelos musicales?

En comparación con Ace Step original, la versión 1.5 mantiene el mismo control basado en etiquetas y la duración máxima de 4 minutos al mismo tiempo que amplía el soporte de letras multilingües a más de 50 idiomas y refina el manejo de letras estructuradas. En comparación con los sistemas exclusivamente instrumentales, Ace Step 1.5 produce de forma nativa voces, instrumentación y fraseo sincronizado en una sola pasada. La reproducibilidad mediante el parámetro seed ayuda a los desarrolladores a iterar consistentemente en una dirección elegida.

¿Qué equipos y casos de uso se benefician más de Ace Step 1.5 en producción?

Los diseñadores, artistas técnicos, creadores de vídeo y equipos de producto pueden usar Ace Step 1.5 para avances, contenido social, prototipos de audio de juegos, vídeos de comercio electrónico y creatividades publicitarias. Los desarrolladores pueden integrarlo en flujos que necesitan bandas sonoras bajo demanda vinculadas a metadatos de escena o briefings de campaña. Debido a que Ace Step 1.5 admite voces e instrumentos en muchos idiomas, cubre una amplia gama de necesidades de audio desde una única interfaz.

¿Qué límites de entrada y salida debo conocer antes de usar Ace Step 1.5?

Ace Step 1.5 admite una duración flexible, ajustable desde 5 segundos hasta 240 segundos (4 minutos) por generación, con un único campo tags requerido y lyrics estructurado opcional. Otras restricciones, como los formatos de audio admitidos y las combinaciones de etiquetas, dependen de la configuración actual del proveedor, así que consulte el panel de parámetros RunComfy para conocer los límites exactos antes de diseñar el flujo de trabajo. Los límites pueden variar según el modo o la configuración del proveedor.

¿Cómo paso de probar Ace Step 1.5 en la interfaz de usuario del modelo a usarlo en producción a través de la API de RunComfy?

Puede crear un prototipo de Ace Step 1.5 en la interfaz web de RunComfy AI Playground ajustando las etiquetas de estilo, las letras, la duración y la semilla hasta que la salida de texto a audio coincida con su objetivo. Una vez que la configuración sea estable, llame al mismo modelo Ace Step 1.5 a través de la API de RunComfy con parámetros idénticos para automatizar la generación desde su backend o flujo de contenido. Esto mantiene la iteración creativa en el navegador y la producción se ejecuta en código, sin cambiar el comportamiento del modelo subyacente.

¿Cómo se manejan los precios al generar audio con Ace Step 1.5 en RunComfy?

Las generaciones Ace Step 1.5 consumen créditos USD de su saldo RunComfy y, según la información disponible del proveedor, el modelo se factura por segundo en $0.0004. Los nuevos usuarios normalmente obtienen créditos USD de prueba gratuitos para experimentar, después de lo cual el uso sigue las tarifas de generación que se muestran en la página del modelo. Para conocer las tarifas más actuales y las diferencias específicas del modo, consulte la sección Generación de la página Ace Step 1.5 en RunComfy.

Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • PixVerse V6
  • PixVerse V6 Text To Video
  • PixVerse C1
  • Wan 2.6 Flash
  • Wan 2.5
  • Wan 3.0
  • Ver todos los modelos →
Modelos de Imagen
  • Qwen Image 2.1
  • Qwen Image 2.1 T2I
  • Wan 2.6 Image to Image
  • Seedream 5.0 Pro
  • Nano Banana Pro
  • Flux 2 Pro
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.