logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

Ace Step 1.5: Text-to-Music con voces, letras y control mediante etiquetas en Models y API | RunComfy

acestep-ai/ace-step-1.5/text-to-audio

Genera canciones de hasta 4 minutos a partir de etiquetas de estilo y letras opcionales, con voces originales y alta fidelidad acústica, desde RunComfy Models y la API HTTP.

Lista de etiquetas de género, ambiente e instrumentos separadas por comas para definir el estilo de la pista generada.
Contenido vocal opcional para la pista. Déjalo en blanco o usa [inst] / [instrumental] para crear una pieza instrumental; usa los marcadores [Verse], [Chorus] y [Bridge] para estructurar la canción.
Duración del audio, en segundos.
Idle
The rate is $0.0003 per second.

Introducción a Ace Step 1.5

Ace Step 1.5 de ACE Studio convierte etiquetas de estilo y letras estructuradas opcionales en canciones completas de hasta 4 minutos por $0.0003 por segundo. Admite más de 50 idiomas y ofrece voces coherentes con alta fidelidad acústica. La generación controlada por etiquetas y prompts sustituye sesiones manuales de composición, contratación de cantantes y producción multipista, y acelera la ideación musical para equipos de medios, estudios de videojuegos, creadores de contenido y equipos publicitarios. Los desarrolladores pueden usar Ace Step 1.5 en RunComfy desde el navegador o mediante una API HTTP, sin alojar ni escalar el modelo.
Ideal para: prototipos de maquetas musicales | Música para cine y videojuegos | Música para anuncios breves

ACE Studio / Ace Step 1.5#


Ace Step 1.5 es un modelo de generación de texto a música que convierte etiquetas de estilo separadas por comas y letras estructuradas opcionales en canciones completas con voces, instrumentación y fraseo sincronizado de la letra. Admite más de 50 idiomas, se ejecuta de manera eficiente y está diseñado para una iteración rápida con duraciones desde unos pocos segundos hasta 4 minutos (240 segundos).


Formato de salida: Solo audio / duración 5–240 segundos / estéreo / frecuencia de muestreo definida por el proveedor.


Parámetros#


ParámetroRequeridoTipoPor defectoRango / OpcionesDescripción
tags*Sí (*)string—Texto libreLista de etiquetas de género, ambiente e instrumentos separadas por comas.
lyricsNostring—Texto libre o [inst] / [instrumental]Contenido vocal; utilice marcadores de sección como [Verse], [Chorus], [Bridge] para estructurar la canción.
durationNointeger605 – 240Duración del audio en segundos.
seedNointeger-1-1 – 2147483647Semilla aleatoria para obtener resultados reproducibles; -1 aleatoriza.

Precios#


Ace Step 1.5 en RunComfy utiliza facturación basada en tiempo para el audio generado.


Unidad de facturaciónTarifa
Por segundo de audio generado$0.0003

Ejemplos de costes estimados


DuraciónCoste aprox.
30 s~$0.009
60 s (predeterminado)~$0.018
120 s~$0.036
240 s (4 mín.)~$0.072

Cómo utilizar#


1) Abra el modelo Ace Step 1.5 en RunComfy y abra el panel de generación.

2) Introduzca etiquetas de estilo como "lofi, hiphop, chill, mellow piano" para definir el género, el estado de ánimo y la instrumentación.

3) Añada una letra si lo desea; mantenga las secciones [Verse], [Chorus] y [Bridge] claramente separadas o use [inst] para un instrumental.

4) Establezca la duración en segundos (5–240); empiece con un clip breve para probar la dirección antes de comprometerse con un renderizado completo de 4 minutos.

5) Fije la semilla cuando desee comparar el impacto de los cambios de etiquetas o letras, o déjela en -1 para variar.

6) Ejecute la generación, obtenga una vista previa del resultado y descargue el archivo de audio de su historial de trabajo.

7) Para uso de API, envíe los mismos campos al endpoint de Ace Step 1.5 en RunComfy; no se requiere autohospedaje.

8) Guarde semillas prometedoras y combinaciones de etiquetas como ajustes preestablecidos para mantener la dirección sonora constante en todo el proyecto.

Modelos relacionados

kling-3.0/standard/text-to-video

Crea películas de múltiples escenas con diálogos sincronizados y personajes consistentes. Use Kling 3.0 on RunComfy.

minimax-h3/image-to-video

Anima una imagen del primer fotograma a un vídeo de 768p o 2K durante hasta 15 segundos

wan-2.7/image-to-video

Convierte imágenes estáticas en clips fluidos con control de audio.

kling-1-6/pro/text-to-video

Genere un video de 5 o 10 segundos a partir de un prompt obligatorio. Elija `16:9`, `9:16` o `1:1`, agregue un prompt negativo opcional y ajuste la intensidad del prompt.

kling-1-6/pro/image-to-video

Transforma imágenes en videos realistas con movimiento fluido y gran calidad.

wan-2-2/fun-control

Redefine el estilo cuadro a cuadro y mantiene coherencia visual en tus videos.

Preguntas Frecuentes

¿Qué es Ace Step 1.5 y qué hace en un flujo de trabajo de texto a audio?

Ace Step 1.5 es un modelo de conversión de texto a música de acestep-ai que convierte etiquetas de estilo y letras estructuradas opcionales en pistas de audio completas con melodía, ritmo y voz. En un flujo de trabajo de texto a audio en RunComfy, usted describe el género, el estado de ánimo y la estructura de la canción, y Ace Step 1.5 genera una pieza musical coherente con fraseo sincronizado de la letra. Está diseñado para creadores que desean una generación de música rápida y ágil sin composición manual.

¿Para qué tipo de tareas de generación es más adecuado Ace Step 1.5?

Ace Step 1.5 es más adecuado para tareas de conversión de texto a audio, como música de fondo para vídeos, demostraciones de canciones cortas, bucles ambientales, jingles publicitarios y pistas de referencia para escenas de juegos. Maneja bien el estilo basado en etiquetas, por lo que puede controlar el género, la instrumentación y la energía con unos pocos descriptores. La generación de letras y voces también hace que Ace Step 1.5 sea útil para escribir borradores y crear prototipos creativos.

¿Cómo se compara Ace Step 1.5 con Ace Step original y otros modelos musicales?

En comparación con Ace Step original, la versión 1.5 mantiene el mismo control basado en etiquetas y la duración máxima de 4 minutos al mismo tiempo que amplía el soporte de letras multilingües a más de 50 idiomas y refina el manejo de letras estructuradas. En comparación con los sistemas exclusivamente instrumentales, Ace Step 1.5 produce de forma nativa voces, instrumentación y fraseo sincronizado en una sola pasada. La reproducibilidad mediante el parámetro seed ayuda a los desarrolladores a iterar consistentemente en una dirección elegida.

¿Qué equipos y casos de uso se benefician más de Ace Step 1.5 en producción?

Los diseñadores, artistas técnicos, creadores de vídeo y equipos de producto pueden usar Ace Step 1.5 para avances, contenido social, prototipos de audio de juegos, vídeos de comercio electrónico y creatividades publicitarias. Los desarrolladores pueden integrarlo en flujos que necesitan bandas sonoras bajo demanda vinculadas a metadatos de escena o briefings de campaña. Debido a que Ace Step 1.5 admite voces e instrumentos en muchos idiomas, cubre una amplia gama de necesidades de audio desde una única interfaz.

¿Qué límites de entrada y salida debo conocer antes de usar Ace Step 1.5?

Ace Step 1.5 admite una duración flexible, ajustable desde 5 segundos hasta 240 segundos (4 minutos) por generación, con un único campo tags requerido y lyrics estructurado opcional. Otras restricciones, como los formatos de audio admitidos y las combinaciones de etiquetas, dependen de la configuración actual del proveedor, así que consulte el panel de parámetros RunComfy para conocer los límites exactos antes de diseñar el flujo de trabajo. Los límites pueden variar según el modo o la configuración del proveedor.

¿Cómo paso de probar Ace Step 1.5 en la interfaz de usuario del modelo a usarlo en producción a través de la API de RunComfy?

Puede crear un prototipo de Ace Step 1.5 en la interfaz web de RunComfy AI Playground ajustando las etiquetas de estilo, las letras, la duración y la semilla hasta que la salida de texto a audio coincida con su objetivo. Una vez que la configuración sea estable, llame al mismo modelo Ace Step 1.5 a través de la API de RunComfy con parámetros idénticos para automatizar la generación desde su backend o flujo de contenido. Esto mantiene la iteración creativa en el navegador y la producción se ejecuta en código, sin cambiar el comportamiento del modelo subyacente.

¿Cómo se manejan los precios al generar audio con Ace Step 1.5 en RunComfy?

Las generaciones Ace Step 1.5 consumen créditos USD de su saldo RunComfy y, según la información disponible del proveedor, el modelo se factura por segundo en $0.0003. Los nuevos usuarios normalmente obtienen créditos USD de prueba gratuitos para experimentar, después de lo cual el uso sigue las tarifas de generación que se muestran en la página del modelo. Para conocer las tarifas más actuales y las diferencias específicas del modo, consulte la sección Generación de la página Ace Step 1.5 en RunComfy.

Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Ver todos los modelos →
Modelos de Imagen
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.