logo
RunComfy
  • ComfyUI
  • TrainerNeu
  • Modelle
  • API
  • Preise
discord logo
MODELLE
Erkunden
Alle Modelle
BIBLIOTHEK
Generierungen
MODELL-APIS
API-Dokumentation
API-Schlüssel
KONTO
Nutzung

Ace Step 1.5: Text-to-Music mit Gesang, Lyrics und Stil-Tag-Steuerung über Models und API | RunComfy

acestep-ai/ace-step-1.5/text-to-audio

Erzeuge aus Stil-Tags und optionalen Lyrics bis zu 4 Minuten lange Songs mit eigenständigem Gesang und hoher Klangtreue – über RunComfy Models und die HTTP-API.

Durch Kommas getrennte Liste von Genre-, Stimmungs- und Instrumenten-Tags zur Steuerung des Stils des generierten Tracks.
Optionaler Gesangstext für den Track. Für eine Instrumentalversion leer lassen oder [inst] / [instrumental] verwenden; mit [Verse], [Chorus] und [Bridge] lässt sich der Song gliedern.
Audiolänge in Sekunden.
Idle
The rate is $0.0003 per second.

Einführung in Ace Step 1.5

Ace Step 1.5 von ACE Studio verwandelt Stil-Tags und optionale strukturierte Lyrics für $0.0003 pro Sekunde in vollständige Songs von bis zu 4 Minuten Länge. Das Modell unterstützt mehr als 50 Sprachen und liefert stimmigen Gesang mit hoher Klangtreue. Statt manueller Kompositionssessions, Sängerbuchungen und Mehrspurproduktion beschleunigt die tag- und promptgesteuerte Erzeugung die musikalische Ideenfindung für Medienteams, Spielestudios, Content-Creator und Werbeproduktionen. Entwickler können Ace Step 1.5 auf RunComfy im Browser oder über eine HTTP-API nutzen, ohne das Modell selbst hosten oder skalieren zu müssen.
Ideal für: Prototypen von Musikdemos | Film- und Spielemusik | Kurze Werbemusik

ACE Studio / Ace Step 1.5#


Ace Step 1.5 ist ein Text-to-Music-Generierungsmodell, das durch Kommas getrennte Stil-Tags und optionale strukturierte Lyrics in vollständige Songs mit Gesang, Instrumentierung und synchronisierter Lyrics-Phrasierung umwandelt. Es unterstützt mehr als 50 Sprachen, läuft effizient und ist für schnelle Iterationen mit einer Dauer von wenigen Sekunden bis zu 4 Minuten (240 Sekunden) ausgelegt.


Ausgabeformat: Nur Audio / Dauer 5–240 Sekunden / Stereo / vom Anbieter definierte Abtastrate.


Parameter#


ParameterErforderlichTypStandardBereich / OptionenBeschreibung
tags*Ja (*)string—FreitextDurch Kommas getrennte Liste von Genre-, Stimmungs- und Instrumenten-Tags.
lyricsNeinstring—Freitext oder [inst] / [instrumental]Gesangsinhalt; verwenden Sie Abschnittsmarkierungen wie [Verse], [Chorus], [Bridge], um den Song zu strukturieren.
durationNeininteger605 – 240Audiolänge in Sekunden.
seedNeininteger-1-1 – 2147483647Zufalls-Seed zur Reproduzierbarkeit; -1 randomisiert.

Preise#


Ace Step 1.5 auf RunComfy verwendet eine zeitbasierte Abrechnung für generiertes Audio.


AbrechnungseinheitTarif
Pro Sekunde generierter Audiodaten$0.0003

Beispiele für geschätzte Kosten


DauerCa. Kosten
30 s~$0.009
60 s (Standard)~$0.018
120 s~$0.036
240 s (4 min)~$0.072

Verwendung#


1) Öffnen Sie das Ace Step 1.5-Modell in RunComfy und zeigen Sie das Generierungsfenster an.

2) Geben Sie Stil-Tags wie "lofi, hiphop, chill, mellow piano" ein, um Genre, Stimmung und Instrumentierung zu definieren.

3) Fügen Sie optional Lyrics hinzu; halten Sie die Abschnitte [Verse], [Chorus] und [Bridge] klar getrennt oder verwenden Sie [inst] für ein Instrumental.

4) Stellen Sie die Dauer in Sekunden ein (5–240); beginnen Sie mit einem kurzen Entwurf, um die Richtung zu testen, bevor Sie einen vollständigen 4-Minuten-Track rendern.

5) Sperren Sie den Seed, wenn Sie die Auswirkungen von Tag- oder Textänderungen vergleichen möchten, oder belassen Sie ihn zur Abwechslung bei -1.

6) Führen Sie die Generierung aus, zeigen Sie eine Vorschau des Ergebnisses an und laden Sie die Audiodatei aus Ihrem Auftragsverlauf herunter.

7) Senden Sie für die API-Nutzung dieselben Felder an den Endpunkt Ace Step 1.5 auf RunComfy. Es ist kein Selbsthosting erforderlich.

8) Speichern Sie vielversprechende Seed- und Tag-Kombinationen als Voreinstellungen, um Ihre Klangrichtung im gesamten Projekt konsistent zu halten.

Verwandte Modelle

minimax-h3-open/image-to-video

Offenes Bild-zu-Video mit optionalem letztem Bild und nativem Stereo-Audio.

flux-3/text-to-video/draft

FLUX 3 Draft: Schnelle, kostengünstige Text-zu-Video-Vorschau mit 720p

kling-2-1/pro/image-to-video

Animieren Sie ein erforderliches Startbild mit einem erforderlichen Prompt mithilfe von Kling 2.1 Pro, mit optionalem Endbild, Dauer, Seitenverhältnis, Negativ-Prompt und Prompt-Stärke.

flux-3/text-to-video

FLUX 3 Video verwandelt Textansagen in filmische Clips mit nativem Audio

kling-video-o3/pro/text-to-video

Cineastische Text-zu-Video-Generierung in Pro-Qualität für 0,112 $ pro Sekunde Ausgabe.

hunyuan-video-v1.5/image-to-video

Animieren Sie ein Ausgangsbild per Prompt zu einem 5- oder 8-sekündigen Video in 480p oder 720p.

Häufig gestellte Fragen

Was ist Ace Step 1.5 und was bewirkt es in einem Text-zu-Audio-Workflow?

Ace Step 1.5 ist ein Text-to-Music-Modell von acestep-ai, das Style-Tags und optionale strukturierte Lyrics in vollständige Audiospuren mit Melodie, Rhythmus und Gesang umwandelt. In einem Text-zu-Audio-Workflow auf RunComfy beschreiben Sie das Genre, die Stimmung und die Songstruktur, und Ace Step 1.5 generiert ein zusammenhängendes Musikstück mit synchronisierter Lyrics-Phrasierung. Es ist für Künstler konzipiert, die eine schnelle, promptgesteuerte Musikgenerierung ohne manuelle Komposition wünschen.

Für welche Arten von Generierungsaufgaben ist Ace Step 1.5 am besten geeignet?

Ace Step 1.5 eignet sich am besten für Text-zu-Audio-Aufgaben wie Hintergrundmusik für Videos, kurze Songdemos, Ambient-Loops, Werbe-Jingles und Referenztracks für Spielszenen. Es beherrscht Tag-basiertes Styling gut, sodass Sie Genre, Instrumentierung und Energie mit ein paar Deskriptoren steuern können. Dank der Text- und Gesangsgenerierung eignet sich Ace Step 1.5 auch für Songwriting-Entwürfe und kreatives Prototyping.

Wie schneidet Ace Step 1.5 im Vergleich zum ursprünglichen Ace Step und anderen Musikmodellen ab?

Im Vergleich zum ursprünglichen Ace Step behält die Version 1.5 die gleiche Tag-gesteuerte Steuerung und die maximale Dauer von 4 Minuten bei, erweitert jedoch die mehrsprachige Textunterstützung auf mehr als 50 Sprachen und verfeinert die strukturierte Textverarbeitung. Im Vergleich zu reinen Instrumentalsystemen erzeugt Ace Step 1.5 nativ Gesang, Instrumentierung und synchronisierte Phrasierung in einem einzigen Durchgang. Die Reproduzierbarkeit durch einen Seed-Parameter hilft Entwicklern, konsistent in einer gewählten Richtung zu iterieren.

Welche Teams und Anwendungsfälle profitieren am meisten von Ace Step 1.5 in der Produktion?

Designer, technische Künstler, Videokünstler und Produktteams können Ace Step 1.5 für Trailer, soziale Inhalte, Audio-Prototypen von Spielen, E-Commerce-Videos und Werbemittel verwenden. Entwickler können es in Pipelines einbinden, die On-Demand-Soundtracks benötigen, die mit Szenenmetadaten oder Kampagnenbeschreibungen verknüpft sind. Da Ace Step 1.5 sowohl Gesang als auch Instrumentalstücke in vielen Sprachen unterstützt, deckt es ein breites Spektrum an Audioanforderungen über eine einzige Schnittstelle ab.

Welche Ein- und Ausgabegrenzen sollte ich kennen, bevor ich Ace Step 1.5 verwende?

Ace Step 1.5 unterstützt eine flexible Dauer, einstellbar von 5 Sekunden bis zu 240 Sekunden (4 Minuten) pro Generation, mit einem einzigen erforderlichen tags-Feld und optionalem strukturiertem lyrics. Andere Einschränkungen wie unterstützte Audioformate und Tag-Kombinationen hängen von der aktuellen Anbieterkonfiguration ab. Überprüfen Sie daher das RunComfy-Parameterfeld auf genaue Grenzwerte, bevor Sie darauf aufbauen. Die Grenzwerte können je nach Modus oder Anbietereinstellungen variieren.

Wie komme ich vom Testen von Ace Step 1.5 in der Modell-Benutzeroberfläche zur Verwendung in der Produktion über die RunComfy-API?

Sie können einen Prototyp von Ace Step 1.5 im RunComfy AI Playground erstellen, indem Sie Stil-Tags, Texte, Dauer und Seed anpassen, bis die Text-zu-Audio-Ausgabe Ihrem Ziel entspricht. Sobald die Konfiguration stabil ist, rufen Sie dasselbe Ace Step 1.5-Modell über die RunComfy-API mit identischen Parametern auf, um die Generierung aus Ihrem Backend oder Ihrer Content-Pipeline zu automatisieren. Dadurch bleiben die kreative Iteration im Browser und die Produktionsläufe im Code erhalten, ohne das zugrunde liegende Modellverhalten zu ändern.

Wie erfolgt die Preisgestaltung bei der Audiogenerierung mit Ace Step 1.5 auf RunComfy?

Ace Step 1.5-Generationen verbrauchen USD-Credits von Ihrem RunComfy-Guthaben, und basierend auf den verfügbaren Anbieterinformationen wird das Modell pro Sekunde bei $0.0003 abgerechnet. Neue Benutzer erhalten in der Regel kostenlose USD-Test-Credits. Anschließend folgt die Nutzung den auf der Modellseite angezeigten Generierungsregeln. Die aktuellsten Tarife und alle modusspezifischen Unterschiede finden Sie im Abschnitt „Generierung“ der Ace Step 1.5-Seite auf RunComfy.

Folge uns
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • E-Mail
  • Systemstatus
  • Partner
Videomodelle
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Alle Modelle anzeigen →
Bildmodelle
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Alle Modelle anzeigen →
Rechtliches
  • Nutzungsbedingungen
  • Datenschutzrichtlinie
  • Cookie-Richtlinie
RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.