logo
RunComfy
  • ComfyUI
  • TrainerNeu
  • Modelle
  • API
  • Preise
discord logo
MODELLE
Erkunden
Alle Modelle
BIBLIOTHEK
Generierungen
MODELL-APIS
API-Dokumentation
API-Schlüssel
KONTO
Nutzung

Ace Step: Text-to-Music mit Gesang, Lyrics und Stil-Tag-Steuerung über Models und API | RunComfy

acestep-ai/ace-step/text-to-audio

Erzeuge aus Stil-Tags und optionalen Lyrics bis zu 4 Minuten lange Songs mit eigenständigem Gesang und hoher Klangtreue – über RunComfy Models und die HTTP-API.

Durch Kommas getrennte Liste von Genre-, Stimmungs- und Instrumenten-Tags zur Steuerung des Stils des generierten Tracks.
Optionaler Gesangstext für den Track. Leer lassen, damit die KI Lyrics erzeugt, oder [inst] / [instrumental] für eine Instrumentalversion verwenden.
Audiolänge in Sekunden.
Idle
The rate is $0.0002 per second.

Einführung in Ace Step

Ace Step von ACE Studio verwandelt Stil-Tags und optionale Lyrics für $0.0002 pro Sekunde in vollständige Songs von bis zu 4 Minuten Länge – mit stimmigem Gesang, Instrumentierung und hoher Klangtreue. Statt manueller Kompositionssessions, Sängerbuchungen und Mehrspurproduktion beschleunigt die tag- und promptgesteuerte Erzeugung mit Ace Step die musikalische Ideenfindung für Medienteams, Spielestudios, Content-Creator und Werbeproduktionen. Entwickler können Ace Step auf RunComfy im Browser oder über eine HTTP-API nutzen, ohne das Modell selbst hosten oder skalieren zu müssen.
Ideal für: Prototypen von Musikdemos | Film- und Spielemusik | Kurze Werbemusik

ACE Studio / Ace Step#


Ace Step ist ein Text-to-Music-Generierungsmodell, das durch Kommas getrennte Stil-Tags und optionale Lyrics in vollständige Songs mit Gesang, Instrumentierung und synchronisierten Lyrics umwandelt. Das Modell ist für schnelle Iterationen ausgelegt und unterstützt Dauern von einigen Sekunden bis zu 4 Minuten (240 Sekunden).


Ausgabeformat: Nur Audio / Dauer 5–240 Sekunden / Stereo / vom Anbieter definierte Abtastrate.


Highlights#


  • Taggesteuerte Text-to-Music-Generierung: Komponieren Sie Titel, indem Sie Genres, Stimmungen und Instrumente auflisten, anstatt detaillierte Absätze zu schreiben.
  • Gesangs- und Textgenerierung: Ace Step kann eigene Texte schreiben oder vom Benutzer bereitgestellte Texte mit synchronisierten Gesangslinien singen.
  • Hohe akustische Wiedergabetreue: Behält dynamische Balance, räumliche Qualität und Instrumentenklarheit über den gesamten 4-Minutenbereich bei.
  • Flexible Dauer: Einstellbar von kurzen Loops bis hin zu 240-Sekunden-Tracks für vollständige Musikstücke.
  • Reproduzierbarkeit: Legen Sie einen festen Seed fest, um bei der Iteration von Tags oder Liedtexten exakte Ergebnisse wiederherzustellen.
  • API- und Browserparität: Dieselben Parameter funktionieren in der Benutzeroberfläche des RunComfy-Modells und über eine HTTP-API.

Parameter#


ParameterErforderlichTypStandardBereich / OptionenBeschreibung
tags*Ja (*)string—FreitextDurch Kommas getrennte Liste von Genre-, Stimmungs- und Instrumenten-Tags.
lyricsNeinstring—Freitext oder [inst] / [instrumental]Gesangsinhalt; lassen Sie das Feld für KI-generierte Liedtexte leer und verwenden Sie [inst] für Instrumentalstücke.
durationNeininteger605 – 240Audiolänge in Sekunden.
seedNeininteger-1-1 – 2147483647Zufalls-Seed zur Reproduzierbarkeit; -1 randomisiert.

Preise#


Ace Step auf RunComfy verwendet eine zeitbasierte Abrechnung für generiertes Audio.


AbrechnungseinheitTarif
Pro Sekunde generierter Audiodaten$0.0002

Beispiele für geschätzte Kosten


DauerCa. Kosten
30 s~$0.006
60 s (Standard)~$0.012
120 s~$0.024
240 s (4 min)~$0.048

Verwendung#


1) Öffnen Sie das Modell Ace Step in RunComfy und zeigen Sie das Generierungsfenster an.

2) Geben Sie Stil-Tags wie "lofi, hiphop, chill, mellow piano" ein, um Genre, Stimmung und Instrumentierung zu definieren.

3) Fügen Sie optional Lyrics hinzu; halten Sie Vers- und Refrainabschnitte klar getrennt oder verwenden Sie [inst] für ein Instrumental.

4) Stellen Sie die Dauer in Sekunden ein (5–240); beginnen Sie mit einem kurzen Entwurf, um die Richtung zu testen, bevor Sie einen vollständigen 4-Minuten-Track rendern.

5) Sperren Sie den Seed, wenn Sie die Auswirkungen von Tag- oder Textänderungen vergleichen möchten, oder belassen Sie ihn zur Abwechslung bei -1.

6) Führen Sie die Generierung aus, zeigen Sie eine Vorschau des Ergebnisses an und laden Sie die Audiodatei aus Ihrem Auftragsverlauf herunter.

7) Senden Sie für die API-Nutzung dieselben Felder an den Endpunkt Ace Step auf RunComfy. Es ist kein Selbsthosting erforderlich.

8) Speichern Sie vielversprechende Seed- und Tag-Kombinationen als Voreinstellungen, um Ihre Klangrichtung im gesamten Projekt konsistent zu halten.


Prompts und Referenztipps#


  • Verwenden Sie mehrere komplementäre Tags (z. B. "trap, dark, 808, brass"), um Genre, Instrumentierung und Energie in einem Durchgang festzulegen.
  • Kombinieren Sie kontrastierende Tags sorgfältig (z. B. "chill, trap"), um einzigartige Mischungen zu finden, ohne das Arrangement unklar werden zu lassen.
  • Stellen Sie strukturierte Liedtexte mit klaren [Verse]- und [Chorus]-Markierungen und konsistenten Silbenzahlen für eine klarere Stimmphrasierung bereit.
  • Beginnen Sie mit 30–45s-Entwürfen, um die Richtung zu überprüfen, bevor Sie längere 120–240s-Renderings anfordern.
  • Fixieren Sie den Seed beim Iterieren. Ändern Sie nur Tags oder Liedtexte, damit Sie Ihren Änderungen Unterschiede zuordnen können.
  • Vermeiden Sie widersprüchliche Hinweise wie "low-fi yet ultra-hi-fi" – wählen Sie in Ace Step eine dominante Ästhetik pro Titel.
  • Geben Sie für Instrumentalstücke [inst] oder [instrumental] im Textfeld ein, anstatt es leer zu lassen.
  • Wenn die Dauer beschleunigt oder gepolstert klingt, passen Sie das Feld „Dauer“ an, anstatt den Liedtext zu stark einzuschränken.

Vergleich zwischen Ace Step und anderen Modellen#


  • Basierend auf öffentlich zugänglichen Informationen konzentriert sich Ace Step auf Tag-gesteuerte Steuerung und Liedlängen von 4 Minuten, während einige Suno-family-Modelle auf Freiform-Prompts mit kürzeren Standardtiteln basieren.
  • Im Vergleich zu reinen Instrumentalsystemen wie MusicGen generiert Ace Step neben der Instrumentierung nativ Gesang und Texte in einem einzigen Durchgang.
  • Idealer Anwendungsfall: Wählen Sie Ace Step, wenn Sie vollständige Songs mit Gesang, Genresteuerung auf Tag-Ebene und reproduzierbare Seeds für die Iteration benötigen.

Verwandte Modelle

seedance-1.0/text-to-video

Erzeugen Sie mit Seedance 1.0 ein Video aus einem Prompt und wählen Sie Auflösung, Seitenverhältnis und Dauer.

flux-3/keyframes-to-video

Erzeugen Sie Videos aus Multi-Keyframe-Standbildern mit optionalem Audio

kling-video-o3/4K/text-to-video

Cineastische 4K-Text-zu-Video-Generierung für 0,42 $ pro Sekunde Ausgabe.

wan-3.0/reference-to-video

Wan 3.0 Reference To Video erstellt Clips aus Bild-, Video- und Audioreferenzen

kling-video-o3/standard/reference-to-video

Referenzgestützte Videoerzeugung von 3 bis 15 Sekunden für $0.084 pro Sekunde.

wan-2-2/first-last-frame

Erstelle fließende Videos aus zwei Bildern mit realistischer Bewegung

Häufig gestellte Fragen

Was ist Ace Step und welche Funktion hat es in einem Text-to-Sound-Workflow?

Ace Step ist ein Text-to-Music-Modell von acestep-ai, das Stil-Tags und Prompts in vollständige Audiotracks mit Melodie, Rhythmus und Gesang umwandelt. In einem Text-to-Sound-Workflow auf RunComfy beschreiben Sie Genre, Stimmung und Struktur und Ace Step generiert ein zusammenhängendes Musikstück mit synchronisierten Texten. Es ist für Künstler konzipiert, die eine schnelle, promptgesteuerte Musikgenerierung ohne manuelle Komposition wünschen.

Für welche Arten von Generierungsaufgaben ist Ace Step am besten geeignet?

Ace Step eignet sich am besten für Text-to-Sound-Aufgaben wie das Generieren von Hintergrundmusik, kurzen Songdemos, Ambient-Loops, Werbe-Jingles und Referenztracks für Video- oder Spielszenen. Die Steuerung von Stil-Tags gelingt gut, sodass Sie Genre, Tempo und Energie mit ein paar Deskriptoren steuern können. Die Generierung von Gesang und Text macht es auch für Songwriting-Entwürfe und kreatives Prototyping nützlich.

Wie schneidet Ace Step im Vergleich zu anderen Text-to-Sound-Musikmodellen hinsichtlich Qualität und Kontrolle ab?

Im Vergleich zu vielen allgemeinen Audiomodellen liegt der Schwerpunkt des Ace Step auf einer feinkörnigen akustischen Wiedergabetreue mit besonderem Augenmerk auf dynamische Balance, räumliche Qualität und Instrumentenklarheit. Die Style-Tag-Schnittstelle gibt technischen Künstlern und Designern eine direktere Kontrolle über Genre und Energie als reine Freiform-Prompts. Die Reproduzierbarkeit durch einen Seed-Parameter hilft Entwicklern auch dabei, konsistent in einer gewählten Richtung zu iterieren.

Welche Teams und Anwendungsfälle profitieren am meisten von Ace Step in der Produktion?

Designer, technische Künstler, Videokünstler und Produktteams können die Text-to-Sound-Generierung mit Ace Step für Trailer, Social-Media-Inhalte, Audio-Prototypen von Spielen, E-Commerce-Videos und Werbemittel nutzen. Entwickler können es in Pipelines einbinden, die On-Demand-Soundtracks benötigen, die mit Szenenmetadaten oder Kampagnenbeschreibungen verknüpft sind. Da das Modell sowohl Gesang als auch Instrumentalmusik unterstützt, deckt es ein breites Spektrum an Audioanforderungen über eine einzige Schnittstelle ab.

Welche Ein- und Ausgabegrenzen sollte ich kennen, bevor ich Ace Step verwende?

Ace Step unterstützt eine flexible Dauer, die von einigen Sekunden bis zu etwa 4 Minuten (240 Sekunden) pro Generation einstellbar ist. Andere Einschränkungen wie Promptlänge, unterstützte Audioformate und Tag-Kombinationen hängen von der aktuellen Anbieterkonfiguration ab. Überprüfen Sie daher das RunComfy-Parameterfeld auf genaue Grenzwerte, bevor Sie darauf aufbauen. Die Grenzwerte können je nach Modus oder Anbietereinstellungen variieren und das Panel spiegelt immer die Live-Werte für den Text-to-Sound-Endpunkt wider.

Wie komme ich vom Testen von Ace Step im Playground zur Verwendung in der Produktion über die RunComfy-API?

Sie können einen Prototyp von Ace Step im RunComfy AI Playground erstellen, indem Sie Stil-Tags, Prompts, Dauer und Seed anpassen, bis die Text-to-Sound-Ausgabe Ihrem Ziel entspricht. Sobald die Konfiguration stabil ist, rufen Sie dasselbe Ace Step-Modell über die RunComfy-API mit identischen Parametern auf, um die Generierung aus Ihrem Backend oder Ihrer Content-Pipeline zu automatisieren. Dadurch bleiben die kreative Iteration im Browser und die Produktionsläufe im Code erhalten, ohne das zugrunde liegende Modellverhalten zu ändern.

Wie erfolgt die Preisgestaltung bei der Audiogenerierung mit Ace Step auf RunComfy?

Ace Step-Generationen verbrauchen USD-Credits von Ihrem RunComfy-Guthaben, und basierend auf den verfügbaren Anbieterinformationen wird das Modell pro Sekunde bei $0.0002 abgerechnet. Neue Benutzer erhalten in der Regel kostenlose USD-Test-Credits zum Experimentieren. Anschließend folgt die Nutzung den auf der Modellseite angezeigten Generierungsregeln. Die aktuellsten Tarife und alle modusspezifischen Unterschiede finden Sie im Abschnitt „Generierung“ der Ace Step-Seite auf RunComfy.

Kann ich die Text-to-Sound-Ausgaben von Ace Step kommerziell nutzen?

RunComfy bietet Zugriff auf das Ace Step-Modell und den Workflow zum Generieren von Audio. Die kommerziellen Nutzungsrechte für die generierte Musik hängen jedoch von der Lizenz des ursprünglichen Modellautors und -anbieters (acestep-ai) ab. Bevor Sie Titel in kommerziellen Produkten, Anzeigen, Filmen oder Spielen veröffentlichen, lesen Sie die offizielle Ace Step-Lizenz und alle Anbieterbedingungen, um zulässige Anwendungsfälle zu bestätigen. Wenn etwas unklar ist, können Sie sich an hi@runcomfy.com wenden, um Hilfe bei Fragen zur Plattform zu erhalten.

Folge uns
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • E-Mail
  • Systemstatus
  • Partner
Videomodelle
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Alle Modelle anzeigen →
Bildmodelle
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Alle Modelle anzeigen →
Rechtliches
  • Nutzungsbedingungen
  • Datenschutzrichtlinie
  • Cookie-Richtlinie
RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.