logo
RunComfy
  • ComfyUI
  • TrainerNeu
  • Modelle
  • API
  • Preise
discord logo
MODELLE
Erkunden
Alle Modelle
BIBLIOTHEK
Generierungen
MODELL-APIS
API-Dokumentation
API-Schlüssel
KONTO
Nutzung

Seed Audio 1.0: Text-to-Audio mit Stimmen-Presets und Referenzaudio in RunComfy Models und per API | RunComfy

bytedance/seed-audio-1.0/text-to-audio

Seed Audio 1.0 erzeugt natürliche Sprache und andere gesprochene Audioinhalte aus Text, Referenzclips oder einem Bild. Stimmen-Presets, Sprechtempo, Tonhöhe und Ausgabeformat sind im Browser und per API einstellbar.

Text, der vertont werden soll. Verweisen Sie der Reihe nach mit @Audio1, @Audio2 und @Audio3 auf Referenzclips.
Voreingestellte Stimme für die Synthese.
Bis zu 3 Referenzclips, auf die Sie im Prompt mit @Audio1, @Audio2 und @Audio3 verweisen. Pro Clip: höchstens 30s und 10MB; Formate: wav/mp3/pcm/ogg_opus.
Ein einzelnes Referenzbild (jpeg/png/webp, bis 10MB). Nicht mit Audioreferenzen kombinierbar.
Containerformat der Audioausgabe.
Abtastrate des ausgegebenen Audios in Hz.
Sprechtempo. 1.0 entspricht normalem Tempo, 0.5 halbem und 2.0 doppeltem Tempo.
Ausgabelautstärke. 1.0 entspricht der normalen Lautstärke, 0.5 der halben und 2.0 der doppelten Lautstärke.
Verschiebung der Stimmhöhe in Halbtönen. 0 ist neutral, -12 senkt die Stimme um eine Oktave, 12 hebt sie um eine Oktave an.
Idle
The rate is $0.075 per minute.

Einführung in Seed Audio 1.0

Seed Audio 1.0 von Bytedance verwandelt schriftliche Vorgaben in hochwertiges, natürlich klingendes Audio. Die Sprechweise lässt sich per Text, mit bis zu drei Referenzclips oder mit einem einzelnen Bild steuern; der Preis beträgt $0.075 pro Minute. So können Kreativ-, Produkt- und Lokalisierungsteams gesprochene Inhalte ohne Aufnahmesitzung und aufwendige Sprecherplanung erstellen. Das Modell ist auf RunComfy im Browser und per HTTP-API nutzbar; eine eigene Hosting- oder Skalierungsinfrastruktur ist nicht erforderlich.
Ideal für: Voiceovers und Erzählungen | mehrsprachige Lokalisierung | interaktive Audio-Prototypen

Bytedance / Seed Audio 1.0#


Seed Audio 1.0 ist ein text-to-audio-Modell von Bytedance, das schriftliche Vorgaben in klare, natürlich klingende Sprache und andere gesprochene Audioinhalte umwandelt. Die Sprechweise lässt sich auf drei Arten steuern: mit einem einfachen Text-Prompt, mit bis zu drei kurzen Referenzclips oder mit einem einzelnen Referenzbild.


Ausgabeformat: Nur Audio / Formate wav, mp3, pcm, ogg_opus / Abtastrate 8 kHz bis 48 kHz.


Wichtigste Funktionen#


Seed Audio 1.0 ist für eine schnelle, flexible Sprachsynthese mit gezielt steuerbarer Sprechweise ausgelegt.


  • Drei Steuerungsarten: Erzeugen Sie Audio nur aus Text, mit einer voreingestellten Stimme oder anhand eigener Referenzaufnahmen. Alternativ kann ein Referenzbild die gewünschte Sprechweise vorgeben.
  • Geordnete Audioreferenzen: Verweisen Sie im Prompt mit @Audio1, @Audio2 und @Audio3 auf bis zu drei Clips, um Einflüsse zu kombinieren oder eine bestimmte Sprechweise zu übernehmen.
  • Mehrsprachige Stimmen: Voreinstellungen decken Englisch, Chinesisch, Spanisch, Japanisch, Indonesisch und Portugiesisch sowie gemischte Sprachprofile ab.
  • Präzise Sprechsteuerung: Passen Sie Tempo, Lautstärke und Tonhöhe an die gewünschte Wirkung und den Rhythmus Ihres Projekts an.
  • Flexible Ausgabe: Exportieren Sie wav, mp3, pcm oder ogg_opus mit Abtastraten bis 48 kHz für die weitere Bearbeitung.

Parameter#


ParameterErforderlichTypStandardBereich / OptionenBeschreibung
prompt*Ja (*)string—FreitextZu vertonender Text; Referenzclips der Reihe nach mit @Audio1, @Audio2 und @Audio3 angeben.
voiceNeinstringvivi_mixed_en_zh_ja_es_idListe der voreingestellten StimmenFür die Synthese verwendete Stimme.
audio_urlsNeinarray—Bis zu 3 URLsReferenzclips (wav/mp3/pcm/ogg_opus), jeweils höchstens 30s und 10MB.
image_urlNeinstring—jpeg/png/webp, bis 10MBEin Referenzbild; nicht mit Audioreferenzen kombinierbar.
output_formatNeinstringmp3wav, mp3, pcm, ogg_opusContainerformat der Audioausgabe.
sample_rateNeininteger240008000 - 48000Abtastrate der Ausgabe in Hz.
speedNeinnumber10.5 - 2.0Sprechtempo; 1.0 entspricht normalem Tempo.
volumeNeinnumber10.5 - 2.0Ausgabelautstärke; 1.0 entspricht der normalen Lautstärke.
pitchNeininteger0-12 - 12Verschiebung der Stimmhöhe in Halbtönen.

Preise#


Seed Audio 1.0 wird auf RunComfy nach der Länge des erzeugten Audios abgerechnet.


AbrechnungseinheitTarif
Pro Minute generierten Audios$0.075

Beispiele für geschätzte Kosten


DauerGeschätzte Kosten
15 s~$0.019
30 s~$0.038
60 s~$0.075
120 s~$0.150

Anwendung#


So erzeugen Sie mit Seed Audio 1.0 eine saubere Sprachausgabe:


  1. Öffnen Sie Seed Audio 1.0 auf RunComfy und wechseln Sie zum Bereich „Generierung“.
  2. Geben Sie den zu vertonenden Text ein. Natürliche Zeichensetzung hilft dem Modell, Satzmelodie und Pausen passend umzusetzen.
  3. Wählen Sie eine voreingestellte Stimme oder fügen Sie Referenzaudio hinzu, wenn Sie eine bestimmte Sprechweise nachbilden möchten.
  4. Für Audioreferenzen hinterlegen Sie bis zu drei Clip-URLs und verweisen im Prompt mit @Audio1, @Audio2 und @Audio3 darauf.
  5. Alternativ können Sie statt Audio ein einzelnes Referenzbild verwenden, um die gewünschte Wirkung der Stimme vorzugeben.
  6. Stellen Sie Sprechtempo, Lautstärke und Tonhöhe ein und wählen Sie anschließend ein passendes output_format und eine passende sample_rate.
  7. Starten Sie die Generierung, hören Sie das Ergebnis in der Vorschau an und laden Sie die Datei aus dem Auftragsverlauf herunter.
  8. Für Automatisierungen übermitteln Sie dieselben Felder an den Seed Audio 1.0-Endpunkt auf RunComfy; eigenes Hosting ist nicht erforderlich.

Tipps für Prompts und Referenzen#


  • Schreiben Sie so, wie der Text gesprochen werden soll: Kurze Sätze und eindeutige Zeichensetzung sorgen für ein gleichmäßigeres Tempo.
  • Verwenden Sie kurze, saubere Referenzclips. Für zuverlässige Ergebnisse sollte jeder Clip unter 30 Sekunden und 10MB bleiben.
  • Achten Sie darauf, dass die Reihenfolge der Clips zu den Verweisen @Audio1, @Audio2 und @Audio3 im Prompt passt.
  • Nutzen Sie eine voreingestellte Stimme für schnelle Entwürfe und wechseln Sie zu Referenzaudio, wenn Sie einen bestimmten Klangcharakter benötigen.
  • Verwenden Sie ein Referenzbild nur dann, wenn Sie kein Referenzaudio einsetzen, da sich beide Modi nicht kombinieren lassen.
  • Verändern Sie Sprechtempo und Tonhöhe in kleinen Schritten; große Sprünge können die Ausgabe unnatürlich wirken lassen.

Vergleich von Seed Audio 1.0 mit anderen Modellen#


  • Multimodale Steuerung: Anders als viele rein textbasierte Sprachmodelle akzeptiert Seed Audio 1.0 nach öffentlich verfügbaren Angaben neben Text auch Referenzaudio oder ein Bild zur Gestaltung der Ausgabe.
  • Geordnete Referenzen: Die Verweise @Audio1, @Audio2 und @Audio3 ermöglichen eine präzisere Zuordnung als ein einzelner, fest vorgegebener Stimmenplatz.
  • Flexible Ausgabe: Mehrere Containerformate und ein großer Abtastratenbereich erleichtern die Einbindung in bestehende Produktionsabläufe.

Verwandte Modelle

hunyuan-video-v1.5/text-to-video

Erzeugen Sie aus einem Pflicht-Prompt ein 5 oder 8 Sekunden langes Video. Ein negativer Prompt, vier feste Ausgabegrößen und ein Seed sind optional einstellbar.

sam-3/video-to-video

Segmentieren Sie ein beschriebenes Motiv über die Frames eines Videos hinweg.

Kling 1.5 Pro

Erstelle filmreife Videos aus Texten oder Bildern mit KI-Präzision

veo-3-1/extend-video

Verlängern Sie ein vorhandenes Video um 7 Sekunden in 720p – mit Prompt-Steuerung und optional generiertem Audio.

kling-1-6/pro/image-to-video

Präzise Eingaben, fließende Bewegungen, brillante Videoqualität.

infinite-talk/fast/video-to-video

Vertonen Sie ein vorhandenes Video mit einer Audiospur; Prompt und Seed sind optional.

Häufig gestellte Fragen

Was ist Seed Audio 1.0 und welche Aufgabe übernimmt es in einem text-to-audio-Workflow?

Seed Audio 1.0 ist ein text-to-audio-Modell von Bytedance, das schriftliche Vorgaben in klare, natürlich klingende Sprache und andere gesprochene Audioinhalte umwandelt. Auf RunComfy geben Sie den zu vertonenden Text ein und steuern die Sprechweise bei Bedarf mit einer voreingestellten Stimme, Referenzclips oder einem einzelnen Bild. So lassen sich Sprachinhalte ohne Aufnahmesitzung erzeugen.

Für welche Aufgaben eignet sich Seed Audio 1.0 besonders?

Seed Audio 1.0 eignet sich für Voiceovers, Erzählungen, Figurendialoge, kurze Hörspielszenen und mehrsprachige Vertonungen. Mit Stimmen-Presets sowie Reglern für Tempo, Lautstärke und Tonhöhe lässt sich die Ausgabe an eine Szene oder Marke anpassen. Referenzaudio hilft außerdem dabei, eine bestimmte Sprechweise über mehrere Clips hinweg konsistent zu halten.

Wie verwendet Seed Audio 1.0 Referenzaudio und Referenzbilder?

Sie können bis zu drei Referenzclips hinterlegen und im Prompt der Reihe nach mit @Audio1, @Audio2 und @Audio3 darauf verweisen. So lassen sich Einflüsse kombinieren oder eine gewünschte Sprechweise auf die Ausgabe übertragen. Alternativ kann ein einzelnes Referenzbild den gewünschten Tonfall vorgeben; Bild- und Audioreferenzen lassen sich jedoch nicht in derselben Anfrage kombinieren. Für zuverlässige Ergebnisse sollte jeder Clip höchstens etwa 30 Sekunden lang und maximal 10MB groß sein.

Welche Teams und Einsatzbereiche profitieren in der Produktion von Seed Audio 1.0?

Content-, Produkt- und Lokalisierungsteams können Seed Audio 1.0 für Erklärvideos, Sprachansagen in Apps, Werbe-Voiceovers und mehrsprachige Synchronfassungen einsetzen. Entwickler können die Erzeugung gesprochener Inhalte aus Skripten oder Kampagnentexten in bestehende Pipelines integrieren. Voreingestellte Stimmen ermöglichen schnelle Entwürfe, Referenzen eine gezieltere Ausarbeitung von Figurenstimmen.

Welche Ein- und Ausgabeoptionen bietet Seed Audio 1.0?

Erforderlich ist ein Prompt; optional können Sie eine Stimme, Referenzaudio oder ein Referenzbild angeben. Sprechtempo, Lautstärke und Tonhöhe sind einstellbar. Die Ausgabe ist als wav, mp3, pcm oder ogg_opus mit Abtastraten von 8 kHz bis 48 kHz möglich. Gültige Größenlimits und Formate finden Sie direkt bei den Einstellungen auf der RunComfy-Modellseite, da sie je nach Anbieter variieren können.

Lässt sich Seed Audio 1.0 über die RunComfy-API nutzen?

Ja. Stimmen Sie Prompt, Stimme, Referenzen und Sprechparameter zunächst im RunComfy AI Playground auf das gewünschte Ergebnis ab. Anschließend können Sie Seed Audio 1.0 mit denselben Parametern über die RunComfy-API aus Ihrem Backend oder Ihrer Content-Pipeline aufrufen. So bleibt die im Browser getestete Konfiguration bei der Automatisierung unverändert.

Was kostet die Generierung mit Seed Audio 1.0 auf RunComfy?

Nach den verfügbaren Anbieterangaben kostet Seed Audio 1.0 $0.075 pro Minute erzeugten Audios. Die Kosten werden vom USD- oder Credit-Guthaben auf RunComfy abgezogen; neue Benutzer erhalten in der Regel ein kostenloses Testguthaben. Aktuelle Tarife und mögliche modusspezifische Unterschiede finden Sie im Bereich „Generierung“ auf der Seed Audio 1.0-Modellseite.

Folge uns
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • E-Mail
  • Systemstatus
  • Partner
Videomodelle
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Alle Modelle anzeigen →
Bildmodelle
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Alle Modelle anzeigen →
Rechtliches
  • Nutzungsbedingungen
  • Datenschutzrichtlinie
  • Cookie-Richtlinie
RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.