Erzeugen Sie aus einem Pflicht-Prompt ein 5 oder 8 Sekunden langes Video. Ein negativer Prompt, vier feste Ausgabegrößen und ein Seed sind optional einstellbar.
Seed Audio 1.0 ist ein text-to-audio-Modell von Bytedance, das schriftliche Vorgaben in klare, natürlich klingende Sprache und andere gesprochene Audioinhalte umwandelt. Die Sprechweise lässt sich auf drei Arten steuern: mit einem einfachen Text-Prompt, mit bis zu drei kurzen Referenzclips oder mit einem einzelnen Referenzbild.
Ausgabeformat: Nur Audio / Formate wav, mp3, pcm, ogg_opus / Abtastrate 8 kHz bis 48 kHz.
Seed Audio 1.0 ist für eine schnelle, flexible Sprachsynthese mit gezielt steuerbarer Sprechweise ausgelegt.
| Parameter | Erforderlich | Typ | Standard | Bereich / Optionen | Beschreibung |
|---|---|---|---|---|---|
| prompt* | Ja (*) | string | — | Freitext | Zu vertonender Text; Referenzclips der Reihe nach mit @Audio1, @Audio2 und @Audio3 angeben. |
| voice | Nein | string | vivi_mixed_en_zh_ja_es_id | Liste der voreingestellten Stimmen | Für die Synthese verwendete Stimme. |
| audio_urls | Nein | array | — | Bis zu 3 URLs | Referenzclips (wav/mp3/pcm/ogg_opus), jeweils höchstens 30s und 10MB. |
| image_url | Nein | string | — | jpeg/png/webp, bis 10MB | Ein Referenzbild; nicht mit Audioreferenzen kombinierbar. |
| output_format | Nein | string | mp3 | wav, mp3, pcm, ogg_opus | Containerformat der Audioausgabe. |
| sample_rate | Nein | integer | 24000 | 8000 - 48000 | Abtastrate der Ausgabe in Hz. |
| speed | Nein | number | 1 | 0.5 - 2.0 | Sprechtempo; 1.0 entspricht normalem Tempo. |
| volume | Nein | number | 1 | 0.5 - 2.0 | Ausgabelautstärke; 1.0 entspricht der normalen Lautstärke. |
| pitch | Nein | integer | 0 | -12 - 12 | Verschiebung der Stimmhöhe in Halbtönen. |
Seed Audio 1.0 wird auf RunComfy nach der Länge des erzeugten Audios abgerechnet.
| Abrechnungseinheit | Tarif |
|---|---|
| Pro Minute generierten Audios | $0.075 |
Beispiele für geschätzte Kosten
| Dauer | Geschätzte Kosten |
|---|---|
| 15 s | ~$0.019 |
| 30 s | ~$0.038 |
| 60 s | ~$0.075 |
| 120 s | ~$0.150 |
So erzeugen Sie mit Seed Audio 1.0 eine saubere Sprachausgabe:
Erzeugen Sie aus einem Pflicht-Prompt ein 5 oder 8 Sekunden langes Video. Ein negativer Prompt, vier feste Ausgabegrößen und ein Seed sind optional einstellbar.
Segmentieren Sie ein beschriebenes Motiv über die Frames eines Videos hinweg.
Erstelle filmreife Videos aus Texten oder Bildern mit KI-Präzision
Verlängern Sie ein vorhandenes Video um 7 Sekunden in 720p – mit Prompt-Steuerung und optional generiertem Audio.
Präzise Eingaben, fließende Bewegungen, brillante Videoqualität.
Vertonen Sie ein vorhandenes Video mit einer Audiospur; Prompt und Seed sind optional.
Seed Audio 1.0 ist ein text-to-audio-Modell von Bytedance, das schriftliche Vorgaben in klare, natürlich klingende Sprache und andere gesprochene Audioinhalte umwandelt. Auf RunComfy geben Sie den zu vertonenden Text ein und steuern die Sprechweise bei Bedarf mit einer voreingestellten Stimme, Referenzclips oder einem einzelnen Bild. So lassen sich Sprachinhalte ohne Aufnahmesitzung erzeugen.
Seed Audio 1.0 eignet sich für Voiceovers, Erzählungen, Figurendialoge, kurze Hörspielszenen und mehrsprachige Vertonungen. Mit Stimmen-Presets sowie Reglern für Tempo, Lautstärke und Tonhöhe lässt sich die Ausgabe an eine Szene oder Marke anpassen. Referenzaudio hilft außerdem dabei, eine bestimmte Sprechweise über mehrere Clips hinweg konsistent zu halten.
Sie können bis zu drei Referenzclips hinterlegen und im Prompt der Reihe nach mit @Audio1, @Audio2 und @Audio3 darauf verweisen. So lassen sich Einflüsse kombinieren oder eine gewünschte Sprechweise auf die Ausgabe übertragen. Alternativ kann ein einzelnes Referenzbild den gewünschten Tonfall vorgeben; Bild- und Audioreferenzen lassen sich jedoch nicht in derselben Anfrage kombinieren. Für zuverlässige Ergebnisse sollte jeder Clip höchstens etwa 30 Sekunden lang und maximal 10MB groß sein.
Content-, Produkt- und Lokalisierungsteams können Seed Audio 1.0 für Erklärvideos, Sprachansagen in Apps, Werbe-Voiceovers und mehrsprachige Synchronfassungen einsetzen. Entwickler können die Erzeugung gesprochener Inhalte aus Skripten oder Kampagnentexten in bestehende Pipelines integrieren. Voreingestellte Stimmen ermöglichen schnelle Entwürfe, Referenzen eine gezieltere Ausarbeitung von Figurenstimmen.
Erforderlich ist ein Prompt; optional können Sie eine Stimme, Referenzaudio oder ein Referenzbild angeben. Sprechtempo, Lautstärke und Tonhöhe sind einstellbar. Die Ausgabe ist als wav, mp3, pcm oder ogg_opus mit Abtastraten von 8 kHz bis 48 kHz möglich. Gültige Größenlimits und Formate finden Sie direkt bei den Einstellungen auf der RunComfy-Modellseite, da sie je nach Anbieter variieren können.
Ja. Stimmen Sie Prompt, Stimme, Referenzen und Sprechparameter zunächst im RunComfy AI Playground auf das gewünschte Ergebnis ab. Anschließend können Sie Seed Audio 1.0 mit denselben Parametern über die RunComfy-API aus Ihrem Backend oder Ihrer Content-Pipeline aufrufen. So bleibt die im Browser getestete Konfiguration bei der Automatisierung unverändert.
Nach den verfügbaren Anbieterangaben kostet Seed Audio 1.0 $0.075 pro Minute erzeugten Audios. Die Kosten werden vom USD- oder Credit-Guthaben auf RunComfy abgezogen; neue Benutzer erhalten in der Regel ein kostenloses Testguthaben. Aktuelle Tarife und mögliche modusspezifische Unterschiede finden Sie im Bereich „Generierung“ auf der Seed Audio 1.0-Modellseite.
RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.