logo
RunComfy
  • ComfyUI
  • ТренерНовое
  • Модели
  • API
  • Цены
discord logo
МОДЕЛИ
Обзор
Все модели
БИБЛИОТЕКА
Генерации
API МОДЕЛЕЙ
Документация API
API-ключи
АККАУНТ
Использование

Seed Audio 1.0: синтез речи по тексту с готовыми голосами и аудиореференсами в каталоге моделей и API RunComfy | RunComfy

bytedance/seed-audio-1.0/text-to-audio

Создавайте естественную речь по тексту, аудиореференсам или изображению с помощью Seed Audio 1.0 в RunComfy. Выбирайте готовые голоса, настраивайте скорость и высоту речи и задавайте формат файла — в браузере или через API.

Текст для озвучивания. Ссылайтесь на референсные записи по порядку: @Audio1, @Audio2, @Audio3.
Готовый голос для синтеза.
До 3 референсных записей; укажите их в промпте как @Audio1, @Audio2 и @Audio3. Каждая запись — до 30 секунд и 10MB, форматы: wav/mp3/pcm/ogg_opus.
Одно референсное изображение в формате jpeg/png/webp размером до 10MB. Нельзя использовать одновременно с аудиореференсами.
Формат выходного аудиофайла.
Частота дискретизации выходного аудио в герцах.
Скорость произнесения: 1.0 — обычная, 0.5 — вдвое медленнее, 2.0 — вдвое быстрее.
Громкость результата: 1.0 — обычная, 0.5 — вдвое тише, 2.0 — вдвое громче.
Изменение высоты голоса в полутонах: 0 — без изменений, -12 — на октаву ниже, 12 — на октаву выше.
Idle
The rate is $0.075 per minute.

Знакомство с Seed Audio 1.0

Seed Audio 1.0 от ByteDance превращает текстовые промпты в качественную, естественно звучащую речь. Манеру звучания можно задать самим текстом, с помощью до трёх аудиореференсов или одного изображения. Стоимость составляет $0.075 за минуту.
Вместо организации студийной записи и согласования графика дикторов Seed Audio 1.0 предлагает синтез по промпту, позволяя авторам контента, продуктовым командам и студиям локализации получать озвучку за несколько минут.
Модель работает в браузере RunComfy и через HTTP API — размещать и масштабировать её самостоятельно не нужно.
Лучше всего подходит для: закадровой озвучки и повествования | многоязычной локализации | прототипирования интерактивного аудио

ByteDance / Seed Audio 1.0#


Seed Audio 1.0 — модель ByteDance для синтеза речи по тексту. Она превращает текстовый промпт в чёткое, естественно звучащее аудио. Манеру подачи можно задать тремя способами: использовать только текст, добавить до трёх коротких аудиореференсов или загрузить одно изображение.


Параметры вывода: только аудио / форматы — wav, mp3, pcm, ogg_opus / частота дискретизации — от 8 kHz до 48 kHz.


Основные возможности#


Seed Audio 1.0 рассчитана на быстрый и гибкий синтез аудио с точной настройкой подачи.


  • Несколько способов управления: синтезируйте речь только по тексту, выберите готовый голос или добавьте собственные аудиореференсы; вместо аудио также можно использовать одно изображение.
  • Ссылки на аудиореференсы по порядку: добавьте до трёх записей и укажите в промпте @Audio1, @Audio2 и @Audio3, чтобы сочетать источники или перенести нужную манеру речи.
  • Многоязычные готовые голоса: доступны варианты для английского, китайского, испанского, японского, индонезийского и португальского языков и их сочетаний.
  • Настройка подачи: регулируйте скорость, громкость и высоту голоса под темп и тон вашего проекта.
  • Гибкие форматы: экспортируйте wav, mp3, pcm или ogg_opus с частотой дискретизации до 48 kHz для последующего монтажа.

Параметры#


ПараметрОбязательныйТипПо умолчаниюДиапазон / вариантыОписание
prompt*Да (*)string—Произвольный текстТекст для озвучивания; ссылки на референсы указываются по порядку: @Audio1, @Audio2, @Audio3.
voiceНетstringvivi_mixed_en_zh_ja_es_idСписок готовых голосовГолос, используемый для синтеза.
audio_urlsНетarray—До 3 URLАудиореференсы в формате wav/mp3/pcm/ogg_opus, каждый — до 30 секунд и 10MB.
image_urlНетstring—jpeg/png/webp, до 10MBОдно референсное изображение; нельзя сочетать с аудиореференсами.
output_formatНетstringmp3wav, mp3, pcm, ogg_opusФормат выходного аудиофайла.
sample_rateНетinteger240008000 - 48000Частота дискретизации выходного аудио в герцах.
speedНетnumber10.5 - 2.0Скорость речи; 1.0 соответствует обычному темпу.
volumeНетnumber10.5 - 2.0Громкость результата; 1.0 соответствует обычному уровню.
pitchНетinteger0-12 - 12Изменение высоты голоса в полутонах.

Стоимость#


В RunComfy стоимость Seed Audio 1.0 зависит от длительности сгенерированного аудио.


Единица расчётаТариф
Минута сгенерированного аудио$0.075

Примеры расчёта


ДлительностьПримерная стоимость
15 секунд~$0.019
30 секунд~$0.038
60 секунд~$0.075
120 секунд~$0.150

Как пользоваться#


Чтобы получить чистую и естественную озвучку в Seed Audio 1.0:


  1. Откройте модель Seed Audio 1.0 в RunComfy и разверните панель генерации.
  2. Введите текст для озвучивания. Используйте естественную пунктуацию, чтобы правильно расставить паузы и интонационные акценты.
  3. Выберите готовый голос. Если нужна конкретная манера речи, вместо него можно добавить аудиореференсы.
  4. Загрузите до трёх референсных записей и укажите их в промпте как @Audio1, @Audio2 и @Audio3.
  5. Вместо аудио можно загрузить одно изображение, которое подскажет модели нужный тон.
  6. Настройте скорость, громкость и высоту голоса, затем выберите подходящие output_format и sample_rate.
  7. Запустите генерацию, прослушайте результат и скачайте файл из истории заданий.
  8. Для автоматизации передайте те же поля в API-эндпоинт Seed Audio 1.0 на RunComfy — самостоятельный хостинг не требуется.

Советы по промптам и референсам#


  • Пишите так, как текст должен звучать: короткие предложения и ясная пунктуация помогают Seed Audio 1.0 выдерживать ровный темп.
  • Используйте короткие и чистые референсные записи; размер каждой не должен превышать 30 секунд и 10MB.
  • Следите за порядком файлов: ссылки @Audio1, @Audio2 и @Audio3 в промпте должны соответствовать нужным источникам.
  • Для быстрых черновиков выбирайте готовый голос, а для точной передачи характера переходите к аудиореференсу.
  • Изображение можно использовать только без аудиореференсов: эти два режима несовместимы в одном запросе.
  • Меняйте скорость и высоту небольшими шагами — слишком резкие значения могут сделать речь неестественной.

Сравнение Seed Audio 1.0 с другими моделями#


  • Мультимодальное управление: в отличие от многих инструментов, работающих только с текстом, Seed Audio 1.0 позволяет формировать результат с помощью текста, аудиореференсов или изображения — согласно общедоступной информации.
  • Работа с референсами: ссылки на записи по порядку через метки @Audio дают более точный контроль, чем один фиксированный голосовой слот.
  • Гибкий вывод: несколько форматов и широкий диапазон частоты дискретизации позволяют легко встроить результат Seed Audio 1.0 в существующий процесс.

Похожие модели

flux-3/text-to-video/draft

FLUX 3 Draft: быстрый и недорогой предварительный просмотр текста в видео в разрешении 720p.

aurora

Создайте видео из изображения, аудиофайла и промпта с раздельной настройкой влияния текста и аудио.

wan-2-2/image-to-video

Мощное решение для создания видео из изображений с точной анимацией

hailuo-2-3/pro/image-to-video

Создавайте реалистичные 1080p видео из фото с помощью умных AI-инструментов.

minimax-h3-open/reference-to-video

Открытая ссылка на видео из изображений, видео и аудиосигналов.

hailuo-02/pro/image-to-video

Анимируйте исходное изображение в Hailuo 02 Pro по промпту и создайте шестисекундное видео.

Часто задаваемые вопросы

Что такое Seed Audio 1.0 и как модель используется для синтеза речи?

Seed Audio 1.0 — модель ByteDance, которая превращает текстовый промпт в чёткую и естественно звучащую речь. В RunComfy достаточно ввести текст и при желании выбрать готовый голос, добавить аудиореференсы или одно изображение, чтобы задать манеру подачи. Модель подходит авторам, которым нужна озвучка по промпту без организации студийной записи.

Для каких задач лучше всего подходит Seed Audio 1.0?

Seed Audio 1.0 хорошо справляется с закадровой озвучкой, повествованием, репликами персонажей, фрагментами аудиоспектаклей и многоязычным контентом. Готовые голоса и настройки позволяют управлять темпом, громкостью и высотой речи под конкретную сцену или бренд. Аудиореференсы также помогают сохранять одинаковую манеру подачи в нескольких файлах.

Как Seed Audio 1.0 использует аудиореференсы и изображения?

Можно загрузить до трёх референсных записей и сослаться на них в промпте по порядку: @Audio1, @Audio2 и @Audio3. Так модель перенесёт нужную манеру речи или объединит влияние нескольких источников. Вместо аудио можно использовать одно изображение, чтобы задать тон, но сочетать изображения и аудиореференсы в одном запросе нельзя. Для стабильного результата каждая запись должна быть не длиннее 30 секунд и не больше 10MB.

Каким командам и рабочим сценариям особенно полезна Seed Audio 1.0?

Авторы контента, продуктовые команды и студии локализации могут применять Seed Audio 1.0 для озвучивания объясняющих роликов, реплик в приложениях, рекламы и дубляжа на разных языках. Разработчики могут встроить модель в процесс, который по запросу создаёт речь из сценариев или рекламных текстов. Готовые голоса удобны для быстрых черновиков, а референсы — для более точной работы с персонажем.

Какие входные и выходные параметры Seed Audio 1.0 нужно знать?

Обязателен только промпт; дополнительно можно выбрать голос, загрузить аудиореференсы или изображение и настроить скорость, громкость и высоту речи. Результат доступен в форматах wav, mp3, pcm или ogg_opus с частотой дискретизации от 8 kHz до 48 kHz. Точные ограничения по размеру и форматам могут зависеть от провайдера, поэтому перед интеграцией проверьте панель параметров RunComfy.

Можно ли использовать Seed Audio 1.0 через API RunComfy?

Да. Сначала настройте промпт, голос, референсы и подачу в веб-интерфейсе RunComfy AI Playground. Когда результат будет устраивать, вызывайте ту же модель Seed Audio 1.0 с теми же параметрами через API из серверного приложения или контентного конвейера. Поведение модели при этом не меняется.

Сколько стоит генерация Seed Audio 1.0 в RunComfy?

Генерации Seed Audio 1.0 оплачиваются с долларового или кредитного баланса RunComfy. Согласно доступной информации провайдера, тариф составляет $0.075 за минуту сгенерированного аудио. Новым пользователям обычно предоставляется пробная сумма; затем действуют правила из раздела «Генерация» на странице модели. Там же указаны актуальные тарифы и возможные различия между режимами.

Подписывайтесь на нас
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Поддержка
  • Discord
  • Email
  • Статус системы
  • партнёр
Модели видео
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Посмотреть все модели →
Модели изображений
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Посмотреть все модели →
Юридическая информация
  • Условия обслуживания
  • Политика конфиденциальности
  • Политика в отношении файлов cookie
RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.