FLUX 3 Draft: быстрый и недорогой предварительный просмотр текста в видео в разрешении 720p.
Seed Audio 1.0 — модель ByteDance для синтеза речи по тексту. Она превращает текстовый промпт в чёткое, естественно звучащее аудио. Манеру подачи можно задать тремя способами: использовать только текст, добавить до трёх коротких аудиореференсов или загрузить одно изображение.
Параметры вывода: только аудио / форматы — wav, mp3, pcm, ogg_opus / частота дискретизации — от 8 kHz до 48 kHz.
Seed Audio 1.0 рассчитана на быстрый и гибкий синтез аудио с точной настройкой подачи.
| Параметр | Обязательный | Тип | По умолчанию | Диапазон / варианты | Описание |
|---|---|---|---|---|---|
| prompt* | Да (*) | string | — | Произвольный текст | Текст для озвучивания; ссылки на референсы указываются по порядку: @Audio1, @Audio2, @Audio3. |
| voice | Нет | string | vivi_mixed_en_zh_ja_es_id | Список готовых голосов | Голос, используемый для синтеза. |
| audio_urls | Нет | array | — | До 3 URL | Аудиореференсы в формате wav/mp3/pcm/ogg_opus, каждый — до 30 секунд и 10MB. |
| image_url | Нет | string | — | jpeg/png/webp, до 10MB | Одно референсное изображение; нельзя сочетать с аудиореференсами. |
| output_format | Нет | string | mp3 | wav, mp3, pcm, ogg_opus | Формат выходного аудиофайла. |
| sample_rate | Нет | integer | 24000 | 8000 - 48000 | Частота дискретизации выходного аудио в герцах. |
| speed | Нет | number | 1 | 0.5 - 2.0 | Скорость речи; 1.0 соответствует обычному темпу. |
| volume | Нет | number | 1 | 0.5 - 2.0 | Громкость результата; 1.0 соответствует обычному уровню. |
| pitch | Нет | integer | 0 | -12 - 12 | Изменение высоты голоса в полутонах. |
В RunComfy стоимость Seed Audio 1.0 зависит от длительности сгенерированного аудио.
| Единица расчёта | Тариф |
|---|---|
| Минута сгенерированного аудио | $0.075 |
Примеры расчёта
| Длительность | Примерная стоимость |
|---|---|
| 15 секунд | ~$0.019 |
| 30 секунд | ~$0.038 |
| 60 секунд | ~$0.075 |
| 120 секунд | ~$0.150 |
Чтобы получить чистую и естественную озвучку в Seed Audio 1.0:
FLUX 3 Draft: быстрый и недорогой предварительный просмотр текста в видео в разрешении 720p.
Создайте видео из изображения, аудиофайла и промпта с раздельной настройкой влияния текста и аудио.
Мощное решение для создания видео из изображений с точной анимацией
Создавайте реалистичные 1080p видео из фото с помощью умных AI-инструментов.
Открытая ссылка на видео из изображений, видео и аудиосигналов.
Анимируйте исходное изображение в Hailuo 02 Pro по промпту и создайте шестисекундное видео.
Seed Audio 1.0 — модель ByteDance, которая превращает текстовый промпт в чёткую и естественно звучащую речь. В RunComfy достаточно ввести текст и при желании выбрать готовый голос, добавить аудиореференсы или одно изображение, чтобы задать манеру подачи. Модель подходит авторам, которым нужна озвучка по промпту без организации студийной записи.
Seed Audio 1.0 хорошо справляется с закадровой озвучкой, повествованием, репликами персонажей, фрагментами аудиоспектаклей и многоязычным контентом. Готовые голоса и настройки позволяют управлять темпом, громкостью и высотой речи под конкретную сцену или бренд. Аудиореференсы также помогают сохранять одинаковую манеру подачи в нескольких файлах.
Можно загрузить до трёх референсных записей и сослаться на них в промпте по порядку: @Audio1, @Audio2 и @Audio3. Так модель перенесёт нужную манеру речи или объединит влияние нескольких источников. Вместо аудио можно использовать одно изображение, чтобы задать тон, но сочетать изображения и аудиореференсы в одном запросе нельзя. Для стабильного результата каждая запись должна быть не длиннее 30 секунд и не больше 10MB.
Авторы контента, продуктовые команды и студии локализации могут применять Seed Audio 1.0 для озвучивания объясняющих роликов, реплик в приложениях, рекламы и дубляжа на разных языках. Разработчики могут встроить модель в процесс, который по запросу создаёт речь из сценариев или рекламных текстов. Готовые голоса удобны для быстрых черновиков, а референсы — для более точной работы с персонажем.
Обязателен только промпт; дополнительно можно выбрать голос, загрузить аудиореференсы или изображение и настроить скорость, громкость и высоту речи. Результат доступен в форматах wav, mp3, pcm или ogg_opus с частотой дискретизации от 8 kHz до 48 kHz. Точные ограничения по размеру и форматам могут зависеть от провайдера, поэтому перед интеграцией проверьте панель параметров RunComfy.
Да. Сначала настройте промпт, голос, референсы и подачу в веб-интерфейсе RunComfy AI Playground. Когда результат будет устраивать, вызывайте ту же модель Seed Audio 1.0 с теми же параметрами через API из серверного приложения или контентного конвейера. Поведение модели при этом не меняется.
Генерации Seed Audio 1.0 оплачиваются с долларового или кредитного баланса RunComfy. Согласно доступной информации провайдера, тариф составляет $0.075 за минуту сгенерированного аудио. Новым пользователям обычно предоставляется пробная сумма; затем действуют правила из раздела «Генерация» на странице модели. Там же указаны актуальные тарифы и возможные различия между режимами.
RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.