logo
RunComfy
  • ComfyUI
  • TreinadorNovo
  • Modelos
  • API
  • Preços
discord logo
MODELOS
Explorar
Todos os modelos
BIBLIOTECA
Gerações
APIS DE MODELOS
Documentação da API
Chaves API
CONTA
Uso

Seed Audio 1.0: geração de áudio a partir de texto com vozes predefinidas e referências | RunComfy Models e API

bytedance/seed-audio-1.0/text-to-audio

Gere fala e áudio naturais a partir de texto, clipes de referência ou uma imagem com Seed Audio 1.0 no RunComfy. Use vozes predefinidas e ajuste velocidade, tom e formato de saída no navegador ou pela API.

Texto a sintetizar. Cite os clipes de referência na ordem com @Audio1, @Audio2 e @Audio3.
Voz predefinida usada na síntese.
Até 3 clipes de referência, citados no prompt como @Audio1, @Audio2 e @Audio3. Cada clipe pode ter até 30s e 10MB, nos formatos wav/mp3/pcm/ogg_opus.
Uma imagem de referência (jpeg/png/webp, até 10MB). Não pode ser combinada com referências de áudio.
Contêiner do áudio de saída.
Taxa de amostragem do áudio de saída, em Hz.
Velocidade de leitura. 1.0 é normal, 0.5 é metade e 2.0 é o dobro.
Volume da saída. 1.0 é normal, 0.5 é metade e 2.0 é o dobro.
Alteração do tom da voz em semitons. 0 é normal, -12 reduz uma oitava e 12 aumenta uma oitava.
Idle
The rate is $0.075 per minute.

Conheça o Seed Audio 1.0

O Seed Audio 1.0 da Bytedance transforma prompts escritos em áudio natural de alta qualidade. O resultado pode ser guiado por texto, por até três clipes de referência ou por uma única imagem, com preço de $0.075 por minuto.
Ao substituir sessões de gravação roteirizadas e o agendamento de locutores por síntese guiada por prompt, o Seed Audio 1.0 permite que criadores, equipes de produto e estúdios de localização produzam fala em poucos minutos.
No RunComfy, pode ser usado no navegador e por uma API HTTP, sem que você precise hospedar ou escalar o modelo.
Ideal para: locução e narração | localização multilíngue | prototipagem de áudio interativo

Bytedance / Seed Audio 1.0#


Seed Audio 1.0 é um modelo de geração de áudio a partir de texto da Bytedance que transforma prompts escritos em fala clara e natural. Há três formas de orientar o resultado: apenas um prompt de texto, até três clipes curtos de referência ou uma única imagem de referência que influencia a interpretação.


Formato de saída: somente áudio / formatos wav, mp3, pcm, ogg_opus / taxa de amostragem de 8 kHz a 48 kHz.


Destaques#


Seed Audio 1.0 foi criado para síntese de áudio rápida e flexível, com controle sobre a interpretação.


  • Três formas de orientação: use apenas texto, vozes predefinidas ou seu próprio áudio de referência; também é possível usar uma imagem em vez do áudio.
  • Áudio de referência por ordem: cite até três clipes no prompt com @Audio1, @Audio2 e @Audio3 para combinar fontes ou levar uma interpretação específica à leitura.
  • Vozes multilíngues: escolha entre vozes predefinidas que combinam inglês, chinês, espanhol, japonês, indonésio e português.
  • Controles de interpretação: ajuste velocidade, volume e tom para adequar a leitura ao ritmo e à intenção do projeto.
  • Saída flexível: exporte wav, mp3, pcm ou ogg_opus em taxas de até 48 kHz para facilitar a edição posterior.

Parâmetros#


ParâmetroObrigatórioTipoPadrãoFaixa / OpçõesDescrição
prompt*Sim (*)string—Texto livreTexto a sintetizar; cite os clipes na ordem com @Audio1, @Audio2, @Audio3.
voiceNãostringvivi_mixed_en_zh_ja_es_idLista de vozes predefinidasVoz predefinida usada na síntese.
audio_urlsNãoarray—Até 3 URLsClipes de referência (wav/mp3/pcm/ogg_opus), cada um com até 30s e 10MB.
image_urlNãostring—jpeg/png/webp, até 10MBUma imagem de referência; não pode ser combinada com áudio de referência.
output_formatNãostringmp3wav, mp3, pcm, ogg_opusContêiner do áudio de saída.
sample_rateNãointeger240008000 - 48000Taxa de amostragem da saída em Hz.
speedNãonumber10.5 - 2.0Velocidade de leitura; 1.0 é o ritmo normal.
volumeNãonumber10.5 - 2.0Volume da saída; 1.0 é normal.
pitchNãointeger0-12 - 12Alteração do tom em semitons.

Preços#


O Seed Audio 1.0 no RunComfy é cobrado pelo tempo, conforme a duração do áudio gerado.


Unidade de cobrançaTarifa
Por minuto de áudio gerado$0.075

Exemplos de custo estimado


DuraçãoCusto aproximado
15 scerca de $0.019
30 scerca de $0.038
60 scerca de $0.075
120 scerca de $0.150

Como usar#


Siga estas etapas para obter uma leitura clara com Seed Audio 1.0.


  1. Abra o modelo Seed Audio 1.0 no RunComfy e exiba o painel de geração.
  2. Escreva o texto que deseja ouvir, usando pontuação natural para melhorar as frases e pausas.
  3. Escolha uma voz predefinida ou pule essa opção e anexe um áudio de referência quando quiser uma interpretação específica.
  4. Para usar referências, adicione até três URLs de clipes e cite-os no prompt como @Audio1, @Audio2 e @Audio3.
  5. Como alternativa, forneça uma imagem de referência no lugar do áudio para orientar o tom da leitura.
  6. Ajuste velocidade, volume e tom; depois escolha output_format e sample_rate adequados ao seu fluxo.
  7. Execute a geração, ouça a prévia e baixe o arquivo no histórico de tarefas.
  8. Para automatizar, envie os mesmos campos ao endpoint do Seed Audio 1.0 no RunComfy; não é preciso hospedar o modelo.

Dicas de prompt e referências#


  • Escreva como deseja que o texto seja falado: frases curtas e pontuação clara produzem um ritmo mais estável.
  • Use clipes de referência curtos e limpos; cada um deve ter menos de 30 segundos e 10MB para resultados confiáveis.
  • Faça a ordem dos clipes corresponder às citações no prompt, para que @Audio1, @Audio2 e @Audio3 apontem para as fontes corretas.
  • Use uma voz predefinida em rascunhos rápidos e passe ao áudio de referência quando precisar de um personagem específico.
  • Use a orientação por imagem apenas quando não estiver enviando áudio, pois os dois tipos de referência não podem ser combinados.
  • Ajuste velocidade e tom em pequenos passos; mudanças grandes podem deixar a leitura pouco natural.

Como o Seed Audio 1.0 se compara a outros modelos#


  • Prompt multimodal: ao contrário de muitas ferramentas que aceitam somente texto, Seed Audio 1.0 usa texto, áudio de referência ou uma imagem para moldar a saída, segundo informações públicas.
  • Tratamento de referências: citar os clipes na ordem com marcadores @Audio oferece mais controle sobre as fontes do que um único espaço de voz fixa.
  • Flexibilidade de saída: vários contêineres e uma ampla faixa de amostragem facilitam a integração dos resultados do Seed Audio 1.0 a fluxos existentes.

Modelos relacionados

hunyuan/text-to-video

Crie vídeos de alta qualidade a partir de prompts de texto com o Tencent Hunyuan Video.

pixverse/v5.5/effects

Anime uma imagem de origem obrigatória com um dos 48 efeitos predefinidos e controles de resolução, duração, prompt negativo e otimização.

kling-video-o1/image-to-video/reference

Gere um vídeo a partir de imagens de referência e elementos obrigatórios. Use tokens @Image e @Element na ordem dos arrays e defina com precisão a duração e a proporção.

pika-2-2/image-to-video

Transforme imagens em vídeos criativos com o Pika 2.2.

lucy-edit/restyle

Reestilize um vídeo existente com instruções de texto, preservando o movimento original e a composição geral.

kling-1-6/pro/image-to-video

Converta imagens em vídeos realistas com movimento fluido e alta qualidade.

Perguntas Frequentes

O que é Seed Audio 1.0 e o que ele faz em um fluxo de geração de áudio a partir de texto?

Seed Audio 1.0 é um modelo da Bytedance que transforma prompts escritos em fala clara e natural. No RunComfy, você digita o conteúdo que deseja ouvir e pode orientar a interpretação com uma voz predefinida, clipes de referência ou uma única imagem. Ele foi criado para quem precisa gerar áudio por prompt sem organizar sessões de gravação.

Para quais tarefas de geração o Seed Audio 1.0 é mais indicado?

Seed Audio 1.0 funciona bem para locuções, narrações, falas de personagens, trechos de dramaturgia em áudio e leituras multilíngues. As vozes predefinidas e os controles de interpretação ajustam ritmo, volume e tom a uma cena ou marca. O áudio de referência também ajuda a manter uma interpretação específica em vários clipes.

Como o Seed Audio 1.0 usa áudio e imagens de referência?

Você pode anexar até três clipes e citá-los no prompt, em ordem, como @Audio1, @Audio2 e @Audio3. Assim, é possível combinar fontes ou levar uma interpretação desejada à leitura. Como alternativa, uma única imagem pode orientar o tom, mas referências de imagem e áudio não podem ser combinadas na mesma solicitação. Para resultados confiáveis, mantenha cada clipe em cerca de 30 segundos e 10MB.

Quais equipes e usos de produção mais se beneficiam do Seed Audio 1.0?

Criadores de conteúdo, equipes de produto e estúdios de localização podem usar Seed Audio 1.0 em locuções explicativas, instruções de aplicativos, anúncios e dublagem entre idiomas. Desenvolvedores podem integrá-lo a fluxos que geram fala sob demanda a partir de roteiros ou textos de campanha. Vozes predefinidas e interpretação por referência atendem tanto a rascunhos rápidos quanto a personagens específicos.

Quais opções de entrada e saída devo conhecer antes de usar o Seed Audio 1.0?

Seed Audio 1.0 exige um prompt e aceita, opcionalmente, uma voz predefinida, áudio de referência ou uma única imagem, além de controles de velocidade, volume e tom. Áudio e imagem de referência são alternativas e não podem ser usados juntos. A saída pode ser wav, mp3, pcm ou ogg_opus, com taxa de amostragem de 8 kHz a 48 kHz. Como tamanho e formatos podem variar conforme o provedor, consulte o painel de parâmetros do RunComfy antes de implementar.

Desenvolvedores podem usar o Seed Audio 1.0 pela API do RunComfy?

Sim. Na interface web do RunComfy AI Playground, ajuste prompt, voz, referências e controles até chegar ao resultado desejado. Depois, chame o mesmo Seed Audio 1.0 pela API com parâmetros idênticos para automatizar seu backend ou fluxo de conteúdo. Assim, você testa no navegador e executa em produção no código sem alterar o comportamento do modelo.

Quanto custa gerar com o Seed Audio 1.0 no RunComfy?

As gerações do Seed Audio 1.0 consomem usd / credits do saldo do RunComfy. Segundo as informações disponíveis do provedor, o modelo custa $0.075 por minuto de áudio gerado. Novos usuários normalmente recebem um valor usd gratuito para testar; depois, o uso segue as regras de Generation exibidas na página. Consulte essa seção para conhecer preços atuais e diferenças entre modos.

Siga-nos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Suporte
  • Discord
  • E-mail
  • Status do Sistema
  • afiliado
Modelos de Vídeo
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Ver todos os modelos →
Modelos de Imagem
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Ver todos os modelos →
Legal
  • Termos de Serviço
  • Política de Privacidade
  • Política de Cookies
RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.