Crie vídeos de alta qualidade a partir de prompts de texto com o Tencent Hunyuan Video.
Seed Audio 1.0 é um modelo de geração de áudio a partir de texto da Bytedance que transforma prompts escritos em fala clara e natural. Há três formas de orientar o resultado: apenas um prompt de texto, até três clipes curtos de referência ou uma única imagem de referência que influencia a interpretação.
Formato de saída: somente áudio / formatos wav, mp3, pcm, ogg_opus / taxa de amostragem de 8 kHz a 48 kHz.
Seed Audio 1.0 foi criado para síntese de áudio rápida e flexível, com controle sobre a interpretação.
| Parâmetro | Obrigatório | Tipo | Padrão | Faixa / Opções | Descrição |
|---|---|---|---|---|---|
| prompt* | Sim (*) | string | — | Texto livre | Texto a sintetizar; cite os clipes na ordem com @Audio1, @Audio2, @Audio3. |
| voice | Não | string | vivi_mixed_en_zh_ja_es_id | Lista de vozes predefinidas | Voz predefinida usada na síntese. |
| audio_urls | Não | array | — | Até 3 URLs | Clipes de referência (wav/mp3/pcm/ogg_opus), cada um com até 30s e 10MB. |
| image_url | Não | string | — | jpeg/png/webp, até 10MB | Uma imagem de referência; não pode ser combinada com áudio de referência. |
| output_format | Não | string | mp3 | wav, mp3, pcm, ogg_opus | Contêiner do áudio de saída. |
| sample_rate | Não | integer | 24000 | 8000 - 48000 | Taxa de amostragem da saída em Hz. |
| speed | Não | number | 1 | 0.5 - 2.0 | Velocidade de leitura; 1.0 é o ritmo normal. |
| volume | Não | number | 1 | 0.5 - 2.0 | Volume da saída; 1.0 é normal. |
| pitch | Não | integer | 0 | -12 - 12 | Alteração do tom em semitons. |
O Seed Audio 1.0 no RunComfy é cobrado pelo tempo, conforme a duração do áudio gerado.
| Unidade de cobrança | Tarifa |
|---|---|
| Por minuto de áudio gerado | $0.075 |
Exemplos de custo estimado
| Duração | Custo aproximado |
|---|---|
| 15 s | cerca de $0.019 |
| 30 s | cerca de $0.038 |
| 60 s | cerca de $0.075 |
| 120 s | cerca de $0.150 |
Siga estas etapas para obter uma leitura clara com Seed Audio 1.0.
Crie vídeos de alta qualidade a partir de prompts de texto com o Tencent Hunyuan Video.
Anime uma imagem de origem obrigatória com um dos 48 efeitos predefinidos e controles de resolução, duração, prompt negativo e otimização.
Gere um vídeo a partir de imagens de referência e elementos obrigatórios. Use tokens @Image e @Element na ordem dos arrays e defina com precisão a duração e a proporção.
Transforme imagens em vídeos criativos com o Pika 2.2.
Reestilize um vídeo existente com instruções de texto, preservando o movimento original e a composição geral.
Converta imagens em vídeos realistas com movimento fluido e alta qualidade.
Seed Audio 1.0 é um modelo da Bytedance que transforma prompts escritos em fala clara e natural. No RunComfy, você digita o conteúdo que deseja ouvir e pode orientar a interpretação com uma voz predefinida, clipes de referência ou uma única imagem. Ele foi criado para quem precisa gerar áudio por prompt sem organizar sessões de gravação.
Seed Audio 1.0 funciona bem para locuções, narrações, falas de personagens, trechos de dramaturgia em áudio e leituras multilíngues. As vozes predefinidas e os controles de interpretação ajustam ritmo, volume e tom a uma cena ou marca. O áudio de referência também ajuda a manter uma interpretação específica em vários clipes.
Você pode anexar até três clipes e citá-los no prompt, em ordem, como @Audio1, @Audio2 e @Audio3. Assim, é possível combinar fontes ou levar uma interpretação desejada à leitura. Como alternativa, uma única imagem pode orientar o tom, mas referências de imagem e áudio não podem ser combinadas na mesma solicitação. Para resultados confiáveis, mantenha cada clipe em cerca de 30 segundos e 10MB.
Criadores de conteúdo, equipes de produto e estúdios de localização podem usar Seed Audio 1.0 em locuções explicativas, instruções de aplicativos, anúncios e dublagem entre idiomas. Desenvolvedores podem integrá-lo a fluxos que geram fala sob demanda a partir de roteiros ou textos de campanha. Vozes predefinidas e interpretação por referência atendem tanto a rascunhos rápidos quanto a personagens específicos.
Seed Audio 1.0 exige um prompt e aceita, opcionalmente, uma voz predefinida, áudio de referência ou uma única imagem, além de controles de velocidade, volume e tom. Áudio e imagem de referência são alternativas e não podem ser usados juntos. A saída pode ser wav, mp3, pcm ou ogg_opus, com taxa de amostragem de 8 kHz a 48 kHz. Como tamanho e formatos podem variar conforme o provedor, consulte o painel de parâmetros do RunComfy antes de implementar.
Sim. Na interface web do RunComfy AI Playground, ajuste prompt, voz, referências e controles até chegar ao resultado desejado. Depois, chame o mesmo Seed Audio 1.0 pela API com parâmetros idênticos para automatizar seu backend ou fluxo de conteúdo. Assim, você testa no navegador e executa em produção no código sem alterar o comportamento do modelo.
As gerações do Seed Audio 1.0 consomem usd / credits do saldo do RunComfy. Segundo as informações disponíveis do provedor, o modelo custa $0.075 por minuto de áudio gerado. Novos usuários normalmente recebem um valor usd gratuito para testar; depois, o uso segue as regras de Generation exibidas na página. Consulte essa seção para conhecer preços atuais e diferenças entre modos.
RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.