logo
RunComfy
  • ComfyUI
  • TrainerNuovo
  • Modelli
  • API
  • Prezzi
discord logo
MODELLI
Esplora
Tutti i modelli
LIBRERIA
Generazioni
API DEI MODELLI
Documentazione API
Chiavi API
ACCOUNT
Utilizzo

Seed Audio 1.0: text-to-audio con voci preimpostate e audio di riferimento, su Models e via API | RunComfy

bytedance/seed-audio-1.0/text-to-audio

Genera voce e audio parlato naturali da testo, clip di riferimento o un'immagine con Seed Audio 1.0 su RunComfy. Include voci preimpostate, velocità, altezza tonale e formato di output regolabili, ed è disponibile nel browser e via API.

Testo da sintetizzare. Cita le clip di riferimento in ordine con @Audio1, @Audio2, @Audio3.
Voce preimpostata usata per la sintesi.
Fino a 3 clip di riferimento, citate nel prompt come @Audio1, @Audio2, @Audio3. Ogni clip può durare fino a 30s e pesare 10MB; formati wav/mp3/pcm/ogg_opus.
Una sola immagine di riferimento (jpeg/png/webp, fino a 10MB). Non può essere combinata con riferimenti audio.
Contenitore audio di output.
Frequenza di campionamento dell'audio in uscita, in Hz.
Velocità di lettura. 1.0 è normale, 0.5 è dimezzata, 2.0 è raddoppiata.
Volume in uscita. 1.0 è normale, 0.5 è dimezzato, 2.0 è raddoppiato.
Variazione dell'altezza della voce in semitoni. 0 è normale, -12 abbassa di un'ottava, 12 alza di un'ottava.
Idle
The rate is $0.075 per minute.

Introduzione a Seed Audio 1.0

Seed Audio 1.0 di Bytedance trasforma prompt scritti in audio naturale di alta qualità e può essere guidato dal testo, da un massimo di tre clip di riferimento o da una singola immagine, al costo di $0.075 al minuto.
Sostituendo sessioni di registrazione su copione e pianificazione dei doppiatori con una sintesi guidata da prompt, Seed Audio 1.0 consente a creator, team di prodotto e studi di localizzazione di produrre audio parlato in pochi minuti.
Gli sviluppatori possono usare Seed Audio 1.0 su RunComfy sia nel browser sia tramite API HTTP, senza dover ospitare o scalare il modello in autonomia.
Ideale per: Voice-over e narrazione | Localizzazione multilingue | Prototipazione audio interattiva

Bytedance / Seed Audio 1.0#


Seed Audio 1.0 è un modello text-to-audio di Bytedance che trasforma prompt scritti in voce e audio parlato chiari e naturali. Puoi guidare il risultato in tre modi: con un semplice prompt testuale, con un massimo di tre brevi clip di riferimento o con una singola immagine di riferimento che orienta l'interpretazione.


Formato di output: solo audio / formati wav, mp3, pcm, ogg_opus / frequenza di campionamento da 8 kHz a 48 kHz.


Punti di forza#


Seed Audio 1.0 è progettato per una sintesi audio rapida, flessibile e controllabile nell'interpretazione.


  • Tre modalità di guida: controlla la sintesi solo con il testo, con voci preimpostate o con il tuo audio di riferimento; in alternativa all'audio è supportata anche un'immagine di riferimento.
  • Audio di riferimento per ordine: cita fino a tre clip nel prompt con @Audio1, @Audio2 e @Audio3 per combinare sorgenti o trasferire un'interpretazione di riferimento alla lettura.
  • Voci preimpostate multilingue: scegli tra voci che combinano inglese, cinese, spagnolo, giapponese, indonesiano e portoghese.
  • Controlli dell'interpretazione: regola velocità, volume e altezza tonale per adattare ritmo e tono alle esigenze del progetto.
  • Esportazione flessibile: esporta wav, mp3, pcm o ogg_opus con frequenze di campionamento fino a 48 kHz per la successiva elaborazione.

Parametri#


ParametroObbligatorioTipoPredefinitoIntervallo / OpzioniDescrizione
prompt*Sì (*)string—Testo liberoTesto da sintetizzare; cita le clip di riferimento in ordine con @Audio1, @Audio2, @Audio3.
voiceNostringvivi_mixed_en_zh_ja_es_idElenco voci preimpostateVoce preimpostata usata per la sintesi.
audio_urlsNoarray—Fino a 3 URLClip di riferimento (wav/mp3/pcm/ogg_opus), ciascuna fino a 30s e 10MB.
image_urlNostring—jpeg/png/webp, fino a 10MBUna sola immagine di riferimento; non può essere combinata con riferimenti audio.
output_formatNostringmp3wav, mp3, pcm, ogg_opusContenitore audio di output.
sample_rateNointeger240008000 - 48000Frequenza di campionamento in uscita, in Hz.
speedNonumber10.5 - 2.0Velocità di lettura; 1.0 corrisponde al ritmo normale.
volumeNonumber10.5 - 2.0Volume in uscita; 1.0 corrisponde al volume normale.
pitchNointeger0-12 - 12Variazione dell'altezza tonale in semitoni.

Prezzi#


Seed Audio 1.0 su RunComfy adotta una tariffazione basata sulla durata dell'audio generato.


Unità di fatturazioneTariffa
Per minuto di audio generato$0.075

Esempi di costo stimato


DurataCosto approssimativo
15 s~$0.019
30 s~$0.038
60 s~$0.075
120 s~$0.150

Come si usa#


Segui questi passaggi per ottenere una lettura pulita con Seed Audio 1.0.


  1. Apri il modello Seed Audio 1.0 su RunComfy e visualizza il pannello di generazione.
  2. Scrivi il prompt da leggere usando una punteggiatura naturale, così fraseggio e pause risultano corretti.
  3. Scegli una voce preimpostata oppure omettila e allega audio di riferimento quando vuoi un'interpretazione specifica.
  4. Per usare i riferimenti, aggiungi fino a tre URL di clip e citali nel prompt come @Audio1, @Audio2, @Audio3.
  5. In alternativa, fornisci un'immagine di riferimento al posto dell'audio per orientare il tono della lettura.
  6. Regola velocità, volume e altezza tonale, quindi scegli output_format e sample_rate adatti al tuo flusso di lavoro.
  7. Avvia la generazione, ascolta l'anteprima e scarica il file dalla cronologia dei job.
  8. Per automatizzare, invia gli stessi campi all'endpoint Seed Audio 1.0 su RunComfy; non è necessario il self-hosting.

Suggerimenti per prompt e riferimenti#


  • Scrivi come vuoi che il testo venga pronunciato: frasi brevi e punteggiatura chiara producono un ritmo più stabile in Seed Audio 1.0.
  • Mantieni le clip di riferimento brevi e pulite; per risultati affidabili, ciascuna deve restare sotto 30 secondi e 10MB.
  • Fai corrispondere l'ordine delle clip alle citazioni nel prompt, così @Audio1, @Audio2 e @Audio3 indicano le sorgenti corrette.
  • Usa una voce preimpostata per le bozze rapide, poi passa all'audio di riferimento quando serve un personaggio specifico.
  • Usa la guida tramite immagine solo quando non invii audio, perché le due modalità di riferimento non possono essere combinate.
  • Modifica velocità e altezza tonale a piccoli passi: variazioni ampie possono rendere innaturale la lettura.

Confronto tra Seed Audio 1.0 e altri modelli#


  • Prompt multimodale: a differenza di molti strumenti vocali basati solo su testo, Seed Audio 1.0 accetta testo, audio di riferimento o un'immagine per definire l'output, in base alle informazioni pubblicamente disponibili.
  • Gestione dei riferimenti: citare le clip per ordine con marcatori @Audio offre un controllo più preciso delle sorgenti rispetto a un singolo slot vocale fisso.
  • Flessibilità di output: diversi formati contenitore e un ampio intervallo di frequenze di campionamento consentono di inserire facilmente i risultati di Seed Audio 1.0 nelle pipeline esistenti.

Modelli correlati

happyhorse-1.0/reference-to-video

HappyHorse 1.0 Reference to Video fonde fino a 9 immagini di riferimento e un messaggio in una clip coerente composta da più caratteri con identità stabile. Use HappyHorse 1.0 Reference to Video on RunComfy.

hunyuan-video-v1.5/text-to-video

Genera un video di 5 o 8 secondi da un prompt obbligatorio, con prompt negativo facoltativo, quattro dimensioni di output precise e controllo del seed.

kling-video-o3/pro/text-to-video

Generazione text-to-video cinematografica di fascia Pro a $0.112 per secondo di output.

flux-3/first-last-frame-to-video/draft

FLUX 3 Draft FLF: anteprime video veloci dei fotogrammi di inizio e fine a 720p

kling-3.0/4k/text-to-video

Genera video cinematografici text-to-video nativi in 4K con dialoghi sincronizzati e personaggi coerenti.

gemini-omni-flash/reference-to-video

Crea un breve video con audio sincronizzato da immagini di riferimento e un prompt.

Domande Frequenti

Che cos'è Seed Audio 1.0 e cosa fa in un flusso text-to-audio?

Seed Audio 1.0 è un modello text-to-audio di Bytedance che trasforma prompt scritti in voce e audio parlato chiari e naturali. In un flusso text-to-audio su RunComfy, inserisci il testo da leggere e, facoltativamente, orienti l'interpretazione con una voce preimpostata, clip di riferimento o una singola immagine. È pensato per creator che vogliono produrre audio tramite prompt senza organizzare sessioni di registrazione.

Per quali attività di generazione è più adatto Seed Audio 1.0?

Seed Audio 1.0 è adatto a voice-over, narrazione, battute di personaggi, brevi radiodrammi e letture multilingue. Voci preimpostate e controlli dell'interpretazione consentono di regolare ritmo, volume e altezza tonale in base a scena o brand. Grazie all'audio di riferimento, è utile anche quando serve mantenere un'interpretazione coerente in più clip.

Come usa Seed Audio 1.0 l'audio e le immagini di riferimento?

Con Seed Audio 1.0 puoi allegare fino a tre clip di riferimento e citarle in ordine nel prompt come @Audio1, @Audio2 e @Audio3, per combinare sorgenti o trasferire un'interpretazione alla lettura. In alternativa, puoi fornire una sola immagine per orientare il tono, ma riferimenti visivi e audio non possono essere combinati nella stessa richiesta. Per risultati affidabili, ogni clip di riferimento deve restare breve, entro circa 30 secondi e 10MB.

Quali team e casi d'uso traggono maggiore vantaggio da Seed Audio 1.0 in produzione?

Creator, team di prodotto e studi di localizzazione possono usare Seed Audio 1.0 per voice-over esplicativi, messaggi vocali nelle app, letture pubblicitarie e doppiaggio multilingue. Gli sviluppatori possono integrarlo in pipeline che generano voce su richiesta da copioni o testi di campagne. Voci preimpostate e interpretazione guidata da riferimenti coprono sia bozze rapide sia personaggi più specifici dalla stessa interfaccia.

Quali opzioni di input e output devo conoscere prima di usare Seed Audio 1.0?

Seed Audio 1.0 richiede un prompt e accetta facoltativamente una voce preimpostata, audio di riferimento oppure una singola immagine, oltre a controlli per velocità, volume e altezza tonale. Audio e immagine di riferimento sono alternative e non possono essere usati insieme. L'output può essere wav, mp3, pcm o ogg_opus, con frequenze di campionamento da 8 kHz a 48 kHz. Limiti esatti, come dimensione delle clip e formati supportati, possono variare in base alle impostazioni del provider: consulta il pannello dei parametri RunComfy prima dell'integrazione.

Gli sviluppatori possono usare Seed Audio 1.0 tramite l'API RunComfy?

Sì. Puoi prima mettere a punto Seed Audio 1.0 nella RunComfy AI Playground Web UI regolando prompt, voce, riferimenti e controlli dell'interpretazione fino a raggiungere il risultato desiderato. Quando la configurazione è stabile, richiama lo stesso modello Seed Audio 1.0 tramite API RunComfy con parametri identici per automatizzare la generazione dal backend o dalla pipeline di contenuti. Puoi così iterare nel browser ed eseguire la produzione nel codice senza cambiare il comportamento del modello.

Quanto costa generare con Seed Audio 1.0 su RunComfy?

Le generazioni di Seed Audio 1.0 vengono addebitate sul saldo RunComfy in usd / credits e, in base alle informazioni disponibili sul provider, sono fatturate a $0.075 per minuto di audio generato. I nuovi utenti in genere ricevono un credito di prova gratuito in usd, dopodiché l'utilizzo segue le regole Generation mostrate nella pagina del modello. Per le tariffe aggiornate e le eventuali differenze tra modalità, consulta la sezione Generation della pagina Seed Audio 1.0 su RunComfy.

Seguici
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Supporto
  • Discord
  • Email
  • Stato del Sistema
  • affiliato
Modelli Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Visualizza tutti i modelli →
Modelli Immagine
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Visualizza tutti i modelli →
Legale
  • Termini di Servizio
  • Informativa sulla Privacy
  • Informativa sui Cookie
RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.