logo
RunComfy
  • ComfyUI
  • 트레이너신규
  • 모델
  • API
  • 가격
discord logo
모델
탐색
모든 모델
라이브러리
생성 기록
모델 API
API 문서
API 키
계정
사용량

Seed Audio 1.0: 음성 프리셋·레퍼런스 오디오를 활용한 텍스트 음성 생성 | RunComfy Models 및 API

bytedance/seed-audio-1.0/text-to-audio

Seed Audio 1.0으로 텍스트, 레퍼런스 클립, 이미지에서 자연스러운 말소리와 오디오를 생성하세요. 음성 프리셋과 속도, 피치, 출력 형식을 조정할 수 있으며 RunComfy 브라우저와 API에서 이용할 수 있습니다.

음성으로 합성할 텍스트입니다. 레퍼런스 클립은 순서대로 @Audio1, @Audio2, @Audio3으로 지정합니다.
합성에 사용할 프리셋 음성입니다.
최대 3개의 레퍼런스 클립입니다. 프롬프트에서 @Audio1, @Audio2, @Audio3으로 지정합니다. 각 클립은 최대 30초, 10MB이며 wav/mp3/pcm/ogg_opus를 지원합니다.
레퍼런스 이미지 1장(jpeg/png/webp, 최대 10MB)입니다. 오디오 레퍼런스와 함께 사용할 수 없습니다.
출력 오디오의 컨테이너 형식입니다.
출력 오디오의 샘플 레이트(Hz)입니다.
읽기 속도입니다. 1.0은 보통, 0.5는 절반, 2.0은 두 배 속도입니다.
출력 음량입니다. 1.0은 보통, 0.5는 절반, 2.0은 두 배 음량입니다.
음성 피치를 반음 단위로 바꿉니다. 0은 기본, -12는 한 옥타브 낮게, 12는 한 옥타브 높게 조정합니다.
Idle
The rate is $0.075 per minute.

Seed Audio 1.0 소개

Bytedance의 Seed Audio 1.0은 텍스트 프롬프트를 고품질의 자연스러운 오디오로 바꾸며, 텍스트와 최대 3개의 레퍼런스 클립 또는 한 장의 이미지로 결과를 유도할 수 있습니다. 요금은 분당 $0.075입니다.
대본 녹음과 성우 일정 조율을 프롬프트 기반 합성으로 대체해 크리에이터와 제품 팀, 현지화 스튜디오가 몇 분 안에 음성 콘텐츠를 만들 수 있도록 돕습니다.
RunComfy에서는 브라우저와 HTTP API에서 모두 사용할 수 있어 모델을 직접 호스팅하거나 확장할 필요가 없습니다.
추천 용도: 보이스오버 및 내레이션 | 다국어 현지화 | 인터랙티브 오디오 프로토타이핑

Bytedance / Seed Audio 1.0#


Seed Audio 1.0은 Bytedance의 텍스트 기반 오디오 모델로, 글로 작성한 프롬프트를 또렷하고 자연스러운 말소리와 음성 콘텐츠로 바꿉니다. 결과는 텍스트 프롬프트만 사용하거나, 최대 3개의 짧은 레퍼런스 클립을 첨부하거나, 전달 방식을 유도하는 한 장의 레퍼런스 이미지를 제공하는 세 가지 방식으로 조정할 수 있습니다.


출력 형식: 오디오 전용 / 형식 wav, mp3, pcm, ogg_opus / 샘플 레이트 8 kHz~48 kHz.


주요 특징#


Seed Audio 1.0은 전달 방식을 제어할 수 있는 빠르고 유연한 오디오 합성 모델입니다.


  • 세 가지 유도 방식: 텍스트만 사용하거나 프리셋 음성 또는 자체 레퍼런스 오디오로 합성할 수 있습니다. 오디오 대신 레퍼런스 이미지로도 유도할 수 있습니다.
  • 순서로 지정하는 레퍼런스 오디오: 프롬프트에서 최대 3개의 클립을 @Audio1, @Audio2, @Audio3으로 지정해 여러 소스를 섞거나 원하는 전달 방식을 읽기에 반영할 수 있습니다.
  • 다국어 프리셋: 영어, 중국어, 스페인어, 일본어, 인도네시아어, 포르투갈어 조합을 아우르는 프리셋 음성을 선택할 수 있습니다.
  • 전달 방식 제어: 속도, 음량, 피치를 조정해 프로젝트에 필요한 템포와 톤을 맞출 수 있습니다.
  • 유연한 출력: wav, mp3, pcm, ogg_opus로 내보낼 수 있으며 최대 48 kHz 샘플 레이트를 지원해 후속 편집 작업에 쉽게 연결할 수 있습니다.

파라미터#


매개변수필수유형기본값범위 / 옵션설명
prompt*예 (*)string—자유 입력합성할 텍스트. 레퍼런스 클립은 @Audio1, @Audio2, @Audio3 순서로 지정합니다.
voice아니요stringvivi_mixed_en_zh_ja_es_id프리셋 음성 목록합성에 사용할 프리셋 음성입니다.
audio_urls아니요array—최대 3개 URL레퍼런스 클립(wav/mp3/pcm/ogg_opus). 각 클립은 최대 30초, 10MB입니다.
image_url아니요string—jpeg/png/webp, 최대 10MB레퍼런스 이미지 1장. 오디오 레퍼런스와 함께 사용할 수 없습니다.
output_format아니요stringmp3wav, mp3, pcm, ogg_opus출력 오디오의 컨테이너 형식입니다.
sample_rate아니요integer240008000 - 48000출력 샘플 레이트(Hz)입니다.
speed아니요number10.5 - 2.0읽기 속도. 1.0이 보통입니다.
volume아니요number10.5 - 2.0출력 음량. 1.0이 보통입니다.
pitch아니요integer0-12 - 12반음 단위 피치 변경입니다.

요금#


RunComfy의 Seed Audio 1.0은 생성된 오디오 길이에 따라 요금이 부과됩니다.


과금 단위요금
생성 오디오 1분당$0.075

예상 비용


길이예상 비용
15초약 $0.019
30초약 $0.038
60초약 $0.075
120초약 $0.150

사용 방법#


Seed Audio 1.0으로 또렷한 음성을 만드는 방법은 다음과 같습니다.


  1. RunComfy에서 Seed Audio 1.0 모델을 열고 생성 패널을 표시합니다.
  2. 음성으로 만들 프롬프트를 작성합니다. 자연스러운 문장부호를 사용하면 구문과 쉼의 흐름이 좋아집니다.
  3. 프리셋 음성을 선택합니다. 특정한 전달 방식이 필요하면 프리셋 대신 레퍼런스 오디오를 첨부합니다.
  4. 레퍼런스를 사용할 때는 최대 3개의 클립 URL을 추가하고 프롬프트에서 @Audio1, @Audio2, @Audio3으로 지정합니다.
  5. 오디오 대신 한 장의 레퍼런스 이미지를 제공해 읽는 톤을 유도할 수도 있습니다.
  6. 속도, 음량, 피치를 조정하고 작업 흐름에 맞는 output_format과 sample_rate를 선택합니다.
  7. 생성을 실행해 결과를 미리 듣고 작업 기록에서 파일을 다운로드합니다.
  8. 자동화하려면 같은 필드를 RunComfy의 Seed Audio 1.0 엔드포인트로 전송하세요. 자체 호스팅은 필요하지 않습니다.

프롬프트 및 레퍼런스 팁#


  • 실제로 말하기를 원하는 방식으로 작성하세요. 짧은 문장과 명확한 문장부호를 사용하면 Seed Audio 1.0의 읽기 속도가 더 안정적입니다.
  • 레퍼런스 클립은 짧고 깨끗한 것을 사용하세요. 안정적인 결과를 위해 각 클립을 30초, 10MB 이하로 유지합니다.
  • @Audio1, @Audio2, @Audio3이 의도한 소스를 가리키도록 클립 순서와 프롬프트의 표기를 맞추세요.
  • 빠른 초안에는 프리셋 음성을 사용하고, 특정한 캐릭터 표현이 필요하면 레퍼런스 오디오로 전환하세요.
  • 이미지와 오디오 레퍼런스는 함께 사용할 수 없으므로 오디오를 전달하지 않을 때만 이미지 유도를 사용하세요.
  • 속도와 피치는 조금씩 조정하세요. 변화 폭이 크면 음성이 부자연스럽게 들릴 수 있습니다.

Seed Audio 1.0과 다른 모델 비교#


  • 멀티모달 프롬프트: 많은 텍스트 전용 음성 도구와 달리 Seed Audio 1.0은 텍스트, 레퍼런스 오디오, 이미지로 결과를 조정할 수 있습니다(공개 정보 기준).
  • 레퍼런스 처리: @Audio 마커로 클립 순서를 지정할 수 있어 고정 음성 슬롯 하나만 있는 방식보다 소스를 세밀하게 제어할 수 있습니다.
  • 유연한 출력: 여러 컨테이너 형식과 폭넓은 샘플 레이트를 지원해 Seed Audio 1.0 결과를 기존 파이프라인에 쉽게 연결할 수 있습니다.

관련 모델

pikadditions

Pikadditions로 이미지 속 인물이나 사물을 기존 동영상에 추가합니다.

ltx-2/fast/text-to-video

텍스트 프롬프트로 16:9 동영상을 만들고 길이, 해상도, 프레임률, 오디오 생성 여부를 선택합니다.

luma-ray-2/text-to-video

필수 텍스트 프롬프트로 동영상을 생성합니다. 여섯 가지 화면 비율, `540p`/`720p`/`1080p`, `5`초/`9`초, 반복 재생 여부를 선택할 수 있습니다.

seedance-2.5/image-to-video/480p

Seedance 2.5 480p: 빠르고 저렴한 스틸 투 비디오 애니메이션 초안

happyhorse-1.0/text-to-video

HappyHorse 1.0은 네이티브 1080p 출력, 시네마틱 모션, 멀티샷 일관성을 제공하는 텍스트-투-비디오 모델입니다.

sync/lipsync/v2

필수 동영상 URL과 오디오 URL로 립싱크 동영상을 만듭니다. `lipsync-2` 또는 `lipsync-2-pro`를 선택할 수 있으며 Pro는 같은 길이 기준으로 비용이 약 1.67배입니다. 입력 길이가 다를 때는 다섯 가지 동기화 모드를 선택할 수 있습니다.

자주 묻는 질문

Seed Audio 1.0은 무엇이며 텍스트 기반 오디오 작업에서 어떤 역할을 하나요?

Seed Audio 1.0은 텍스트 프롬프트를 또렷하고 자연스러운 말소리와 음성 콘텐츠로 바꾸는 Bytedance의 모델입니다. RunComfy에서는 읽힐 내용을 입력하고 선택적으로 프리셋 음성, 레퍼런스 클립, 이미지 한 장을 사용해 전달 방식을 조정할 수 있습니다. 녹음 세션 없이 프롬프트로 오디오를 만들고 싶은 크리에이터에게 적합합니다.

Seed Audio 1.0은 어떤 생성 작업에 가장 적합한가요?

보이스오버, 내레이션, 캐릭터 대사, 짧은 오디오 드라마, 다국어 읽기에 잘 맞습니다. 프리셋 음성과 전달 제어로 장면이나 브랜드에 맞게 속도, 음량, 피치를 조정할 수 있습니다. 레퍼런스 오디오를 지원하므로 여러 클립에서 목표로 한 말투를 일관되게 유지해야 할 때도 유용합니다.

Seed Audio 1.0은 레퍼런스 오디오와 이미지를 어떻게 사용하나요?

최대 3개의 레퍼런스 클립을 첨부하고 프롬프트에서 순서대로 @Audio1, @Audio2, @Audio3으로 지정할 수 있습니다. 이를 통해 여러 소스를 섞거나 목표로 한 전달 방식을 읽기에 반영할 수 있습니다. 오디오 대신 이미지 한 장으로 톤을 유도할 수도 있지만 이미지와 오디오 레퍼런스는 같은 요청에서 함께 사용할 수 없습니다. 안정적인 결과를 위해 각 레퍼런스 클립은 약 30초, 10MB 이내로 유지하세요.

Seed Audio 1.0은 어떤 팀과 프로덕션 용도에 가장 유용한가요?

콘텐츠 제작자, 제품 팀, 현지화 스튜디오가 설명 영상 보이스오버, 앱 음성 안내, 광고 읽기, 다국어 더빙에 활용할 수 있습니다. 개발자는 대본이나 캠페인 문구에서 필요할 때 음성을 생성하는 파이프라인에 Seed Audio 1.0을 연결할 수 있습니다. 프리셋 음성과 레퍼런스 기반 전달 방식을 한 인터페이스에서 함께 제공하므로 빠른 초안부터 구체적인 캐릭터 표현까지 처리할 수 있습니다.

Seed Audio 1.0을 사용하기 전에 알아야 할 입출력 옵션은 무엇인가요?

필수 프롬프트와 함께 음성, 레퍼런스 오디오, 이미지를 선택적으로 입력하고 속도, 음량, 피치를 조정할 수 있습니다. 출력 형식은 wav, mp3, pcm, ogg_opus이며 샘플 레이트는 8 kHz~48 kHz입니다. 클립 크기와 지원 형식 같은 정확한 제한은 제공업체 설정에 따라 달라질 수 있으므로 구현 전에 RunComfy 매개변수 패널을 확인하세요.

개발자가 RunComfy API로 Seed Audio 1.0을 사용할 수 있나요?

네. RunComfy AI Playground Web UI에서 프롬프트, 음성, 레퍼런스, 전달 제어를 조정하며 목표한 결과가 나올 때까지 시험할 수 있습니다. 설정이 안정되면 동일한 매개변수로 RunComfy API에서 Seed Audio 1.0을 호출해 백엔드나 콘텐츠 파이프라인을 자동화하세요. 모델 동작을 바꾸지 않고 브라우저 반복 작업에서 코드 기반 프로덕션 실행으로 옮길 수 있습니다.

RunComfy에서 Seed Audio 1.0 생성 비용은 얼마인가요?

Seed Audio 1.0 생성에는 RunComfy 잔액의 usd / credits가 사용되며, 이용 가능한 제공업체 정보에 따르면 생성 오디오 1분당 $0.075입니다. 신규 사용자는 일반적으로 시험용 무료 usd 금액을 받고 이후 사용량에는 모델 페이지의 Generation 규칙이 적용됩니다. 최신 요금과 모드별 차이는 Seed Audio 1.0 페이지의 Generation 섹션을 확인하세요.

팔로우하기
  • 링크드인
  • 페이스북
  • Instagram
  • 트위터
지원
  • 디스코드
  • 이메일
  • 시스템 상태
  • 제휴사
비디오 모델
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 모든 모델 보기 →
이미지 모델
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 모든 모델 보기 →
법적 고지
  • 서비스 약관
  • 개인정보 보호정책
  • 쿠키 정책
RunComfy
저작권 2026 RunComfy. All Rights Reserved.

RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.