Pikadditions로 이미지 속 인물이나 사물을 기존 동영상에 추가합니다.
Seed Audio 1.0은 Bytedance의 텍스트 기반 오디오 모델로, 글로 작성한 프롬프트를 또렷하고 자연스러운 말소리와 음성 콘텐츠로 바꿉니다. 결과는 텍스트 프롬프트만 사용하거나, 최대 3개의 짧은 레퍼런스 클립을 첨부하거나, 전달 방식을 유도하는 한 장의 레퍼런스 이미지를 제공하는 세 가지 방식으로 조정할 수 있습니다.
출력 형식: 오디오 전용 / 형식 wav, mp3, pcm, ogg_opus / 샘플 레이트 8 kHz~48 kHz.
Seed Audio 1.0은 전달 방식을 제어할 수 있는 빠르고 유연한 오디오 합성 모델입니다.
| 매개변수 | 필수 | 유형 | 기본값 | 범위 / 옵션 | 설명 |
|---|---|---|---|---|---|
| prompt* | 예 (*) | string | — | 자유 입력 | 합성할 텍스트. 레퍼런스 클립은 @Audio1, @Audio2, @Audio3 순서로 지정합니다. |
| voice | 아니요 | string | vivi_mixed_en_zh_ja_es_id | 프리셋 음성 목록 | 합성에 사용할 프리셋 음성입니다. |
| audio_urls | 아니요 | array | — | 최대 3개 URL | 레퍼런스 클립(wav/mp3/pcm/ogg_opus). 각 클립은 최대 30초, 10MB입니다. |
| image_url | 아니요 | string | — | jpeg/png/webp, 최대 10MB | 레퍼런스 이미지 1장. 오디오 레퍼런스와 함께 사용할 수 없습니다. |
| output_format | 아니요 | string | mp3 | wav, mp3, pcm, ogg_opus | 출력 오디오의 컨테이너 형식입니다. |
| sample_rate | 아니요 | integer | 24000 | 8000 - 48000 | 출력 샘플 레이트(Hz)입니다. |
| speed | 아니요 | number | 1 | 0.5 - 2.0 | 읽기 속도. 1.0이 보통입니다. |
| volume | 아니요 | number | 1 | 0.5 - 2.0 | 출력 음량. 1.0이 보통입니다. |
| pitch | 아니요 | integer | 0 | -12 - 12 | 반음 단위 피치 변경입니다. |
RunComfy의 Seed Audio 1.0은 생성된 오디오 길이에 따라 요금이 부과됩니다.
| 과금 단위 | 요금 |
|---|---|
| 생성 오디오 1분당 | $0.075 |
예상 비용
| 길이 | 예상 비용 |
|---|---|
| 15초 | 약 $0.019 |
| 30초 | 약 $0.038 |
| 60초 | 약 $0.075 |
| 120초 | 약 $0.150 |
Seed Audio 1.0으로 또렷한 음성을 만드는 방법은 다음과 같습니다.
Pikadditions로 이미지 속 인물이나 사물을 기존 동영상에 추가합니다.
텍스트 프롬프트로 16:9 동영상을 만들고 길이, 해상도, 프레임률, 오디오 생성 여부를 선택합니다.
필수 텍스트 프롬프트로 동영상을 생성합니다. 여섯 가지 화면 비율, `540p`/`720p`/`1080p`, `5`초/`9`초, 반복 재생 여부를 선택할 수 있습니다.
Seedance 2.5 480p: 빠르고 저렴한 스틸 투 비디오 애니메이션 초안
HappyHorse 1.0은 네이티브 1080p 출력, 시네마틱 모션, 멀티샷 일관성을 제공하는 텍스트-투-비디오 모델입니다.
필수 동영상 URL과 오디오 URL로 립싱크 동영상을 만듭니다. `lipsync-2` 또는 `lipsync-2-pro`를 선택할 수 있으며 Pro는 같은 길이 기준으로 비용이 약 1.67배입니다. 입력 길이가 다를 때는 다섯 가지 동기화 모드를 선택할 수 있습니다.
Seed Audio 1.0은 텍스트 프롬프트를 또렷하고 자연스러운 말소리와 음성 콘텐츠로 바꾸는 Bytedance의 모델입니다. RunComfy에서는 읽힐 내용을 입력하고 선택적으로 프리셋 음성, 레퍼런스 클립, 이미지 한 장을 사용해 전달 방식을 조정할 수 있습니다. 녹음 세션 없이 프롬프트로 오디오를 만들고 싶은 크리에이터에게 적합합니다.
보이스오버, 내레이션, 캐릭터 대사, 짧은 오디오 드라마, 다국어 읽기에 잘 맞습니다. 프리셋 음성과 전달 제어로 장면이나 브랜드에 맞게 속도, 음량, 피치를 조정할 수 있습니다. 레퍼런스 오디오를 지원하므로 여러 클립에서 목표로 한 말투를 일관되게 유지해야 할 때도 유용합니다.
최대 3개의 레퍼런스 클립을 첨부하고 프롬프트에서 순서대로 @Audio1, @Audio2, @Audio3으로 지정할 수 있습니다. 이를 통해 여러 소스를 섞거나 목표로 한 전달 방식을 읽기에 반영할 수 있습니다. 오디오 대신 이미지 한 장으로 톤을 유도할 수도 있지만 이미지와 오디오 레퍼런스는 같은 요청에서 함께 사용할 수 없습니다. 안정적인 결과를 위해 각 레퍼런스 클립은 약 30초, 10MB 이내로 유지하세요.
콘텐츠 제작자, 제품 팀, 현지화 스튜디오가 설명 영상 보이스오버, 앱 음성 안내, 광고 읽기, 다국어 더빙에 활용할 수 있습니다. 개발자는 대본이나 캠페인 문구에서 필요할 때 음성을 생성하는 파이프라인에 Seed Audio 1.0을 연결할 수 있습니다. 프리셋 음성과 레퍼런스 기반 전달 방식을 한 인터페이스에서 함께 제공하므로 빠른 초안부터 구체적인 캐릭터 표현까지 처리할 수 있습니다.
필수 프롬프트와 함께 음성, 레퍼런스 오디오, 이미지를 선택적으로 입력하고 속도, 음량, 피치를 조정할 수 있습니다. 출력 형식은 wav, mp3, pcm, ogg_opus이며 샘플 레이트는 8 kHz~48 kHz입니다. 클립 크기와 지원 형식 같은 정확한 제한은 제공업체 설정에 따라 달라질 수 있으므로 구현 전에 RunComfy 매개변수 패널을 확인하세요.
네. RunComfy AI Playground Web UI에서 프롬프트, 음성, 레퍼런스, 전달 제어를 조정하며 목표한 결과가 나올 때까지 시험할 수 있습니다. 설정이 안정되면 동일한 매개변수로 RunComfy API에서 Seed Audio 1.0을 호출해 백엔드나 콘텐츠 파이프라인을 자동화하세요. 모델 동작을 바꾸지 않고 브라우저 반복 작업에서 코드 기반 프로덕션 실행으로 옮길 수 있습니다.
Seed Audio 1.0 생성에는 RunComfy 잔액의 usd / credits가 사용되며, 이용 가능한 제공업체 정보에 따르면 생성 오디오 1분당 $0.075입니다. 신규 사용자는 일반적으로 시험용 무료 usd 금액을 받고 이후 사용량에는 모델 페이지의 Generation 규칙이 적용됩니다. 최신 요금과 모드별 차이는 Seed Audio 1.0 페이지의 Generation 섹션을 확인하세요.
RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.