필수 동영상 URL과 오디오 URL로 립싱크 동영상을 만듭니다. `lipsync-2` 또는 `lipsync-2-pro`를 선택할 수 있으며 Pro는 같은 길이 기준으로 비용이 약 1.67배입니다. 입력 길이가 다를 때는 다섯 가지 동기화 모드를 선택할 수 있습니다.
Wan 3.0은 텍스트, 이미지, 비디오, 오디오, 파일 및 웹 페이지를 동기화된 사운드와 함께 일관된 클립으로 변환하는 Wan-AI의 올인원 비디오 생성 모델입니다. 이 페이지에서는 Wan 3.0 Image to Video을 제공합니다. 첫 번째 프레임 이미지와 프롬프트를 제공하고 해당 프레임을 2~30초 길이의 클립으로 애니메이션화하며 선택적인 마지막 프레임을 사용하여 샷이 끝나는 방식을 고정합니다. 동일한 기본 모델은 텍스트-비디오 및 비디오 참조도 실행하므로 여기서 개발한 룩은 전체 제품군에 걸쳐 전송됩니다.
| Wan 3.0 장점 | 그것이 당신에게 의미하는 것 |
|---|---|
| 하나의 모델, 많은 입력 | Wan 3.0은 텍스트, 첫 번째/마지막 프레임 이미지, 참조 이미지, 비디오, 오디오, 문서 및 링크를 처리하므로 아이디어 간에 도구를 전환할 필요가 거의 없습니다. |
| 첫 번째 및 마지막 프레임 제어 | 이 페이지에서는 시작 프레임과 종료 프레임을 모두 설정할 수 있으므로 Wan 3.0이 첫 번째 프레임 전용 애니메이션보다 샷이 시작되고 해결되는 방식을 더욱 엄격하게 제어할 수 있습니다. |
| 유연한 2~30초 출력 | Wan 3.0는 짧은 초안이나 긴 싱글 테이크를 렌더링하므로 빠른 반복과 완성된 샷이 동일한 끝점에서 나옵니다. |
| 동기화된 오디오, 선택 사항 | 모든 Wan 3.0 결과에는 일치하는 오디오 트랙이 포함되거나 무성 클립을 내보낼 수 있습니다. 오디오를 전환해도 가격은 변경되지 않습니다. |
첫 번째 표에는 이 페이지의 Wan 3.0 Image to Video 도구에 의해 노출된 컨트롤이 나열되어 있습니다.
| 매개변수 | 필수 | 유형 | 기본값 | 범위 / 옵션 | 선택 방법 |
|---|---|---|---|---|---|
프롬프트* | 예(*) | 문자열 | 예시 프롬프트 | 최대 20,000자 | 피사체, 움직임, 카메라 움직임, 조명 및 스타일을 설명합니다. 명확한 구조는 길이보다 더 중요합니다. |
`image_url* | 예(*) | 문자열 | 예시 이미지 | 이미지 URL 또는 Base64 | 첫 번째 프레임 Wan 3.0에서 애니메이션이 적용됩니다. 최상의 피사체 보존을 위해 선명하고 조명이 밝으며 깔끔한 이미지를 사용하십시오. |
`end_image_url | 아니요 | 문자열 | 비어 있음 | 이미지 URL 또는 Base64 | 선택적 마지막 프레임입니다. 엔딩 포즈나 구도가 정해졌을 때 설정하세요. |
| '해상도' | 아니요 | 문자열 | `720p | 480p, 720p, 1080p | 빠른 초안을 작성하려면 480p을 사용하고 더 자세한 내용을 전달하려면 1080p을 사용하세요. |
`aspect_ratio | 아니요 | 문자열 | `adaptive | adaptive, 16:9, 9:16, 1:1, 4:3, 3:4 | 입력 이미지를 따르려면 adaptive을 그대로 두거나 특정 배치에 대한 비율을 강제로 적용하세요. |
기간 | 아니요 | 정수 | 5 | 2~30초 | 모션을 다듬는 동안 짧게 유지하고 방향이 확정되면 올립니다. |
`thinking_mode | 아니요 | 부울 | '거짓' | 참 / 거짓 | 여러 동작이나 구성 규칙을 결합하는 복잡한 프롬프트를 활성화합니다. |
`enable_audio | 아니요 | 부울 | '사실' | 참 / 거짓 | 동기화된 오디오 트랙을 계속 사용하세요. 조용한 클립을 위해 끄십시오. |
| '씨앗' | 아니요 | 정수 | 무작위 | 0-2147483647 | 작고 유사한 편집을 수행하는 동안 결과를 재현하기 위해 시드를 수정합니다. |
다음 표에는 더 넓은 Wan 3.0 모델이 요약되어 있습니다. 참조, 문서 및 텍스트 전용 입력은 이 이미지-비디오 페이지의 컨트롤이 아닌 모델의 다른 모드 및 형제 도구를 통해 사용할 수 있습니다.
| 핵심 차원 | Wan 3.0 |
|---|---|
| 모델 | `wan3.0-video |
| 세대 모드 | 텍스트-비디오; 이미지-비디오(첫 번째 프레임 또는 첫 번째 + 마지막 프레임); 이미지, 비디오 및 오디오의 비디오 참조; 게다가 문서 및 웹 링크 참조. |
| 출력 기간 | 2~30초. 비디오 입력의 경우 입력과 출력이 30초 이내에 유지됩니다. 스마트 기간 옵션을 사용하면 Wan 3.0에서 길이를 추천할 수 있습니다. |
| 해상도 | 480P, 720P 또는 1080P. |
| 출력 종횡비 | adaptive(입력에서 권장) 또는 16:9, 4:3, 1:1, 3:4, 9:16. |
| 오디오 출력 | 사진과 함께 생성되고 기본적으로 켜져 있는 선택적 동기화 오디오. |
| 첫 번째/마지막 프레임 입력 | 최대 1개의 first_frame 및 1개의 last_frame. 이미지: JPEG, JPG, PNG, BMP 또는 WEBP; 측면당 '240~8000' 픽셀; 종횡비 최대 '8:1'; 각각 최대 20MB. |
| 참고 이미지 | 피사체, 객체 또는 장면 일관성을 위한 최대 10개의 참조 이미지. |
| 참고 동영상 | 최대 5개의 클립; MP4 또는 MOV; 각각 1~15초; 최대 15초의 영상 결합; 측면당 '240~4096' 픽셀; 클립당 최대 100MB. |
| 참조 오디오 | 최대 5개의 클립; WAV 또는 MP3; 최대 15초의 오디오 결합; 각각 최대 15MB. |
| 문서/웹 입력 | 문서 1개(DOCX, PDF, PPTX, XLSX, TXT 등 최대 50페이지) 또는 공개 웹 링크 1개. |
| 모드 독점 | 첫 번째/마지막 프레임 입력은 동일한 요청의 참조, 문서 또는 링크 입력과 결합될 수 없습니다. |
| 프롬프트 제한 | 최대 20,000자입니다. |
Wan 3.0 가격은 선택한 해결 방법과 생성 기간에 따라 달라집니다. Wan 3.0 오디오를 활성화하거나 비활성화해도 속도는 변경되지 않습니다.
| 해결 | 초당 가격 | 5초 | 10대 | 30대 |
|---|---|---|---|---|
| 480p | $0.06 | $0.30 | $0.60 | $1.80 |
| 720p | $0.12 | $0.60 | $1.20 | $3.60 |
| 1080p | $0.25 | $1.25 | $2.50 | $7.50 |
1~4개 출력 배치의 경우 '기간 × 초당 속도 × 출력 횟수'로 총계를 계산합니다.
재사용 가능한 Wan 3.0 구조를 사용하세요.
[주제 + 세부 사항 정의] + [시간에 따른 하나의 동작] + [카메라 프레이밍 및 움직임] + [설정 + 조명] + [시각적 처리] + [오디오] + [엔딩 프레임 또는 제약 조건]
이 Wan 3.0 비교를 모델 제품군 가이드로 사용하세요. 최대 해상도와 지속 시간은 함께 사용할 수 없으며, 도구마다 다른 입력 및 컨트롤이 노출될 수 있습니다. 공개적으로 이용 가능한 정보를 기반으로 합니다.
| 모델 | 해결 | 최대 기간 | 오디오 | 눈에 띄는 |
|---|---|---|---|---|
| Wan 3.0 | 480p–1080p | 30대 | 선택적 동기화 오디오 | 텍스트, 첫 번째/마지막 프레임, 이미지, 비디오, 오디오의 비디오 참조, 문서 및 웹 입력을 포괄하는 하나의 올인원 모델입니다. |
| 클링 3.0 | 최대 4K | 15초 | 립싱크가 포함된 네이티브 오디오 | 대본이 있는 광고와 캐릭터 장면에 대해 다중 촬영 카메라 변경과 화자가 할당한 대화를 조정합니다. |
| 하이뤄 02 | 1080p | ~10초 | 없음 | 조용한 액션과 제품 촬영을 위한 물리학 중심의 모션과 강력하고 신속한 준수. |
| 시던스 2.5 | 1080p | 30대 | 공동 오디오 및 비디오 | 신원에 민감한 편집을 위해 동기화된 음성 및 효과를 갖춘 참조가 많은 생성입니다. |
| 베오 3.1 | 4K | 8초 | 네이티브 대화 및 효과 | 영화 전환 및 조합된 시퀀스에 적합한 첫 번째/마지막 프레임 및 참조 컨트롤입니다. |
Wan 3.0을 차별화하는 것은 폭입니다. 첫 번째 프레임에 애니메이션을 적용하고 마지막 프레임을 존중하며 이미지, 비디오, 오디오, 문서 및 링크에서 가져올 수 있는 단일 모델이며 선택적으로 동기화된 사운드를 생성합니다. 생기를 불어넣을 시작 프레임이 있으면 Wan 3.0 Image to Video을 선택하고, 시작점이 변경되면 텍스트 또는 참조 도구로 이동하세요.
필수 동영상 URL과 오디오 URL로 립싱크 동영상을 만듭니다. `lipsync-2` 또는 `lipsync-2-pro`를 선택할 수 있으며 Pro는 같은 길이 기준으로 비용이 약 1.67배입니다. 입력 길이가 다를 때는 다섯 가지 동기화 모드를 선택할 수 있습니다.
정지 이미지를 네이티브 4K 시네마틱 영상으로 구현합니다. 시작 이미지는 필수이며 종료 이미지는 선택 사항이고, 동기화 오디오를 지원합니다.
영상 길이, 출력 크기, 장면 구조, 시드, 네거티브 프롬프트 및 오디오 생성에 대한 제어 기능을 사용하여 텍스트 프롬프트와 1~3개의 참조 클립에서 동영상을 만듭니다.
이미지 1장으로 영화 같은 4K 영상을 생성하며 출력 1초당 $0.42입니다.
Sora 2 Pro로 텍스트 프롬프트에서 동영상을 만들고 출력 크기와 길이를 선택합니다.
영상 배경을 분리하고 후반 작업에 맞게 코덱과 색 번짐 억제를 조절하세요.
Wan 3.0 이미지-비디오는 단일 첫 번째 프레임 이미지를 가져와 텍스트 프롬프트에 따라 짧고 일관된 클립으로 애니메이션을 적용합니다. 리깅이나 수동 키프레임 없이 제품 사진, 인물 사진, 라이프스타일 사진 또는 컨셉 아트를 모션으로 전환하는 데 적합합니다.
항상 첫 번째 프레임 이미지를 제공하고, 종료 포즈나 구성이 중요한 경우 선택적으로 마지막 프레임 이미지를 추가할 수 있습니다. 그런 다음 Wan 3.0은 첫 번째 프레임에서 시작하여 마지막 프레임을 향해 해결되는 연속 모션을 생성하여 샷의 시작과 종료 방식을 더욱 세밀하게 제어할 수 있습니다.
첫 번째 프레임이 비디오의 오프닝으로 직접 사용되기 때문에 Wan 3.0은 클립 전체에서 피사체의 모습과 프레임을 일관되게 유지하는 경향이 있습니다. 선명하고 조명이 밝으며 정돈된 입력 이미지를 사용하면 피사체가 가장 잘 보존됩니다.
Wan 3.0는 480p, 720p 및 1080p 출력을 지원하며 720p은 공통 기본값입니다. 지속 시간은 2~30초 범위에서 조정 가능하며 화면 비율은 와이드스크린, 수직, 정사각형 또는 클래식으로 설정하거나 adaptive로 설정하여 입력 이미지를 따라갈 수 있습니다. 정확한 전류 제한은 RunComfy 매개변수 패널을 확인하세요.
예. Wan 3.0은 클립과 함께 동기화된 오디오 트랙을 생성할 수 있으며, 무성 영상만 필요한 경우 오디오를 끌 수 있습니다. 오디오를 전환해도 생성 비용은 변경되지 않습니다.
입력 이미지는 JPEG, PNG 또는 WEBP와 같은 일반적인 형식이어야 하며 적절한 해상도와 종횡비가 있어야 합니다. 품질이 매우 낮거나 프레임이 너무 복잡하면 모션 품질이 저하될 수 있으므로 깨끗하고 해상도가 높은 첫 번째 프레임을 선호하세요. 한도는 공급자 설정에 따라 다를 수 있습니다.
예. RunComfy 모델 UI에서 Wan 3.0의 프로토타입을 만든 다음 생산 또는 자동화를 위해 동일한 매개변수를 사용하여 RunComfy HTTP API을 통해 동일한 모델을 호출할 수 있습니다. 이를 통해 모델을 변경하지 않고도 브라우저 테스트에서 통합 파이프라인으로 이동할 수 있습니다.
세대는 출력 해상도 및 기간에 따라 USD 또는 크레딧을 소비합니다. 480p에서는 초당 $0.06, 720p에서는 초당 $0.12, 1080p에서는 초당 $0.25입니다. 신규 사용자는 일반적으로 대규모 실행을 시작하기 전에 Wan 3.0을 사용해 볼 수 있는 무료 평가판을 받습니다.
RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.





