선택적인 소스 오디오와 크기, 샷 구조, 네거티브 프롬프트, 시드, 프롬프트 확장 및 생성된 오디오에 대한 제어 기능을 사용하여 텍스트 프롬프트에서 5초, 10초 또는 15초 동영상을 생성합니다.
Wan 3.0은 텍스트, 이미지, 비디오, 오디오, 파일 및 웹 페이지를 동기화된 사운드와 함께 일관된 클립으로 변환하는 Wan-AI의 올인원 비디오 생성 모델입니다. 이 페이지에서는 Wan 3.0 Image to Video을 제공합니다. 첫 번째 프레임 이미지와 프롬프트를 제공하고 해당 프레임을 2~30초 길이의 클립으로 애니메이션화하며 선택적인 마지막 프레임을 사용하여 샷이 끝나는 방식을 고정합니다. 동일한 기본 모델은 텍스트-비디오 및 비디오 참조도 실행하므로 여기서 개발한 룩은 전체 제품군에 걸쳐 전송됩니다.
| Wan 3.0 장점 | 그것이 당신에게 의미하는 것 |
|---|---|
| 하나의 모델, 많은 입력 | Wan 3.0은 텍스트, 첫 번째/마지막 프레임 이미지, 참조 이미지, 비디오, 오디오, 문서 및 링크를 처리하므로 아이디어 간에 도구를 전환할 필요가 거의 없습니다. |
| 첫 번째 및 마지막 프레임 제어 | 이 페이지에서는 시작 프레임과 종료 프레임을 모두 설정할 수 있으므로 Wan 3.0이 첫 번째 프레임 전용 애니메이션보다 샷이 시작되고 해결되는 방식을 더욱 엄격하게 제어할 수 있습니다. |
| 유연한 2~30초 출력 | Wan 3.0는 짧은 초안이나 긴 싱글 테이크를 렌더링하므로 빠른 반복과 완성된 샷이 동일한 끝점에서 나옵니다. |
| 동기화된 오디오, 선택 사항 | 모든 Wan 3.0 결과에는 일치하는 오디오 트랙이 포함되거나 무성 클립을 내보낼 수 있습니다. 오디오를 전환해도 가격은 변경되지 않습니다. |
첫 번째 표에는 이 페이지의 Wan 3.0 Image to Video 도구에 의해 노출된 컨트롤이 나열되어 있습니다.
| 매개변수 | 필수 | 유형 | 기본값 | 범위 / 옵션 | 선택 방법 |
|---|---|---|---|---|---|
프롬프트* | 예(*) | 문자열 | 예시 프롬프트 | 최대 20,000자 | 피사체, 움직임, 카메라 움직임, 조명 및 스타일을 설명합니다. 명확한 구조는 길이보다 더 중요합니다. |
`image_url* | 예(*) | 문자열 | 예시 이미지 | 이미지 URL 또는 Base64 | 첫 번째 프레임 Wan 3.0에서 애니메이션이 적용됩니다. 최상의 피사체 보존을 위해 선명하고 조명이 밝으며 깔끔한 이미지를 사용하십시오. |
`end_image_url | 아니요 | 문자열 | 비어 있음 | 이미지 URL 또는 Base64 | 선택적 마지막 프레임입니다. 엔딩 포즈나 구도가 정해졌을 때 설정하세요. |
| '해상도' | 아니요 | 문자열 | `720p | 480p, 720p, 1080p | 빠른 초안을 작성하려면 480p을 사용하고 더 자세한 내용을 전달하려면 1080p을 사용하세요. |
`aspect_ratio | 아니요 | 문자열 | `adaptive | adaptive, 16:9, 9:16, 1:1, 4:3, 3:4 | 입력 이미지를 따르려면 adaptive을 그대로 두거나 특정 배치에 대한 비율을 강제로 적용하세요. |
기간 | 아니요 | 정수 | 5 | 2~30초 | 모션을 다듬는 동안 짧게 유지하고 방향이 확정되면 올립니다. |
`enable_audio | 아니요 | 부울 | '사실' | 참 / 거짓 | 동기화된 오디오 트랙을 계속 사용하세요. 조용한 클립을 위해 끄십시오. |
| '씨앗' | 아니요 | 정수 | 무작위 | 0-2147483647 | 작고 유사한 편집을 수행하는 동안 결과를 재현하기 위해 시드를 수정합니다. |
다음 표에는 더 넓은 Wan 3.0 모델이 요약되어 있습니다. 참조, 문서 및 텍스트 전용 입력은 이 이미지-비디오 페이지의 컨트롤이 아닌 모델의 다른 모드 및 형제 도구를 통해 사용할 수 있습니다.
| 핵심 차원 | Wan 3.0 |
|---|---|
| 모델 | `wan3.0-video |
| 세대 모드 | 텍스트-비디오; 이미지-비디오(첫 번째 프레임 또는 첫 번째 + 마지막 프레임); 이미지, 비디오 및 오디오의 비디오 참조; 게다가 문서 및 웹 링크 참조. |
| 출력 기간 | 2~30초. 비디오 입력의 경우 입력과 출력이 30초 이내에 유지됩니다. 스마트 기간 옵션을 사용하면 Wan 3.0에서 길이를 추천할 수 있습니다. |
| 해상도 | 480P, 720P 또는 1080P. |
| 출력 종횡비 | adaptive(입력에서 권장) 또는 16:9, 4:3, 1:1, 3:4, 9:16. |
| 오디오 출력 | 사진과 함께 생성되고 기본적으로 켜져 있는 선택적 동기화 오디오. |
| 첫 번째/마지막 프레임 입력 | 최대 1개의 first_frame 및 1개의 last_frame. 이미지: JPEG, JPG, PNG, BMP 또는 WEBP; 측면당 '240~8000' 픽셀; 종횡비 최대 '8:1'; 각각 최대 20MB. |
| 참고 이미지 | 피사체, 객체 또는 장면 일관성을 위한 최대 10개의 참조 이미지. |
| 참고 동영상 | 최대 5개의 클립; MP4 또는 MOV; 각각 1~15초; 최대 15초의 영상 결합; 측면당 '240~4096' 픽셀; 클립당 최대 100MB. |
| 참조 오디오 | 최대 5개의 클립; WAV 또는 MP3; 최대 15초의 오디오 결합; 각각 최대 15MB. |
| 문서/웹 입력 | 문서 1개(DOCX, PDF, PPTX, XLSX, TXT 등 최대 50페이지) 또는 공개 웹 링크 1개. |
| 모드 독점 | 첫 번째/마지막 프레임 입력은 동일한 요청의 참조, 문서 또는 링크 입력과 결합될 수 없습니다. |
| 프롬프트 제한 | 최대 20,000자입니다. |
Wan 3.0 가격은 선택한 해결 방법과 생성 기간에 따라 달라집니다. Wan 3.0 오디오를 활성화하거나 비활성화해도 속도는 변경되지 않습니다.
| 해결 | 초당 가격 | 5초 | 10대 | 30대 |
|---|---|---|---|---|
| 480p | $0.049 | $0.245 | $0.49 | $1.47 |
| 720p | $0.099 | $0.495 | $0.99 | $2.97 |
| 1080p | $0.199 | $0.995 | $1.99 | $5.97 |
1~4개 출력 배치의 경우 '기간 × 초당 속도 × 출력 횟수'로 총계를 계산합니다.
재사용 가능한 Wan 3.0 구조를 사용하세요.
[주제 + 세부 사항 정의] + [시간에 따른 하나의 동작] + [카메라 프레이밍 및 움직임] + [설정 + 조명] + [시각적 처리] + [오디오] + [엔딩 프레임 또는 제약 조건]
이 Wan 3.0 비교를 모델 제품군 가이드로 사용하세요. 최대 해상도와 지속 시간은 함께 사용할 수 없으며, 도구마다 다른 입력 및 컨트롤이 노출될 수 있습니다. 공개적으로 이용 가능한 정보를 기반으로 합니다.
| 모델 | 해결 | 최대 기간 | 오디오 | 눈에 띄는 |
|---|---|---|---|---|
| Wan 3.0 | 480p–1080p | 30대 | 선택적 동기화 오디오 | 텍스트, 첫 번째/마지막 프레임, 이미지, 비디오, 오디오의 비디오 참조, 문서 및 웹 입력을 포괄하는 하나의 올인원 모델입니다. |
| 클링 3.0 | 최대 4K | 15초 | 립싱크가 포함된 네이티브 오디오 | 대본이 있는 광고와 캐릭터 장면에 대해 다중 촬영 카메라 변경과 화자가 할당한 대화를 조정합니다. |
| 하이뤄 02 | 1080p | ~10초 | 없음 | 조용한 액션과 제품 촬영을 위한 물리학 중심의 모션과 강력하고 신속한 준수. |
| 시던스 2.5 | 1080p | 30대 | 공동 오디오 및 비디오 | 신원에 민감한 편집을 위해 동기화된 음성 및 효과를 갖춘 참조가 많은 생성입니다. |
| 베오 3.1 | 4K | 8초 | 네이티브 대화 및 효과 | 영화 전환 및 조합된 시퀀스에 적합한 첫 번째/마지막 프레임 및 참조 컨트롤입니다. |
Wan 3.0을 차별화하는 것은 폭입니다. 첫 번째 프레임에 애니메이션을 적용하고 마지막 프레임을 존중하며 이미지, 비디오, 오디오, 문서 및 링크에서 가져올 수 있는 단일 모델이며 선택적으로 동기화된 사운드를 생성합니다. 생기를 불어넣을 시작 프레임이 있으면 Wan 3.0 Image to Video을 선택하고, 시작점이 변경되면 텍스트 또는 참조 도구로 이동하세요.
선택적인 소스 오디오와 크기, 샷 구조, 네거티브 프롬프트, 시드, 프롬프트 확장 및 생성된 오디오에 대한 제어 기능을 사용하여 텍스트 프롬프트에서 5초, 10초 또는 15초 동영상을 생성합니다.
필수 프롬프트를 바탕으로 5초 또는 8초 동영상을 생성합니다. 선택형 네거티브 프롬프트, 네 가지 출력 크기와 시드를 설정할 수 있습니다.
텍스트 프롬프트에서 필수 시작 프레임 이미지에 애니메이션을 적용하고 선택적으로 마지막 프레임 이미지로 결말을 안내합니다.
멀티모달 참조, 립싱크, 카메라 제어를 활용해 영화 같은 짧은 영상을 더 빠르게 생성합니다.
텍스트, 레퍼런스 오디오, 이미지에서 자연스러운 음성과 오디오를 생성합니다.
Wan 3.0 Prime Text To Video을 사용하면 프롬프트에서 클립을 빠르게 만들 수 있습니다.
Wan 3.0 이미지-비디오는 단일 첫 번째 프레임 이미지를 가져와 텍스트 프롬프트에 따라 짧고 일관된 클립으로 애니메이션을 적용합니다. 리깅이나 수동 키프레임 없이 제품 사진, 인물 사진, 라이프스타일 사진 또는 컨셉 아트를 모션으로 전환하는 데 적합합니다.
항상 첫 번째 프레임 이미지를 제공하고, 종료 포즈나 구성이 중요한 경우 선택적으로 마지막 프레임 이미지를 추가할 수 있습니다. 그런 다음 Wan 3.0은 첫 번째 프레임에서 시작하여 마지막 프레임을 향해 해결되는 연속 모션을 생성하여 샷의 시작과 종료 방식을 더욱 세밀하게 제어할 수 있습니다.
첫 번째 프레임이 비디오의 오프닝으로 직접 사용되기 때문에 Wan 3.0은 클립 전체에서 피사체의 모습과 프레임을 일관되게 유지하는 경향이 있습니다. 선명하고 조명이 밝으며 정돈된 입력 이미지를 사용하면 피사체가 가장 잘 보존됩니다.
Wan 3.0는 480p, 720p 및 1080p 출력을 지원하며 720p은 공통 기본값입니다. 지속 시간은 2~30초 범위에서 조정 가능하며 화면 비율은 와이드스크린, 수직, 정사각형 또는 클래식으로 설정하거나 adaptive로 설정하여 입력 이미지를 따라갈 수 있습니다. 정확한 전류 제한은 RunComfy 매개변수 패널을 확인하세요.
예. Wan 3.0은 클립과 함께 동기화된 오디오 트랙을 생성할 수 있으며, 무성 영상만 필요한 경우 오디오를 끌 수 있습니다. 오디오를 전환해도 생성 비용은 변경되지 않습니다.
입력 이미지는 JPEG, PNG 또는 WEBP와 같은 일반적인 형식이어야 하며 적절한 해상도와 종횡비가 있어야 합니다. 품질이 매우 낮거나 프레임이 너무 복잡하면 모션 품질이 저하될 수 있으므로 깨끗하고 해상도가 높은 첫 번째 프레임을 선호하세요. 한도는 공급자 설정에 따라 다를 수 있습니다.
예. RunComfy 모델 UI에서 Wan 3.0의 프로토타입을 만든 다음 생산 또는 자동화를 위해 동일한 매개변수를 사용하여 RunComfy HTTP API을 통해 동일한 모델을 호출할 수 있습니다. 이를 통해 모델을 변경하지 않고도 브라우저 테스트에서 통합 파이프라인으로 이동할 수 있습니다.
세대는 출력 해상도 및 기간에 따라 USD 또는 크레딧을 소비합니다. 480p에서는 초당 $0.049, 720p에서는 초당 $0.099, 1080p에서는 초당 $0.199입니다. 신규 사용자는 일반적으로 대규모 실행을 시작하기 전에 Wan 3.0을 사용해 볼 수 있는 무료 평가판을 받습니다.
RunComfy는 최고의 ComfyUI 플랫폼으로서 ComfyUI 온라인 환경과 서비스를 제공하며 ComfyUI 워크플로우 멋진 비주얼을 제공합니다. RunComfy는 또한 제공합니다 AI Models, 예술가들이 최신 AI 도구를 활용하여 놀라운 예술을 창조할 수 있도록 지원합니다.





