logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Wan 3.0:图像到视频、首尾帧、Models and API 上的音频 | RunComfy

wan-ai/wan-3.0/image-to-video

Wan 3.0 将第一帧图像动画化为连贯的视频,并具有可选的最后一帧控制、灵活的持续时间、宽高比和音频,以实现精美的短片。

描述您希望第一帧动画呈现的动作、动作、摄像机移动、灯光和风格。
模型将第一帧图像动画化为视频。使用清晰、高质量的图像可以更好地保留拍摄对象。
可选的最后一帧图像,用于指导视频的结束姿势、构图或场景。
输出分辨率层。使用 480p 进行快速草稿,使用 1080p 获得更高质量的输出。
输出纵横比。使用 adaptive 匹配输入图像比例。
生成视频的长度(以秒为单位)。范围为 2-30。开始时进行短距离迭代,然后在运动看起来正确后增加。
为具有多种动作或构图要求的复杂场景提供更深入的提示解释。
打开时,输出视频包括同步音轨。关闭以获得无声剪辑。
随机种子以获得可重复的结果。范围为 0 到 2147483647。
Idle
The rate is $0.06 per second for 480p, $0.12 per second for 720p, and $0.25 per second for 1080p.

Wan 3.0 简介

Wan 3.0 图像到视频将单个第一帧图像以电影剪辑的形式呈现出来,并具有可选的最后一帧引导、2-30 秒的持续时间、宽高比控制和同步音频。将缓慢的手动关键帧换成快速驱动的运动,使主题和场景保持一致,它适合产品营销人员、肖像和生活方式创作者以及快速发布短片的社交团队。对于开发人员来说,RunComfy 上的 Wan 3.0 既可以在浏览器中使用,也可以通过 HTTP API 使用,因此您无需自行托管或扩展模型。
非常适合:产品和营销剪辑|肖像动画|垂直社交视频

为什么选择Wan 3.0#


Wan 3.0 是 Wan-AI 的一体化视频生成模型,可将文本、图像、视频、音频、文件和网页转换为具有同步声音的连贯剪辑。此页面提供 Wan 3.0 Image to Video:为其提供第一帧图像和提示,然后将该帧动画化为 2-30 秒的剪辑,并可选用最后一帧来确定镜头的结束方式。相同的底层模型还运行文本到视频和参考到视频,因此您在这里开发的外观可以在整个系列中传输。


Wan 3.0优势这对您意味着什么
一种模型,多种输入Wan 3.0 处理文本、第一帧/最后一帧图像、参考图像、视频、音频、文档和链接,因此您很少需要在想法之间切换工具。
首帧和末帧控制在此页面上,您可以设置开始帧和结束帧,与仅第一帧的动画相比,Wan 3.0 可以更严格地控​​制镜头的开始和结束方式。
灵活的 2–30 秒输出Wan 3.0 渲染短草稿或较长的单次拍摄,因此快速迭代和完成的镜头来自同一端点。
同步音频,可选每个 Wan 3.0 结果都可以包含匹配的音轨,或者您可以导出无声剪辑 - 切换音频不会改变价格。

最佳用例#


  • 产品和营销视频: 使用 Wan 3.0 将产品或包装照片变成具有受控运动和取景的简短宣传剪辑。
  • 肖像和生活方式动画: 让 Wan 3.0 将肖像、时尚或生活方式动画化为自然的品牌时刻。
  • 社交媒体内容: 从单个图像生成垂直、方形或宽屏 Wan 3.0 剪辑,用于卷轴、短片、故事或提要展示位置。
  • 创意原型制作: 在进行完整的生产过程之前,使用 Wan 3.0 从固定框架测试相机方向、运动和视觉风格。

它是如何工作的#


  1. 设置起始帧: 上传 Wan 3.0 将带来的干净、高分辨率的第一帧图像。
  2. 描述运动: 告诉 Wan 3.0 什么在移动、相机如何移动以及光线和场景如何随时间变化。
  3. 引导结局(​​可选): 当最终姿势、构图或场景很重要时添加最后一帧图像,Wan 3.0 将在两者之间架起桥梁。
  4. 选择交付格式: 选择分辨率、宽高比、2-30 秒的持续时间以及是否生成音频,然后查看 Wan 3.0 结果并每次优化一条指令。

## 参数


第一个表列出了此页面上 Wan 3.0 Image to Video 工具公开的控件。


参数必填类型默认范围/选项如何选择
提示*是 (*)字符串示例提示最多 20,000 个字符描述拍摄对象、其运动、相机移动、灯光和风格。清晰的结构比长度更重要。
image_url*是 (*)字符串示例图像图像 URL 或 Base64第一帧 Wan 3.0 产生动画。使用清晰、光线充足、整洁的图像,以实现最佳的主题保留。
end_image_url没有字符串空图像 URL 或 Base64可选的最后一帧;当结束姿势或构图固定时设置它。
决议没有字符串720p480p、720p、1080p使用“480p”进行快速草稿,使用“1080p”进行更详细的交付。
aspect_ratio没有字符串adaptiveadaptive、16:9、9:16、1:1、4:3、3:4保留“adaptive”以跟随输入图像,或强制指定特定位置的比例。
持续时间没有整数52–30 秒在完善动作时保持较短的距离,然后在方向确定后将其升高。
thinking_mode没有布尔假“真”/“假”启用结合了多个动作或合成规则的复杂提示。
enable_audio没有布尔真实“真”/“假”继续播放同步音轨;关闭以获得静音剪辑。
种子没有整数随机0–2147483647修复种子以重现结果,同时进行小的、可比较的编辑。

  • 必填字段。

下表总结了更广泛的 Wan 3.0 模型。参考、文档和纯文本输入可通过模型的其他模式和同级工具获得,而不是作为此图像到视频页面上的控件。


核心维度Wan 3.0
型号wan3.0-video
生成模式文本转视频;图像到视频(第一帧,或第一帧+最后一帧);来自图像、视频和音频的视频参考;加上文档和网络链接参考。
输出持续时间2-30 秒。使用视频输入时,输入加输出保持在 30 秒内。智能持续时间选项让 Wan 3.0 推荐长度。
分辨率“480P”、“720P”或“1080P”。
输出纵横比adaptive(从输入中推荐)或16:9、4:3、1:1、3:4、9:16。
输出音频可选的同步音频,与图片一起生成并默认打开。
第一帧/最后一帧输入最多 1 个“first_frame”和 1 个“last_frame”。图片:JPEG、JPG、PNG、BMP 或 WEBP;每边“240–8000”像素;宽高比高达“8:1”;每个最多 20 MB。
参考图片最多 10 个参考图像,以确保主题、物体或场景的一致性。
参考视频最多 5 个剪辑; MP4 或 MOV;每次“1–15”秒;组合视频长达 15 秒;每边“240–4096”像素;每个剪辑最多 100 MB。
参考音频最多 5 个剪辑; WAV 或 MP3;组合音频长达 15 秒;每个最多 15 MB。
文档/网页输入一份文档(DOCX、PDF、PPTX、XLSX、TXT 及类似文档,最多 50 页)或一个公共 Web 链接。
模式独家第一帧/最后一帧输入不能与同一请求中的参考、文档或链接输入组合。
提示限制最多 20,000 个字符。

定价#


Wan 3.0 定价取决于您选择的分辨率和生成的持续时间。启用或禁用 Wan 3.0 音频不会更改速率。


分辨率每秒价格5秒10 秒30 多岁
480p0.06 美元0.30 美元0.60 美元1.80 美元
720p0.12 美元0.60 美元1.20 美元3.60 美元
1080p0.25 美元1.25 美元2.50 美元7.50 美元

对于 1-4 个输出的批次,计算总数为“持续时间 × 每秒速率 × 输出计数”。


提示和参考提示#


使用这个可重用的 Wan 3.0 结构:


[主题 + 定义细节] + [随着时间的推移一个动作] + [相机取景和移动] + [设置 + 灯光] + [视觉处理] + [音频] + [结束帧或约束]


  • 引导主题: 说出第一帧包含的内容,然后描述 Wan 3.0 应如何移动它。
  • 将相机与拍摄对象分开: 独立描述拍摄对象运动和相机运动,以获得更清晰的 Wan 3.0 结果。
  • 使用清晰的第一帧: 视频输入中出现模糊、混乱或低分辨率。
  • 锚定结局: 当特定的最终姿势或构图无可协商时,获取最后一帧图像。
  • 打开思考模式: 当 Wan 3.0 镜头分层多个动作或构图规则时启用它。
  • 修复种子: 一旦镜头看起来正确就锁定种子,这样您就可以公平地比较小的提示编辑。

Wan 3.0 比较如何#


使用此 Wan 3.0 比较作为模型系列指南;最大分辨率和持续时间可能无法同时使用,并且不同的工具可以公开不同的输入和控件。基于公开信息。


型号分辨率最长持续时间音频杰出
Wan 3.0480p–1080p30 多岁可选同步音频一个一体化模型,涵盖文本、第一帧/最后一帧以及来自图像、视频和音频的视频参考,以及文档和 Web 输入。
克林3.0高达 4K15 秒具有口型同步的原生音频协调脚本广告和角色场景的多镜头摄像机变化和扬声器分配的对话。
海螺021080p〜10 秒无以物理为中心的运动和对无声动作和产品镜头的强烈提示依从性。
种子之舞 2.51080p30 多岁音视频联合具有同步语音和效果的参考大量生成,用于身份敏感的编辑。
维奥 3.14K8 秒原生对话和效果适用于电影过渡和组合序列的第一帧/最后一帧和参考控制。

Wan 3.0 的独特之处在于其广度:单一模型可以对第一帧进行动画处理,尊重最后一帧,并且可以从图像、视频、音频、文档和链接中提取数据,同时生成可选的同步声音。当您有一个可以赋予生命的开放框架时,请选择 Wan 3.0 Image to Video;当您的起点发生变化时,请移至文本或参考工具。


更多模型可供尝试#


  • Wan 3.0 文本到视频: 当您没有起始图像时,仅根据提示生成剪辑。
  • Wan 3.0 视频参考: 组合图像、视频和音频参考以实现角色和对象的一致性。
  • Seedance 2.5 文本到视频: 从文本生成快速、低成本的草稿渲染。
  • Kling 3.0: 使用可选的结束帧和同步音频对起始图像进行动画处理。

官方资源#


  • Wan 3.0视频生成API参考(阿里云Model Studio)
  • Wan模型家族概述

相关模型

SkyReels V1

支持33种表情与400+动作组合,打造电影质感AI短视频

dreamina-3-0/image-to-video

利用Dreamina 3.0快速将静态图像转化为2K高质量动态视频,让创意更生动自然。

wan-2-1/fusionx/image-to-video

以FusionX轻松将图像生成电影质感视频,精准控制创意与细节

ltx-2-19b/image-to-video/lora

将静态图像转化为富有表现力的动态短片,并生成同步音频。

kling-video-o3/4K/reference-to-video

电影感 4K 参考图生视频,输出每秒 $0.42。

ltx-2-19b/video-to-video/lora

以电影级动作表现和精细创作控制,高效转换现有视频。

常见问题

Wan 3.0 在图像到视频工作流程中的用途是什么?

Wan 3.0 图像到视频采用单个第一帧图像,并根据您的文本提示将其动画化为简短、连贯的剪辑。它非常适合将产品照片、肖像、生活方式照片或概念艺术转变为动态,而无需索具或手动关键帧。

Wan 3.0 中的第一帧和最后一帧选项如何工作?

您始终提供第一帧图像,并且当结束姿势或构图很重要时,您可以选择添加最后一帧图像。然后,Wan 3.0 会生成从第一帧开始一直到最后一帧的连续运动,让您可以更严格地控​​制镜头的开始和结束方式。

Wan 3.0 从输入图像中保留主体的效果如何?

由于第一帧直接用作视频的开头,Wan 3.0 倾向于在整个剪辑中保持主体的外观和取景一致。使用清晰、明亮、整洁的输入图像可以最好地保留主题。

Wan 3.0 图像到视频支持哪些分辨率、持续时间和宽高比?

Wan 3.0 支持 480p、720p 和 1080p 输出,其中 720p 作为常见默认值。持续时间可在 2 至 30 秒之间调节,宽高比可以是宽屏、垂直、方形或经典,或设置为 adaptive 以使其跟随输入图像。检查 RunComfy 参数面板以了解确切的电流限制。

Wan 3.0 可以与视频一起生成音频吗?

是的。 Wan 3.0 可以与剪辑一起生成同步音轨,并且当您只需要无声素材时可以关闭音频。切换音频不会改变生成成本。

在使用 Wan 3.0 之前我应该​​了解哪些输入限制?

输入图像应为常见格式,例如 JPEG、PNG 或 WEBP,并具有合理的分辨率和宽高比。质量极低或严重混乱的帧会降低运动质量,因此最好选择干净、高分辨率的第一帧。限制可能因提供商设置而异。

开发人员可以通过 RunComfy API 使用 Wan 3.0 吗?

是的。您可以在 RunComfy 模型 UI 中对 Wan 3.0 进行原型设计,然后通过 RunComfy HTTP API 使用相同的参数调用相同的模型以进行生产或自动化。 That lets you move from a browser test to an integrated pipeline without changing the model.

在 RunComfy 上使用 Wan 3.0 生成需要多少钱?

各代根据输出分辨率和持续时间消耗美元或积分:480p 每秒 0.06 美元,720p 每秒 0.12 美元,1080p 每秒 0.25 美元。新用户通常会获得免费试用量来尝试 Wan 3.0,然后再进行更大规模的运行。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Wan 3.0 的示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...