根据文字、参考音频或图像生成自然的语音与音频。
Wan 3.0 Text To Video 读取简单语言描述并返回一个简短的电影剪辑。您描述主题、动作、摄像机和光线;该模型可以构图、驱动动作,并且可以一次性添加匹配的音频。
本页涵盖 Wan 3.0 系列的纯文本端点。无需上传图像,因此这是一种快速探索想法、勾画场景或仅通过文字制作完成的短镜头的方法。
| 参数 | 必填 | 类型 | 默认 | 范围/选项 | 描述 |
|---|---|---|---|---|---|
| 提示* | 是 (*) | 字符串 | - | - | 场景、主题、动作、摄像机、灯光和动作。 |
| 分辨率 | 没有 | 字符串 | 720p | 480p、720p、1080p | 输出分辨率层。 |
| aspect_ratio | 没有 | 字符串 | 16:9 | 16:9、9:16、1:1、4:3、3:4、adaptive | 输出纵横比。 |
| 持续时间 | 没有 | 整数 | 5 | 2-30 | 2-30输出长度(以秒为单位)。 |
| thinking_mode | 没有 | 布尔 | 假 | 真/假 | 对复杂提示进行更深入的解释。 |
| enable_audio | 没有 | 布尔 | 真实 | 真/假 | 包括同步音轨。 |
| 种子 | 没有 | 整数 | 随机 | 0-2147483647 | 可重复结果的种子。 |
定价取决于所选分辨率:480p 每秒 0.06 美元,720p 每秒 0.12 美元,1080p 每秒 0.25 美元。启用或禁用音频不会更改速率。
根据文字、参考音频或图像生成自然的语音与音频。
Kling V3.0 系列中具有最高视觉保真度的优质电影文本转视频。
Pika 2.2 让设计师轻松将图片或文字提示转化为高质量视频,快速实现创意动画。
Veo 3.1 帮助设计师快速将图像转换为高质量动态视频,创作流畅又真实的视觉作品。
使用必填音频驱动一段短视频,并控制情绪、编辑范围、音视频时长不一致时的处理方式和表现力。
支持33种表情与400+动作组合,打造电影质感AI短视频
Wan 3.0 Text To Video 直接根据书面提示生成简短的电影剪辑,无需参考图像。它对于概念预可视化、广告和促销镜头以及社交视频非常有用,让您只需几分钟即可通过文字将想法形象化。
文本到视频端点仅从提示开始,因此模型组成了整个场景,而图像到视频端点则对您提供的特定第一帧进行动画处理。当您希望模型发明取景时,选择 Wan 3.0 Text To Video;当您已经有了开场镜头时,选择图像到视频。
Wan 3.0 Text To Video 遵循结构化提示,命名主题、动作、摄像机移动和灯光,并产生连贯的、电影般的动作。清晰、具体的提示以及每次拍摄的单个摄像机方向通常会给出最可预测的结果。
它支持 480p、720p 和 1080p 输出,持续时间从 2 到 30 秒,宽高比包括 16:9、9:16、1:1、4:3 和 3:4。使用 480p 进行快速草稿,使用 1080p 进行交付;检查 RunComfy 面板以了解确切的电流限制。
是的。 Wan 3.0 Text To Video 可以生成与视频同步的音轨,并且您可以禁用音频以进行静默导出。启用或禁用音频不会影响价格。
思维模式可以对提示进行更审慎的解释,这在场景结合了多个动作、主题或构图规则时会有所帮助。它是可选的,默认情况下处于关闭状态,因此您可以针对复杂的提示启用它,而对于简单的提示则将其关闭。
是的。您可以在 RunComfy 模型 UI 中对 Wan 3.0 Text To Video 进行原型设计,然后使用相同的参数通过 RunComfy HTTP API 调用相同的模型。这使得从浏览器测试转移到自动化生产工作流程变得简单。
各代人根据分辨率和持续时间消耗美元或积分:480p 每秒 0.06 美元,720p 每秒 0.12 美元,1080p 每秒 0.25 美元。新用户通常会收到免费试用金额以首先测试 Wan 3.0 Text To Video。
RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。





