logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Wan 2.6 Text to Image:支持参考图的精准文生图模型 | RunComfy

wan-ai/wan-2-6/text-to-image

根据文字提示和参考图生成高质量图像,精确控制风格与主体一致性,适合品牌视觉、广告创意和电商商品图。

提示词长度须少于 2000 个字符。
可选参考图。支持 JPEG、JPG、PNG(不含 Alpha 通道)、BMP 和 WEBP;单边分辨率为 384~5000 px,文件最大 10 MB。
填写不希望出现在生成图像中的内容。
单次最多生成的图像数量。实际数量由模型推理结果决定,可能少于设定值;例如设为 5 时,模型可能根据内容只生成 3 张。
Idle
The rate is $0.017 per image.

Wan 2.6 Text to Image 简介

Wan AI 的 Wan 2.6 Text to Image 能以每张 $0.015 的价格,将提示词转化为可直接用于生产的图像。你可以上传参考图,精确控制画面风格、主体一致性和品牌特征,减少素材搜索、复杂蒙版与手工修图,让视觉创作更统一、更高效。该模型适合营销负责人、创意总监和电商品牌团队。在 RunComfy 中,Wan 2.6 Text to Image 既可直接通过浏览器使用,也可接入 HTTP API,无需自行部署或扩容模型。
适合场景:高转化广告创意 | 商品主视觉 | 分镜关键帧

模型概述#


  • 提供商: Alibaba Cloud
  • 任务: text-to-image
  • 支持的图像尺寸: 1024×1024、800×1200、1200×800、960×1280、1280×960、720×1280、1280×720、1344×576 px
  • 概述: Wan 2.6 Text to Image 可根据自然语言提示生成高质量图像,并能借助可选参考图控制画面风格、主体一致性或编辑方向。模型注重准确理解提示词、呈现真实质感,并保持稳定构图。

核心能力#


参考图驱动的主体与风格控制#

  • 参考图提供视觉依据,提示词则负责描述目标画面和具体调整。
  • 有助于在多次生成中保持角色特征与品牌元素的一致性。

高保真、准确遵循提示词#

  • 可理解英文或中文输入的主体、风格、光线、氛围和构图要求。
  • 能生成结构合理、纹理自然的画面,适用于电商、营销和编辑配图。

文本与图像结合的创作流程#

  • 将文字说明与参考图结合,用于生成变体或进行针对性调整。
  • 可通过负向提示词排除不需要的物体、颜色或瑕疵。

输入参数#


提示词#

参数类型默认值/限制说明
promptstring少于 2000 个字符描述目标图像的主体、风格、光线、氛围和构图。
negative_promptstring最多 500 个字符指定需要避开的元素或画面特征。

参考图#

参数类型默认值/限制说明
image_urlimage_uri可选;JPEG/JPG/不含 Alpha 通道的 PNG/BMP/WEBP;单边 384~5000 px;最大 10 MB用于控制风格、主体一致性或编辑方向的参考图。

输出与复现#

参数类型默认值/限制说明
image_sizestring默认:1024*1024 (1:1);共 8 种固定尺寸可选 10241024 (1:1)、8001200 (2:3)、1200800 (3:2)、9601280 (3:4)、1280960 (4:3)、7201280 (9:16)、1280720 (16:9) 或 1344576 (21:9)。
max_imagesinteger默认:1;范围:1~5设置单次生成数量上限;模型实际返回的图片可能少于该数值。
seedinteger默认:0;范围:0~2147483647固定随机种子有助于复现结果。

与其他模型的比较#


  • 对比 Flux 2: Wan 2.6 Text to Image 将文本生成和参考图控制整合在同一流程中,更适合需要保持主体一致性并持续调整画面的场景。Flux 2 Dev 目前可在 RunComfy 免费使用。
  • 对比 Z-Image-Turbo: Wan 2.6 Text to Image 更重视复杂提示词下的参考图还原度和合理构图,而不是一味追求最快生成速度。
  • 对比 Nano Banana Pro: Wan 2.6 Text to Image 兼顾参考图控制与稳定编辑,适合需要统一视觉身份的系列创作。
  • 推荐场景: 对风格、主体一致性和稳定修改流程要求较高的品牌视觉、广告创意与电商图片。

API 接入#


开发者可通过标准 HTTP 请求接入 RunComfy API,调用 Wan 2.6 Text to Image。提交提示词、可选参考图和输出尺寸,即可在创意流程或 CI/CD 管线中自动生成图片。


说明:Wan 2.6 Text to Image API 端点


官方资源与许可#


  • Alibaba Cloud: Wan 2.6 系列
  • Alibaba Cloud Model Studio: 模型列表
  • Wan: 官方网站
  • 许可: 该模型为通过 Alibaba Cloud Model Studio 托管的专有模型。商业使用须遵守 Alibaba Cloud 的条款;根据部署方式和所在地区,可能需要另行签署协议。免费方案不包含商业许可。

相关能力#


如需生成动态画面和叙事内容,请使用 Wan 2.6 Text to Video:https://www.runcomfy.com/models/wan-ai/wan-2-6/text-to-video


如需让现有图片动起来,请使用 Wan 2.6 Image to Video:https://www.runcomfy.com/models/wan-ai/wan-2-6/image-to-video


相关模型

qwen-edit-2509/lora/multiple-angles

根据必填提示词调整一张源图的镜头角度或进行其他编辑,并可设置六种输出尺寸、推理步数、引导强度、1–4 张结果图以及 JPEG/PNG 输出。

ideogram-v2/generate

使用 6 种风格和 11 种宽高比,生成包含文字设计的视觉图片。

nano-banana-2/edit

使用 Nano Banana 2 Edit 进行提示词驱动的图像编辑,支持多图输入,并可控制宽高比、分辨率、安全容忍度和输出选项。

ovis-image

根据文字生成图片,可设置负面提示词、6 种宽高比和采样参数。

flux-1-kontext/max/edit

使用 FLUX Kontext Max 根据提示词编辑图像,并设置随机种子和 9 种宽高比之一。

imagen-4/text-to-image

以文字生成高清逼真图像,灵活创作助力设计师灵感呈现

常见问题

Wan 2.6 Text to Image 主要能做什么?

Wan 2.6 Text to Image 可根据文字提示生成高质量静态图像,还能使用可选参考图进一步控制画面风格、主体一致性或具体修改方向。模型注重准确遵循提示词、呈现真实纹理,并保持稳定构图。

Wan 2.6 Text to Image 与 Flux 2 或 Nano Banana Pro 有什么区别?

Wan 2.6 Text to Image 将文生图与可选的参考图控制整合在同一流程中。相比不使用参考图的单次生成,它更适合重视视觉识别、品牌元素和定向修改的创作任务。

Wan 2.6 Text to Image 支持哪些分辨率和宽高比?

可选尺寸为 1024×1024(1:1)、800×1200(2:3)、1200×800(3:2)、960×1280(3:4)、1280×960(4:3)、720×1280(9:16)、1280×720(16:9)和 1344×576(21:9)。当前界面不支持其他尺寸或自定义宽高。

使用 Wan 2.6 Text to Image 时有哪些输入限制?

提示词须少于 2000 个字符,负向提示词最多 500 个字符。可选参考图须为 JPEG、JPG、PNG(不含 Alpha 通道)、BMP 或 WEBP 格式;单边需在 384~5000 像素之间,文件最大 10 MB。

如何从 RunComfy 在线测试切换到生产环境 API?

在 RunComfy 模型界面完成测试后,可使用 API 密钥调用 Wan 2.6 Text to Image API 端点,通过 HTTP 提交提示词、可选参考图和输出尺寸。当前页面标示的价格为每张 $0.015;调用前请确认账户内有可用点数。

Wan 2.6 Text to Image 如何保持视觉主体的一致性?

可选参考图用于提供主体特征和风格依据,提示词负责描述目标场景。持续使用同一张参考图并保持指令清晰,有助于提高一致性,但不能保证每次生成都完全相同。

Wan 2.6 Text to Image 能生成音频或视频吗?

不能。该模型只生成静态图像。如需视频,请使用 Wan 2.6 Text to Video 或 Wan 2.6 Image to Video;音频同步和口型同步不属于此文生图端点的功能。

Wan 2.6 Text to Image 的生成结果可以商用吗?

该模型依据 Alibaba Cloud Model Studio 的相关条款提供。是否可商用取决于这些条款、所在地区和具体合同;模型页面注明免费方案不包含商业许可。正式发布前请务必查看最新许可条款。

Wan 2.6 Text to Image 可以一次生成多张一致的图像吗?

max_images 可将生成数量上限设为 1~5 张,但模型实际返回的图片可能更少。使用 0~2147483647 范围内的固定 seed 有助于复现结果,但不保证整组图像在像素层面完全一致。

Wan 2.6 Text to Image 适合移动端和社交媒体尺寸吗?

适合。竖版内容可选择 720×1280(9:16)、800×1200(2:3)或 960×1280(3:4);方形和横版素材还可选择 1:1、4:3、3:2、16:9 或 21:9。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Wan 2.6 Text to Image 生成示例