logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Qwen Image Layered:精准的 RGBA 图层分解 | RunComfy

qwen/qwen-image-layered

将输入图像转换为 1-10 个可编辑的 RGBA 图层,用于透明无损编辑、合成、原型设计和 VFX 流程。

输入图片的 URL。
指定生成中需要排除的元素。
执行的推理步数。
控制结果遵循提示词的程度。
需要生成的图层数量。
生成图像的文件格式。
Idle
The rate is $0.05 per image.

Qwen Image Layered 功能简介

Qwen Image Layered 可按每张图像 $0.05 的价格,将一张 RGB 输入图像转换为可编辑的 RGBA 图层。它会把语义不同的元素分开并保留透明度,大幅简化对象隔离和无损编辑。通过 num_layers 可指定 1-10 个图层,并可按需使用 prompt 与 negative_prompt 引导分解。在 RunComfy 中,你可以通过浏览器或 HTTP API 使用,无需自行部署模型。

适用场景:精准对象隔离 | 快速布局原型 | 品牌素材整合

模型概览#


  • 提供方: Alibaba / 通义千问团队
  • 任务: 将图像分解为可编辑的 RGBA 图层
  • 价格: 每张图像 $0.05
  • 简介: Qwen Image Layered 将一张 RGB 输入图像分解为语义独立的 RGBA 图层。主体、背景和其他元素可在后续工具中分别移动、改色或合成。

主要能力#


可编辑的 RGBA 图层#

  • 输出独立的 RGBA 素材,而非仅预测蒙版。
  • 保留 Alpha 透明度,便于合成、UI 素材、动画和 VFX 制作。

提示词引导的图层分解#

  • prompt 可描述期望的图层结构,以及各元素应分配到哪个图层。
  • negative_prompt 可指定需要排除的内容。
  • num_layers 控制图层数量,范围为 1-10。

输入参数#


ParameterTypeDefault/Range说明
image_urlstringRequired输入图片的 URL。
promptstringOptional对图层结构和图像内容的引导。
negative_promptstringOptional需要排除的元素。
num_layersintegerDefault: 4; Range: 1-10需要生成的 RGBA 图层数量。
num_inference_stepsintegerDefault: 28; Range: 1-50推理步数。
guidance_scalefloatDefault: 5; Range: 1-20结果遵循 prompt 的程度。
seedintegerDefault: 0用于复现结果的固定随机种子。
output_formatstringOptions: png, webp; Default: png输出图像格式;需要保留透明度时建议使用 png。

API 集成#


RunComfy API 与浏览器界面使用相同字段。image_url 为必填项,prompt 和 negative_prompt 为可选控制项。响应会返回生成的图层素材,可用于编辑器或自动化流程。


Qwen Image Layered API 接口


官方资源与许可证#


  • 官方博客: Qwen.ai Blog
  • 技术报告: Arxiv Paper
  • GitHub 仓库: QwenLM/Qwen-Image-Layered
  • Hugging Face: Model Page | Demo Space
  • ModelScope: Model Page | Demo Studio
  • 许可证: Apache-2.0;可在其条款允许的范围内商用。

相关能力#


如需编辑平面图像中的局部区域,可使用 Qwen-Image-Edit-2509。

相关模型

chrono-edit/lora/upscaler

对一张必填输入图片进行放大,并可调整推理步数、LoRA 作用强度、种子和输出格式。

qwen-edit-2509/lora/edit-skin

编辑单张图片的皮肤细节,并设置尺寸、步数、引导强度、生成数量、格式和随机种子。

flux-2/flex/edit

通过提示词编辑 1–10 张图片,并调整尺寸、提示词扩展、引导强度、步数、随机种子和格式。

seedream-4-0/sequential

以智能序列和风格一致的图像生成为设计师打造连贯的视觉故事体验。

ideogram-v4/text-to-image

根据文本提示词生成海报、标志和以字体排版为核心的图像。

wan-2-2/flash/text-to-image

根据必填提示词生成图像。可设置选填反向提示词、15 种输出尺寸、Magic Prompt 扩写和随机种子。

常见问题

Qwen Image Layered 与普通图生图模型有什么不同?

它会把一张输入图像分解为多个语义独立的 RGBA 图层。每个图层都保留透明度,可分别移动、改色、编辑或合成。

Qwen Image Layered 的输出可以商用吗?

该模型采用 Apache-2.0 许可证,可按许可证条款商用。你仍需拥有输入图片的合法使用权,并遵守内容中涉及的第三方知识产权。

这个接口公开了哪些技术限制?

num_layers 范围为 1-10,num_inference_steps 为 1-50,guidance_scale 为 1-20。接口没有开放分辨率设置或提示词 token 上限。

这个接口支持 ControlNet、IP-Adapter 或多张参考图吗?

当前 schema 没有这些输入项。接口必须提供一个 image_url,并可选用 prompt 和 negative_prompt 引导图层分解。

怎样从浏览器测试转到 API 集成?

先在 RunComfy 浏览器界面中测试参数,再通过该模型的 RunComfy API 接口使用相同字段。image_url 为必填,其他已公开控制项可按需添加。

Qwen Image Layered 使用什么模型架构?

已发布的模型说明采用带有 Layer3D RoPE 位置嵌入的 VLD-MMDiT 主干,用于在图层间共享上下文,同时保持语义元素分离。

Qwen Image Layered 如何保留透明度?

它的 RGBA-VAE 在共享潜在空间中表示 RGB 与 RGBA 数据,有助于为各语义组件生成一致的 Alpha 信息,便于后续编辑与合成。

Qwen Image Layered 能完美保留文字吗?

它可以把包含文字的区域分到可编辑图层,但文字准确度仍会随输入与设置而变化。重要排版在投入生产前应仔细检查。

Qwen Image Layered 有哪些主要用途?

常见用途包括对象隔离、品牌素材调整、UI 组件提取、背景替换、布局原型、动画准备和 VFX 合成。

Qwen Image Layered 与 Qwen Image Edit 有什么区别?

Qwen Image Edit 修改平面图像中的选定区域;Qwen Image Layered 则把图像分解为多个 RGBA 图层,更适合反复进行图层级编辑与合成。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Qwen Image Layered 生成示例