Fluxo de Trabalho Qwen Image 2.1 Texto Para Imagem ComfyUI#
Transforme prompts de texto em imagens detalhadas e de alta resolução com os pesos abertos oficiais do Qwen-Image-2.1 empacotados para o ComfyUI. Este fluxo de trabalho Qwen Image 2.1 Texto Para Imagem ComfyUI é projetado para criadores que desejam resultados reproduzíveis e saída nítida na resolução nativa de 2048×2048. Ele suporta inferência INT8 para uso eficiente de VRAM e salva PNGs RGBA limpos, sendo uma excelente escolha para retratos de moda, imagens cinematográficas e conceitos de produtos polidos.
Construído ao redor de um caminho simples de gerar–decodificar–salvar, o fluxo de trabalho oferece controle direto sobre o texto do prompt, semente e resolução. Mantenha uma semente fixa para iterações versionadas, alterne estilos com frases de prompt e exporte ativos com fundo transparente prontos para pipelines de design.
Modelos principais no Fluxo de Trabalho Qwen Image 2.1 Texto Para Imagem ComfyUI#
- Qwen-Image-2.1 (Comfy-Org): O modelo principal de texto-para-imagem de peso aberto que interpreta seu prompt e sintetiza a imagem no espaço latente. Ele utiliza um gerador no estilo MMDiT otimizado para detalhes de alta fidelidade e composição tipográfica. Comfy-Org/Qwen-Image-2.1
- Qwen-Image-2.1 VAE: O autoencoder que decodifica os latentes gerados de volta para pixels. Ele preserva detalhes finos e consistência tonal em altas resoluções. Distribuído com o mesmo pacote de modelo acima.
- Modelo oficial (referência): Um gráfico de texto-para-imagem autoritário que você pode comparar ou adaptar às suas necessidades. image_qwen_image_2_1_t2i.json
Como usar o Fluxo de Trabalho Qwen Image 2.1 Texto Para Imagem ComfyUI#
Fluxo geral: prompts e uma condição de semente modelam a imagem no espaço latente, o VAE decodifica para pixels e a saída é salva como um PNG RGBA. Os grupos executam da esquerda para a direita para que você possa visualizar e iterar rapidamente.
Prompt e estilo
- Use o prompt positivo para intenção e direção artística e o prompt negativo para evitar artefatos. Para retratos de moda, faça referência a iluminação, ângulo da câmera, lente e materiais; para quadros cinematográficos, guie o humor e a gradação de cores; para fotos de produtos, especifique superfícies, iluminação de estúdio e reflexos. Mantenha uma semente estável quando quiser reprodução estrita entre ajustes de prompt.
Resolução e semente
- Defina seu tamanho alvo no nó de resolução antes de amostrar. O fluxo de trabalho é validado em 2048×2048 com pesos INT8 e tamanho de lote 1 para confiabilidade em GPUs modernas. Se precisar de pré-visualizações mais rápidas, reduza para 1024 ou 1536 e depois retorne a 2048 para renderizações finais. A semente é exposta ao usuário para que você possa fixar variações ou randomizar explorações.
Carregamento de modelo
- O grupo de modelos carrega os pesos INT8 do Qwen-Image-2.1 e o VAE acompanhante. Não é necessário fiação manual além de selecionar os checkpoints corretos. Os prompts são codificados e passados para o gerador, para que o amostrador tenha tanto o condicionamento de texto quanto a tela latente que precisa.
Amostragem
- Uma etapa
KSamplerlida com a trajetória de difusão. Passos e CFG são expostos para que você possa equilibrar velocidade e adesão ao prompt. Escolhas de amostrador e scheduler são incluídas para controle de estilo e estabilidade; comece com os padrões e ajuste apenas quando precisar de uma aparência diferente ou adesão mais rígida ao prompt.
Decodificar e salvar
- O VAE decodifica o latente final para uma imagem e o grupo de salvamento escreve PNGs RGBA. Se sua composição assumir transparência (logos, sobreposições de UI, recortes de produtos), o exportador preserva o canal alfa para que os ativos sejam inseridos diretamente em ferramentas de design sem mascaramento extra.
Principais nós no Fluxo de Trabalho Qwen Image 2.1 Texto Para Imagem ComfyUI#
UNETLoaderCarrega a base de difusão INT8 do Qwen-Image-2.1 que realmente executa a geração. Mantenha isso apontado para os pesos 2.1 para consistência entre sessões; mude apenas ao testar variantes.CLIPLoaderou carregador de codificador de texto específico do modelo Inicializa o codificador de prompt para que seu texto seja incorporado corretamente para o gerador. Se você mudar os codificadores, ajuste ligeiramente o CFG e verifique novamente a frase do prompt para manter a mesma intenção visual.EmptySD3LatentImageDefine o tamanho e lote da tela latente. Defina largura e altura aqui para 2048 × 2048 para finais e ajuste para baixo para rascunhos mais rápidos. Mantenha o tamanho do lote 1 na resolução nativa para evitar pressão de VRAM.KSamplerConduz o processo de difusão. Use etapas para trocar velocidade por detalhe e ajustecfgpara apertar ou relaxar a adesão ao prompt. Se você mudar amostradores ou schedulers, faça pequenas mudanças incrementais e compare resultados em uma semente fixa.SaveImageExporta a imagem decodificada como um PNG RGBA com o padrão de nomeação escolhido. Isso preserva a transparência para composição e garante reprodução exata quando combinado com uma semente e prompt fixos.
Extras opcionais#
- Padrões de prompt que funcionam: “Retrato de moda 35mm, luz de borda suave, estilo editorial, detalhe de textura de tecido, fundo neutro” ou “Plano geral cinematográfico, luz volumétrica através de persianas, gradação teal–laranja, alto contraste” ou “Renderização de produto em estúdio, caneca de cerâmica brilhante, iluminação de três pontos, sombra suave em papel contínuo.”
- Reprodutibilidade: Registre prompt, prompt negativo, semente e resolução com cada exportação. Pequenas edições contra uma semente fixa são a maneira mais rápida de ajustar a aparência sem perder a composição.
- Desempenho: Pesos INT8 reduzem o uso de VRAM e tornam 2048×2048 prático. Para hardware de menor memória, pré-visualize em 1024 e faça upscaling ou re-renderize em tamanho completo quando satisfeito.
- Construção de referência: Se quiser comparar a estrutura dos nós ou restaurar padrões, comece com o modelo oficial e migre seus nós de prompt e salvar. image_qwen_image_2_1_t2i.json
- Pacote de modelo: Use a distribuição mantida pela Comfy-Org para comportamento consistente entre ambientes. Comfy-Org/Qwen-Image-2.1
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos a Comfy.org pelo artigo de lançamento do ComfyUI, a Comfy-Org pelos pesos abertos do Qwen-Image-2.1 e a Comfy-Org pelo modelo oficial de fluxo de trabalho de texto-para-imagem por suas contribuições e manutenção. Para detalhes autoritativos, por favor, consulte a documentação original e os repositórios listados abaixo.
Recursos#
- Artigo de lançamento Comfy.org/ComfyUI
- Documentos / Notas de Lançamento: Postagem no blog da Comfy.org
- Pesos oficiais Comfy-Org/Comfy-Org Qwen-Image-2.1
- Hugging Face: Comfy-Org/Qwen-Image-2.1
- Modelo oficial de texto-para-imagem Comfy-Org
- GitHub: Comfy-Org/workflow_templates
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.









