Qwen Image 2.1 Edição de Imagem Múltipla para composição guiada por referência no ComfyUI#
Este workflow monta várias imagens de referência em uma cena coerente usando instruções de edição em inglês. Ele mistura sujeitos, objetos e ambientes enquanto preserva características de design reconhecíveis, materiais e iluminação. Uma etapa de aprimoramento de prompt ciente de referência expande suas direções antes da geração para que o Qwen Image 2.1 possa posicionar cada elemento com precisão e manter as identidades intactas.
Qwen Image 2.1 Edição de Imagem Múltipla é ideal para estilização de interiores, visualização de trajes coordenados e retratos de grupo criados a partir de fotos separadas. Você descreve como cada referência deve aparecer e interagir, o workflow reescreve sua instrução em um prompt de edição explícito, e o modelo produz uma única imagem fotorrealística ou estilizada que parece naturalmente composta.
Modelos chave no workflow Comfyui Qwen Image 2.1 Edição de Imagem Múltipla#
- Qwen-Image-2.1. O modelo de difusão condicionado por texto e imagem usado para geração. Ele permite edição ciente de referência e posicionamento robusto de múltiplas entradas visuais. Veja o cartão do modelo e a visão geral do projeto para capacidades e variantes: Hugging Face, GitHub.
- Qwen-Image-2.1-PE-I2I. Um componente ajustado por instrução usado aqui para aprimoramento de prompt ciente de referência. Ele reescreve suas direções em inglês em um prompt de edição conciso, pronto para geração, fundamentado nas imagens fornecidas: Hugging Face.
- Qwen-Image-2.1 VAE. O autoencoder variacional que decodifica latentes de volta para RGB enquanto mantém a fidelidade de cor e detalhes finos: embalado com o lançamento do Qwen-Image-2.1 no Hugging Face.
Como usar o workflow Comfyui Qwen Image 2.1 Edição de Imagem Múltipla#
O workflow executa-se em três estágios: você fornece referências e uma instrução em inglês simples, o prompt é reescrito com base nas imagens, e o gerador compõe uma imagem final a partir do prompt aprimorado mais suas referências.
Entrada do Usuário#
Use os quatro nós LoadImage para sua cena base e elementos de referência: Image 1 - Sala de Leitura (#470), Image 2 - Poltrona Sage (#510), Image 3 - Mesa Lateral e Chá (#503), e Image 4 - Flores Cosmos (#511). Nós LoadImage adicionais rotulados como “Unused Reference” estão disponíveis se você precisar de mais fontes; conecte-os quando quiser que as referências influenciem o resultado. Escreva sua instrução em Edit Instructions - English (#516), declarando claramente o papel de cada imagem, os traços a preservar, onde colocar os objetos e o que evitar. Defina seu aspecto de saída e tamanho em ResolutionSelector (#13), então o workflow criará um EmptyLatentImage (#480) naquela resolução para geração, a menos que você escolha o caminho alternativo descrito abaixo.
Reescrita do Prompt#
Todas as imagens selecionadas são compiladas por ZNGB_ImageBatchMulti (#531) e passadas para English Prompt Enhancement via TextGenerateLTX2Prompt (#502). Uma linha auxiliar curta é adicionada em English Output Instruction (#517) para retornar apenas o prompt final. A etapa de aprimoramento usa um modelo Qwen Image 2.1 PE para expandir papéis, posicionamento, iluminação e regras de consistência em uma única instrução de edição explícita. Você pode visualizar este texto refinado em Enhanced Prompt Preview (#501) antes que a geração prossiga automaticamente.
Modelos#
O grupo Models carrega os componentes de geração: UNETLoader (#477) para Qwen-Image-2.1, CLIPLoader (#533) para seus codificadores de texto-visão, e VAELoader (#479) para decodificação. TextEncodeQwenImage21 (#519) então mescla o prompt aprimorado, seu prompt negativo opcional, e até dez imagens de referência em condicionamento adequado para edição de imagem múltipla. Ele também produz um latente de referência opcional que pode guiar a estrutura mais de perto quando desejado.
Amostragem e saída#
QwenImage21Cache (#484) compartilha o modelo com KSampler (#482) para amostragem iterativa eficiente. Por padrão, ComfySwitchNode (#483) direciona um latente em branco de EmptyLatentImage (#480) para composição livre; alterne para usar o latente de TextEncodeQwenImage21 quando você quiser uma adesão mais forte à geometria ou layout de referência. Ajuste KSampler para equilibrar adesão ao prompt e variação, então VAEDecode (#481) e SaveImage (#534) produzem sua imagem final com o prefixo de nome de arquivo escolhido.
Nós chave no workflow Comfyui Qwen Image 2.1 Edição de Imagem Múltipla#
TextGenerateLTX2Prompt (#502)#
Este nó realiza o aprimoramento de prompt ciente de referência usando um modelo Qwen Image 2.1 PE. Forneça sua instrução e o lote de imagens montado para obter um único prompt de edição explícito fundamentado nas referências. Aumente o comprimento permitido quando precisar preservar muitos atributos de objeto e ajuste as opções de amostragem para favorecer a paráfrase criativa ou reescritas estritamente literais. O nó de pré-visualização mostra exatamente o que o gerador seguirá.
TextEncodeQwenImage21 (#519)#
Codifica o prompt aprimorado e até dez imagens de referência em condicionamento para Qwen-Image-2.1. Use o negative_prompt para proibir duplicatas indesejadas, efeitos de colagem ou pessoas extras. A entrada resolution define a escala de trabalho para extração de características; combine-a com sua saída para retenção estável de detalhes. Este nó também pode emitir um latente inicial que bloqueia a composição mais firmemente quando selecionado via o interruptor.
ComfySwitchNode (#483)#
Alterna a estratégia de iniciação para KSampler. Mantenha o latente em branco padrão para composição mais livre que ainda respeita a identidade de referência através de condicionamento. Altere para o latente de referência de TextEncodeQwenImage21 quando você quiser uma orientação estrutural mais forte; combine isso com menor desnoising para enfatizar as referências.
KSampler (#482)#
Dirige o processo de desnoising do Qwen-Image-2.1. Use seed para reproduzir um arranjo específico ou explorar variações. Ajuste cfg para quão firmemente o modelo segue o prompt aprimorado e steps para o equilíbrio entre qualidade e velocidade. As escolhas de sampler_name e scheduler podem mudar sutilmente a textura e nitidez; escolha um par consistente ao iterar sobre um visual.
ResolutionSelector (#13)#
Fornece controle rápido sobre largura e altura de saída. Escolha uma proporção que enquadre confortavelmente todos os elementos referenciados. Resoluções maiores revelam mais textura das referências, mas exigem mais computação, então aumente gradualmente à medida que sua composição se estabiliza.
Extras opcionais#
- Ao escrever instruções, enumere o papel de cada imagem e os recursos exatos a serem preservados: material, cor, padrão, silhueta e escala.
- Mantenha o ângulo da câmera, hora do dia e direção da iluminação consistentes em todas as referências para composições mais naturais.
- Para interiores, escolha uma sala base como o ambiente e trate móveis ou decoração como objetos a serem colocados; para trajes, use um manequim ou modelo como base e forneça vestuário como referências de objeto.
- Se você vir duplicatas ou artefatos de colagem, fortaleça o
negative_promptcom termos como "sem duplicatas, sem colagem" e seja explícito sobre contagens de objetos. - Use o interruptor latente para dois modos: latente em branco para layout exploratório, latente de referência para posicionamento preciso.
- Bloqueie um visual promissor com uma
seedfixa, então crie variações mudando apenas a instrução ou trocando uma referência de cada vez. - Organize resultados por cena usando o prefixo de nome de arquivo
SaveImagepara que as iterações permaneçam fáceis de comparar.
Para informações sobre a família de modelos e pesos usados neste workflow Qwen Image 2.1 Edição de Imagem Múltipla, veja os recursos oficiais: Qwen-Image-2.1 no Hugging Face, Qwen-Image-2.1-PE-I2I, e o repositório do projeto no GitHub.
Agradecimentos#
Este workflow implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos RunningHub pela fonte do workflow, QwenLM (Qwen) por Qwen-Image-2.1, e Qwen pelo aprimoramento de prompt ciente de referência Qwen-Image-2.1-PE-I2I por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- RunningHub/Fonte do workflow
- Documentos / Notas de Lançamento: Fonte do workflow
- Qwen/Qwen-Image-2.1
- Hugging Face: Qwen/Qwen-Image-2.1
- GitHub: QwenLM/Qwen-Image-2.1
- QwenLM/Qwen-Image-2.1
- GitHub: QwenLM/Qwen-Image-2.1
- Hugging Face: Qwen/Qwen-Image-2.1
- Qwen/Qwen-Image-2.1-PE-I2I
- Hugging Face: Qwen/Qwen-Image-2.1-PE-I2I
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.




