Qwen Image 2.1 Édition multi-images pour la composition guidée par référence dans ComfyUI#
Ce workflow assemble plusieurs images de référence en une scène cohérente en utilisant des instructions d'édition en anglais. Il mélange des sujets, objets et environnements tout en préservant les caractéristiques de design reconnaissables, les matériaux et l'éclairage. Une étape d'amélioration des invites conscientes des références étend vos directions avant la génération pour que Qwen Image 2.1 puisse placer chaque élément avec précision et garder les identités intactes.
Qwen Image 2.1 Édition multi-images est idéal pour le stylisme d'intérieur, la visualisation de tenues coordonnées et les portraits de groupe créés à partir de photos séparées. Vous décrivez comment chaque référence doit apparaître et interagir, le workflow réécrit votre instruction en une invite d'édition explicite, et le modèle produit une image photoréaliste ou stylisée qui semble naturellement composée.
Modèles clés dans le workflow Comfyui Qwen Image 2.1 Édition multi-images#
- Qwen-Image-2.1. Le modèle de diffusion conditionné par texte et image utilisé pour la génération. Il permet une édition consciente des références et un placement robuste de multiples entrées visuelles. Voir la carte du modèle et l'aperçu du projet pour les capacités et les variantes : Hugging Face, GitHub.
- Qwen-Image-2.1-PE-I2I. Un composant ajusté pour les instructions utilisé ici pour l'amélioration des invites conscientes des références. Il réécrit vos directions en anglais en une invite d'édition concise et prête pour la génération fondée sur les images fournies : Hugging Face.
- Qwen-Image-2.1 VAE. L'autoencodeur variationnel qui décode les latents en RGB tout en maintenant la fidélité des couleurs et les détails fins : emballé avec la version Qwen-Image-2.1 sur Hugging Face.
Comment utiliser le workflow Comfyui Qwen Image 2.1 Édition multi-images#
Le workflow se déroule en trois étapes : vous fournissez des références et une instruction en anglais simple, l'invite est réécrite avec un ancrage d'image, et le générateur compose une image finale à partir de l'invite améliorée plus vos références.
Entrée utilisateur#
Utilisez les quatre nœuds LoadImage pour votre scène de base et les éléments de référence : Image 1 - Reading Room (#470), Image 2 - Sage Armchair (#510), Image 3 - Side Table and Tea (#503), et Image 4 - Cosmos Flowers (#511). Des nœuds LoadImage supplémentaires étiquetés "Unused Reference" sont disponibles si vous avez besoin de plus de sources ; connectez-les lorsque vous souhaitez que les références influencent le résultat. Écrivez votre instruction dans Edit Instructions - English (#516), en indiquant clairement le rôle de chaque image, les caractéristiques à préserver, où placer les objets, et ce qu'il faut éviter. Définissez votre aspect et taille de sortie dans ResolutionSelector (#13), puis le workflow créera une EmptyLatentImage (#480) à cette résolution pour la génération à moins que vous ne choisissiez le chemin alternatif décrit ci-dessous.
Réécriture de l'invite#
Toutes les images sélectionnées sont rassemblées par ZNGB_ImageBatchMulti (#531) et passées à English Prompt Enhancement via TextGenerateLTX2Prompt (#502). Une courte ligne d'aide est ajoutée dans English Output Instruction (#517) pour ne retourner que l'invite finale. L'étape d'amélioration utilise un modèle Qwen Image 2.1 PE pour étendre les rôles, le placement, l'éclairage et les règles de cohérence en une seule instruction d'édition explicite. Vous pouvez prévisualiser ce texte affiné dans Enhanced Prompt Preview (#501) avant que la génération ne se poursuive automatiquement.
Modèles#
Le groupe Models charge les composants de génération : UNETLoader (#477) pour Qwen-Image-2.1, CLIPLoader (#533) pour ses encodeurs texte-vision, et VAELoader (#479) pour le décodage. TextEncodeQwenImage21 (#519) fusionne ensuite l'invite améliorée, votre invite négative optionnelle, et jusqu'à dix images de référence en un conditionnement adapté à l'édition multi-images. Il produit également un latent de référence optionnel qui peut guider la structure plus étroitement si désiré.
Échantillonnage et sortie#
QwenImage21Cache (#484) partage le modèle avec KSampler (#482) pour un échantillonnage itératif efficace. Par défaut, ComfySwitchNode (#483) oriente un latent vierge de EmptyLatentImage (#480) pour une composition libre ; basculez-le pour utiliser le latent de TextEncodeQwenImage21 lorsque vous voulez une adhérence plus forte à la géométrie ou à la disposition de référence. Réglez KSampler pour équilibrer l'adhérence à l'invite et la variation, puis VAEDecode (#481) et SaveImage (#534) produisent votre image finale avec le préfixe de nom de fichier choisi.
Nœuds clés dans le workflow Comfyui Qwen Image 2.1 Édition multi-images#
TextGenerateLTX2Prompt (#502)#
Ce nœud effectue l'amélioration de l'invite consciente des références en utilisant un modèle Qwen Image 2.1 PE. Fournissez votre instruction et le lot d'images assemblé pour obtenir une seule invite d'édition explicite fondée sur les références. Augmentez la longueur autorisée lorsque vous devez préserver de nombreux attributs d'objet, et ajustez les options d'échantillonnage pour favoriser soit la paraphrase créative soit les réécritures strictement littérales. Le nœud de prévisualisation montre exactement ce que le générateur suivra.
TextEncodeQwenImage21 (#519)#
Encode l'invite améliorée et jusqu'à dix images de référence en un conditionnement pour Qwen-Image-2.1. Utilisez le negative_prompt pour interdire les doublons indésirables, les effets de collage ou les personnes supplémentaires. L'entrée resolution définit l'échelle de travail pour l'extraction des caractéristiques ; adaptez-la à votre sortie pour une rétention stable des détails. Ce nœud peut également émettre un latent initial qui verrouille plus étroitement la composition lorsqu'il est sélectionné via le commutateur.
ComfySwitchNode (#483)#
Bascule la stratégie d'initiation pour KSampler. Gardez le latent vierge par défaut pour une composition plus libre qui respecte toujours l'identité de référence à travers le conditionnement. Passez au latent de référence de TextEncodeQwenImage21 lorsque vous voulez une guidance structurelle plus forte ; combinez cela avec un débruitage plus faible pour mettre l'accent sur les références.
KSampler (#482)#
Conduit le processus de débruitage de Qwen-Image-2.1. Utilisez seed pour reproduire une disposition spécifique ou pour explorer des variations. Ajustez cfg pour déterminer à quel point le modèle suit l'invite améliorée et steps pour le compromis qualité-vitesse. Les choix sampler_name et scheduler peuvent subtilement modifier la texture et la netteté ; choisissez une paire cohérente lors de l'itération sur un look.
ResolutionSelector (#13)#
Fournit un contrôle rapide sur la largeur et la hauteur de sortie. Choisissez un ratio d'aspect qui cadre confortablement tous les éléments référencés. Des résolutions plus grandes révèlent plus de texture à partir des références mais nécessitent plus de calcul, donc augmentez progressivement au fur et à mesure que votre composition se stabilise.
Extras optionnels#
- Lors de l'écriture d'instructions, énumérez le rôle de chaque image et les caractéristiques exactes à préserver : matériau, couleur, motif, silhouette et échelle.
- Gardez l'angle de la caméra, l'heure de la journée et la direction de l'éclairage cohérents à travers les références pour des composites plus naturels.
- Pour les intérieurs, choisissez une pièce de base comme environnement et traitez les meubles ou la décoration comme des objets à placer ; pour les tenues, utilisez un mannequin ou un modèle comme base et fournissez les vêtements comme références d'objet.
- Si vous voyez des doublons ou des artefacts de collage, renforcez le
negative_promptavec des termes comme "pas de doublons, pas de collage" et soyez explicite quant au nombre d'objets. - Utilisez le commutateur latent pour deux modes : latent-vierge pour une disposition exploratoire, latent-de-référence pour un placement précis.
- Verrouillez un look prometteur avec une
seedfixe, puis créez des variations en ne changeant que l'instruction ou en échangeant une référence à la fois. - Organisez les résultats par scène en utilisant le préfixe de nom de fichier
SaveImageafin que les itérations restent faciles à comparer.
Pour des informations de fond sur la famille de modèles et les poids utilisés dans ce workflow Qwen Image 2.1 Édition multi-images, consultez les ressources officielles : Qwen-Image-2.1 sur Hugging Face, Qwen-Image-2.1-PE-I2I, et le dépôt du projet sur GitHub.
Remerciements#
Ce workflow met en œuvre et s'appuie sur les travaux et ressources suivants. Nous remercions chaleureusement RunningHub pour la source du workflow, QwenLM (Qwen) pour Qwen-Image-2.1, et Qwen pour l'amélioration des invites conscientes des références Qwen-Image-2.1-PE-I2I pour leurs contributions et leur maintenance. Pour des détails autorisés, veuillez vous référer à la documentation et aux dépôts originaux liés ci-dessous.
Ressources#
- RunningHub/Source du workflow
- Docs / Notes de version : Source du workflow
- Qwen/Qwen-Image-2.1
- Hugging Face : Qwen/Qwen-Image-2.1
- GitHub : QwenLM/Qwen-Image-2.1
- QwenLM/Qwen-Image-2.1
- GitHub : QwenLM/Qwen-Image-2.1
- Hugging Face : Qwen/Qwen-Image-2.1
- Qwen/Qwen-Image-2.1-PE-I2I
- Hugging Face : Qwen/Qwen-Image-2.1-PE-I2I
Note : L'utilisation des modèles, ensembles de données et code référencés est soumise aux licences et conditions respectives fournies par leurs auteurs et mainteneurs.





