Flux de travail Qwen Image 2.1 Texte à Image dans ComfyUI#
Transformez les invites textuelles en images détaillées et haute résolution avec les poids ouverts officiels de Qwen-Image-2.1 emballés pour ComfyUI. Ce flux de travail Qwen Image 2.1 Texte à Image dans ComfyUI est conçu pour les créateurs qui souhaitent des résultats reproductibles et une sortie nette en résolution native de 2048×2048. Il prend en charge l'inférence INT8 pour une utilisation efficace de la VRAM et enregistre des PNG RGBA propres, ce qui en fait un choix idéal pour les portraits de mode, les images cinématographiques et les concepts de produits raffinés.
Construit autour d'un chemin simple générer–décoder–sauvegarder, le flux de travail vous donne un contrôle direct sur le texte de l'invite, la graine et la résolution. Gardez une graine fixe pour les itérations versionnées, changez de style avec la formulation des invites, et exportez des actifs avec fond transparent prêts pour les pipelines de conception.
Modèles clés dans le flux de travail Qwen Image 2.1 Texte à Image dans ComfyUI#
- Qwen-Image-2.1 (Comfy-Org) : Le modèle de base de texte-à-image à poids ouvert qui interprète votre invite et synthétise l'image dans l'espace latent. Il utilise un générateur de style MMDiT optimisé pour un détail haute fidélité et une composition sensible à la typographie. Comfy-Org/Qwen-Image-2.1
- Qwen-Image-2.1 VAE : L'autoencodeur qui décode les latents générés en pixels. Il préserve les détails fins et la cohérence tonale à haute résolution. Distribué avec le même pack de modèles que ci-dessus.
- Modèle officiel (référence) : Un graphique texte-à-image autoritaire que vous pouvez comparer ou adapter à vos besoins. image_qwen_image_2_1_t2i.json
Comment utiliser le flux de travail Qwen Image 2.1 Texte à Image dans ComfyUI#
Flux global : les invites et une condition de graine conditionnent le modèle, un échantillonneur produit l'image dans l'espace latent, le VAE décode en pixels, et la sortie est enregistrée sous forme de PNG RGBA. Les groupes s'exécutent de gauche à droite pour que vous puissiez prévisualiser et itérer rapidement.
Invite et style
- Utilisez l'invite positive pour l'intention et la direction artistique et l'invite négative pour éviter les artefacts. Pour les portraits de mode, référez-vous à l'éclairage, l'angle de la caméra, l'objectif et les matériaux ; pour les cadres cinématographiques, guidez l'ambiance et le traitement des couleurs ; pour les photos de produits, spécifiez les surfaces, l'éclairage de studio et les reflets. Conservez une graine stable lorsque vous souhaitez une reproductibilité stricte lors des ajustements d'invite.
Résolution et graine
- Définissez votre taille cible dans le nœud de résolution avant l'échantillonnage. Le flux de travail est validé à 2048×2048 avec des poids INT8 et une taille de lot 1 pour la fiabilité sur les GPU modernes. Si vous avez besoin de prévisualisations plus rapides, baissez à 1024 ou 1536, puis revenez à 2048 pour les rendus finaux. La graine est exposée à l'utilisateur pour que vous puissiez verrouiller les variations ou explorer aléatoirement.
Chargement du modèle
- Le groupe de modèles charge les poids INT8 de Qwen-Image-2.1 et le VAE compagnon. Aucun câblage manuel n'est requis au-delà de la sélection des bons points de contrôle. Les invites sont encodées et passées au générateur pour que l'échantillonneur ait à la fois le conditionnement textuel et le canevas latent dont il a besoin.
Échantillonnage
- Une étape
KSamplergère la trajectoire de diffusion. Les étapes et le CFG sont exposés pour que vous puissiez équilibrer la vitesse et l'adhérence à l'invite. Les choix d'échantillonneur et de planificateur sont inclus pour le contrôle du style et la stabilité ; commencez par les valeurs par défaut, puis ajustez uniquement lorsque vous avez besoin d'un look différent ou d'une adhérence plus stricte à l'invite.
Décoder et sauvegarder
- Le VAE décode le latent final en une image et le groupe de sauvegarde écrit des PNG RGBA. Si votre composition suppose la transparence (logos, superpositions d'interface utilisateur, découpes de produits), l'exportateur préserve le canal alpha pour que les actifs s'intègrent directement dans les outils de conception sans masquage supplémentaire.
Nœuds clés dans le flux de travail Qwen Image 2.1 Texte à Image dans ComfyUI#
UNETLoaderCharge l'épine dorsale de diffusion INT8 de Qwen-Image-2.1 qui effectue réellement la génération. Gardez ce pointé sur les poids 2.1 pour la cohérence entre les sessions ; ne changez que lors de l'évaluation de variantes.CLIPLoaderou chargeur d'encodeur de texte spécifique au modèle Initialise l'encodeur d'invite pour que votre texte soit correctement intégré pour le générateur. Si vous changez d'encodeurs, ajustez légèrement le CFG et revérifiez la formulation des invites pour maintenir la même intention visuelle.EmptySD3LatentImageDéfinit la taille du canevas latent et le lot. Définissez la largeur et la hauteur ici à 2048 × 2048 pour les finales, puis ajustez vers le bas pour des brouillons plus rapides. Gardez la taille de lot 1 à la résolution native pour éviter la pression sur la VRAM.KSamplerConduit le processus de diffusion. Utilisez les étapes pour échanger la vitesse contre le détail, et ajustezcfgpour resserrer ou détendre l'adhérence à l'invite. Si vous changez d'échantillonneurs ou de planificateurs, faites des changements petits et progressifs et comparez les résultats à une graine fixe.SaveImageExporte l'image décodée sous forme de PNG RGBA avec le schéma de nommage de votre choix. Cela préserve la transparence pour la composition et assure une reproductibilité exacte lorsqu'il est combiné avec une graine fixe et une invite.
Extras optionnels#
- Modèles d'invite qui fonctionnent : "Portrait de mode en 35 mm, lumière de bord doux, style éditorial, détail de texture de tissu, arrière-plan neutre" ou "Prise de vue cinématographique large, lumière volumétrique à travers des stores, grade bleu–orange, contraste élevé" ou "Rendu de produit en studio, tasse en céramique brillante, éclairage à trois points, ombre douce sur papier sans couture."
- Reproductibilité : Enregistrez l'invite, l'invite négative, la graine et la résolution avec chaque exportation. De petites modifications contre une graine fixe sont le moyen le plus rapide de régler le look sans perdre la composition.
- Performance : Les poids INT8 réduisent l'utilisation de la VRAM et rendent le 2048×2048 pratique. Pour le matériel à mémoire inférieure, prévisualisez à 1024 et mettez à l'échelle ou rendez à pleine taille lorsque vous êtes satisfait.
- Construction de référence : Si vous souhaitez comparer la structure des nœuds ou restaurer les valeurs par défaut, commencez par le modèle officiel et migrez vos nœuds d'invite et de sauvegarde. image_qwen_image_2_1_t2i.json
- Pack de modèles : Utilisez la distribution maintenue par Comfy-Org pour un comportement cohérent dans tous les environnements. Comfy-Org/Qwen-Image-2.1
Remerciements#
Ce flux de travail implémente et s'appuie sur les œuvres et ressources suivantes. Nous remercions chaleureusement Comfy.org pour l'article de sortie de ComfyUI, Comfy-Org pour les poids ouverts de Qwen-Image-2.1, et Comfy-Org pour le modèle de flux de travail texte-à-image officiel pour leurs contributions et leur maintenance. Pour des détails autoritaires, veuillez vous référer à la documentation originale et aux référentiels liés ci-dessous.
Ressources#
- Article de sortie Comfy.org/ComfyUI
- Docs / Notes de version : Article de blog Comfy.org
- Poids officiels Comfy-Org Qwen-Image-2.1
- Hugging Face : Comfy-Org/Qwen-Image-2.1
- Modèle texte-à-image officiel Comfy-Org
- GitHub : Comfy-Org/workflow_templates
Note : L'utilisation des modèles, ensembles de données et codes référencés est soumise aux licences et termes respectifs fournis par leurs auteurs et mainteneurs.








