Qwen Image 2.1 Text-zu-Bild ComfyUI Workflow#
Verwandeln Sie Text-Prompts in detaillierte, hochauflösende Bilder mit den offiziellen Qwen-Image-2.1 offenen Gewichten, die für ComfyUI verpackt sind. Dieser Qwen Image 2.1 Text-zu-Bild ComfyUI-Workflow ist für Kreative konzipiert, die reproduzierbare Ergebnisse und klare Ausgaben bei nativen 2048×2048 wünschen. Er unterstützt INT8-Inferenz für eine effiziente VRAM-Nutzung und speichert saubere RGBA-PNGs, was ihn zu einer starken Wahl für Modeporträts, filmische Stills und polierte Produktkonzepte macht.
Der Workflow basiert auf einem einfachen Generieren-Dekodieren-Speichern-Pfad und gibt Ihnen direkte Kontrolle über Prompttext, Seed und Auflösung. Behalten Sie einen festen Seed für versionierte Iterationen bei, wechseln Sie Stile mit Promptformulierungen und exportieren Sie Assets mit transparentem Hintergrund, die bereit für Design-Pipelines sind.
Schlüsselmodelle im Comfyui Qwen Image 2.1 Text-zu-Bild ComfyUI Workflow#
- Qwen-Image-2.1 (Comfy-Org): Das zentrale offene Text-zu-Bild-Modell, das Ihren Prompt interpretiert und das Bild im latenten Raum synthetisiert. Es verwendet einen MMDiT-Stil-Generator, der für hochdetaillierte Darstellung und typografiebewusste Komposition optimiert ist. Comfy-Org/Qwen-Image-2.1
- Qwen-Image-2.1 VAE: Der Autoencoder, der die generierten Latenten zurück zu Pixeln dekodiert. Er bewahrt feine Details und tonale Konsistenz bei hohen Auflösungen. Wird mit dem gleichen Modellpaket wie oben verteilt.
- Offizielle Vorlage (Referenz): Ein autoritatives Text-zu-Bild-Diagramm, das Sie vergleichen oder an Ihre Bedürfnisse anpassen können. image_qwen_image_2_1_t2i.json
So verwenden Sie den Comfyui Qwen Image 2.1 Text-zu-Bild ComfyUI Workflow#
Gesamtfluss: Prompts und ein Seed konditionieren das Modell, ein Sampler erzeugt das Bild im latenten Raum, der VAE dekodiert zu Pixeln und das Ergebnis wird als RGBA-PNG gespeichert. Die Gruppen laufen von links nach rechts, sodass Sie schnell Vorschauen anzeigen und iterieren können.
Prompt und Stil
- Verwenden Sie den positiven Prompt für die Absicht und Kunstrichtung und den negativen Prompt, um Artefakte auszuschließen. Bei Modeporträts verweisen Sie auf Beleuchtung, Kamerawinkel, Objektiv und Materialien; bei filmischen Rahmen leiten Sie Stimmung und Farbkorrektur; bei Produktaufnahmen spezifizieren Sie Oberflächen, Studio-Beleuchtung und Reflexionen. Behalten Sie einen stabilen Seed bei, wenn Sie strikte Reproduzierbarkeit bei Promptanpassungen wünschen.
Auflösung und Seed
- Legen Sie Ihre Zielgröße im Auflösungs-Node fest, bevor Sie sampeln. Der Workflow ist bei 2048×2048 mit INT8-Gewichten und Batchgröße 1 für Zuverlässigkeit auf modernen GPUs validiert. Wenn Sie schnellere Vorschauen benötigen, reduzieren Sie auf 1024 oder 1536 und kehren Sie dann für endgültige Renderings zu 2048 zurück. Der Seed ist benutzerzugänglich, sodass Sie Variationen sperren oder Erkundungen randomisieren können.
Modell-Laden
- Die Modellgruppe lädt Qwen-Image-2.1 INT8-Gewichte und den begleitenden VAE. Keine manuelle Verkabelung ist erforderlich, außer der Auswahl der richtigen Checkpoints. Prompts werden kodiert und an den Generator weitergeleitet, sodass der Sampler sowohl die Textkonditionierung als auch die latente Leinwand hat, die er benötigt.
Sampling
- Eine
KSampler-Stufe behandelt die Diffusionstrajektorie. Schritte und CFG sind offengelegt, sodass Sie Geschwindigkeit und Einhaltung des Prompts ausbalancieren können. Sampler- und Scheduler-Auswahlen sind für Stilkontrolle und Stabilität enthalten; beginnen Sie mit den Standardeinstellungen und passen Sie nur an, wenn Sie einen anderen Look oder eine strengere Promptverfolgung benötigen.
Dekodieren und speichern
- Der VAE dekodiert das finale Latente zu einem Bild und die Speichergruppe schreibt RGBA-PNGs. Wenn Ihre Komposition Transparenz voraussetzt (Logos, UI-Overlays, Produktausschnitte), bewahrt der Exporteur den Alphakanal, sodass die Assets direkt in Design-Tools ohne zusätzliche Maskierung fallen.
Schlüsselknoten im Comfyui Qwen Image 2.1 Text-zu-Bild ComfyUI Workflow#
UNETLoaderLädt das Qwen-Image-2.1 INT8-Diffusions-Backbone, das tatsächlich die Generierung durchführt. Halten Sie dies auf die 2.1-Gewichte gerichtet für Konsistenz über Sitzungen hinweg; wechseln Sie nur beim Benchmarken von Varianten.CLIPLoaderoder modellspezifischer Text-Encoder-Loader Initialisiert den Prompt-Encoder, sodass Ihr Text korrekt für den Generator eingebettet wird. Wenn Sie Encoder wechseln, passen Sie CFG leicht an und überprüfen Sie die Prompt-Formulierung, um die gleiche visuelle Absicht beizubehalten.EmptySD3LatentImageDefiniert die latente Leinwandgröße und den Batch. Stellen Sie Breite und Höhe hier auf 2048 × 2048 für Endversionen ein, dann reduzieren Sie für schnellere Entwürfe. Halten Sie die Batchgröße bei nativer Auflösung auf 1, um VRAM-Druck zu vermeiden.KSamplerSteuert den Diffusionsprozess. Verwenden Sie Schritte, um Geschwindigkeit gegen Detail zu tauschen, und passen Siecfgan, um die Einhaltung des Prompts zu straffen oder zu lockern. Wenn Sie Sampler oder Scheduler wechseln, machen Sie kleine, inkrementelle Änderungen und vergleichen Sie die Ergebnisse bei einem festen Seed.SaveImageExportiert das dekodierte Bild als RGBA-PNG mit Ihrem gewählten Namensmuster. Dies bewahrt die Transparenz für die Komposition und gewährleistet eine genaue Reproduzierbarkeit in Kombination mit einem festen Seed und Prompt.
Optionale Extras#
- Funktionierende Prompt-Muster: "35mm Modeporträt, weiches Randlicht, redaktionelles Styling, Stoffstruktur-Detail, neutraler Hintergrund" oder "filmische Weitwinkelaufnahme, volumetrisches Licht durch Jalousien, Teal-Orange-Abstufung, hoher Kontrast" oder "Studio-Produkt-Render, glänzende Keramiktasse, Drei-Punkt-Beleuchtung, weicher Schatten auf nahtlosem Papier."
- Reproduzierbarkeit: Protokollieren Sie Prompt, negativen Prompt, Seed und Auflösung bei jedem Export. Kleine Bearbeitungen gegen einen festen Seed sind der schnellste Weg, um das Aussehen einzustellen, ohne die Komposition zu verlieren.
- Leistung: INT8-Gewichte reduzieren den VRAM-Verbrauch und machen 2048×2048 praktikabel. Für Hardware mit geringerer Speicherkapazität, Vorschau bei 1024 und Hochskalieren oder Neurendern in voller Größe, wenn Sie zufrieden sind.
- Referenzaufbau: Wenn Sie die Knotenstruktur vergleichen oder Standardeinstellungen wiederherstellen möchten, beginnen Sie mit der offiziellen Vorlage und migrieren Sie Ihre Prompt- und Speichernodes. image_qwen_image_2_1_t2i.json
- Modellpaket: Verwenden Sie die gewartete Comfy-Org-Verteilung für konsistentes Verhalten über Umgebungen hinweg. Comfy-Org/Qwen-Image-2.1
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Comfy.org für den ComfyUI-Release-Artikel, Comfy-Org für die Qwen-Image-2.1 offenen Gewichte und Comfy-Org für die offizielle Text-zu-Bild-Workflow-Vorlage für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die originale Dokumentation und die unten verlinkten Repositories.
Ressourcen#
- Comfy.org/ComfyUI Release-Artikel
- Docs / Release Notes: Comfy.org Blogbeitrag
- Comfy-Org/Offizielle Comfy-Org Qwen-Image-2.1 Gewichte
- Hugging Face: Comfy-Org/Qwen-Image-2.1
- Comfy-Org/Offizielle Text-zu-Bild-Vorlage
- GitHub: Comfy-Org/workflow_templates
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen ihrer Autoren und Betreuer.








