Qwen Image 2.1 Text To Image ComfyUI Workflow#
Trasforma prompt di testo in immagini dettagliate e ad alta risoluzione con i pesi open ufficiali di Qwen-Image-2.1 confezionati per ComfyUI. Questo flusso di lavoro di Qwen Image 2.1 Text To Image ComfyUI è progettato per i creatori che vogliono risultati riproducibili e output nitido a 2048×2048 nativi. Supporta l'inferenza INT8 per un uso efficiente della VRAM e salva PNG RGBA puliti, rendendolo adatto a ritratti di moda, fotogrammi cinematografici e concetti di prodotto raffinati.
Costruito attorno a un percorso semplice di generazione-decoding-salvataggio, il flusso di lavoro ti dà controllo diretto sul testo del prompt, sul seme e sulla risoluzione. Mantieni un seme fisso per iterazioni versionate, cambia stile con la frase del prompt ed esporta asset con sfondo trasparente pronti per pipeline di design.
Modelli chiave nel flusso di lavoro Comfyui Qwen Image 2.1 Text To Image ComfyUI#
- Qwen-Image-2.1 (Comfy-Org): Il modello di base open-weight text-to-image che interpreta il tuo prompt e sintetizza l'immagine nello spazio latente. Utilizza un generatore in stile MMDiT ottimizzato per dettagli ad alta fedeltà e composizione tipografica. Comfy-Org/Qwen-Image-2.1
- Qwen-Image-2.1 VAE: L'autoencoder che decodifica i latenti generati in pixel. Preserva i dettagli fini e la coerenza tonale ad alte risoluzioni. Distribuito con lo stesso pacchetto modello di cui sopra.
- Modello ufficiale (riferimento): Un grafico text-to-image autorevole che puoi confrontare o adattare alle tue esigenze. image_qwen_image_2_1_t2i.json
Come utilizzare il flusso di lavoro Comfyui Qwen Image 2.1 Text To Image ComfyUI#
Flusso generale: i prompt e un seme condizionano il modello, un campionatore produce l'immagine nello spazio latente, il VAE decodifica in pixel e l'output viene salvato come PNG RGBA. I gruppi funzionano da sinistra a destra, così puoi visualizzare in anteprima e iterare rapidamente.
Prompt e stile
- Usa il prompt positivo per l'intento e la direzione artistica e il prompt negativo per tenere fuori gli artefatti. Per ritratti di moda, riferimenti a illuminazione, angolo della fotocamera, lente e materiali; per fotogrammi cinematografici, guida umore e color grading; per scatti di prodotto, specifica superfici, illuminazione da studio e riflessi. Mantieni un seme stabile quando vuoi una riproducibilità rigorosa tra modifiche ai prompt.
Risoluzione e seme
- Imposta la tua dimensione target nel nodo risoluzione prima di campionare. Il flusso di lavoro è convalidato a 2048×2048 con pesi INT8 e dimensione batch 1 per affidabilità su GPU moderne. Se hai bisogno di anteprime più veloci, scendi a 1024 o 1536 e poi ritorna a 2048 per i rendering finali. Il seme è esposto all'utente, così puoi bloccare le variazioni o esplorare casualmente.
Caricamento del modello
- Il gruppo modello carica i pesi INT8 di Qwen-Image-2.1 e il VAE di accompagnamento. Non è richiesta alcuna connessione manuale oltre alla selezione dei checkpoint corretti. I prompt sono codificati e passati al generatore, così il campionatore ha sia il condizionamento del testo che la tela latente di cui ha bisogno.
Campionamento
- Una fase
KSamplergestisce la traiettoria di diffusione. I passaggi e il CFG sono esposti, così puoi bilanciare velocità e aderenza al prompt. Le scelte di campionatore e scheduler sono incluse per il controllo dello stile e la stabilità; inizia con i valori predefiniti, poi aggiusta solo quando hai bisogno di un aspetto diverso o di un'aderenza più stretta al prompt.
Decodifica e salva
- Il VAE decodifica il latente finale in un'immagine e il gruppo di salvataggio scrive PNG RGBA. Se la tua composizione presume trasparenza (loghi, sovrapposizioni UI, ritagli di prodotto), l'esportatore preserva il canale alfa, così gli asset vengono inseriti direttamente negli strumenti di design senza mascherature aggiuntive.
Nodi chiave nel flusso di lavoro Comfyui Qwen Image 2.1 Text To Image ComfyUI#
UNETLoaderCarica la dorsale di diffusione INT8 di Qwen-Image-2.1 che effettua effettivamente la generazione. Mantieni questo puntato sui pesi 2.1 per coerenza tra le sessioni; cambia solo durante il benchmarking delle varianti.CLIPLoadero caricatore di encoder di testo specifico del modello Inizializza il codificatore del prompt, così il tuo testo viene incorporato correttamente per il generatore. Se cambi i codificatori, ritocca leggermente il CFG e ricontrolla la formulazione del prompt per mantenere lo stesso intento visivo.EmptySD3LatentImageDefinisce la dimensione e il batch della tela latente. Imposta larghezza e altezza qui su 2048 × 2048 per i finali, poi regola verso il basso per bozze più veloci. Mantieni la dimensione batch 1 alla risoluzione nativa per evitare pressioni sulla VRAM.KSamplerGuida il processo di diffusione. Usa i passaggi per scambiare velocità per dettaglio e regolacfgper stringere o rilassare l'aderenza al prompt. Se cambi campionatori o scheduler, apporta modifiche piccole e incrementali e confronta i risultati a un seme fisso.SaveImageEsporta l'immagine decodificata come PNG RGBA con il pattern di denominazione scelto. Questo preserva la trasparenza per il compositing e assicura una riproducibilità esatta quando combinato con un seme e un prompt fissi.
Extra opzionali#
- Modelli di prompt che funzionano: “Ritratto di moda 35mm, luce di contorno morbida, styling editoriale, dettaglio della trama del tessuto, sfondo neutro” o “Scatto cinematografico ampio, luce volumetrica attraverso persiane, gradazione teal–orange, alto contrasto” o “Render di prodotto in studio, tazza di ceramica lucida, illuminazione a tre punti, ombra morbida su carta senza cuciture.”
- Riproducibilità: Registra prompt, prompt negativo, seme e risoluzione con ogni esportazione. Piccole modifiche su un seme fisso sono il modo più veloce per regolare l'aspetto senza perdere la composizione.
- Prestazioni: I pesi INT8 riducono l'uso della VRAM e rendono praticabile 2048×2048. Per hardware a memoria inferiore, anteprima a 1024 e upscale o ri-renderizza a dimensione piena quando soddisfatto.
- Build di riferimento: Se vuoi confrontare la struttura del nodo o ripristinare i valori predefiniti, inizia dal modello ufficiale e migra i tuoi nodi di prompt e salvataggio. image_qwen_image_2_1_t2i.json
- Pacchetto modello: Usa la distribuzione mantenuta da Comfy-Org per un comportamento coerente tra gli ambienti. Comfy-Org/Qwen-Image-2.1
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo Comfy.org per l'articolo di rilascio di ComfyUI, Comfy-Org per i pesi open di Qwen-Image-2.1 e Comfy-Org per il modello di flusso di lavoro text-to-image ufficiale per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- Articolo di rilascio di Comfy.org/ComfyUI
- Documentazione / Note di rilascio: Post sul blog di Comfy.org
- Pesi ufficiali di Comfy-Org/Comfy-Org Qwen-Image-2.1
- Hugging Face: Comfy-Org/Qwen-Image-2.1
- Modello text-to-image ufficiale di Comfy-Org
- GitHub: Comfy-Org/workflow_templates
Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e condizioni fornite dai loro autori e manutentori.








