Vai al contenuto
AI.info

The Pulse

Qwen-Image 2.1 rilasciato su ModelScope con generazione e modifica di immagini trasparenti

Qwen-Image 2.1 è ora disponibile su ModelScope come modello open source per la generazione e la modifica di immagini, con supporto per immagini RGBA trasparenti, modifiche localizzate e più immagini di riferimento.

Qwen-Image 2.1 rilasciato su ModelScope con generazione e modifica di immagini trasparenti

AI.info Team ·

Qwen-Image 2.1 è ora disponibile su ModelScope come modello open source. La scheda lo presenta come un sistema unificato per la generazione di immagini da testo e la modifica di immagini, appartenente alla famiglia Qwen e incentrato sulla qualità delle immagini, l’efficienza dell’inferenza e flussi di lavoro visivi flessibili.

La pagina del modello indica Qwen/Qwen-Image-2.1 come identificativo e fornisce informazioni su download e inferenza. Descrive un componente di generazione visiva con 7 miliardi di parametri, realizzato con 32 livelli Single-Stream DiT. Secondo la pagina, l’architettura è progettata per bilanciare qualità di generazione, efficienza computazionale e versatilità.

«Siamo entusiasti di rendere open source Qwen-Image-2.1, un modello unificato per la generazione di immagini da testo e la modifica di immagini appartenente alla famiglia Qwen.»
— Qwen, editore del modello

Generazione e modifica in un unico modello

Qwen-Image 2.1 supporta sia la generazione di immagini da testo sia la modifica di immagini. La documentazione su ModelScope include un esempio di generazione da testo a immagine che crea un’immagine di 2.048 × 2.048 pixel a partire da un prompt scritto. Fornisce anche un esempio di modifica in cui un’immagine di input viene modificata tramite un’istruzione in linguaggio naturale.

Secondo la scheda, il modello consente modifiche localizzate tramite cerchi, annotazioni disegnate e maschere separate. Gli utenti possono inoltre fornire fino a 10 immagini di riferimento. La documentazione afferma che queste funzionalità sono pensate per aiutare a preservare l’identità di persone e prodotti, perfezionando al contempo aree selezionate di un’immagine.

Trasparenza nativa e output RGBA

A differenza delle informazioni precedenti riportate nella scheda, la documentazione del modello rilasciato descrive esplicitamente la generazione nativa di immagini trasparenti. Afferma che Qwen-Image 2.1 può generare immagini RGBA normali o trasparenti, modificare livelli trasparenti ed estrarre soggetti dalle fotografie.

Le istruzioni di avvio rapido includono un flusso di lavoro per immagini trasparenti che usa un prompt in cui si fa riferimento a un’immagine RGBA, a un canale alfa e a uno sfondo trasparente. L’immagine risultante può essere salvata tramite l’esempio Python fornito. La pagina include inoltre la generazione nativa di immagini trasparenti tra le funzionalità del modello messe in evidenza.

Qualità delle immagini e miglioramenti tecnici

La descrizione su ModelScope mette in risalto i miglioramenti nella tipografia, nell’illuminazione dei ritratti, nelle texture realistiche e nei dettagli visivi più fini. Presenta questi cambiamenti come parte di un impegno volto a produrre immagini più convincenti e a preservare meglio le caratteristiche visive durante le modifiche.

Il modello utilizza l’attenzione a granularità mista e il riutilizzo della cache key-value del prefisso, che la scheda associa a un’architettura compatta ed efficiente. La pagina afferma che questo design offre un’elevata qualità delle immagini a un costo computazionale inferiore, ma non include tabelle di benchmark che confrontino Qwen-Image 2.1 con modelli precedenti di generazione di immagini Qwen o con sistemi concorrenti.

Dimensioni supportate e distribuzione

La documentazione elenca rapporti d’aspetto predefiniti che vanno dalle immagini quadrate 1:1 ai formati orizzontali 16:9 e verticali 9:16. Le risoluzioni corrispondenti vanno da 1.536 × 2.752 pixel a 2.752 × 1.536 pixel; sono inoltre disponibili diversi formati intermedi, sia verticali sia orizzontali.

Le istruzioni di avvio rapido utilizzano PyTorch, Transformers, Diffusers, Accelerate e Pillow. Illustrano il caricamento del modello tramite QwenImage21Pipeline e includono un’opzione di offload della CPU per la gestione della memoria. La pagina fornisce anche un esempio di API di inferenza per ModelScope, con una richiesta asincrona di generazione di immagini e un ciclo di interrogazione dello stato dell’attività.

Qwen-Image 2.1 è distribuito con la Qwen Research License Agreement. La scheda su ModelScope include link a materiali aggiuntivi sul progetto, immagini di esempio e indicazioni per l’inferenza, offrendo agli utenti un punto di partenza per la generazione in locale, la modifica delle immagini e i flussi di lavoro con output trasparente.

Fonte

Esplora

Altri articoli