Vai al contenuto
AI.info

The Pulse

OpenAI lancia ChatGPT Images 2.5, con modifiche più rapide e precise

OpenAI ha rilasciato ChatGPT Images 2.5, con una maggiore fedeltà alle foto di riferimento, modifiche su più turni, generazione basata su schizzi e una latenza inferiore fino al 50%. L’aggiornamento aggiunge anche modelli, commenti sulle im

OpenAI lancia ChatGPT Images 2.5, con modifiche più rapide e precise

AI.info Team ·

Quando Axios ha testato il nuovo motore per immagini di OpenAI con la fotografia di un gatto nero di nome Raven, il modello ha trasformato l’animale in un detective da film noir, in un soggetto da vetrata e in un diagramma anatomico, preservando quella che il tester ha definito «l’espressione meravigliosamente impassibile» di Raven. In un test separato di modifica di un tatuaggio, l’utente ha potuto cerchiare l’area da cambiare, chiedere elementi più chiari e perfezionare il disegno nel corso di più turni.

Queste dimostrazioni riassumono l’obiettivo di ChatGPT Images 2.5, rilasciato da OpenAI l’8 settembre. L’aggiornamento punta a una debolezza persistente dei generatori di immagini: apportare modifiche sostanziali senza perdere l’identità, la composizione o i dettagli dell’immagine originale.

OpenAI afferma che ogni settimana vengono create oltre 3 miliardi di immagini con ChatGPT Images e i suoi modelli GPT-Image nell’API. Images 2.5 è ora in distribuzione per gli utenti di ChatGPT, ChatGPT Work e Codex sul web, desktop e dispositivi mobili, in tutti i piani.

Il test pratico di Axios ha rilevato che il nuovo editor gestiva le immagini di riferimento e le modifiche mirate con maggiore efficacia rispetto alle versioni precedenti, comprese quelle apportate segnando una parte dell’immagine anziché descrivere ogni cambiamento a parole.

Gestione più coerente delle foto di riferimento

OpenAI afferma che Images 2.5 produce un’illuminazione più naturale, texture più ricche e soggetti più riconoscibili quando lavora a partire da foto di riferimento. Gli utenti possono inserire una persona, un animale domestico o un altro soggetto familiare in un’ambientazione, uno stile visivo o una composizione diversi, conservandone meglio i tratti distintivi.

Il modello mira inoltre a preservare il resto dell’immagine quando l’utente modifica un elemento. L’editor può aggiornare un prodotto, uno sfondo o un testo, mantenendo intatti il soggetto, la composizione e il trattamento visivo circostante. È importante quando si lavora ripetutamente a un progetto creativo, perché ricreare un intero elemento grafico dopo ogni revisione può introdurre modifiche indesiderate.

«Ciò che ci ha colpito di più di GPT‑Image‑2.5 Flare è la sua capacità di capire cosa non deve cambiare», ha dichiarato Axultan Alimkulov, responsabile del prodotto di Higgsfield AI. «Si può apportare una modifica significativa senza perdere il carattere, la composizione o l’identità visiva dell’immagine originale».

OpenAI afferma inoltre che il modello conserva con maggiore affidabilità le modifiche precedenti nel corso di conversazioni più lunghe. Ogni nuova istruzione dovrebbe basarsi sulla versione precedente senza deteriorare la qualità dell’immagine né annullare i dettagli definiti in precedenza.

Schizzi, modelli e commenti ampliano le possibilità di modifica oltre i prompt

ChatGPT Images 2.5 aggiunge diversi strumenti per chi non vuole descrivere a parole ogni modifica visiva. La nuova funzione Sketch consente agli utenti di disegnare direttamente in ChatGPT e usare il disegno come guida per l’immagine finale. Una disposizione approssimativa di una stanza, il contorno di un abito o un oggetto possono fungere da riferimento visivo prima che il modello generi il risultato completo.

I modelli offrono punti di partenza per formati come poster, volantini, merchandising e fotografie di prodotti. Gli utenti possono poi aggiungere le informazioni, gli elementi grafici e lo stile visivo che desiderano. La documentazione di assistenza di OpenAI afferma che, quando la categoria lo consente, ai modelli si possono anche allegare immagini di riferimento.

Gli utenti possono inserire commenti direttamente su un’immagine per indicare dove intervenire. Possono anche condividere il prompt usato per creare un’immagine, così che un’altra persona possa riutilizzare l’idea con foto e dettagli diversi, anziché copiare senza modifiche l’elemento grafico originale.

Flare e Sunburst dividono l’offerta API

Insieme all’aggiornamento di ChatGPT, OpenAI rilascia due modelli API. GPT-Image-2.5 Flare è l’opzione predefinita per la maggior parte delle applicazioni ed è pensato per strumenti creativi, contenuti social, esperienze di prodotto, ricerca visiva, prototipazione e generazione su larga scala.

OpenAI afferma che Flare offre risultati di qualità superiore rispetto a GPT-Image-2, con una latenza inferiore del 50%. GPT-Image-2.5 Sunburst è pensato per flussi di lavoro che richiedono un controllo più preciso sulle modifiche, come la creatività per le campagne e le immagini di prodotto rifinite, e tempi di generazione più lunghi.

Questa distinzione offre agli sviluppatori la possibilità di scegliere tra una generazione più rapida e versatile e un modello più lento, pensato per lavori creativi dettagliati. Secondo l’annuncio di OpenAI, i modelli sono disponibili anche attraverso prodotti partner, tra cui Adobe Firefly.

Più velocità, ma il realismo aumenta i rischi per la sicurezza

OpenAI afferma che Images 2.5 riduce la latenza di generazione fino al 50% rispetto a Images 2.0. Risultati più rapidi sono particolarmente utili nelle modifiche in più passaggi, quando gli utenti possono apportare diverse piccole correzioni prima di accettare un’immagine finale.

La scheda sulla sicurezza dell’azienda riconosce che un maggiore realismo può rendere più convincenti i deepfake che coinvolgono persone, luoghi ed eventi reali. OpenAI afferma che le sue misure di protezione controllano i prompt, le immagini in ingresso e i risultati generati, applicando verifiche di conformità alle policy, classificatori di immagini e un modello di ragionamento sulla sicurezza prima di mostrare un’immagine.

Nella valutazione avversaria di OpenAI, risultati non sicuri sono stati mostrati nell’1,09% dei casi per Sunburst e nell’1,41% per Flare, contro l’1,64% del modello di riferimento ChatGPT Images 2.0. L’azienda avverte che il set di test era stato progettato per provocare violazioni delle policy e non rappresenta il normale traffico di produzione.

OpenAI afferma che Images 2.5 continua a usare metadati C2PA e filigrane invisibili per aiutare a identificare le immagini realizzate con i suoi strumenti. Con questo lancio, l’aggiornamento arriva direttamente agli utenti di ChatGPT, mentre gli sviluppatori possono scegliere tra due modelli distinti per i flussi di lavoro di produzione delle immagini.

Fonte

Esplora

Altri articoli