Vai al contenuto
AI.info

Ricerca

FLAT: ricampionamento di immagini e testo in token transmodali allineati di lunghezza flessibile in 1D per il recupero e la generazione

Tradizionalmente, l’apprendimento di rappresentazioni multimodali e la generazione avvengono in due fasi: prima si addestra un encoder visivo contrastivo o auto-supervisionato, poi un modello generati

FLAT: ricampionamento di immagini e testo in token transmodali allineati di lunghezza flessibile in 1D per il recupero e la generazione
arXiv
2609.16591
Pubblicato
2026-09-15
Autori
Guangyu Sun, Shlok Kumar Mishra, Wentao Bao, Robert Zhenheng Yang, Xiao Wang, Xiyuan Wang, Yujunrong Ma, Chen Yuan, Max Xiangjun Fan, Jun Xiao, Jianpeng Cheng

Abstract degli autori

Tradizionalmente, l’apprendimento di rappresentazioni multimodali e la generazione avvengono in due fasi: prima si addestra un encoder visivo contrastivo o auto-supervisionato, poi un modello generativo separato per i compiti successivi. Questa impostazione limita le prestazioni generative, vincolandole a embedding congelati. Per superare questo limite, torniamo a esaminare l’apprendimento congiunto di rappresentazioni multimodali e della generazione, con l’obiettivo di produrre embedding interpolabili linearmente e direttamente utilizzabili dai decoder generativi. Presentiamo FLAT (Flexible-Length Aligned Transmodal representations), un framework di pre-addestramento delle rappresentazioni che ottimizza congiuntamente un encoder multimodale condiviso e decoder per la generazione da testo a immagine (T2I) e da immagine a testo (I2T). Combinando l’allineamento contrastivo con obiettivi generativi bidirezionali tra modalità, FLAT fa sì che le sue rappresentazioni funzionino sia come descrittori semantici discriminativi sia come condizioni per la generazione. Sul piano architetturale, FLAT mappa gli input visivi e testuali in uno spazio unificato di sequenze continue 1D e applica il dropout annidato ai token del prefisso K, consentendo lunghezze di output variabili. Un’unica fase di pre-addestramento permette a FLAT di eseguire il recupero e la generazione tra modalità con valori variabili del prefisso K, ottenendo un punteggio GenEval di 71,1 nella generazione T2I. Il fine-tuning specifico per ciascun compito porta le prestazioni del modello in linea con le baseline allo stato dell’arte: 83,1 su GenEval nella generazione T2I; 40,5 su BLEU-4 e 138,6 su CIDEr nella generazione di didascalie per immagini su MS-COCO; punteggi Recall@5 di 86,8 (I2T) / 75,8 (T2I) su MS-COCO e di 98,3 (I2T) / 93,6 (T2I) su Flickr30K. Infine, le valutazioni qualitative mostrano che le rappresentazioni di FLAT supportano direttamente l’interpolazione lineare, le operazioni aritmetiche nello spazio latente e il recupero composito zero-shot.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv