Vai al contenuto
AI.info

Ricerca

LatentPress: compressione del contesto oltre il testo e la visione

Il contesto compresso viene di solito rappresentato come testo leggibile dalle persone o come immagini renderizzate che devono essere decodificate, anche quando a utilizzarlo è un modello linguistico.

LatentPress: compressione del contesto oltre il testo e la visione
arXiv
2609.01507
Pubblicato
2026-09-01
Autori
Zhengze Zhou, Hejian Sang

Abstract degli autori

Il contesto compresso viene di solito rappresentato come testo leggibile dalle persone o come immagini renderizzate che devono essere decodificate, anche quando a utilizzarlo è un modello linguistico. Presentiamo LatentPress, che codifica cronologie delle conversazioni e documenti lunghi in una terza rappresentazione: token di memoria continui che un decoder congelato legge direttamente attraverso la propria interfaccia di embedding in ingresso, senza ricostruire il testo durante l’inferenza. Un piccolo writer abbinato al lettore comprime di $4$-$16\times$ addestrando soltanto un adapter (4,2M-26,2M parametri, $\sim\!0.1\%$ di quelli del decoder). Su LongMemEval, LatentPress raggiunge un’accuratezza di $0.504$ con una compressione di $7.70\times$, contro $0.490$ per le evidenze non compresse, superando i riassunti testuali (0,184) e la compressione basata su OCR (da 0,426 a 0,312). Su LongBench-QA, i writer dello stesso dominio eguagliano o superano la lettura del contesto non compresso con una compressione di $4$-$8\times$, mentre a $16\times$ ottengono risultati inferiori. La codifica richiede 43 ms per conversazione, circa un ordine di grandezza meno rispetto al riassunto testuale o alla ricostruzione tramite OCR, e la lettura è $5$-$9\times$ più veloce rispetto alla lettura del contesto non compresso o dell’OCR memorizzato nella cache. Convalidiamo l’interfaccia in due scenari di trasferimento: zero-shot da UltraChat alle domande e risposte basate sulla memoria di LongMemEval e dalle domande e risposte derivate da LongMemEval a domini documentali di LongBench mai visti, dimostrando che i token soft diretti costituiscono un’interfaccia pratica per fornire contesto alle macchine, oltre il testo e la visione. L’implementazione degli esperimenti è disponibile all’indirizzo: https://github.com/xuyd16ai/context_softtoken_compress .

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv