Vai al contenuto
AI.info

Ricerca

Persi nella compressione: una verifica interlinguistica controllata dei compressori estrattivi di prompt

La compressione estrattiva dei prompt promette di ridurre i costi di inferenza degli LLM eliminando i token a basso contenuto informativo, e compressori addestrati come LLMLingua-2 riportano ottimi ri

Persi nella compressione: una verifica interlinguistica controllata dei compressori estrattivi di prompt
arXiv
2608.26175
Pubblicato
2026-07-27
Autori
Mantas Lukauskas

Abstract degli autori

La compressione estrattiva dei prompt promette di ridurre i costi di inferenza degli LLM eliminando i token a basso contenuto informativo, e compressori addestrati come LLMLingua-2 riportano ottimi risultati nei benchmark in inglese. La maggior parte delle altre lingue comporta già un costo aggiuntivo in token: lo stesso contenuto richiede da 1,3 a 1,8 volte più token che in inglese. Ci chiediamo se la compressione riduca o ampli questo divario. Con dati perfettamente paralleli in dieci lingue che utilizzano cinque sistemi di scrittura, e controlli il cui budget è equiparato secondo il tokenizer del modello bersaglio, esaminiamo quattro compressori addestrati rispetto a quattro metodi deterministici di riferimento, su undici modelli bersaglio di dieci fornitori (oltre 250.000 chiamate di valutazione). Tre compressori sono addestrati con supervisione in inglese (LLMLingua-2 XLM-R/mBERT; Kompress-v2 dello stack di produzione Headroom); il quarto, XProvence, è addestrato su più lingue. In primo luogo, il divario nel trasferimento è reale, si ripresenta con diversi modelli bersaglio e architetture di base dei compressori e dipende fortemente dal tasso di conservazione: con un tasso di 0,33, l’inglese conserva il 57-62% dell’utilizzo normalizzato del contesto, il lituano il 10-24% e il cinese sostanzialmente nulla, pur avendo il minor costo aggiuntivo in token. In secondo luogo, il divario è legato ai dati usati per supervisionare la compressione, non all’architettura. Tutti e tre i compressori addestrati in inglese lo mostrano, i metodi deterministici non mostrano un divario paragonabile e XProvence v1, addestrato su più lingue, non ne mostra alcuno. La versione v2 di XProvence, riaddestrata su dati tradotti, svuota il 92% dei contesti in cinese alla sua soglia di compressione aggressiva, senza alcun avviso. In terzo luogo, in uno scenario più difficile con contesti lunghi, la compressione aggressiva tramite compressori addestrati porta l’utilità dei contesti compressi a un livello pari o inferiore a quella ottenuta senza contesto in tre delle cinque lingue diverse dall’inglese. Una procedura che prima traduce e poi comprime eguaglia o supera la compressione nella lingua originale, con un costo in token pari a circa la metà, in tre delle cinque lingue esaminate. Rendiamo disponibili tutto il codice, le compressioni e gli output dei modelli. Al di fuori dell’inglese, i budget di compressione sicuri sono molto più ridotti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv