Ricerca
I confini dei paragrafi non sono spazi bianchi: la profondità della compressione come segno distintivo della struttura gerarchica
Le codifiche posizionali standard rappresentano la posizione come una coordinata unidimensionale che segue l’ordine di lettura, ma l’ordine di lettura da solo non determina la struttura gerarchica del

- arXiv
- 2609.23551
- Pubblicato
- 2026-09-20
- Autori
- Shuyang Xiang
Abstract degli autori
Le codifiche posizionali standard rappresentano la posizione come una coordinata unidimensionale che segue l’ordine di lettura, ma l’ordine di lettura da solo non determina la struttura gerarchica del testo. Usiamo una codifica posizionale rotativa gerarchica (hRoPE) che rappresenta gli indici di paragrafo, frase e token come canali separati. Manteniamo fissa la sequenza di token, interveniamo sulla coordinata di paragrafo p1 e misuriamo l’attenzione tra paragrafi con uno stimatore esatto rispetto alla distanza tra token. In ogni corpus, l’attenzione risulta compressa rispetto a un riferimento appaiato per distanza tra token, ma la compressione da sola non è indicativa della struttura reale: anche un canale architettonicamente identico, con etichette casuali della stessa densità, produce compressione, seppure meno profonda. A distinguere la struttura reale è la profondità della compressione, che è maggiore e dipende dal corpus, mentre quella del controllo non dipende dal corpus. Confrontiamo otto grandezze ricavate esclusivamente dai corpora, relative a tre aspetti (persistenza lessicale, lunghezza dei paragrafi e coerenza basata sugli embedding): nessuna riproduce pienamente l’ordinamento della profondità tra i corpora, anche se la coerenza basata sugli embedding è quella che vi si avvicina di più. Nel nostro contesto, il segno distintivo riproducibile dell’autentica struttura dei paragrafi è la profondità della compressione, non la posizione in cui si verifica.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv