Ricerca
The Functionalizer: decomposizione funzionale senza perdita per la tokenizzazione in sottoparole
I tokenizzatori standard per sottoparole trattano ogni variazione ortografica di una parola (come hello, Hello, HELLO e Héllo) come una voce di vocabolario distinta, frammentando così lo spazio degli

- arXiv
- 2609.15991
- Pubblicato
- 2026-07-07
- Autori
- Connor Makowski, Willem Guter
Abstract degli autori
I tokenizzatori standard per sottoparole trattano ogni variazione ortografica di una parola (come hello, Hello, HELLO e Héllo) come una voce di vocabolario distinta, frammentando così lo spazio degli embedding, oppure eliminano queste variazioni tramite una normalizzazione con perdita di informazioni. Presentiamo The Functionalizer, un framework di pre-tokenizzazione senza perdita di informazioni che, prima della tokenizzazione, scompone le variazioni ortografiche e strutturali in uno stream prefisso composizionale di opcode/operando: un token base canonico (operando) preceduto da operatori di trasformazione parametrici (opcode) codificati nell’area di uso privato Unicode. Introduciamo operatori per la gestione delle maiuscole (CAPITALIZE), dei segni diacritici (13 opcode dedicati) e della ripetizione dei caratteri (REPEAT, MULTIREPEAT), tutti completamente reversibili. Su corpora di linguaggio naturale e di codice, The Functionalizer consente di coprire l’intero corpus con vocabolari significativamente più piccoli, in condizioni di esaurimento senza vincoli, riducendo fino al 19,7% il numero effettivo di slot richiesti nel vocabolario. Le valutazioni a valle su modelli GPT-2 da 98 milioni di parametri mostrano che The Functionalizer migliora la validità sintattica del codice Python (9,12% contro 7,70%) e riduce al contempo la ripetizione di n-grammi duplicati nella prosa in linguaggio naturale. Questi risultati dimostrano che la scomposizione funzionale può essere un meccanismo efficace per modellare il linguaggio in modo strutturalmente consapevole e con un uso efficiente del vocabolario, e motivano ulteriori verifiche su scala di produzione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv