Vai al contenuto
AI.info

Ricerca

I modelli linguistici hanno bisogno di una tabella di embedding di input addestrabile? Codici fissi e minimi per i token su scala da 1,7 miliardi di parametri

Una tabella di embedding di input addestrabile assegna a ogni elemento del vocabolario un vettore regolabile in modo indipendente. Esaminiamo se questa parametrizzazione specifica per ciascun token si

I modelli linguistici hanno bisogno di una tabella di embedding di input addestrabile? Codici fissi e minimi per i token su scala da 1,7 miliardi di parametri
arXiv
2610.04002
Pubblicato
2026-10-02
Autori
A. Bochkov

Abstract degli autori

Una tabella di embedding di input addestrabile assegna a ogni elemento del vocabolario un vettore regolabile in modo indipendente. Esaminiamo se questa parametrizzazione specifica per ciascun token sia necessaria per ottenere capacità sostanziali nella modellazione del linguaggio, o se un Transformer condiviso possa apprendere a partire da identità dei token fisse. Confrontiamo tre modelli linguistici decoder-only addestrati da zero con lo stesso tokenizer, la stessa architettura contestuale di base, la stessa architettura con testa di output a pesi non condivisi e la stessa procedura di addestramento, puntando a 100 miliardi di token di predizione per modello. Le rispettive interfacce di input sono una tabella appresa, codici canonici a 16 bit degli ID dei token e una ricodifica fissa invertibile su GF(2). I codici fissi vengono ripetuti fino a raggiungere la dimensione del modello, senza un’ulteriore proiezione di input addestrabile. Entrambi i modelli con codici fissi acquisiscono capacità sostanziali: i codici canonici raggiungono un’accuratezza normalizzata del 52,40\% su HellaSwag, un’accuratezza del 70,51\% su PIQA e del 42,75\% su LAMBADA. Il modello di controllo con input appreso ottiene risultati migliori in diverse valutazioni, tra cui HellaSwag e LAMBADA: questi risultati dimostrano quindi la fattibilità dell’approccio, non la parità di prestazioni. Le interfacce fisse eliminano 100,7 milioni di parametri addestrabili, producendo modelli da 1,711 miliardi di parametri, ma la riduzione dei parametri non è il risultato centrale. Questi esperimenti, condotti una sola volta per ciascun modello, distinguono la necessità architetturale dall’utilità empirica: vettori di input specifici per ciascun token e addestrabili in modo indipendente non sono necessari per le capacità osservate. Un’interfaccia fissa per l’identità dei token offre inoltre un contesto controllato per studiare l’apprendimento delle rappresentazioni a valle di un input immutabile, senza stabilire dove siano localizzate particolari capacità.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv