Ricerca
Cambia il prodotto, mantieni i parametri: livelli di algebra associativa per i transformer
Gli algoritmi di moltiplicazione rapida delle matrici mantengono fisso il prodotto e cercano un modo meno costoso per calcolarlo. Noi ci chiediamo invece se le proiezioni apprese da un transformer pos

- arXiv
- 2609.32814
- Pubblicato
- 2026-09-26
- Autori
- Ilya Koziev, Ivan Oseledets
Abstract degli autori
Gli algoritmi di moltiplicazione rapida delle matrici mantengono fisso il prodotto e cercano un modo meno costoso per calcolarlo. Noi ci chiediamo invece se le proiezioni apprese da un transformer possano usare un prodotto diverso e meno costoso. Partendo da una costruzione basata sull’algebra associativa, che sostituisce la normale moltiplicazione matriciale con una tabella di interazioni più sparsa sugli stessi blocchi di pesi, costruiamo una famiglia il cui costo aritmetico è quadratico rispetto alla dimensione della matrice quando la dimensione fisica dei blocchi resta fissa, e ricaviamo vincoli sulle dimensioni finite per l’esecuzione su GPU. La costruzione è dimostrabilmente ottimale rispetto al suo rango bilineare in base al limite di Alder--Strassen e può essere realizzata come proiezioni rettangolari tipizzate per riga, compatibili con il mascheramento causale e la decodifica con cache KV. Mettiamo alla prova empiricamente questo approccio addestrando due modelli linguistici transformer con solo decoder, ciascuno con circa 110 milioni di parametri, secondo la stessa procedura e con un budget di 12,3 miliardi di token. I modelli differiscono solo per il livello feed-forward: uno usa la normale moltiplicazione matriciale densa, l’altro il prodotto dell’algebra associativa. In quattro domini di prompt, il modello algebrico ottiene un aumento del 6,2--7,8\% del throughput di generazione end-to-end, ma punteggi inferiori in tutte e tre le metriche a valle riportate. Consideriamo questi risultati una verifica, su piccola scala, della fattibilità dell’approccio proposto e della possibilità di addestrarlo, lasciando ulteriori indagini a lavori futuri.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv