Vai al contenuto
AI.info

Ricerca

Iperreti di circuiti per modelli linguistici a diffusione potenziati dal calcolo quantistico

I modelli linguistici possono essere adattati modificando i calcoli applicati ai singoli token. I circuiti quantistici offrono un possibile approccio, ma valutare circuiti più ampi all’interno di un m

Iperreti di circuiti per modelli linguistici a diffusione potenziati dal calcolo quantistico
arXiv
2609.24657
Pubblicato
2026-09-21
Autori
Xiaoqiang Wang, Mengyang Xiong, Jun Dai, Bang Liu

Abstract degli autori

I modelli linguistici possono essere adattati modificando i calcoli applicati ai singoli token. I circuiti quantistici offrono un possibile approccio, ma valutare circuiti più ampi all’interno di un modello di grandi dimensioni può richiedere molte risorse computazionali. Qui presentiamo HyperQ, che aggiunge rami residui quantistici condizionati ai token a un modello linguistico a diffusione mascherata con parametri congelati. Un ramo residuo quantistico è un modulo presente in ogni blocco transformer che legge lo stato nascosto di un token, produce le coordinate del circuito associato a quel token, lo esegue e aggiunge i valori misurati tramite una connessione residua. Il modello di base rimane congelato e vengono addestrati solo i rami aggiunti. All’interno di ciascun ramo, una leggera iperrete di circuiti produce angoli di rotazione, intensità di accoppiamento e assi di misurazione specifici per ogni token, all’interno di una struttura di circuito sparsa condivisa. I valori di aspettazione richiesti hanno un’espressione classica esatta, il cui costo di valutazione cresce linearmente con il numero di qubit; ciò consente di addestrare circuiti da 16 a 64 qubit all’interno di un modello di base con 1,1 miliardi di parametri. Nei benchmark a valle, l’aumento della larghezza del circuito fa salire il punteggio medio da 47,65 a 54,30. Con 64 qubit, HyperQ supera il modello di base e la sua variante adattata a basso rango rispettivamente di 4,71 e 3,67 punti. HyperQ viene sottoposto a fine-tuning su 20.000 coppie prompt-risposta, rispetto alle 200.000 usate per i modelli classici di riferimento. Questi risultati avvalorano l’emissione di circuiti condizionata ai token come approccio architetturale praticabile per la modellazione linguistica potenziata dal calcolo quantistico.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv