Ricerca
FLEET: dall’entropia dei logit a traiettorie potenziate nella generazione del testo
Le soluzioni basate su modelli linguistici di grandi dimensioni (LLM) spesso si affidano al campionamento con temperatura per migliorare accuratezza e stabilità, aggregando più campioni dalla distribu

- arXiv
- 2609.27657
- Pubblicato
- 2026-09-23
- Autori
- Oleksii Streltsov, Oleksandra Vitko
Abstract degli autori
Le soluzioni basate su modelli linguistici di grandi dimensioni (LLM) spesso si affidano al campionamento con temperatura per migliorare accuratezza e stabilità, aggregando più campioni dalla distribuzione delle completazioni. Questo approccio privo di memoria è però intrinsecamente subottimale: poiché non tiene conto delle generazioni precedenti né delle relative valutazioni, al crescere del numero di campioni produce una quota sempre maggiore di risposte semanticamente duplicate, con rendimenti decrescenti. Per affrontare questo limite, introduciamo FLEET, un nuovo metodo che integra un meccanismo di memoria nel processo di generazione. FLEET rappresenta ogni generazione come una traiettoria sparsa attraverso stati la cui entropia supera una soglia predefinita e usa queste traiettorie per dedurre punteggi di utilità per token, che modificano i logit. Le valutazioni sui benchmark dimostrano che FLEET raggiunge la stessa accuratezza del metodo di riferimento basato sul campionamento ripetuto, con un’accelerazione di 3×, e migliora sensibilmente l’accuratezza nei compiti di programmazione complessi (LiveCodeBench Pass@32 passa dal 59,9% al 66,2%) a parità di budget. Inoltre, nella configurazione di decodifica greedy valutata in questo studio, il metodo è deterministico e ricava i suoi principali iperparametri con un’unica passata di calibrazione, richiedendo solo modifiche minime alle pipeline LLM esistenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv