Ricerca
Dal traffico in produzione al post-training: costruire un LLM ospitato internamente che copra la varietà delle richieste aziendali
I vincoli sulla residenza dei dati impongono alle aziende di ospitare internamente gli LLM, ma l’adozione continua di modelli più recenti senza dismettere i precedenti amplia l’insieme dei modelli da

- arXiv
- 2609.01572
- Pubblicato
- 2026-09-01
- Autori
- Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov, Danil Taranets, Daniil Dryabin, Mikhail Gashkov, Viktor Zelenkovskiy, Aleksandr Fida, Gleb Alektorov, Nikita Gulyakov, Arthur Babkin, Aleksandr Medvedev, Pavel Gein, Anatolii Potapov
Abstract degli autori
I vincoli sulla residenza dei dati impongono alle aziende di ospitare internamente gli LLM, ma l’adozione continua di modelli più recenti senza dismettere i precedenti amplia l’insieme dei modelli da gestire, frammentando una dotazione limitata di GPU. Concentriamo il traffico di oltre 200 applicazioni interne su un unico modello, colmando le lacune qualitative individuate dall’analisi degli errori in produzione lungo tre direttrici: aderenza alle istruzioni, function-calling e distribuzione dei task interni. La qualità viene monitorata con benchmark offline stratificati in base al traffico in produzione e valutati da verificatori deterministici o da LLM giudici calibrati. Anziché ottimizzare congiuntamente tutti gli obiettivi, introducendo interferenze tra le ricompense di domini diversi, addestriamo un esperto GRPO distinto per ciascuna direttrice e li fondiamo tramite SLERP in due fasi. La ricompensa di ciascun esperto rivela un diverso problema: collasso semantico, eccesso di chiamate e sfruttamento della verbosità. Ognuno richiede una soluzione specifica per il proprio dominio. In modalità senza ragionamento, il modello supera un modello di riferimento con un numero totale di parametri pari a ${\sim}7\times$ il suo: 69,6 contro 65,8 nell’Arena interna, 0,85 contro 0,83 nell’aderenza alle istruzioni e 0,79 contro 0,77 nel function-calling. Migliora inoltre i risultati nei benchmark di dialogo generale. Il modello assorbe il 50% del traffico della piattaforma, pari a 116 milioni di richieste al mese, a una frazione del costo di erogazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv