Ricerca
Quando i modelli modificano troppo: la fedeltà delle modifiche minime al codice
I modelli linguistici di grandi dimensioni (LLM) sono sempre più usati per modificare codice esistente, ma la correttezza da sola non basta: le correzioni utili dovrebbero anche essere minime, facili

- arXiv
- 2609.04061
- Pubblicato
- 2026-09-03
- Autori
- Tongyao Zhu, Wei Hern Lim, Min-Yen Kan
Abstract degli autori
I modelli linguistici di grandi dimensioni (LLM) sono sempre più usati per modificare codice esistente, ma la correttezza da sola non basta: le correzioni utili dovrebbero anche essere minime, facili da esaminare e fedeli all’implementazione originale. Studiamo la tendenza dei modelli a modificare il codice più del necessario per correggere un bug. Costruiamo un quadro di valutazione a partire da 400 problemi di BigCodeBench, introducendo alterazioni controllate a livello di AST nelle soluzioni di riferimento: per ogni compito di correzione conosciamo così la patch minima. Tra gli LLM di frontiera, questa tendenza è diffusa anche nei modelli più avanzati come GPT-5.5: un Pass@1 elevato può coesistere con modifiche inutilmente ampie e con un aumento della complessità cognitiva. Un’istruzione a preservare il codice riduce sensibilmente il fenomeno: abbassa la distanza media di Levenshtein in eccesso da 0,195 a 0,131, riduce del 26,6% la complessità cognitiva aggiunta e aumenta Pass@1 di 2,3 punti. Questi miglioramenti, però, non derivano semplicemente da un maggiore budget di ragionamento o da modelli più grandi. Ci chiediamo quindi se si possa insegnare direttamente ai modelli a effettuare modifiche minime durante il post-training. Osserviamo che il fine-tuning supervisionato si adatta eccessivamente alle alterazioni già viste, mentre l’apprendimento per rinforzo offre il miglior compromesso tra fedeltà delle modifiche fuori dominio e mantenimento delle prestazioni. Questi risultati indicano che la fedeltà delle modifiche è una dimensione distinta della qualità della correzione del codice e mostrano che può essere misurata e appresa.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv