Vai al contenuto
AI.info

Ricerca

Quando i modelli modificano troppo: la fedeltà delle modifiche minime al codice

I modelli linguistici di grandi dimensioni (LLM) sono sempre più usati per modificare codice esistente, ma la correttezza da sola non basta: le correzioni utili dovrebbero anche essere minime, facili

Quando i modelli modificano troppo: la fedeltà delle modifiche minime al codice
arXiv
2609.04061
Pubblicato
2026-09-03
Autori
Tongyao Zhu, Wei Hern Lim, Min-Yen Kan

Abstract degli autori

I modelli linguistici di grandi dimensioni (LLM) sono sempre più usati per modificare codice esistente, ma la correttezza da sola non basta: le correzioni utili dovrebbero anche essere minime, facili da esaminare e fedeli all’implementazione originale. Studiamo la tendenza dei modelli a modificare il codice più del necessario per correggere un bug. Costruiamo un quadro di valutazione a partire da 400 problemi di BigCodeBench, introducendo alterazioni controllate a livello di AST nelle soluzioni di riferimento: per ogni compito di correzione conosciamo così la patch minima. Tra gli LLM di frontiera, questa tendenza è diffusa anche nei modelli più avanzati come GPT-5.5: un Pass@1 elevato può coesistere con modifiche inutilmente ampie e con un aumento della complessità cognitiva. Un’istruzione a preservare il codice riduce sensibilmente il fenomeno: abbassa la distanza media di Levenshtein in eccesso da 0,195 a 0,131, riduce del 26,6% la complessità cognitiva aggiunta e aumenta Pass@1 di 2,3 punti. Questi miglioramenti, però, non derivano semplicemente da un maggiore budget di ragionamento o da modelli più grandi. Ci chiediamo quindi se si possa insegnare direttamente ai modelli a effettuare modifiche minime durante il post-training. Osserviamo che il fine-tuning supervisionato si adatta eccessivamente alle alterazioni già viste, mentre l’apprendimento per rinforzo offre il miglior compromesso tra fedeltà delle modifiche fuori dominio e mantenimento delle prestazioni. Questi risultati indicano che la fedeltà delle modifiche è una dimensione distinta della qualità della correzione del codice e mostrano che può essere misurata e appresa.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv