Vai al contenuto
AI.info

Ricerca

Il repository di codice di Schrödinger: gli LLM hanno imparato SWE-bench o l’hanno memorizzato?

I benchmark di programmazione a livello di repository sono diventati lo standard per valutare gli agenti di programmazione, ma soffrono inevitabilmente di contaminazione dei dati, perché si basano su

Il repository di codice di Schrödinger: gli LLM hanno imparato SWE-bench o l’hanno memorizzato?
arXiv
2609.27891
Pubblicato
2026-08-21
Autori
Silin Chen, Yufei Yang, Xiaodong Gu, Yuling Shi, Chengcheng Wan, Haibing Guan

Abstract degli autori

I benchmark di programmazione a livello di repository sono diventati lo standard per valutare gli agenti di programmazione, ma soffrono inevitabilmente di contaminazione dei dati, perché si basano su repository open source popolari, usati ripetutamente per l’addestramento. Di conseguenza, prestazioni elevate possono riflettere la memorizzazione di indizi canonici legati ai repository, anziché una solida capacità di ragionamento sui repository. Proponiamo SchrodingerRepo (Schrödinger’s Repository), un framework di valutazione per testare gli agenti di programmazione con rappresentazioni dei repository istanziate dinamicamente. Invece di usare ripetutamente una rappresentazione statica del repository di test, SchrodingerRepo tratta il repository di test come una variabile latente in fase di valutazione, istanziata dinamicamente solo quando l’agente entra nell’ambiente di valutazione. Il repository istanziato conserva il comportamento eseguibile originale, ma rende meno riconoscibili gli indizi familiari, come le convenzioni di denominazione, la struttura dei file e i modelli di implementazione, attraverso quattro livelli di trasformazione: ricostruzione della descrizione del problema, rimappatura degli spazi dei nomi, riordino della disposizione all’interno dei file e riscrittura del codice che ne preserva le funzionalità. Valutiamo modelli di IA popolari su SWE-bench Verified e SWE-QA. I risultati mostrano che la rimozione degli indizi familiari legati ai repository riduce sistematicamente le prestazioni degli agenti e aumenta notevolmente i costi di interazione tra i diversi modelli. Ulteriori analisi rivelano che i costi aggiuntivi sono dovuti principalmente alla maggiore difficoltà nell’esplorazione dei repository e nell’individuazione delle informazioni rilevanti. Questi risultati suggeriscono che gli attuali agenti di programmazione potrebbero fare parzialmente affidamento su indizi legati ai repository memorizzati, evidenziando la necessità di valutazioni basate su rappresentazioni dei repository istanziate dinamicamente.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv