Vai al contenuto
AI.info

Ricerca

IdeaAMBIG: valutare con un benchmark le lacune critiche per l’implementazione nelle specifiche delle idee di ricerca

Un’idea di ricerca può essere originale, coerente e scientificamente plausibile, ma il metodo che propone può comunque essere descritto in modo insufficiente per consentirne un’implementazione fedele.

IdeaAMBIG: valutare con un benchmark le lacune critiche per l’implementazione nelle specifiche delle idee di ricerca
arXiv
2609.10539
Pubblicato
2026-09-09
Autori
Yiling Ma, Yilun Zhao, Sihong Wu, Manasi Patwardhan, Arman Cohan

Abstract degli autori

Un’idea di ricerca può essere originale, coerente e scientificamente plausibile, ma il metodo che propone può comunque essere descritto in modo insufficiente per consentirne un’implementazione fedele. Studiamo la prontezza alla codifica delle specifiche dei metodi di ricerca destinate all’implementazione: una specifica è pronta se fornisce informazioni metodologiche sufficienti perché una persona competente o un agente di programmazione possa realizzare il metodo previsto senza ricorrere ad assunzioni prive di riscontro. A partire da articoli scientifici, codebase, discussioni sulle issue e materiali relativi alla riproduzione dei risultati, costruiamo specifiche fondate su evidenze e le relative soluzioni corroborate dalle stesse evidenze. Presentiamo IdeaAMBIG, un benchmark di 660 casi fondati su evidenze: 163 lacune reali tratte da rapporti sulla riproducibilità e issue di GitHub, e 497 lacune sintetiche controllate, introdotte in testi di riferimento pronti per la codifica. IdeaAMBIG valuta tre capacità: stabilire se una specifica è pronta per la codifica, individuare i difetti e generare azioni di chiarimento. Per individuare i difetti viene fornita soltanto la specifica; per generare le azioni di chiarimento viene fornito anche il difetto annotato. Tra 13 LLM, il modello migliore raggiunge un Macro Defect Recovery Rate del 9,6% sui casi reali, ma un Macro Clarification Action Success Rate dell’80,6% quando gli viene fornito il difetto. In uno studio con informazioni ideali, fornire la soluzione di riferimento porta il tasso di prontezza alla codifica nella fase successiva dal 14% al 98%. Per tutti i modelli valutati, l’ostacolo principale è individuare i difetti, mentre la generazione di azioni di chiarimento è più efficace quando il difetto viene fornito.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv