Vai al contenuto
AI.info

Ricerca

Harness engineering per l’ingegneria del software tramite Dev-Primitives modulari ed eseguibili

I modelli linguistici di grandi dimensioni (LLM) dotati di accesso al terminale hanno dimostrato notevoli capacità nell’automatizzare le attività di ingegneria del software. Gli agenti esistenti resta

Harness engineering per l’ingegneria del software tramite Dev-Primitives modulari ed eseguibili
arXiv
2610.07832
Pubblicato
2026-10-06
Autori
Haibo Jin, Xinjie Li, Peng Kuang, Haohan Wang

Abstract degli autori

I modelli linguistici di grandi dimensioni (LLM) dotati di accesso al terminale hanno dimostrato notevoli capacità nell’automatizzare le attività di ingegneria del software. Gli agenti esistenti restano però fragili nei flussi di lavoro di lunga durata: devono ricostruire ripetutamente lo stato del programma, disseminato tra file sorgente, configurazioni, test, dipendenze e comportamento in esecuzione. Ne derivano cronologie delle interazioni sempre più lunghe, un’esplosione del contesto e una deriva semantica. I repository di grandi dimensioni complicano ulteriormente l’individuazione dei componenti pertinenti all’attività. Per affrontare queste difficoltà, introduciamo \textbf{Dev-Primitives} (\emph{Development Primitives}), un’astrazione modulare ed eseguibile che trasforma i componenti del repository da artefatti software passivi in partecipanti attivi all’ingegneria del software. Ogni Dev-Primitive associa un artefatto del repository a un LLM residente, dotando l’artefatto di un’interfaccia per agenti fondata sulla propria implementazione e sulle proprie dipendenze. Questo consente il ragionamento in linguaggio naturale, la comunicazione tra componenti e l’auto-modifica localizzata. A partire dai Dev-Primitives, proponiamo \textbf{HERMES}, un framework di Harness Engineering per l’ingegneria del software tramite Dev-Primitives modulari ed eseguibili. HERMES istanzia questi elementi su scala di repository attraverso un meccanismo di attivazione dinamica che tiene conto delle dipendenze e un meccanismo di diagnosi dei bug che riconduce le evidenze dell’esecuzione ai componenti da modificare. Esperimenti approfonditi su quattro benchmark di ingegneria del software mostrano che HERMES supera gli harness di riferimento corrispondenti del 12,4\% in media. Inoltre, se abbinato a modelli di attivazione e diagnosi potenti, HERMES, anche con Dev-Primitives Qwen3-8B, si mantiene entro il 4,5\% dalla configurazione omogenea GPT-5.6 Sol in tutti e quattro i benchmark, riducendo al contempo i costi di inferenza del 26,2\% su Terminal-Bench 4.0. Ciò evidenzia l’importanza della progettazione degli harness per gli agenti di ingegneria del software.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv