Vai al contenuto
AI.info

Ricerca

Uno studio empirico sulla progettazione degli harness per agenti di coding

Gli harness per il coding determinano il modo in cui gli agenti autonomi trasformano le capacità dei modelli in prestazioni di ingegneria del software su orizzonti temporali lunghi. Tuttavia, gli stud

Uno studio empirico sulla progettazione degli harness per agenti di coding
arXiv
2609.20804
Pubblicato
2026-09-17
Autori
Run-Ze Fan, Zihao Zhang, Simin Ma, Yebowen Hu, Shouju Wang, Kaiqiang Song, Fei Liu, Hamed Zamani, Xiaoyang Wang

Abstract degli autori

Gli harness per il coding determinano il modo in cui gli agenti autonomi trasformano le capacità dei modelli in prestazioni di ingegneria del software su orizzonti temporali lunghi. Tuttavia, gli studi esistenti valutano in genere gli harness come sistemi monolitici, rendendo difficile capire quanto siano efficaci i singoli componenti. Per consentire confronti a livello di componente, studiamo la questione con un harness di coding leggero, il cui ciclo di esecuzione rimane fisso mentre variano tre componenti: pianificazione, spazio delle azioni e gestione del contesto. Valutiamo quattro modelli su SWE-Bench Verified e Terminal-Bench 2.1, esaminando 176 configurazioni abbinate che coprono cinque strategie di gestione del contesto, quattro budget per la finestra di contesto e ablazioni mirate della pianificazione e dello spazio delle azioni. I risultati mostrano che: (1) la gestione del contesto diventa sempre più preziosa man mano che si riduce il budget della finestra di contesto, e la maggior parte dei benefici deriva dalla prevenzione degli errori dovuti al superamento del contesto; (2) applicare l’elisione basata su regole prima del riepilogo basato su LLM offre la migliore efficienza complessiva tra le strategie di gestione del contesto, mentre rendere recuperabili i contenuti elisi aggiunge complessità che i modelli usano di rado e non migliora l’accuratezza; (3) la pianificazione passa dall’essere un supporto all’accuratezza per i modelli più deboli a uno strumento per ridurre i costi per quelli più forti, con variazioni minime nell’accuratezza; (4) gli strumenti predefiniti migliorano le prestazioni dei modelli meno competenti in bash, mentre i modelli capaci di usare bash possono operare efficacemente con un’interfaccia basata solo su bash e ottenere costi notevolmente inferiori, soprattutto nelle attività incentrate sulla riga di comando. L’analisi a livello di traiettoria spiega questi effetti: la gestione del contesto prolunga le traiettorie di esecuzione senza modificare in misura sostanziale il comportamento degli agenti, la pianificazione cambia il punto in cui le traiettorie si interrompono e lo spazio delle azioni modifica la granularità con cui viene scritto il codice. Questi risultati forniscono indicazioni per progettare harness che tengano conto del modello e del budget e offrono un quadro modulare per valutare i componenti dei futuri harness.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv