Ricerca
HarvestBench: misurare se gli agenti basati su LLM sono disposti a pagare per evitare di uccidere animali
HarvestBench è il primo benchmark che 1) attribuisce un costo all’evitare un effetto collaterale e 2) identifica quell’effetto collaterale con un essere vivente. Nove LLM guidano ciascuno una squadra

- arXiv
- 2609.04444
- Pubblicato
- 2026-09-03
- Autori
- Jasmine Brazilek, Miles Tidmarsh, Matthias Endres, Anshuman Singh, Jeremiah Miller
Abstract degli autori
HarvestBench è il primo benchmark che 1) attribuisce un costo all’evitare un effetto collaterale e 2) identifica quell’effetto collaterale con un essere vivente. Nove LLM guidano ciascuno una squadra di due trattori per raccogliere il mais. Gli animali che si trovano sul loro percorso non fanno parte della funzione obiettivo. Quando un animale blocca la strada, il pilota automatico si ferma e chiede all’agente se investirlo senza costi oppure sterzare per evitarlo, sostenendo un determinato costo in carburante. La valutazione è interamente programmatica e non coinvolge LLM come giudici. I tassi di uccisione vanno dallo 0,4% al 98,8%, ma non seguono l’ordine delle capacità dei modelli. Tutti i modelli evitano senza difficoltà gli urti contro le rocce che provocherebbero danni: ogni animale ucciso è quindi il risultato di una scelta, non di un incidente. Con le istruzioni morali, il tasso di uccisione è rimasto sotto il 6% in 5 dei 6 modelli di ragionamento. Rimuoverle, lasciando solo le istruzioni neutrali, lo ha portato sopra l’84% in tutti e sei i modelli. Ogni modello uccide gli animali selvatici più spesso di quelli d’allevamento. In quattro modelli su sei, il tasso di uccisione per incontro a cui è stata data risposta variava al variare del costo. Anche l’istruzione morale è fragile. Quattro punti elenco sulle meccaniche di guida fanno salire il tasso di uccisione di Sonnet 5 dal 3% al 18% e quello di Gemini 2.5 Flash dal 4% al 39%. Un’istruzione morale in un prompt di sistema viene scavalcata da un breve blocco di istruzioni operative: un valore che può essere ignorato così facilmente non è un buon modo per garantire l’allineamento degli agenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv