Ricerca
SkillSeek: ripensare il recupero delle skill degli agenti su scala di marketplace
Le Agent Skills di Anthropic racchiudono in directory SKILL.md conoscenze procedurali riutilizzabili per un agente basato su LLM. Le raccolte open source hanno superato le 230.000 skill, rendendo la s

- arXiv
- 2609.38822
- Pubblicato
- 2026-09-30
- Autori
- Guanqun Yang, Wenlong Zhang, Tian Shi, Ping Wang
Abstract degli autori
Le Agent Skills di Anthropic racchiudono in directory SKILL.md conoscenze procedurali riutilizzabili per un agente basato su LLM. Le raccolte open source hanno superato le 230.000 skill, rendendo la selezione, anziché la creazione, il collo di bottiglia. La risposta prevalente nella letteratura affida la selezione all’agente stesso: un ciclo di recupero mediato da un LLM che riformula le query e affina i candidati all’interno del ciclo decisionale dell’agente, consumando token LLM per ogni attività. Presentiamo SkillSeek, un sistema open source di recupero delle skill in due fasi basato sull’approccio standard dell’IR (un bi-encoder BGE-base che alimenta un piccolo cross-encoder, accessibile tramite MCP). Su una griglia $4 \times 11$ di insiemi di skill, backbone e metodi, valutata sulle 89 attività del benchmark SkillsBench, SkillSeek raggiunge una parità osservata con il ciclo mediato da LLM di Liu et al. praticamente senza costi aggiuntivi: il solo bm25 registra un tasso di superamento pari o superiore a quello del loro ciclo affinato in tre delle quattro configurazioni, e un piccolo cross-encoder colma la differenza rimanente nella quarta. Un limite del recall nella prima fase spiega questo andamento, mentre la spesa totale per prova scende da 51,30 USD a 27,54 USD, entro cinquanta centesimi dalla baseline senza skill. Per le attività di SkillsBench e l’infrastruttura di test OpenHands che abbiamo utilizzato, questi risultati indicano nell’approccio standard dell’IR una solida scelta predefinita per il recupero delle skill degli agenti, mentre le alternative mediate da LLM sono una scelta naturale nei casi in cui i metodi deterministici non bastano.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv