Vai al contenuto
AI.info

Ricerca

DART-SD: recupero e ottimizzazione consapevoli della topologia a diamante per l’autodistillazione di agenti che chiamano strumenti in più turni

Dotare i modelli linguistici di grandi dimensioni (LLM) della capacità di chiamare strumenti in più turni è essenziale per costruire agenti autonomi. Tuttavia, i progressi sono fondamentalmente limita

DART-SD: recupero e ottimizzazione consapevoli della topologia a diamante per l’autodistillazione di agenti che chiamano strumenti in più turni
arXiv
2608.18524
Pubblicato
2026-08-19
Autori
Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu, Jingming Cai, Yan Song

Abstract degli autori

Dotare i modelli linguistici di grandi dimensioni (LLM) della capacità di chiamare strumenti in più turni è essenziale per costruire agenti autonomi. Tuttavia, i progressi sono fondamentalmente limitati dalla dipendenza dall’imitazione di traiettorie complete. Nei compiti che comprendono più sotto-obiettivi il cui ordine è indifferente, lo spazio delle soluzioni ottimali forma un vasto reticolo combinatorio a diamante. Costringere questa ricca topologia entro traiettorie monolitiche provoca un grave collasso topologico: penalizza indiscriminatamente percorsi esplorativi alternativi validi e riduce fortemente la diversità delle strategie. Per affrontare il problema, proponiamo DART-SD (Diamond-topology Aware Retrieval and Tuning for Self-Distillation), un nuovo framework che sostituisce l’imposizione globale con una correzione localizzata guidata dalla topologia. DART-SD modella innanzitutto il processo di esecuzione come un grafo convergente delle transizioni tra stati di interazione (ISTG), rappresentando fedelmente la topologia a diamante intrinseca dei percorsi esplorativi riusciti e falliti. Durante i rollout autonomi, il framework individua il punto critico di discontinuità topologica (CTB) e recupera riferimenti per il recupero basati su percorsi riusciti. Introduciamo infine un paradigma di autodistillazione progressiva attraverso una supervisione localizzata guidata dal CTB: la perdita di addestramento viene calcolata esclusivamente sui passaggi di recupero generati, mentre il prefisso valido del ragionamento viene rigorosamente protetto dagli aggiornamenti dei gradienti che potrebbero danneggiarlo. Esperimenti su benchmark complessi di chiamata di strumenti in più turni dimostrano che DART-SD supera nettamente i metodi di riferimento tradizionali basati su traiettorie complete.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv