Ricerca
Addestrare gli agenti a evolvere insieme al proprio Harness: rapporto tecnico su TaoLive Digital Avatar Agent
Gli streamer con avatar digitali basati sull’IA devono rispondere alle domande sui prodotti, coinvolgere gli spettatori e attuare strategie di marketing in tempo reale. Questo richiede bassa latenza,

- arXiv
- 2608.15763
- Pubblicato
- 2026-08-16
- Autori
- TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen
Abstract degli autori
Gli streamer con avatar digitali basati sull’IA devono rispondere alle domande sui prodotti, coinvolgere gli spettatori e attuare strategie di marketing in tempo reale. Questo richiede bassa latenza, aggiornamenti frequenti delle strategie e risposte accurate ma anche efficaci. Gli Evolvable Harnesses, i cui Skills, Hooks, prompt e strumenti possono essere aggiornati indipendentemente dai pesi del modello, consentono iterazioni rapide, ma comportano un compromesso: i modelli di grandi dimensioni si adattano senza addestramento specifico, ma sono troppo lenti; quelli compatti rispettano gli obiettivi di latenza, ma si adattano eccessivamente a configurazioni fisse dell’Harness. Proponiamo Harness-Aware Training (HAT), un metodo che addestra modelli compatti ad adattarsi a Harness in evoluzione. Il suo componente principale, Harness-State Augmentation (HSA), applica trasformazioni che preservano il compito agli identificatori e ai contenuti degli Skill, agli schemi degli strumenti, alle strutture dei prompt e alle funzioni degli Hook. L’addestramento si svolge in tre fasi: HSA-SFT apprende il ragionamento e l’uso degli strumenti dalle traiettorie di modelli potenti in ambienti diversi; General On-Policy Distillation recupera la capacità di generalizzazione persa durante l’SFT; HSA-RL migliora la robustezza ai cambiamenti dell’Harness mediante l’apprendimento per rinforzo in ambienti aumentati. Su quattro set di valutazione, HAT ottiene 94,8 su Live-Stream QA (modello di base: 80,3; miglior LLM generalista: 93,0) e 94,6 su Harness-Variant QA (modello di base: 75,4). A differenza di Fixed-Harness SFT, che riduce il punteggio IFEval di 7,7 punti rispetto al modello di base, HAT evita questo peggioramento e raggiunge 83,5. Su una GPU NVIDIA H20, il sistema ottimizzato registra latenze P50 e P95 rispettivamente di 3,4 s e 8,1 s. Impiegato nel servizio di avatar digitali di Taobao Live, produce inoltre risultati positivi nei test A/B online per le visualizzazioni delle pagine degli articoli.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv