Vai al contenuto
AI.info

The Pulse

Apple riferisce un completamento del 96% con la memoria selettiva, contro il 71% con la cronologia completa

Apple Machine Learning Research riferisce che, in tre scenari di implementazione aziendale, la memoria persistente selettiva ha superato sia l’assenza di memoria sia l’uso delle cronologie complete delle conversazioni, mentre un meccanismo

Apple riferisce un completamento del 96% con la memoria selettiva, contro il 71% con la cronologia completa

AI.info Team ·

Apple Machine Learning Research riferisce che un agente con memoria persistente selettiva ha completato il 96% dei compiti in tre scenari di implementazione aziendale. Lo stesso sistema ha completato il 79% dei compiti senza memoria e il 71% quando gli è stata fornita la cronologia completa della conversazione.

Il risultato emerge da Memoria persistente selettiva condivisa per sistemi LLM agentici, un articolo di Sanjana Pedada, Aditya Dhavala e Neelraj Patil. La pagina di ricerca di Apple afferma che il lavoro è stato pubblicato nel settembre 2026 e descrive un’architettura di memoria per sistemi agentici che generano codice tramite l’uso di strumenti in più turni.

Gli autori dell’articolo scrivono:

Salvare senza criterio intere cronologie delle conversazioni è inefficiente in termini di token e controproducente: il contesto irrilevante peggiora la qualità della generazione.

L’architettura proposta conserva quattro categorie di contesto riutilizzabile: specifiche dei compiti, schemi dei dati, configurazioni degli strumenti e vincoli sull’output. Scarta le tracce di ragionamento specifiche della sessione, anziché trasferire l’intera conversazione precedente in una nuova sessione.

Le specifiche dei compiti conservano requisiti riutilizzabili in più sessioni. Gli schemi dei dati raccolgono informazioni sulla struttura dei dati di origine. Le configurazioni degli strumenti descrivono i connettori e gli strumenti a disposizione dell’agente, mentre i vincoli sull’output conservano i requisiti che regolano gli artefatti prodotti dal sistema.

La memoria è condivisa tra gli utenti attraverso spazi di lavoro con controllo degli accessi basato sui ruoli. Il sistema è implementato in una piattaforma collaborativa di lavoro in cui gli agenti creano, modificano e mantengono artefatti versionati con git, tra cui dashboard interattive, rapporti strutturati e altri documenti basati sui dati.

La piattaforma supporta fonti di dati eterogenee accessibili tramite caricamenti di file CSV, SQL, API REST e server MCP. Il versionamento basato su git garantisce l’isolamento delle bozze, consentendo agli utenti di testare le modifiche e ripristinare uno stato precedente senza richiamare il modello.

Aggiornamenti senza una nuova chiamata al modello

L’articolo descrive anche un meccanismo di aggiornamento dei dati a zero token. I programmi generati restano separati dai dati di runtime, consentendo a un artefatto esistente di utilizzare dati aggiornati compatibili senza una nuova chiamata a un LLM.

Apple riferisce che questo meccanismo di aggiornamento riduce di 14× il tempo necessario per i compiti. Secondo la pagina di ricerca, una replica condotta con quattro dataset pubblici ha avuto esito positivo in tutte e 12 le prove.

Per i compiti che richiedono l’input del modello, il sistema usa riassunti anziché inserire dati grezzi. Apple riferisce che la generazione basata sui riassunti riduce di 97× il costo in token per chiamata rispetto all’inserimento di dati grezzi.

Perché le cronologie complete hanno dato risultati peggiori

La pagina di ricerca afferma che salvare la cronologia completa può ridurre attivamente il completamento dei compiti, influenzando l’agente con tracce di ragionamento obsolete. Il ragionamento precedente, anziché limitarsi a requisiti riutilizzabili e alla struttura dei dati, può introdurre un contesto non più adatto al compito corrente.

I risultati non dimostrano che la cronologia delle conversazioni debba sempre essere scartata. Avvalorano una scelta progettuale più circoscritta: conservare le informazioni riutilizzabili e tralasciare il ragionamento specifico della sessione e altri elementi di contesto che potrebbero fuorviare una generazione successiva.

Il confronto riportato da Apple favorisce quindi la memoria selettiva rispetto a entrambi gli estremi testati nella pagina. Gli agenti senza memoria persistente hanno ottenuto un tasso di completamento inferiore rispetto al sistema con memoria selettiva, mentre quelli a cui sono state fornite cronologie complete hanno fatto peggio. Il meccanismo di aggiornamento descritto ha inoltre ridotto la necessità di richiamare il modello per gli aggiornamenti ricorrenti dei dati.

Fonte

Esplora

Altri articoli