Vai al contenuto
AI.info

The Pulse

XConf insegna ai modelli a calibrare le proprie stime sulla base del passato

Un nuovo preprint su arXiv descrive XConf, un metodo di stima della confidenza che usa le esperienze passate valutate di un modello per migliorare la calibrazione e la previsione selettiva.

XConf insegna ai modelli a calibrare le proprie stime sulla base del passato

AI.info Team ·

XConf mette in discussione i punteggi di confidenza basati su una singola sessione

La maggior parte dei metodi per stimare la confidenza dei modelli linguistici valuta una risposta sulla base delle informazioni disponibili durante una singola inferenza: il ragionamento del modello, le probabilità dei token o diverse risposte campionate in modo indipendente. Un articolo inviato ad arXiv il 15 settembre sostiene che questi segnali non tengono conto delle informazioni che un modello ha accumulato grazie ai successi e agli insuccessi precedenti.

Il metodo proposto, XConf, registra le esperienze passate di un modello, valutate una per una. Ogni registrazione contiene il compito, la riflessione del modello, la confidenza dichiarata, l’esito finale e una lezione formulata dopo la valutazione. Quando arriva un nuovo compito, XConf recupera le esperienze precedenti con compiti e livelli di confidenza simili, quindi usa il loro tasso storico di successo per elaborare una stima aggiornata.

Gli autori — Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Yulong Chen, Dharshan Kumaran e Nigel Collier — descrivono il sistema nell’articolo Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents. Il lavoro è un preprint su arXiv.

«Riteniamo che l’inferenza corrente non sia una base sufficiente per la confidenza.» — Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Yulong Chen, Dharshan Kumaran e Nigel Collier, autori dell’articolo

Prima il richiamo, poi la riflessione

XConf divide il processo in due fasi. La fase Recall cerca tra le esperienze archiviate e verifica con quale frequenza i giudizi simili espressi in passato si sono rivelati corretti. La fase Reflect presenta al modello queste informazioni, gli chiede di individuare uno schema ricorrente di errore e poi di formulare una nuova stima della confidenza basata sui risultati ottenuti in precedenza.

Il sistema non richiede l’accesso ai logits del modello né modifiche ai pesi. L’articolo afferma inoltre che il metodo funziona con diversi formati di output e richiede una sola generazione della risposta per stimarne la confidenza. Si distingue così dagli approcci che si basano su dati interni sulle probabilità o su campionamenti ripetuti, non disponibili per tutti i modelli e potenzialmente molto onerosi in termini di inferenza.

23 confronti su 24 a favore rispetto alla self-consistency

La valutazione copre nove benchmark, che spaziano dal ragionamento alla programmazione, fino alle risposte a domande multimodali e agli agenti interattivi. Gli autori testano quattro modelli appartenenti a tre famiglie di modelli e confrontano XConf con la self-consistency a dieci campioni, un metodo che genera più risposte e usa il loro grado di concordanza come segnale di confidenza.

Secondo l’articolo, XConf eguaglia o supera la self-consistency a dieci campioni in termini di AUROC — l’area sotto la curva ROC, ovvero la curva caratteristica operativa del ricevitore — in 23 confronti su 24. Gli autori riportano inoltre un errore atteso di calibrazione, o ECE, molto più basso, pur usando un decimo del costo di generazione indicato per il metodo di riferimento basato sulla self-consistency.

Questi risultati misurano la capacità dei punteggi di confidenza di distinguere le risposte probabilmente corrette da quelle probabilmente errate. Non dimostrano che XConf renda più accurata la risposta sottostante per ogni compito. Il metodo punta invece ad aiutare un sistema a decidere se procedere, riprovare, affidare il compito a un altro sistema o astenersi.

La previsione selettiva aumenta il successo degli agenti

L’articolo verifica questo impiego nel processo decisionale facendo sì che i sistemi si astengano dal completare il 10 per cento delle esperienze con i punteggi di confidenza più bassi. Nei compiti affidati agli agenti, gli autori riferiscono che questo accorgimento aumenta i tassi di successo ottenuti fino a 8,7 punti percentuali.

La previsione selettiva cambia il significato di successo: un sistema viene valutato non solo in base alla frequenza con cui completa un compito, ma anche alla sua capacità di evitare di presentare come affidabili tentativi deboli. Per un agente che gestisce un flusso di lavoro articolato in più fasi, una stima della confidenza può determinare se proseguire l’esecuzione o affidare il compito a un altro processo.

Il fatto che XConf si basi su esperienze passate valutate comporta anche una dipendenza pratica. L’approccio richiede un archivio di esperienze precedenti con esiti e lezioni affidabili. L’abstract non chiarisce come cambino le prestazioni quando l’archivio è piccolo, etichettato male o composto da compiti molto diversi dalla nuova richiesta.

Un sistema di memoria, non un nuovo modello

XConf non riaddestra il modello linguistico né ne modifica i parametri. Aggiunge un archivio esterno di esperienze precedenti e una procedura per recuperarle e rifletterci sopra. La proposta assomiglia quindi più a uno strato di stima della confidenza che affianca un modello esistente che a una nuova architettura di modello.

La tesi centrale dell’articolo è più circoscritta dell’affermazione secondo cui i modelli imparerebbero in modo permanente da ogni interazione. XConf utilizza l’esperienza accumulata al momento dell’inferenza, a condizione che il sistema abbia archiviato, valutato e recuperato le esperienze pertinenti. I vantaggi riportati dipendono quindi dalla qualità della memoria e dalla somiglianza tra i compiti passati e quelli presenti.

Il preprint è disponibile su arXiv. Le prove presentate consistono nella valutazione condotta dagli autori sui nove benchmark riportati.

Fonte

Esplora

Altri articoli