Vai al contenuto
AI.info

The Pulse

I chatbot sbagliano il 57% delle domande finanziarie, secondo uno studio di Saturn

Uno studio di Saturn ha messo alla prova 18 modelli di IA con 121 domande di finanza personale e ha rilevato risposte errate nel 57% dei casi. I risultati arrivano mentre PensionBee riferisce che molti utenti agirebbero sulla base dei consi

I chatbot sbagliano il 57% delle domande finanziarie, secondo uno studio di Saturn

AI.info Team ·

Il 57% delle risposte era sbagliato

Secondo uno studio di Saturn ripreso da Startup Fortune, i modelli di IA hanno dato risposte errate nel 57% dei casi in un test con domande di finanza personale. La ricerca ha messo alla prova 18 modelli, tra cui ChatGPT, Claude, Copilot, Grok e Gemini, sottoponendo loro 121 domande su temi come debiti, prestiti agli studenti, mutui, pensioni, tasse e risparmi.

Saturn ha riproposto ogni domanda cinque volte, ottenendo più di 10.000 risposte da valutare. Lo studio ha descritto i risultati in un rapporto intitolato Autorità artificiale: ci si può fidare dell’IA per ricevere consigli finanziari? Un resoconto separato pubblicato da Financial Reporter conferma il tasso complessivo di errore e spiega che Saturn ha considerato errate le risposte che contenevano inesattezze fattuali, tralasciavano aspetti importanti o omettevano avvertimenti.

I risultati non significano che ogni modello abbia sbagliato il 57% delle 121 domande. La percentuale indicata si riferisce alla frequenza delle risposte errate tra quelle esaminate. La distinzione è importante perché, ripetendo una stessa domanda, si potevano ottenere risposte diverse: emerge così un secondo problema, oltre alla semplice accuratezza, ossia l’incoerenza.

Risultati peggiori sulle domande finanziarie complesse

Le prestazioni sono peggiorate con le domande più difficili dello studio. Secondo quanto riportato, Saturn ha rilevato un tasso medio di errore dell’88% per le domande più complesse, con alcuni modelli che hanno raggiunto un tasso di errore del 99%.

Le domande riguardavano decisioni che i consumatori si trovano abitualmente ad affrontare, ma che dipendono molto dalle circostanze individuali. Tra gli esempi: se sia meglio versare rate del mutuo superiori al dovuto o investire il denaro in più, quanto risparmiare per la pensione e cosa fare dopo aver saltato una rata di un prestito agli studenti. Una spiegazione scorrevole può sembrare utile pur trascurando le norme fiscali, i tassi d’interesse, la variabilità del reddito, le condizioni del debito o il bisogno di una famiglia di avere liquidità per le emergenze.

Financial Reporter ha riferito che i modelli gratuiti hanno prodotto risposte errate nel 63% dei casi, contro il 49% dei modelli a pagamento. Lo stesso rapporto ha affermato che gli strumenti gratuiti hanno sbagliato il 93% delle domande più difficili. Questi confronti si basano sul metodo di valutazione usato da Saturn e non vanno considerati una classifica generale di tutti i prodotti di IA gratuiti e a pagamento.

Gli utenti spesso saltano la verifica

I risultati sull’accuratezza coincidono con un sondaggio di PensionBee, che evidenzia una discrepanza tra le prestazioni dei modelli e il comportamento degli utenti. Nel suo 2026 AI and Your Money Report, PensionBee ha intervistato 1.000 adulti statunitensi che usano l’IA per porre domande finanziarie e ha rilevato che il 57% accetterebbe la risposta di un chatbot su una decisione finanziaria senza verificarla.

Il 23% ha dichiarato che un chatbot aveva già fornito informazioni finanziarie errate, mentre il 5% ha detto di essersi accorto dell’errore solo dopo aver agito di conseguenza. PensionBee ha inoltre rilevato che il 53% degli intervistati aveva preoccupazioni per la privacy, pur condividendo con gli strumenti di IA informazioni come estratti conto, dettagli sullo stipendio e dati sui debiti.

Il sondaggio indica che gli utenti non si limitano a usare i chatbot per attività a basso rischio, come spiegare un termine o organizzare un bilancio. Gli intervistati hanno descritto l’uso dell’IA per decisioni riguardanti investimenti, tempistiche del pensionamento e altre scelte difficili da modificare.

Le autorità di regolamentazione osservano il confine della consulenza

La Mills Review della Financial Conduct Authority, pubblicata a luglio, individua nel ricorso a un’IA non regolamentata per ricevere indicazioni o consigli finanziari un possibile danno per i consumatori. La revisione solleva inoltre preoccupazioni riguardo alle vendite scorrette, agli errori dei modelli, ai pregiudizi e alla difficoltà di stabilire chi sia responsabile quando i consumatori delegano le decisioni a sistemi basati sull’IA.

La FCA afferma che le norme esistenti forniscono un quadro di riferimento per le aziende che usano l’IA e, nella revisione, non propone un insieme distinto di norme sull’IA. Chiede tuttavia di continuare a prestare attenzione al confine tra indicazioni generali e consulenza finanziaria regolamentata, man mano che i sistemi automatizzati diventano più personalizzati.

Questo confine è centrale nei risultati di Saturn. Un chatbot può riassumere un concetto legato alle pensioni o aiutare un utente a preparare domande per un consulente abilitato senza formulare una raccomandazione regolamentata. Il rischio aumenta quando un utente considera una risposta sicura di sé come un piano completo e agisce senza verificarne i calcoli o le ipotesi di partenza.

Cosa mostra — e cosa non mostra — lo studio

Il test di Saturn non dimostra che l’IA sia inutile per la finanza personale. Altre ricerche hanno rilevato che i modelli linguistici possono incoraggiare abitudini generali, come risparmiare di più, ridurre le spese e diversificare gli investimenti. Uno studio del MIT Sloan pubblicato a maggio ha rilevato che la qualità delle indicazioni generate dall’IA variava in base alle informazioni fornite dagli utenti e che i modelli avevano difficoltà con gli shock di reddito, il ribilanciamento del portafoglio e i prelievi pensionistici.

Gli studi misurano aspetti diversi. Saturn ha valutato le risposte a una serie di domande finanziarie, assegnando un punteggio agli errori e alle omissioni. La ricerca del MIT ha esaminato simulazioni di risultati finanziari nel corso della vita, basate su consigli generati a partire da prompt scritti dagli utenti. Nel loro insieme, mostrano perché una risposta ben formulata non equivale a un consiglio accurato, personalizzato e adatto a una specifica famiglia.

Per i consumatori, la lezione pratica è circoscritta ma importante: usare un chatbot per chiarire la terminologia, confrontare le domande o organizzare le informazioni, quindi verificare con fonti autorevoli o con un professionista qualificato qualsiasi raccomandazione che riguardi prestiti, tasse, pensione, assicurazioni o investimenti. Nel test di Saturn, affidarsi alla prima risposta avrebbe significato accettare una risposta errata più spesso che una corretta.

Fonti

Esplora

Altri articoli